# Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models

DevFeed: [Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models](<https://devfeed.tech/articles/fine-tuning-florence-2-microsoft-s-cutting-edge-vision-language-models-7200.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/finetune-florence2>)

Author: Andres Marafioti; merve; Piotr Skalski

Published: 2024-06-24T00:00:00Z

Content type: article

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [Fine-tuning](<https://devfeed.tech/topics/fine-tuning.md>), [vlm](<https://devfeed.tech/topics/vlm.md>), [Computer vision](<https://devfeed.tech/topics/computer-vision.md>), [datasets](<https://devfeed.tech/topics/datasets.md>), [Embeddings](<https://devfeed.tech/topics/embeddings.md>)

Tags: [collaboration](<https://devfeed.tech/tags/collaboration.md>), [community](<https://devfeed.tech/tags/community.md>), [computer-vision](<https://devfeed.tech/tags/computer-vision.md>), [dataset](<https://devfeed.tech/tags/dataset.md>), [datasets](<https://devfeed.tech/tags/datasets.md>), [fine-tuning](<https://devfeed.tech/tags/fine-tuning.md>), [object-detection](<https://devfeed.tech/tags/object-detection.md>), [ocr](<https://devfeed.tech/tags/ocr.md>), [open-source](<https://devfeed.tech/tags/open-source.md>), [research](<https://devfeed.tech/tags/research.md>), [transformer-architecture](<https://devfeed.tech/tags/transformer-architecture.md>), [vision](<https://devfeed.tech/tags/vision.md>), [vqa](<https://devfeed.tech/tags/vqa.md>)

## AI overview

The article explains how to fine-tune Microsoft's Florence-2 vision-language model for DocVQA. It describes the model's sequence-to-sequence architecture, its large FLD-5B pre-training dataset, prompting experiments, and evaluation using Levenshtein similarity.

## Source excerpt

We're on a journey to advance and democratize artificial intelligence through open source and open science.