# Vision Language Models (Better, faster, stronger)

DevFeed: [Vision Language Models (Better, faster, stronger)](<https://devfeed.tech/articles/vision-language-models-better-faster-stronger-7561.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/vlms-2025>)

Author: merve; Sergio Paniego; Aritra Roy Gosthipaty; Pedro Cuenca; Andres Marafioti

Published: 2025-05-12T00:00:00Z

Content type: article

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [vlm](<https://devfeed.tech/topics/vlm.md>), [multimodal](<https://devfeed.tech/topics/multimodal.md>), [Open Source](<https://devfeed.tech/topics/open-source.md>), [qwen](<https://devfeed.tech/topics/qwen.md>), [Meta](<https://devfeed.tech/topics/meta.md>), [deepseek](<https://devfeed.tech/topics/deepseek.md>)

Tags: [architecture](<https://devfeed.tech/tags/architecture.md>), [community](<https://devfeed.tech/tags/community.md>), [deepseek](<https://devfeed.tech/tags/deepseek.md>), [embeddings](<https://devfeed.tech/tags/embeddings.md>), [multimodal](<https://devfeed.tech/tags/multimodal.md>), [open-source](<https://devfeed.tech/tags/open-source.md>), [qwen](<https://devfeed.tech/tags/qwen.md>), [research](<https://devfeed.tech/tags/research.md>), [streaming](<https://devfeed.tech/tags/streaming.md>), [vision](<https://devfeed.tech/tags/vision.md>), [vlm](<https://devfeed.tech/tags/vlm.md>), [vlms](<https://devfeed.tech/tags/vlms.md>)

## AI overview

This article reviews major developments in vision-language models over the past year, including smaller and more capable models, new architectures, reasoning, agency, long-video understanding, multimodal Retrieval Augmented Generation, and multimodal agents. It also explains any-to-any models and discusses examples including Chameleon, Lumina-mGPT, Qwen 2.5 Omni, MiniCPM-o 2.6, and Janus-Pro-7B.

## Source excerpt

We're on a journey to advance and democratize artificial intelligence through open source and open science.