# Visual Document Retrieval Goes Multilingual

DevFeed: [Visual Document Retrieval Goes Multilingual](<https://devfeed.tech/articles/visual-document-retrieval-goes-multilingual-7550.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/vdr-2b-multilingual>)

Author: Marco Cimolai; Logan Markewich

Published: 2025-01-10T00:00:00Z

Content type: article

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [datasets](<https://devfeed.tech/topics/datasets.md>), [Embeddings](<https://devfeed.tech/topics/embeddings.md>), [hugging face](<https://devfeed.tech/topics/hugging-face.md>), [llamaindex](<https://devfeed.tech/topics/llamaindex.md>), [multimodal](<https://devfeed.tech/topics/multimodal.md>), [Open Source](<https://devfeed.tech/topics/open-source.md>), [Inference](<https://devfeed.tech/topics/inference.md>), [data](<https://devfeed.tech/topics/data.md>), [Query (disambiguation)](<https://devfeed.tech/topics/query.md>)

Tags: [artificial-intelligence](<https://devfeed.tech/tags/artificial-intelligence.md>), [benchmarks](<https://devfeed.tech/tags/benchmarks.md>), [cv](<https://devfeed.tech/tags/cv.md>), [data](<https://devfeed.tech/tags/data.md>), [datasets](<https://devfeed.tech/tags/datasets.md>), [embeddings](<https://devfeed.tech/tags/embeddings.md>), [hugging-face](<https://devfeed.tech/tags/hugging-face.md>), [inference](<https://devfeed.tech/tags/inference.md>), [integrations](<https://devfeed.tech/tags/integrations.md>), [llamaindex](<https://devfeed.tech/tags/llamaindex.md>), [multimodal](<https://devfeed.tech/tags/multimodal.md>), [nlp](<https://devfeed.tech/tags/nlp.md>), [open-source](<https://devfeed.tech/tags/open-source.md>), [open-source-collab](<https://devfeed.tech/tags/open-source-collab.md>), [retrieval](<https://devfeed.tech/tags/retrieval.md>), [synthetic](<https://devfeed.tech/tags/synthetic.md>), [vector](<https://devfeed.tech/tags/vector.md>), [vlms](<https://devfeed.tech/tags/vlms.md>)

## AI overview

The article introduces a multilingual embedding model for visual document retrieval and its English-only counterpart. The models encode document page screenshots into dense single-vector representations, enabling visual search across languages without OCR or document-chunking pipelines. The article also presents a 500,000-sample open-source multilingual synthetic dataset, reports faster inference and lower VRAM usage, and describes cross-lingual retrieval and Matryoshka Representation Learning capabilities.

## Source excerpt

We're on a journey to advance and democratize artificial intelligence through open source and open science.