# поисковые технологии

Published articles for поисковые технологии.

This is one page of public article previews, not the complete archive. Follow Next page to continue. Summaries are not the original full articles.

## How Yandex combined image and document text signals for image-search ranking

DevFeed: [How Yandex combined image and document text signals for image-search ranking](<https://devfeed.tech/articles/article-24877.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1066946/>)

Author: nikolaevkona (Яндекс)

Published: 2026-08-10T08:00:19Z

Content type: tutorial

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [яндекс](<https://devfeed.tech/topics/tag-4004cf5948d3.md>), [vlm](<https://devfeed.tech/topics/vlm.md>), [Image](<https://devfeed.tech/topics/image.md>), [realtime](<https://devfeed.tech/topics/realtime.md>)

Tags: [image](<https://devfeed.tech/tags/image.md>), [machine-learning](<https://devfeed.tech/tags/machine-learning.md>), [ml](<https://devfeed.tech/tags/ml.md>), [realtime](<https://devfeed.tech/tags/realtime.md>), [tag-4004cf5948d3](<https://devfeed.tech/tags/tag-4004cf5948d3.md>), [tag-8be2dbf54d97](<https://devfeed.tech/tags/tag-8be2dbf54d97.md>), [vlm](<https://devfeed.tech/tags/vlm.md>), [yandex-e983188bc433](<https://devfeed.tech/tags/yandex-e983188bc433.md>)

### AI overview

Yandex describes using multimodal vision-language models to jointly assess an image and its associated document text for image-search ranking. The team distilled a larger model into lighter models for different pipeline stages and reports deployment in real-time search.

### Source excerpt

Исторически в Яндекс Картинках релевантность документа оценивалась по двум сигналам: насколько запросу подходит само изображение и насколько -- текст, связанный с этим изображением. Такой подход позволяет учесть контент картинки и не провалиться на визуально трудноотличимых объектах, однако он же порождает проблему: в "серой зоне", когда текстовая релевантность не сонаправлена с картиночной, становится неочевидно, как именно агрегировать сигналы в финальный скор релевантности. Привет! Я Константин Николаев, занимаюсь внедрением нейротехнологий в Поиске по картинкам. В этой статье я расскажу, как наша команда научила модели смотреть на картинку и читать текст документа одновременно: начали с тяжёлой мультимодальной VLM ради максимального качества, а затем дистиллировали её в набор лёгких моделей -- по одной под каждую стадию пайплайна. Что из этого удалось довести до realtime-поиска с десятками тысяч запросов в секунду и как совместный анализ двух модальностей добавил 5% релевантных картинок в топ выдачи -- под катом. Читать далее