# yandex ai studio

Published articles for yandex ai studio.

This is one page of public article previews, not the complete archive. Follow Next page to continue. Summaries are not the original full articles.

## PereStruct: Modular Pipeline and Dataset for Parsing Historical Newspapers

DevFeed: [PereStruct: Modular Pipeline and Dataset for Parsing Historical Newspapers](<https://devfeed.tech/articles/vlm-perestruct-24889.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1076770/>)

Author: makSShan (Яндекс, Yandex Cloud & Yandex Infrastructure)

Published: 2026-09-01T07:05:21Z

Content type: tutorial

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [яндекс](<https://devfeed.tech/topics/tag-4004cf5948d3.md>), [vlm](<https://devfeed.tech/topics/vlm.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [ai-studio](<https://devfeed.tech/tags/ai-studio.md>), [bleu](<https://devfeed.tech/tags/bleu.md>), [computervision](<https://devfeed.tech/tags/computervision.md>), [ocr](<https://devfeed.tech/tags/ocr.md>), [perestruct](<https://devfeed.tech/tags/perestruct.md>), [rouge](<https://devfeed.tech/tags/rouge.md>), [tag-4004cf5948d3](<https://devfeed.tech/tags/tag-4004cf5948d3.md>), [tag-65c8d6d9e736](<https://devfeed.tech/tags/tag-65c8d6d9e736.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-d27a0708d400](<https://devfeed.tech/tags/tag-d27a0708d400.md>), [vision](<https://devfeed.tech/tags/vision.md>), [vlm](<https://devfeed.tech/tags/vlm.md>), [yandex-ai-studio](<https://devfeed.tech/tags/yandex-ai-studio.md>), [yolo](<https://devfeed.tech/tags/yolo.md>)

### AI overview

The article presents PereStruct, a modular pipeline for reconstructing articles from historical newspaper scans. It combines YOLO-based layout detection, Yandex Vision OCR, Yandex AI Studio models for error correction, and a semantic model for assembling article blocks; the authors also publish code, an annotated dataset, and a benchmark.

### Source excerpt

Попробуйте открыть скан советской газеты и прочитать одну статью от начала до конца. Человек быстро замечает крупный заголовок, продолжение в соседней колонке и подпись под фотографией. Для алгоритма перед ним -- это выцветшая страница с десятками тесно расположенных прямоугольников, нестандартными шрифтами и неоднозначным порядком чтения. Даже если OCR правильно распознаёт почти все слова, на выходе ещё не получится документ. Нужно понять, какие фрагменты относятся к одной статье, где её начало, в каком порядке соединить блоки и что не следует включать в основной текст. Мы разработали PereStruct -- модульный пайплайн для разбора исторических газет. Он объединяет детектор вёрстки на базе YOLO, Yandex Vision OCR, коррекцию ошибок с помощью моделей Yandex AI Studio и отдельную модель семантической сборки статей. Вместе с кодом мы публикуем размеченный датасет и бенчмарк, чтобы другие команды могли изучать подход и ставить эксперименты на исторических документах. Читать далее