# сырые данные

Published articles for сырые данные.

This is one page of public article previews, not the complete archive. Follow Next page to continue. Summaries are not the original full articles.

## Как мы описали 15 000 таблиц за полгода вместо 500 за год -- и перестали писать документацию руками

DevFeed: [Как мы описали 15 000 таблиц за полгода вместо 500 за год -- и перестали писать документацию руками](<https://devfeed.tech/articles/15-000-500-24870.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1060882/>)

Author: rgridnev (Яндекс)

Published: 2026-07-29T07:03:01Z

Content type: article

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [Large Language Model](<https://devfeed.tech/topics/llm.md>), [.env](<https://devfeed.tech/topics/dotenv.md>)

Tags: [dwh](<https://devfeed.tech/tags/dwh.md>), [llm](<https://devfeed.tech/tags/llm.md>), [tag-0d83e6fe8cd5](<https://devfeed.tech/tags/tag-0d83e6fe8cd5.md>), [tag-32a4c9a0ec10](<https://devfeed.tech/tags/tag-32a4c9a0ec10.md>), [tag-61cd5a476b1d](<https://devfeed.tech/tags/tag-61cd5a476b1d.md>), [tag-9d8cf70dc46c](<https://devfeed.tech/tags/tag-9d8cf70dc46c.md>), [tag-dc23c7266507](<https://devfeed.tech/tags/tag-dc23c7266507.md>)

### AI overview

Yandex describes using an LLM to generate draft documentation for data tables, giving analysts a starting point instead of a blank page. Over six months, the approach produced descriptions for 15,000 tables compared with 500 tables documented manually over a year, saving about five years of analyst work. The article also discusses how documentation quality varies across DWH data, analyst data, and raw logs.

### Source excerpt

Годы идут, но что-то остаётся неизменным: писать документацию никто не любит, но тем не менее все почему-то ругают тех, кто её не пишет. В Яндексе одних только таблиц с данными -- десятки миллионов, общим объёмом в экзабайты данных. Даже когда мы оставляем из всего этого количества только самое востребованное, остаётся несколько десятков тысяч таблиц, которые кто-то должен описать словами: что внутри, откуда взялось, можно ли этому доверять. Без таких описаний аналитик не находит данные через поиск, не понимает, что лежит в таблице, и заново собирает то, что уже собрал коллега. И страдает не только человек: ИИ-агенты, которые всё чаще сами решают аналитические задачи, на неописанных данных также теряют в качестве -- чем меньше известно про таблицу, тем хуже результат. Год мы уговаривали людей описывать таблицы вручную -- и собрали описания всего на 500 таблиц из 40 тысяч. Если описывать все данные с такой скоростью (при учёте, что постоянно появляются новые) -- страшно представить, на сколько десятков лет мог бы растянуться этот процесс. Меня зовут Роман Гриднев, я технический менеджер в Яндексе. Расскажу, как мы научились не писать документацию. "Не писать-то все могут", -- скажете вы. Но мы подключили к задаче LLM и дали людям вместо чистого листа черновик: пусть с ошибками, зато не пустую страницу, которая пугает. За полгода мы так описали 15 тысяч таблиц и сэкономили около пяти лет рабочего времени аналитиков. Со временем качество черновиков от LLM доросло до почти полного соответствия описаниям, сделанным людьми. Читать далее