# Как мы описали 15 000 таблиц за полгода вместо 500 за год -- и перестали писать документацию руками

DevFeed: [Как мы описали 15 000 таблиц за полгода вместо 500 за год -- и перестали писать документацию руками](<https://devfeed.tech/articles/15-000-500-24870.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1060882/>)

Author: rgridnev (Яндекс)

Published: 2026-07-29T07:03:01Z

Content type: article

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [Large Language Model](<https://devfeed.tech/topics/llm.md>), [.env](<https://devfeed.tech/topics/dotenv.md>)

Tags: [dwh](<https://devfeed.tech/tags/dwh.md>), [llm](<https://devfeed.tech/tags/llm.md>), [tag-0d83e6fe8cd5](<https://devfeed.tech/tags/tag-0d83e6fe8cd5.md>), [tag-32a4c9a0ec10](<https://devfeed.tech/tags/tag-32a4c9a0ec10.md>), [tag-61cd5a476b1d](<https://devfeed.tech/tags/tag-61cd5a476b1d.md>), [tag-9d8cf70dc46c](<https://devfeed.tech/tags/tag-9d8cf70dc46c.md>), [tag-dc23c7266507](<https://devfeed.tech/tags/tag-dc23c7266507.md>)

## AI overview

Yandex describes using an LLM to generate draft documentation for data tables, giving analysts a starting point instead of a blank page. Over six months, the approach produced descriptions for 15,000 tables compared with 500 tables documented manually over a year, saving about five years of analyst work. The article also discusses how documentation quality varies across DWH data, analyst data, and raw logs.

## Source excerpt

Годы идут, но что-то остаётся неизменным: писать документацию никто не любит, но тем не менее все почему-то ругают тех, кто её не пишет. В Яндексе одних только таблиц с данными -- десятки миллионов, общим объёмом в экзабайты данных. Даже когда мы оставляем из всего этого количества только самое востребованное, остаётся несколько десятков тысяч таблиц, которые кто-то должен описать словами: что внутри, откуда взялось, можно ли этому доверять. Без таких описаний аналитик не находит данные через поиск, не понимает, что лежит в таблице, и заново собирает то, что уже собрал коллега. И страдает не только человек: ИИ-агенты, которые всё чаще сами решают аналитические задачи, на неописанных данных также теряют в качестве -- чем меньше известно про таблицу, тем хуже результат. Год мы уговаривали людей описывать таблицы вручную -- и собрали описания всего на 500 таблиц из 40 тысяч. Если описывать все данные с такой скоростью (при учёте, что постоянно появляются новые) -- страшно представить, на сколько десятков лет мог бы растянуться этот процесс. Меня зовут Роман Гриднев, я технический менеджер в Яндексе. Расскажу, как мы научились не писать документацию. "Не писать-то все могут", -- скажете вы. Но мы подключили к задаче LLM и дали людям вместо чистого листа черновик: пусть с ошибками, зато не пустую страницу, которая пугает. За полгода мы так описали 15 тысяч таблиц и сэкономили около пяти лет рабочего времени аналитиков. Со временем качество черновиков от LLM доросло до почти полного соответствия описаниям, сделанным людьми. Читать далее