# датасет

Published articles for датасет.

This is one page of public article previews, not the complete archive. Follow Next page to continue. Summaries are not the original full articles.

## В открытых иностранных датасетах для ИИ нашли песни и клипы российских исполнителей

DevFeed: [В открытых иностранных датасетах для ИИ нашли песни и клипы российских исполнителей](<https://devfeed.tech/articles/article-40913.md>)

Original publisher: [Read original article](<https://habr.com/ru/news/1083250/>)

Author: TraurigerNarr

Published: 2026-09-17T07:54:17Z

Content type: news

Language: ru

Sources: [Tagir Valeev](<https://devfeed.tech/sources/tagir-valeev.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [OpenAI](<https://devfeed.tech/topics/openai.md>), [anthropic](<https://devfeed.tech/topics/anthropic.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [anthropic](<https://devfeed.tech/tags/anthropic.md>), [openai](<https://devfeed.tech/tags/openai.md>), [tag-0b20a7592413](<https://devfeed.tech/tags/tag-0b20a7592413.md>), [tag-13e2af703774](<https://devfeed.tech/tags/tag-13e2af703774.md>), [tag-61cd5a476b1d](<https://devfeed.tech/tags/tag-61cd5a476b1d.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-b74d52e26215](<https://devfeed.tech/tags/tag-b74d52e26215.md>), [tag-ecb3d714bf55](<https://devfeed.tech/tags/tag-ecb3d714bf55.md>)

### AI overview

Analysts from Russia's National Federation of the Music Industry found songs and music videos by Russian artists in two foreign AI datasets containing millions of tracks sourced from YouTube. Music industry representatives said they had not received licensing requests from the neural-network creators, and the article reports that the tracks may have come from pirated sources.

### Source excerpt

Аналитики Национальной федерации музыкальной индустрии (НФМИ) исследовали базу данных проекта AI Watchdog, созданного журналом The Atlantic. Проект анализирует датасеты Laion-Disco-12M от Laion с 12,3 млн треков с YouTube и Sleeping-D 9M от Sleeping AI с 9,7 млн треков из того же источника. В указанных базах нашлись песни Басты, Димы Билана, Леонида Агутина и других российских музыкантов, пишут "Ведомости". Читать далее

## PereStruct: Modular Pipeline and Dataset for Parsing Historical Newspapers

DevFeed: [PereStruct: Modular Pipeline and Dataset for Parsing Historical Newspapers](<https://devfeed.tech/articles/vlm-perestruct-24889.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1076770/>)

Author: makSShan (Яндекс, Yandex Cloud & Yandex Infrastructure)

Published: 2026-09-01T07:05:21Z

Content type: tutorial

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [яндекс](<https://devfeed.tech/topics/tag-4004cf5948d3.md>), [vlm](<https://devfeed.tech/topics/vlm.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [ai-studio](<https://devfeed.tech/tags/ai-studio.md>), [bleu](<https://devfeed.tech/tags/bleu.md>), [computervision](<https://devfeed.tech/tags/computervision.md>), [ocr](<https://devfeed.tech/tags/ocr.md>), [perestruct](<https://devfeed.tech/tags/perestruct.md>), [rouge](<https://devfeed.tech/tags/rouge.md>), [tag-4004cf5948d3](<https://devfeed.tech/tags/tag-4004cf5948d3.md>), [tag-65c8d6d9e736](<https://devfeed.tech/tags/tag-65c8d6d9e736.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-d27a0708d400](<https://devfeed.tech/tags/tag-d27a0708d400.md>), [vision](<https://devfeed.tech/tags/vision.md>), [vlm](<https://devfeed.tech/tags/vlm.md>), [yandex-ai-studio](<https://devfeed.tech/tags/yandex-ai-studio.md>), [yolo](<https://devfeed.tech/tags/yolo.md>)

### AI overview

The article presents PereStruct, a modular pipeline for reconstructing articles from historical newspaper scans. It combines YOLO-based layout detection, Yandex Vision OCR, Yandex AI Studio models for error correction, and a semantic model for assembling article blocks; the authors also publish code, an annotated dataset, and a benchmark.

### Source excerpt

Попробуйте открыть скан советской газеты и прочитать одну статью от начала до конца. Человек быстро замечает крупный заголовок, продолжение в соседней колонке и подпись под фотографией. Для алгоритма перед ним -- это выцветшая страница с десятками тесно расположенных прямоугольников, нестандартными шрифтами и неоднозначным порядком чтения. Даже если OCR правильно распознаёт почти все слова, на выходе ещё не получится документ. Нужно понять, какие фрагменты относятся к одной статье, где её начало, в каком порядке соединить блоки и что не следует включать в основной текст. Мы разработали PereStruct -- модульный пайплайн для разбора исторических газет. Он объединяет детектор вёрстки на базе YOLO, Yandex Vision OCR, коррекцию ошибок с помощью моделей Yandex AI Studio и отдельную модель семантической сборки статей. Вместе с кодом мы публикуем размеченный датасет и бенчмарк, чтобы другие команды могли изучать подход и ставить эксперименты на исторических документах. Читать далее

## Эволюция данных: генетический алгоритм в задаче классификации текстов

DevFeed: [Эволюция данных: генетический алгоритм в задаче классификации текстов](<https://devfeed.tech/articles/article-23997.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/redmadrobot/articles/1027238/>)

Author: evgeneration (red\_mad\_robot)

Published: 2026-04-23T19:05:42Z

Content type: article

Language: ru

Sources: [Redmadrobot EN](<https://devfeed.tech/sources/redmadrobot-en.md>), [Redmadrobot RU](<https://devfeed.tech/sources/redmadrobot-ru.md>)

Topics: [Natural language processing](<https://devfeed.tech/topics/nlp.md>), [Large Language Model](<https://devfeed.tech/topics/llm.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [evolution](<https://devfeed.tech/tags/evolution.md>), [llm](<https://devfeed.tech/tags/llm.md>), [ml](<https://devfeed.tech/tags/ml.md>), [nlp](<https://devfeed.tech/tags/nlp.md>), [prompt](<https://devfeed.tech/tags/prompt.md>), [tag-1cd610c0e518](<https://devfeed.tech/tags/tag-1cd610c0e518.md>), [tag-1f12060c781a](<https://devfeed.tech/tags/tag-1f12060c781a.md>), [tag-2d1b71a8786f](<https://devfeed.tech/tags/tag-2d1b71a8786f.md>), [tag-7bc388df28ed](<https://devfeed.tech/tags/tag-7bc388df28ed.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-9d8cf70dc46c](<https://devfeed.tech/tags/tag-9d8cf70dc46c.md>)

### AI overview

The article describes using a genetic algorithm to evolve prompts that generate training data for text-classification models. The approach was motivated by poor results from synthetic datasets and manual prompt iteration, with prompt fitness evaluated by classifier performance on a fixed test set.

### Source excerpt

Привет! Меня зовут Женя Андриевская. Я -- NLP-инженер в лаборатории R&D red_mad_robot. Сегодня расскажу, как мы призвали на помощь эволюцию, чтобы улучшить качество данных в задачах классификации текстов. Да-да, ту самую эволюцию, с мутациями и скрещиваниями -- только в мире данных, промптов и LLM. Читать далее

## Как маскировать персональные данные на изображениях: наш эксперимент с OCR и NER

DevFeed: [Как маскировать персональные данные на изображениях: наш эксперимент с OCR и NER](<https://devfeed.tech/articles/ocr-ner-23996.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/redmadrobot/articles/1011450/>)

Author: andrivasg (red\_mad\_robot)

Published: 2026-03-17T15:55:37Z

Content type: tutorial

Language: ru

Sources: [Redmadrobot EN](<https://devfeed.tech/sources/redmadrobot-en.md>), [Redmadrobot RU](<https://devfeed.tech/sources/redmadrobot-ru.md>)

Topics: [Natural language processing](<https://devfeed.tech/topics/nlp.md>), [pii](<https://devfeed.tech/topics/pii.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [computer-vision](<https://devfeed.tech/tags/computer-vision.md>), [llm](<https://devfeed.tech/tags/llm.md>), [ner](<https://devfeed.tech/tags/ner.md>), [nlp](<https://devfeed.tech/tags/nlp.md>), [ocr](<https://devfeed.tech/tags/ocr.md>), [pii](<https://devfeed.tech/tags/pii.md>), [red-mad-robot](<https://devfeed.tech/tags/red-mad-robot.md>), [rnd](<https://devfeed.tech/tags/rnd.md>), [tag-601fbc7112a4](<https://devfeed.tech/tags/tag-601fbc7112a4.md>), [tag-7bc388df28ed](<https://devfeed.tech/tags/tag-7bc388df28ed.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-b92bf5906bbd](<https://devfeed.tech/tags/tag-b92bf5906bbd.md>), [tag-ef0b1bf200df](<https://devfeed.tech/tags/tag-ef0b1bf200df.md>)

### AI overview

The article describes red_mad_robot's experiment using OCR combined with a NER model to detect and selectively mask personally identifiable information in images without training specialized visual detectors. On a dataset of 40 annotated images, the pipeline masked 90% of personal data while falsely masking 14% of text polygons; performance declined on difficult real-world photographs.

### Source excerpt

Всем привет! Меня зовут Андрей Иванов, я NLP-исследователь в R&D red_mad_robot. Мы разрабатываем систему Guardrails для защиты персональных данных (PII) и фильтрации небезопасного контента. В этой статье расскажу, как мы решали задачу точечного маскирования PII на картинках без обучения специальных визуальных детекторов. Разберём связку оптического распознавания символов (OCR) с NER-моделью, покажем метрики на реальных данных, раскроем ограничения подхода и наши решения для их преодоления. Читать далее

## What MarkUp Engineers Do and How QA Engineers Are Trained for AI Data Labeling

DevFeed: [What MarkUp Engineers Do and How QA Engineers Are Trained for AI Data Labeling](<https://devfeed.tech/articles/markup-24003.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/redmadrobot/articles/860070/>)

Author: redmadrobot (red\_mad\_robot)

Published: 2024-11-20T14:45:37Z

Content type: tutorial

Language: ru

Sources: [Redmadrobot EN](<https://devfeed.tech/sources/redmadrobot-en.md>), [Redmadrobot RU](<https://devfeed.tech/sources/redmadrobot-ru.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [Large Language Model](<https://devfeed.tech/topics/llm.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [llm](<https://devfeed.tech/tags/llm.md>), [markup](<https://devfeed.tech/tags/markup.md>), [prompt-engineering](<https://devfeed.tech/tags/prompt-engineering.md>), [qa](<https://devfeed.tech/tags/qa.md>), [tag-265903b3a1bd](<https://devfeed.tech/tags/tag-265903b3a1bd.md>), [tag-86b843454893](<https://devfeed.tech/tags/tag-86b843454893.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-9d8cf70dc46c](<https://devfeed.tech/tags/tag-9d8cf70dc46c.md>), [tag-c24f64f30028](<https://devfeed.tech/tags/tag-c24f64f30028.md>), [tag-f432a38ebe75](<https://devfeed.tech/tags/tag-f432a38ebe75.md>)

### AI overview

The article explains the role of MarkUp engineers in AI projects and describes an internal training approach that helps QA engineers develop data-labeling skills. It also introduces terminology related to LLM data preparation, including chunks, prompts, parsers, temperature, and datasets.

### Source excerpt

В работе над смарт-системой на базе AI нам понадобились специалисты по разметке данных -- MarkUp-инженеры. Рынок труда быстро трансформируется, и новые позиции не всегда можно закрыть готовыми специалистами, поэтому мы сосредоточились на формировании навыков внутри команды. Мы поняли, что навыки QA-инженеров пересекаются с компетенциями, необходимыми для работы с данными в AI-системах, и решили организовать производственное обучение внутри команды. Рассказываем о том, кто такие разметчики, как тестировщики осваивали MarkUp, и что из этого вышло. Читать далее

## Code Completion. Часть 3: где взять данные для обучения?

DevFeed: [Code Completion. Часть 3: где взять данные для обучения?](<https://devfeed.tech/articles/code-completion-3-23935.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/JetBrains/articles/578650/>)

Author: p0b0rchy (JetBrains)

Published: 2021-09-20T10:27:02Z

Content type: article

Language: ru

Sources: [JetBrains RU](<https://devfeed.tech/sources/jetbrains-ru.md>)

Topics: [Code](<https://devfeed.tech/topics/code.md>), [code-completion](<https://devfeed.tech/topics/code-completion.md>), [машинное обучение](<https://devfeed.tech/topics/tag-055aee430837.md>), [jetbrains](<https://devfeed.tech/topics/jetbrains.md>)

Tags: [code](<https://devfeed.tech/tags/code.md>), [code-completion](<https://devfeed.tech/tags/code-completion.md>), [data-protection](<https://devfeed.tech/tags/data-protection.md>), [dataset](<https://devfeed.tech/tags/dataset.md>), [ide](<https://devfeed.tech/tags/ide.md>), [jetbrains](<https://devfeed.tech/tags/jetbrains.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-baed6d151ab4](<https://devfeed.tech/tags/tag-baed6d151ab4.md>)

### AI overview

This article explains how JetBrains approaches building training data for machine-learning-based code completion. It describes why user code cannot be collected and why datasets derived only from completed open-source repositories do not adequately represent real development scenarios.

### Source excerpt

В предыдущей статье цикла мы установили, что современной системе автодополнения нужно машинное обучение -- чтобы ранжировать варианты подсказок. Машине, как и человеку, для обучения нужны данные. Мы используем подход "обучение с учителем". Он предполагает, что мы показываем алгоритму примеры задач, для которых нам заранее известно правильное решение. Алгоритм извлекает из этих примеров закономерности и учится принимать правильные решения даже в тех ситуациях, которых он раньше не видел. Результат обучения критическим образом зависит от качества и объема этих примеров. И именно здесь у нас возникают трудности. С одной стороны, собирать базу на основе кода наших пользователей нельзя: результат вашего труда остается только у вас, на серверы JetBrains он не попадает. С другой стороны, из доступных репозиториев с открытым кодом полноценный датасет собрать не получается. Делая так, мы обучали бы алгоритм работать только с готовым (рабочим) кодом. Сегодня обсудим, как мы выкручиваемся из этой ситуации. Для начала давайте более подробно рассмотрим, почему не получается работать с готовыми репозиториями. А потому что они "готовые"