# машинное обучение

Published articles for машинное обучение.

This is one page of public article previews, not the complete archive. Follow Next page to continue. Summaries are not the original full articles.

## Training Yandex's Alice Omnimodel to Integrate Text and Images

DevFeed: [Training Yandex's Alice Omnimodel to Integrate Text and Images](<https://devfeed.tech/articles/ai-vlm-llm-24891.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1077274/>)

Author: formica\_rufa (Яндекс)

Published: 2026-09-03T07:03:43Z

Content type: tutorial

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [Large Language Model](<https://devfeed.tech/topics/llm.md>), [vlm](<https://devfeed.tech/topics/vlm.md>), [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [Mixture of Experts (MoE)](<https://devfeed.tech/topics/mixture-of-experts-moe.md>), [qwen](<https://devfeed.tech/topics/qwen.md>), [Mercury](<https://devfeed.tech/topics/mercury-lang.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [llm](<https://devfeed.tech/tags/llm.md>), [ml](<https://devfeed.tech/tags/ml.md>), [moe](<https://devfeed.tech/tags/moe.md>), [qwen](<https://devfeed.tech/tags/qwen.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-61cd5a476b1d](<https://devfeed.tech/tags/tag-61cd5a476b1d.md>), [tag-831b63de9433](<https://devfeed.tech/tags/tag-831b63de9433.md>), [tag-86b843454893](<https://devfeed.tech/tags/tag-86b843454893.md>), [tag-95a2c958e46b](<https://devfeed.tech/tags/tag-95a2c958e46b.md>), [tag-ef0b1bf200df](<https://devfeed.tech/tags/tag-ef0b1bf200df.md>), [vlm](<https://devfeed.tech/tags/vlm.md>)

### AI overview

Yandex describes its work on an Alice omnimodel that combines a text LLM and a visual VLM into one model for text and image interactions. The article focuses on lessons from training and alignment, including the role of MoE architecture and reinforcement learning.

### Source excerpt

Ещё недавно Алиса отвечала на текст и на картинку будто двумя разными голосами. Под капотом и правда жили две генеративные модели: текстовая LLM и визуальная VLM, а между ними -- стена из непрозрачного роутинга, разных форматов ответов и разной вёрстки. Почти год мы сводили их в одну омнимодель -- такую, которая воспринимает текст и изображения как единое целое, без переключений за кадром. Получилось не всё и не сразу, но путь вышел поучительным, и в этой статье я хочу поделиться тем, что мы поняли про обучение таких моделей. Попутно -- несколько неочевидных поворотов: почему за два года до этого та же затея разваливалась, что изменила MoE-архитектура, почему омнипретрейн пришлось собирать с конца и почему один вид RL переезжает на большую модель легко, а другой рассыпается прямо на глазах. Меня зовут Алексей Григорьев, я представляю большую команду разработки омнимодели Яндекса. Вместе с моим коллегой Данилой Кашиным я расскажу про все технические грабли не со стороны наблюдателя, а как их непосредственный собиратель. Но рассказывать я буду с акцентом не на красивом замысле, а на самой болезненной части -- алайнменте. Читать далее

## Инженер против попугая: пишем промпты для больших продакшен-сервисов

DevFeed: [Инженер против попугая: пишем промпты для больших продакшен-сервисов](<https://devfeed.tech/articles/article-30662.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/hh/articles/1015896/>)

Author: polina\_belokrys (hh.ru)

Published: 2026-03-31T05:00:57Z

Content type: tutorial

Language: ru

Sources: [HeadHunter RU](<https://devfeed.tech/sources/headhunter-ru.md>)

Topics: [genai](<https://devfeed.tech/topics/genai.md>), [Machine learning](<https://devfeed.tech/topics/machine-learning.md>), [программирование](<https://devfeed.tech/topics/tag-2c039dce53be.md>)

Tags: [genai](<https://devfeed.tech/tags/genai.md>), [llm](<https://devfeed.tech/tags/llm.md>), [ml](<https://devfeed.tech/tags/ml.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-2c039dce53be](<https://devfeed.tech/tags/tag-2c039dce53be.md>), [tag-61cd5a476b1d](<https://devfeed.tech/tags/tag-61cd5a476b1d.md>), [tag-86b843454893](<https://devfeed.tech/tags/tag-86b843454893.md>), [tag-8ad48733f33c](<https://devfeed.tech/tags/tag-8ad48733f33c.md>), [tag-c8d154c0a625](<https://devfeed.tech/tags/tag-c8d154c0a625.md>), [tool](<https://devfeed.tech/tags/tool.md>)

### AI overview

A prompt engineer at hh.ru explains how prompting for production services differs from everyday chatbot use. Production prompt systems combine multiple prompts, structured data, tool calling, constraints, testing, and structured design to produce predictable, safe responses across diverse user scenarios.

### Source excerpt

Привет, Хабр! Меня зовут Полина Белокрыс, я промпт-инженер в hh.ru. Моя команда развивает ИИ-ассистента для работодателей, который берёт на себя рутинные задачи и помогает бизнесу сосредоточиться на главном -- внимательной работе с подходящими кандидатами. В этой статье расскажу, как на самом деле устроен промптинг в продакшене -- и почему написать промпт сложнее, чем просто поболтать с ChatGPT. Статья будет полезна промпт-инженерам, начинающим ML-инженерам и инженерам GenAI, которые работают с языковыми моделями и хотят лучше понимать, как пишутся промпты для продуктовых систем. Читать далее

## Автоматическая многоязычная модерация сообщений для миллионов пользователей

DevFeed: [Автоматическая многоязычная модерация сообщений для миллионов пользователей](<https://devfeed.tech/articles/article-23645.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/badoo/articles/648815/>)

Author: punkerpunker (Badoo)

Published: 2022-02-01T10:50:28Z

Content type: article

Language: ru

Sources: [Badoo EN](<https://devfeed.tech/sources/badoo-en.md>), [Badoo RU](<https://devfeed.tech/sources/badoo-ru.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [Natural language processing](<https://devfeed.tech/topics/nlp.md>), [Large Language Model](<https://devfeed.tech/topics/llm.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [badoo](<https://devfeed.tech/tags/badoo.md>), [bert](<https://devfeed.tech/tags/bert.md>), [data-science](<https://devfeed.tech/tags/data-science.md>), [gpt](<https://devfeed.tech/tags/gpt.md>), [gpt-3](<https://devfeed.tech/tags/gpt-3.md>), [natural-language-processing](<https://devfeed.tech/tags/natural-language-processing.md>), [nlp](<https://devfeed.tech/tags/nlp.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-13e2af703774](<https://devfeed.tech/tags/tag-13e2af703774.md>), [tag-1cd610c0e518](<https://devfeed.tech/tags/tag-1cd610c0e518.md>), [tag-5cb789e9aaa3](<https://devfeed.tech/tags/tag-5cb789e9aaa3.md>), [tag-9d8cf70dc46c](<https://devfeed.tech/tags/tag-9d8cf70dc46c.md>), [tag-e69b694e3ce2](<https://devfeed.tech/tags/tag-e69b694e3ce2.md>)

### AI overview

The article describes Badoo and Bumble's Rude Message Detector, a machine-learning system for multilingual moderation of rude messages. It discusses the system's architecture, deployment infrastructure, implementation challenges, and results, including the use of transformer-based architectures and large language models such as BERT, GPT-2, and GPT-3.

### Source excerpt

Как мы все знаем, слова обладают силой. Ими можно вдохновить людей, но можно и навредить. Мы в Badoo и Bumble стараемся оградить пользователей от неприятных ситуаций, поэтому внедрили инструмент Rude Message Detector. Это многоязычный детектор грубых высказываний, работающий на основе машинного обучения. В этой статье мы расскажем о технических особенностях нашего решения, сложностях, с которыми столкнулись в ходе реализации проекта, и его результатах. Читать далее

## Code Completion. Часть 4: обучение модели

DevFeed: [Code Completion. Часть 4: обучение модели](<https://devfeed.tech/articles/code-completion-4-23939.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/JetBrains/articles/582388/>)

Author: p0b0rchy (JetBrains)

Published: 2021-10-11T09:02:36Z

Content type: article

Language: ru

Sources: [JetBrains RU](<https://devfeed.tech/sources/jetbrains-ru.md>)

Topics: [code-completion](<https://devfeed.tech/topics/code-completion.md>), [машинное обучение](<https://devfeed.tech/topics/tag-055aee430837.md>), [ide](<https://devfeed.tech/topics/ide.md>)

Tags: [catboost](<https://devfeed.tech/tags/catboost.md>), [code-completion](<https://devfeed.tech/tags/code-completion.md>), [ide](<https://devfeed.tech/tags/ide.md>), [metric-learning](<https://devfeed.tech/tags/metric-learning.md>), [ml](<https://devfeed.tech/tags/ml.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-baed6d151ab4](<https://devfeed.tech/tags/tag-baed6d151ab4.md>)

### AI overview

This fourth article in a code-completion series describes problems encountered while training a machine-learning model. It explains anonymizing collected IDE data, investigating anomalous autocomplete usage through logs, and excluding users with alphabetical suggestion sorting from the training dataset and experiments.

### Source excerpt

Хотим поделиться специфическими проблемами, возникшими у нас при обучении модели, и решениями, которые мы для этих проблем придумали. В прошлый раз мы остановились на том, что из-за необходимости защищать код пользователей даже от себя самих нам необходимо анонимизировать все собранные данные. Вызову окна автодополнения сопоставляется набор параметров, каждый из которых -- либо число, либо перечислимый тип. А вот сам код, на котором пользователь вызвал окно, мы не сохраняем. Если при сборе данных мы допустим ошибку, нельзя будет просто заглянуть в код и все понять. Нам придется устраивать целое расследование без всякой гарантии успеха. Например

## Code Completion. Часть 3: где взять данные для обучения?

DevFeed: [Code Completion. Часть 3: где взять данные для обучения?](<https://devfeed.tech/articles/code-completion-3-23935.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/JetBrains/articles/578650/>)

Author: p0b0rchy (JetBrains)

Published: 2021-09-20T10:27:02Z

Content type: article

Language: ru

Sources: [JetBrains RU](<https://devfeed.tech/sources/jetbrains-ru.md>)

Topics: [Code](<https://devfeed.tech/topics/code.md>), [code-completion](<https://devfeed.tech/topics/code-completion.md>), [машинное обучение](<https://devfeed.tech/topics/tag-055aee430837.md>), [jetbrains](<https://devfeed.tech/topics/jetbrains.md>)

Tags: [code](<https://devfeed.tech/tags/code.md>), [code-completion](<https://devfeed.tech/tags/code-completion.md>), [data-protection](<https://devfeed.tech/tags/data-protection.md>), [dataset](<https://devfeed.tech/tags/dataset.md>), [ide](<https://devfeed.tech/tags/ide.md>), [jetbrains](<https://devfeed.tech/tags/jetbrains.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-9bf5e01ce62e](<https://devfeed.tech/tags/tag-9bf5e01ce62e.md>), [tag-baed6d151ab4](<https://devfeed.tech/tags/tag-baed6d151ab4.md>)

### AI overview

This article explains how JetBrains approaches building training data for machine-learning-based code completion. It describes why user code cannot be collected and why datasets derived only from completed open-source repositories do not adequately represent real development scenarios.

### Source excerpt

В предыдущей статье цикла мы установили, что современной системе автодополнения нужно машинное обучение -- чтобы ранжировать варианты подсказок. Машине, как и человеку, для обучения нужны данные. Мы используем подход "обучение с учителем". Он предполагает, что мы показываем алгоритму примеры задач, для которых нам заранее известно правильное решение. Алгоритм извлекает из этих примеров закономерности и учится принимать правильные решения даже в тех ситуациях, которых он раньше не видел. Результат обучения критическим образом зависит от качества и объема этих примеров. И именно здесь у нас возникают трудности. С одной стороны, собирать базу на основе кода наших пользователей нельзя: результат вашего труда остается только у вас, на серверы JetBrains он не попадает. С другой стороны, из доступных репозиториев с открытым кодом полноценный датасет собрать не получается. Делая так, мы обучали бы алгоритм работать только с готовым (рабочим) кодом. Сегодня обсудим, как мы выкручиваемся из этой ситуации. Для начала давайте более подробно рассмотрим, почему не получается работать с готовыми репозиториями. А потому что они "готовые"

## Code Completion. Часть 2: зачем тут машинное обучение?

DevFeed: [Code Completion. Часть 2: зачем тут машинное обучение?](<https://devfeed.tech/articles/code-completion-2-23929.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/JetBrains/articles/572864/>)

Author: p0b0rchy (JetBrains)

Published: 2021-08-17T09:45:16Z

Content type: tutorial

Language: ru

Sources: [JetBrains RU](<https://devfeed.tech/sources/jetbrains-ru.md>)

Topics: [code-completion](<https://devfeed.tech/topics/code-completion.md>), [машинное обучение](<https://devfeed.tech/topics/tag-055aee430837.md>), [ide](<https://devfeed.tech/topics/ide.md>), [Code](<https://devfeed.tech/topics/code.md>)

Tags: [code](<https://devfeed.tech/tags/code.md>), [code-completion](<https://devfeed.tech/tags/code-completion.md>), [ide](<https://devfeed.tech/tags/ide.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-baed6d151ab4](<https://devfeed.tech/tags/tag-baed6d151ab4.md>)

### AI overview

The second part of a series explains why machine learning is used in code completion. It examines conflicts among heuristic rules, including prefix and CamelCase matching, and discusses ranking suggestions by correctness and proximity to the edited code.

### Source excerpt

В первой части мы сформулировали, из каких компонентов состоит система автодополнения, обсудили способы ее использования и требования к качеству. Теперь давайте разберемся, зачем там нужно машинное обучение. Казалось бы, страшно выбрасывать работающий код и заменять его машиннообученным бинарником, который жрет память, может замедлить работу IDE, да еще не вдруг и отладишь его, если что-то пошло не так. В нашем случае "работающий код" -- это эвристики, жесткие правила. Они отлично работают, пока их не очень много и они не конфликтуют между собой. Давайте рассмотрим такие правила подробнее и разберемся, откуда берутся конфликты. Как на самом деле работают подсказки

## Code Completion. Часть 1: сценарии и требования

DevFeed: [Code Completion. Часть 1: сценарии и требования](<https://devfeed.tech/articles/code-completion-1-23920.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/JetBrains/articles/568884/>)

Author: p0b0rchy (JetBrains)

Published: 2021-07-21T11:18:54Z

Content type: article

Language: ru

Sources: [JetBrains RU](<https://devfeed.tech/sources/jetbrains-ru.md>)

Topics: [code-completion](<https://devfeed.tech/topics/code-completion.md>), [Code](<https://devfeed.tech/topics/code.md>), [ide](<https://devfeed.tech/topics/ide.md>), [машинное обучение](<https://devfeed.tech/topics/tag-055aee430837.md>)

Tags: [code](<https://devfeed.tech/tags/code.md>), [code-completion](<https://devfeed.tech/tags/code-completion.md>), [ide](<https://devfeed.tech/tags/ide.md>), [machine-learning](<https://devfeed.tech/tags/machine-learning.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>)

### AI overview

This first article in a series examines why machine learning is useful for code completion in JetBrains IDEs. It introduces completion-use scenarios and requirements, including dataset collection, data protection, model training, and quality evaluation with desktop-application A/B tests.

### Source excerpt

Знаете, сколько всего успевает сделать IDE, чтобы показать окно сode сompletion, когда вы начинаете набирать новое слово? Под капотом формулы, полученные с помощью машинного обучения. Сортировка подсказок -- одно из первых применений машинного обучения в IDE JetBrains. Думаем, вам будет интересно узнать, через какие тернии нам пришлось пройти, чтобы эту сортировку реализовать. Данная статья -- первая из цикла, в рамках которого мы расскажем, зачем окну с подсказками вообще нужно машинное обучение и как мы решали некоторые связанные с этим задачи. А задач тех немало

## Анонсируем версию Datalore Enterprise для команд Data Science

DevFeed: [Анонсируем версию Datalore Enterprise для команд Data Science](<https://devfeed.tech/articles/datalore-enterprise-data-science-23918.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/JetBrains/articles/566378/>)

Author: alenaguzharina (JetBrains)

Published: 2021-07-06T15:00:01Z

Content type: release

Language: ru

Sources: [JetBrains RU](<https://devfeed.tech/sources/jetbrains-ru.md>)

Topics: [Data Science](<https://devfeed.tech/topics/data-science.md>), [jupyter](<https://devfeed.tech/topics/jupyter.md>), [Python](<https://devfeed.tech/topics/python.md>), [Amazon S3](<https://devfeed.tech/topics/amazon-s3.md>)

Tags: [aws](<https://devfeed.tech/tags/aws.md>), [aws-s3](<https://devfeed.tech/tags/aws-s3.md>), [data-science](<https://devfeed.tech/tags/data-science.md>), [datalore](<https://devfeed.tech/tags/datalore.md>), [jetbrains](<https://devfeed.tech/tags/jetbrains.md>), [jupyter](<https://devfeed.tech/tags/jupyter.md>), [jupyter-notebooks](<https://devfeed.tech/tags/jupyter-notebooks.md>), [jupyterhub](<https://devfeed.tech/tags/jupyterhub.md>), [jupyterlab](<https://devfeed.tech/tags/jupyterlab.md>), [python](<https://devfeed.tech/tags/python.md>), [tag-055aee430837](<https://devfeed.tech/tags/tag-055aee430837.md>), [tag-752bfc3f8269](<https://devfeed.tech/tags/tag-752bfc3f8269.md>), [tag-baf5012a40ff](<https://devfeed.tech/tags/tag-baf5012a40ff.md>)

### AI overview

JetBrains announces Datalore Enterprise, a version of Datalore designed for Data Science teams. It adds team-oriented capabilities to Jupyter notebooks, including PyCharm code assistance, persistent data storage, authentication, configurable environments, compute-resource management, versioning, real-time collaboration, and AWS S3 integration.

### Source excerpt

Привет, Хабр! Jupyter-ноутбуки хоть и вызывают споры, однако все равно являются самым часто используемым инструментом для решения задач Data Science. Ноутбуки просты в личном использовании. Но если вы когда-либо пробовали организовать командную работу с ними, то наверняка сталкивались со сложностями. Именно поэтому мы в JetBrains решили выпустить специальную версию Datalore Enterprise для команд Data Science! Читать далее