# Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы

DevFeed: [Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы](<https://devfeed.tech/articles/llm-gpu-24867.md>)

Original publisher: [Read original article](<https://habr.com/ru/companies/yandex/articles/1056694/>)

Author: hotckisss (Яндекс, Yandex Cloud & Yandex Infrastructure)

Published: 2026-07-08T07:04:08Z

Content type: tutorial

Language: ru

Sources: [Яндекс - Как мы делаем Яндекс / Статьи](<https://devfeed.tech/sources/source.md>)

Topics: [Large Language Model](<https://devfeed.tech/topics/llm.md>), [Inference Performance](<https://devfeed.tech/topics/inference-performance.md>), [Low-Latency Inference](<https://devfeed.tech/topics/low-latency-inference.md>), [GPU](<https://devfeed.tech/topics/gpu.md>), [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [inference](<https://devfeed.tech/tags/inference.md>), [llm](<https://devfeed.tech/tags/llm.md>), [ml](<https://devfeed.tech/tags/ml.md>), [mlops](<https://devfeed.tech/tags/mlops.md>), [tag-b92bf5906bbd](<https://devfeed.tech/tags/tag-b92bf5906bbd.md>), [time](<https://devfeed.tech/tags/time.md>), [token](<https://devfeed.tech/tags/token.md>)

## AI overview

This article explains how to optimize LLM inference in production under mixed workloads. It examines causes of increased Time to First Token, including scheduling, GPU memory allocation, streaming output queues, networking, long contexts, and KV-cache growth, and outlines optimizations such as separating prefill and decode, contextual parallelism, speculative decoding, cache-aware load balancing, and large-model delivery.

## Source excerpt

Вы запустили LLM-инференс в продакшене. Поток запросов не менялся, нагрузка та же, что вчера, -- а Time to First Token внезапно вырос в три раза. Первая мысль: что-то с моделью. На деле причина почти никогда не в модели -- она прячется в планировщике, аллокаторе GPU-памяти, очереди стримингового вывода или сети. Чем длиннее контекст, тем больнее. Для классического attention вычислительная сложность растёт очень быстро. KV-кеш раздувается до десятков и сотен гигабайт, а в облаке всё это происходит на совершенно произвольном трафике: у одного клиента кодовый ассистент, у другого -- аналитика на миллион запросов в день, у третьего -- голосовой робот. На таких смешанных нагрузках всплывает то, чего не видно на референсных замерах вендора. Читать далее