# Prefill and Decode for Concurrent Requests - Optimizing LLM Performance

DevFeed: [Prefill and Decode for Concurrent Requests - Optimizing LLM Performance](<https://devfeed.tech/articles/prefill-and-decode-for-concurrent-requests-optimizing-llm-performance-7517.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/tngtech/llm-performance-prefill-decode-concurrent-requests>)

Author: Benjamin Merkel

Published: 2025-04-16T10:10:58Z

Content type: article

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [Inference Performance](<https://devfeed.tech/topics/inference-performance.md>), [Language models](<https://devfeed.tech/topics/language-models.md>)

Tags: [blog](<https://devfeed.tech/tags/blog.md>), [cache](<https://devfeed.tech/tags/cache.md>), [hosting](<https://devfeed.tech/tags/hosting.md>), [hugging-face](<https://devfeed.tech/tags/hugging-face.md>), [large-language-models](<https://devfeed.tech/tags/large-language-models.md>), [latency](<https://devfeed.tech/tags/latency.md>), [llm](<https://devfeed.tech/tags/llm.md>), [llms](<https://devfeed.tech/tags/llms.md>), [metrics](<https://devfeed.tech/tags/metrics.md>), [performance](<https://devfeed.tech/tags/performance.md>), [text-generation](<https://devfeed.tech/tags/text-generation.md>)

## AI overview

The article explains how LLM text generation differs between prefill, which processes prompt tokens to produce the first output token, and decode, which produces later tokens sequentially. It relates this distinction to KV caching and latency metrics such as time to first token and time per output token.

## Source excerpt

A Blog post by TNG Technology Consulting GmbH on Hugging Face