태그 / #Decode

#Decode

1편

AI

LLM 답변은 왜 첫 글자만 늦게 나올까요?

챗봇 답변의 첫 글자만 늦는 이유는 답을 만드는 과정이 Prefill 과 Decode 두 단계로 나뉘고 병목이 서로 다르기 때문입니다. 둘 사이의 KV Cache 가 왜 필요하고 얼마나 큰지, TTFT·Tokens/sec 가 뭘 재는지 정리했습니다.

KV CachePrefillDecodeLLM 추론LLM 인프라 입문