Serving LLM: Vì sao chạy production khó hơn demo rất nhiều

Model benchmark đẹp, demo trên máy cá nhân mượt — nhưng đưa lên production cho 5000 người dùng cùng lúc thì GPU báo Out-of-memory. Đi từ prefill/decode, KV Cache, PagedAttention, continuous batching, chunked prefill, đến cách chọn serving engine (vLLM, SGLang…) — và vì sao vấn đề không nằm ở model mà nằm ở cách serving.

22-08-2026 · 24 phút · 5040 từ · Kh4ng