Serving LLM: Vì sao chạy production khó hơn demo rất nhiều
Model benchmark đẹp, demo trên máy cá nhân mượt — nhưng đưa lên production cho 5000 người dùng cùng lúc thì GPU báo Out-of-memory. Đi từ prefill/decode, KV Cache, PagedAttention, continuous batching, chunked prefill, đến cách chọn serving engine (vLLM, SGLang…) — và vì sao vấn đề không nằm ở model mà nằm ở cách serving.