Serving LLM: Vì sao chạy production khó hơn demo rất nhiều

Model benchmark đẹp, demo trên máy cá nhân mượt — nhưng đưa lên production cho 5000 người dùng cùng lúc thì GPU báo Out-of-memory. Đi từ prefill/decode, KV Cache, PagedAttention, continuous batching, chunked prefill, đến cách chọn serving engine (vLLM, SGLang…) — và vì sao vấn đề không nằm ở model mà nằm ở cách serving.

22-08-2026 · 24 phút · 5040 từ · Kh4ng

Fine-tuning LLM: Từ Prompt, RAG đến LoRA, QLoRA và DoRA

Vì sao general model chưa đủ cho bài toán domain-specific, và fine-tuning giải quyết gì mà Prompt Engineering hay RAG không làm được. Đi từ format dữ liệu, sequence packing, Full Fine-tuning, đến LoRA, QLoRA và DoRA — cùng lý do từng kỹ thuật ra đời.

15-08-2026 · 24 phút · 4927 từ · Kh4ng

Graph Engineering: Kiến trúc đồ thị cho hệ thống AI Agent thế hệ mới

Loop Engineering Is Dead. Enter Graph Engineering — khi một vòng lặp đơn lẻ không còn đủ, thứ bạn thu được là một đồ thị. Tổng hợp và phân tích về xu hướng kiến trúc đồ thị cho hệ thống AI agent đa thành phần.

03-08-2026 · 27 phút · 5691 từ · Kh4ng