Chào mừng đến với blog của Kh4ng 👋

Đây là nơi mình ghi lại những gì học được về lập trình, công nghệ và một vài suy nghĩ cá nhân trên đường đi.

Serving LLM: Vì sao chạy production khó hơn demo rất nhiều

Model benchmark đẹp, demo trên máy cá nhân mượt — nhưng đưa lên production cho 5000 người dùng cùng lúc thì GPU báo Out-of-memory. Đi từ prefill/decode, KV Cache, PagedAttention, continuous batching, chunked prefill, đến cách chọn serving engine (vLLM, SGLang…) — và vì sao vấn đề không nằm ở model mà nằm ở cách serving.

22-08-2026 · 24 phút · 5040 từ · Kh4ng

Fine-tuning LLM: Từ Prompt, RAG đến LoRA, QLoRA và DoRA

Vì sao general model chưa đủ cho bài toán domain-specific, và fine-tuning giải quyết gì mà Prompt Engineering hay RAG không làm được. Đi từ format dữ liệu, sequence packing, Full Fine-tuning, đến LoRA, QLoRA và DoRA — cùng lý do từng kỹ thuật ra đời.

15-08-2026 · 24 phút · 4927 từ · Kh4ng

Graph Engineering: Kiến trúc đồ thị cho hệ thống AI Agent thế hệ mới

Loop Engineering Is Dead. Enter Graph Engineering — khi một vòng lặp đơn lẻ không còn đủ, thứ bạn thu được là một đồ thị. Tổng hợp và phân tích về xu hướng kiến trúc đồ thị cho hệ thống AI agent đa thành phần.

03-08-2026 · 27 phút · 5691 từ · Kh4ng

Conjecture Machines: AI agent và nút thắt kiểm chứng mới trong khoa học

Tóm tắt và một vài suy nghĩ về báo cáo ‘Conjecture Machines’ của Google DeepMind (7/2026): AI agent đang khiến việc tạo ra ý tưởng khoa học trở nên rẻ và dồi dào, nhưng khâu kiểm chứng lại chưa theo kịp.

19-07-2026 · 9 phút · 1824 từ · Kh4ng

Thiết lập blog cá nhân với Hugo + PaperMod

Ghi chú nhanh các bước dựng blog tĩnh với Hugo, theme PaperMod, và deploy lên GitHub Pages.

18-07-2026 · 1 phút · 107 từ · Kh4ng

Xin chào, đây là blog của mình

Bài viết đầu tiên trên blog — lý do mình bắt đầu viết và dự định sắp tới.

18-07-2026 · 1 phút · 92 từ · Kh4ng