Đây là nơi mình ghi lại những gì học được về lập trình, công nghệ và một vài suy nghĩ cá nhân trên đường đi.
Serving LLM: Vì sao chạy production khó hơn demo rất nhiều
Model benchmark đẹp, demo trên máy cá nhân mượt — nhưng đưa lên production cho 5000 người dùng cùng lúc thì GPU báo Out-of-memory. Đi từ prefill/decode, KV Cache, PagedAttention, continuous batching, chunked prefill, đến cách chọn serving engine (vLLM, SGLang…) — và vì sao vấn đề không nằm ở model mà nằm ở cách serving.
Fine-tuning LLM: Từ Prompt, RAG đến LoRA, QLoRA và DoRA
Vì sao general model chưa đủ cho bài toán domain-specific, và fine-tuning giải quyết gì mà Prompt Engineering hay RAG không làm được. Đi từ format dữ liệu, sequence packing, Full Fine-tuning, đến LoRA, QLoRA và DoRA — cùng lý do từng kỹ thuật ra đời.
Graph Engineering: Kiến trúc đồ thị cho hệ thống AI Agent thế hệ mới
Loop Engineering Is Dead. Enter Graph Engineering — khi một vòng lặp đơn lẻ không còn đủ, thứ bạn thu được là một đồ thị. Tổng hợp và phân tích về xu hướng kiến trúc đồ thị cho hệ thống AI agent đa thành phần.
Conjecture Machines: AI agent và nút thắt kiểm chứng mới trong khoa học
Tóm tắt và một vài suy nghĩ về báo cáo ‘Conjecture Machines’ của Google DeepMind (7/2026): AI agent đang khiến việc tạo ra ý tưởng khoa học trở nên rẻ và dồi dào, nhưng khâu kiểm chứng lại chưa theo kịp.
Thiết lập blog cá nhân với Hugo + PaperMod
Ghi chú nhanh các bước dựng blog tĩnh với Hugo, theme PaperMod, và deploy lên GitHub Pages.
Xin chào, đây là blog của mình
Bài viết đầu tiên trên blog — lý do mình bắt đầu viết và dự định sắp tới.