🎯 Inference là gì?
Lúc model chạy thật để trả kết quả.
1
Hiểu nó là gì
Inference là giai đoạn dùng model đã huấn luyện xong để xử lý dữ liệu mới, khác với training là giai đoạn còn đang học.
Nói theo đời thường:
Học xong thì đến lúc hành nghề: training là đi học, inference là ngồi tiếp khách và xử lý từng ca.
Học xong thì đến lúc hành nghề: training là đi học, inference là ngồi tiếp khách và xử lý từng ca.
⚠ Chỗ ẩn dụ này hỏng
“Học xong rồi hành nghề” — nhưng model không tích luỹ kinh nghiệm qua từng ca như người hành nghề.
Mỗi lần gọi là một lần hoàn toàn mới. Nó không nhớ gì về lần trước trừ khi bạn tự nhét lại lịch sử vào prompt. Cảm giác “chatbot nhớ mình” thực ra là ứng dụng đang gửi lại toàn bộ cuộc trò chuyện mỗi lần — và đó là lý do chat càng dài càng tốn tiền.
2
Code trông thế nào
Bạn tưởng: bạn: "tên tôi là Na" → model ghi nhớ bạn: "tôi tên gì?" → model nhớ lại Thực tế mỗi lần gọi: gửi đi: ["tên tôi là Na", "chào Na", "tôi tên gì?"] ← gửi lại tất cả
Không có trí nhớ nào cả — chỉ là gửi lại toàn bộ lịch sử mỗi lượt.
3
Khi nào bạn dùng nó
✓ Dùng khi
- Bất cứ khi nào bạn dùng AI thật sự
- Cần ước lượng chi phí và độ trễ vận hành
✗ Đừng dùng khi
- Kỳ vọng model tự học từ phản hồi người dùng (không có chuyện đó)
Chưa cần biết: gộp lô, phục vụ model, tối ưu độ trễ, lượng tử hoá.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi ứng dụng của bạn có người dùng thật và chi phí gọi API bắt đầu đáng kể.
4
Đi đâu tiếp
- ModelThứ đang được đem ra chạy.
- Context windowGiới hạn lịch sử gửi lại được.
- TokenĐơn vị tính tiền cho mỗi lần gọi.