💬 LLM là gì?
Mô hình ngôn ngữ lớn, thứ đứng sau các chatbot.
1
Hiểu nó là gì
LLM là model được huấn luyện trên lượng văn bản khổng lồ để hiểu và tạo ra ngôn ngữ tự nhiên.
Nói theo đời thường:
Như người đã đọc gần hết thư viện: không nhớ từng trang, nhưng thấm được cách chữ nghĩa thường đi với nhau nên viết tiếp rất trôi.
Như người đã đọc gần hết thư viện: không nhớ từng trang, nhưng thấm được cách chữ nghĩa thường đi với nhau nên viết tiếp rất trôi.
⚠ Chỗ ẩn dụ này hỏng
“Mô hình ngôn ngữ lớn” nghe như nó biết ngôn ngữ. Thực chất nó chỉ đoán token tiếp theo, từng cái một.
Không có kế hoạch cho cả câu trả lời, không kiểm tra lại. Hiểu điều này giải thích được gần hết hành vi kỳ lạ của nó: vì sao nó bịa ra tên sách nghe rất thật, vì sao bảo nó “nghĩ từng bước” lại cho kết quả tốt hơn, và vì sao nó không đếm nổi chữ cái.
2
Code trông thế nào
Cách LLM sinh câu trả lời: "Thủ đô của Việt Nam là" → đoán: "Hà" "Thủ đô của Việt Nam là Hà" → đoán: "Nội" "...Hà Nội" → đoán: "." Mỗi lần chỉ đoán đúng một mẩu, dựa trên toàn bộ phần trước
Không có bước nào nó “biết” đáp án trước rồi mới viết ra.
3
Khi nào bạn dùng nó
✓ Dùng khi
- Việc liên quan tới ngôn ngữ: viết, tóm tắt, dịch, phân loại
- Chấp nhận kiểm tra lại kết quả
✗ Đừng dùng khi
- Cần con số chính xác tuyệt đối
- Cần thông tin mới hơn ngày model được huấn luyện
Chưa cần biết: nhiệt độ, top-p, cửa sổ ngữ cảnh, gọi hàm, so sánh model.
Để dành tới Mốc 2 — Tự dùng được: Bạn viết được prompt cho ra kết quả dùng được thật, và giải thích được vì sao lần trước nó hỏng.
Dấu hiệu bạn đã cần học nó: Khi cùng một prompt cho ra kết quả khác nhau mỗi lần và bạn cần nó ổn định.
4
Đi đâu tiếp
- PromptCách điều khiển LLM.
- HallucinationHệ quả trực tiếp của việc chỉ đoán token tiếp theo.
- RAGCách cho LLM tra tài liệu để bớt bịa.