🌫️ Hallucination là gì?
AI nói sai nhưng nghe rất thuyết phục.
1
Hiểu nó là gì
Hallucination là khi model tạo ra thông tin không có thật, như tên sách, số liệu hay trích dẫn, mà vẫn trình bày chắc nịch.
Nói theo đời thường:
Như người kể chuyện quá tự tin: chỗ nào quên thì bịa cho liền mạch, nghe trôi chảy nên người nghe khó nhận ra.
Như người kể chuyện quá tự tin: chỗ nào quên thì bịa cho liền mạch, nghe trôi chảy nên người nghe khó nhận ra.
⚠ Chỗ ẩn dụ này hỏng
“Ảo giác” gợi ra một trạng thái bất thường, thi thoảng mới xảy ra. Thực ra bịa và trả lời đúng là cùng một cơ chế.
Model luôn đoán token có khả năng nhất. Khi nó biết, kết quả đúng. Khi nó không biết, nó vẫn đoán — và câu bịa nghe y hệt câu đúng, cùng giọng tự tin. Không có công tắc nào bật lên khi nó đang bịa, kể cả với chính nó. Đó là lý do không thể tin vào độ chắc chắn trong giọng văn của AI.
2
Code trông thế nào
Câu hỏi: "Điều 47 Luật Doanh nghiệp 2020 quy định gì?" Model trả lời trôi chảy, có số điều, có trích dẫn. Nghe rất thuyết phục. Có thể hoàn toàn bịa. Cách duy nhất chắc chắn: tự tra lại nguồn gốc.
Càng chuyên ngành hẹp, tỉ lệ bịa càng cao — và bạn càng khó phát hiện.
3
Khi nào bạn dùng nó
✓ Dùng khi
- — Không ai muốn có. Việc của bạn là biết nó luôn có thể xảy ra.
✗ Đừng dùng khi
- Tin vào số liệu, trích dẫn, tên riêng mà chưa tra lại
- Dùng AI làm nguồn cuối cùng cho việc quan trọng
Chưa cần biết: đo tỉ lệ bịa, chấm điểm bằng model khác, hệ thống trích nguồn.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi bạn cần đưa AI vào sản phẩm thật và phải trả lời câu “làm sao biết nó không bịa?”
4
Đi đâu tiếp
- RAGCách giảm bịa hiệu quả nhất hiện nay.
- LLMHiểu cơ chế đoán token thì hiểu vì sao có hallucination.
- PromptPrompt tốt giảm được phần nào.