⚖️ Bias là gì?
Thiên lệch học từ dữ liệu, dẫn tới kết quả thiếu công bằng.
1
Hiểu nó là gì
Bias xảy ra khi dữ liệu huấn luyện mang sẵn định kiến hoặc thiếu đại diện, khiến model đối xử lệch với một số nhóm.
Nói theo đời thường:
Tuyển người mà chỉ nhìn theo hồ sơ cũ của công ty thì sẽ lặp lại đúng thói quen tuyển ngày trước, kể cả những thói quen sai.
Tuyển người mà chỉ nhìn theo hồ sơ cũ của công ty thì sẽ lặp lại đúng thói quen tuyển ngày trước, kể cả những thói quen sai.
⚠ Chỗ ẩn dụ này hỏng
“Học theo hồ sơ cũ nên lặp lại thói quen cũ” — đúng, nhưng bỏ trường giới tính hay dân tộc ra không hề xoá được thiên lệch.
Model sẽ tìm ra thứ thay thế: mã vùng, tên trường học, thậm chí cách viết tên. Đây là điều khiến bias khó xử lý hơn người ta tưởng — không phải cứ giấu thông tin nhạy cảm đi là công bằng. Phải đo kết quả thật trên từng nhóm người mới biết.
2
Code trông thế nào
Bỏ trường "giới tính" khỏi dữ liệu tuyển dụng → model học từ "câu lạc bộ bóng đá nữ" trong CV → vẫn phân biệt như cũ, chỉ khó phát hiện hơn Cách duy nhất: đo tỉ lệ chấp nhận trên từng nhóm sau khi chạy
Công bằng phải đo được ở đầu ra, không đảm bảo được ở đầu vào.
3
Khi nào bạn dùng nó
✓ Dùng khi
- Mọi hệ thống AI ảnh hưởng tới con người: tuyển dụng, tín dụng, y tế
- Trước khi đưa model vào dùng thật
✗ Đừng dùng khi
- Cho rằng bỏ trường nhạy cảm là đã xử lý xong
- Chỉ đo độ chính xác tổng thể mà không tách theo nhóm
Chưa cần biết: các định nghĩa công bằng, kiểm định thiên lệch, tài liệu model.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi model của bạn sắp được dùng để ra quyết định ảnh hưởng tới quyền lợi người khác.
4
Đi đâu tiếp
- DatasetNơi thiên lệch bắt đầu.
- TrainingNơi thiên lệch được khuếch đại.
- AIBối cảnh chung của vấn đề này.