IT nói tiếng người
AIMốc 1 · Nói chuyện được

⚖️ Bias là gì?

Thiên lệch học từ dữ liệu, dẫn tới kết quả thiếu công bằng.

1
Hiểu nó là gì

Bias xảy ra khi dữ liệu huấn luyện mang sẵn định kiến hoặc thiếu đại diện, khiến model đối xử lệch với một số nhóm.

Nói theo đời thường:
Tuyển người mà chỉ nhìn theo hồ sơ cũ của công ty thì sẽ lặp lại đúng thói quen tuyển ngày trước, kể cả những thói quen sai.

⚠ Chỗ ẩn dụ này hỏng

“Học theo hồ sơ cũ nên lặp lại thói quen cũ” — đúng, nhưng bỏ trường giới tính hay dân tộc ra không hề xoá được thiên lệch.

Model sẽ tìm ra thứ thay thế: mã vùng, tên trường học, thậm chí cách viết tên. Đây là điều khiến bias khó xử lý hơn người ta tưởng — không phải cứ giấu thông tin nhạy cảm đi là công bằng. Phải đo kết quả thật trên từng nhóm người mới biết.

2
Code trông thế nào
Bỏ trường "giới tính" khỏi dữ liệu tuyển dụng
  → model học từ "câu lạc bộ bóng đá nữ" trong CV
  → vẫn phân biệt như cũ, chỉ khó phát hiện hơn

Cách duy nhất: đo tỉ lệ chấp nhận trên từng nhóm sau khi chạy

Công bằng phải đo được ở đầu ra, không đảm bảo được ở đầu vào.

3
Khi nào bạn dùng nó

✓ Dùng khi

  • Mọi hệ thống AI ảnh hưởng tới con người: tuyển dụng, tín dụng, y tế
  • Trước khi đưa model vào dùng thật

✗ Đừng dùng khi

  • Cho rằng bỏ trường nhạy cảm là đã xử lý xong
  • Chỉ đo độ chính xác tổng thể mà không tách theo nhóm
Chưa cần biết: các định nghĩa công bằng, kiểm định thiên lệch, tài liệu model.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi model của bạn sắp được dùng để ra quyết định ảnh hưởng tới quyền lợi người khác.
4
Đi đâu tiếp

🧪 Thử 2 phút, không cần cài gì

Yêu cầu một công cụ tạo ảnh vẽ “một giám đốc điều hành” 10 lần. Đếm tỉ lệ giới tính và độ tuổi trong kết quả. Đó là bias hiện ra bằng mắt thường.
← Xem tất cả thuật ngữ