IT nói tiếng người
AIMốc 1 · Nói chuyện được

📚 Dataset là gì?

Kho ví dụ dùng để dạy và kiểm tra máy.

1
Hiểu nó là gì

Dataset là tập dữ liệu đã thu thập và sắp xếp để huấn luyện hoặc đánh giá model.

Nói theo đời thường:
Giống bộ đề ôn thi: đề càng sát thực tế và càng đa dạng thì học xong càng làm được nhiều dạng bài.

⚠ Chỗ ẩn dụ này hỏng

“Tập dữ liệu” nghe trung tính, khách quan. Nhưng mọi dataset đều mang sẵn quan điểm của người thu thập nó.

Chọn lấy dữ liệu ở đâu, gán nhãn thế nào, bỏ qua trường hợp nào — mỗi quyết định đó đều là một lựa chọn của con người, và model sẽ học đúng những lựa chọn ấy. Dataset không phải tấm gương phản chiếu thế giới; nó là bức ảnh chụp từ một góc cụ thể.

2
Code trông thế nào
Chia dataset ba phần, không bao giờ trộn lẫn:

Train  70%  →  để model học
Valid  15%  →  để chỉnh trong lúc học
Test   15%  →  model chưa từng thấy, dùng chấm điểm cuối

Trộn lẫn = tự chấm bài mình bằng đề đã biết trước

Rò rỉ dữ liệu giữa ba phần là lỗi kinh điển khiến model đẹp trên giấy, tệ ngoài đời.

3
Khi nào bạn dùng nó

✓ Dùng khi

  • Chuẩn bị huấn luyện hoặc đánh giá model
  • Cần đo model tốt tới đâu một cách trung thực

✗ Đừng dùng khi

  • Dùng dữ liệu thật của khách mà chưa xin phép
  • Gộp dữ liệu test vào dữ liệu học
Chưa cần biết: tăng cường dữ liệu, cân bằng lớp, quy trình gán nhãn, dữ liệu tổng hợp.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi model đạt 95% khi chấm nhưng dùng thật thì sai liên tục.
4
Đi đâu tiếp

🧪 Thử 2 phút, không cần cài gì

Nghĩ về một dataset ảnh “bác sĩ” lấy từ internet. Thử đoán tỉ lệ giới tính trong đó. Đó chính là thứ model sẽ học và lặp lại.
← Xem tất cả thuật ngữ