👁️ Computer Vision là gì?
Dạy máy nhìn và hiểu hình ảnh.
1
Hiểu nó là gì
Computer Vision giúp máy nhận ra vật thể, khuôn mặt, chữ viết hay chuyển động trong ảnh và video.
Nói theo đời thường:
Như dạy người mới phân biệt biển báo giao thông: nhìn đủ nhiều rồi thì liếc qua là biết ngay biển nào.
Như dạy người mới phân biệt biển báo giao thông: nhìn đủ nhiều rồi thì liếc qua là biết ngay biển nào.
⚠ Chỗ ẩn dụ này hỏng
“Dạy máy nhìn” — nhưng máy không nhìn thấy vật thể, nó xử lý một bảng số.
Hệ quả rất thực tế: đổi ánh sáng, đổi góc chụp, hay thêm vài điểm nhiễu mắt người không thấy cũng có thể khiến nó nhận nhầm hoàn toàn. Con người nhận ra cái ghế dù ở góc nào; model thì chỉ nhận ra những góc nó từng thấy trong dữ liệu huấn luyện.
2
Code trông thế nào
Ảnh với máy chỉ là bảng số: mỗi điểm ảnh → [đỏ, xanh lá, xanh dương] → [237, 28, 36] ảnh 1000×1000 → 3 triệu con số "Nhận ra con mèo" = tìm khuôn mẫu trong 3 triệu con số đó
Không có khái niệm “con mèo” ở đâu cả — chỉ có khuôn mẫu số học.
3
Khi nào bạn dùng nó
✓ Dùng khi
- Đếm, phân loại, phát hiện vật thể trong ảnh và video
- Đọc chữ từ ảnh chụp giấy tờ
- Kiểm tra chất lượng sản phẩm trên dây chuyền
✗ Đừng dùng khi
- Cần độ chính xác tuyệt đối trong điều kiện ánh sáng thất thường
- Dữ liệu huấn luyện không phủ được điều kiện thực tế
Chưa cần biết: CNN, phát hiện vật thể, phân đoạn ảnh, tăng cường dữ liệu.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi model chạy tốt ở phòng thí nghiệm nhưng sai liên tục ngoài công trường.
4
Đi đâu tiếp
- Deep LearningCông nghệ đứng sau computer vision hiện đại.
- DatasetĐiều kiện chụp trong dataset quyết định tất cả.
- Visual TestingHọ hàng gần trong lĩnh vực kiểm thử.