IT nói tiếng người
AIMốc 2 · Tự dùng được

🧩 Token là gì?

Mẩu chữ nhỏ mà AI thực sự đọc.

1
Hiểu nó là gì

Model không đọc theo từ mà cắt văn bản thành các token, mỗi token là một mẩu ký tự. Chi phí và giới hạn độ dài đều tính theo token.

Nói theo đời thường:
Như đếm tiền theo tờ chứ không theo câu chuyện: dài hay ngắn rốt cuộc đều quy ra bao nhiêu mẩu.

⚠ Chỗ ẩn dụ này hỏng

“Mẩu chữ” khiến người ta tưởng một token là một từ. Với tiếng Việt thì lệch rất xa.

Model chủ yếu được huấn luyện trên tiếng Anh, nên tiếng Việt có dấu bị cắt vụn hơn nhiều: một từ như “nghiêng” có thể tốn 3-4 token trong khi “tilt” chỉ tốn 1. Hệ quả thực tế: cùng một nội dung, viết bằng tiếng Việt tốn tiền và tốn chỗ hơn tiếng Anh khoảng 2-3 lần.

2
Code trông thế nào
"Hello world"        →  2 token
"Xin chào thế giới"  →  ~8 token

Chi phí và giới hạn độ dài đều tính theo token,
nên cùng một ý, tiếng Việt đắt hơn đáng kể.

Đây là lý do thực tế khiến nhiều sản phẩm AI cho thị trường Việt tốn hơn dự tính.

3
Khi nào bạn dùng nó

✓ Dùng khi

  • Cần ước lượng chi phí gọi API
  • Cần biết còn bao nhiêu chỗ trong cửa sổ ngữ cảnh

✗ Đừng dùng khi

  • Đếm token bằng cách đếm từ (luôn sai với tiếng Việt)
Chưa cần biết: thuật toán tách token, khác biệt giữa các model, tối ưu chi phí.
Để dành tới Mốc 3 — Tự ghép được: Bạn nối được AI vào tài liệu của mình và biết cách kiểm tra nó trả lời đúng hay đang bịa.
Dấu hiệu bạn đã cần học nó: Khi hoá đơn API cao hơn dự tính và bạn cần biết chỗ nào đang tốn.
4
Đi đâu tiếp

🧪 Thử 2 phút, không cần cài gì

Tìm “tokenizer” trên trang của bất kỳ nhà cung cấp AI nào, dán một đoạn tiếng Việt vào. Xem nó bị cắt thành bao nhiêu mẩu — thường nhiều hơn bạn tưởng.
← Xem tất cả thuật ngữ