OCR là gì?
OCR (Optical Character Recognition) là kỹ thuật nhận dạng ký tự trong ảnh hoặc bản scan để chuyển thành văn bản có thể copy, tìm kiếm và chỉnh sửa. Thay vì gõ lại hóa đơn, biển báo, tài liệu scan hay ảnh chụp màn hình, bạn chỉ cần tải ảnh lên và để máy “đọc chữ”.
Công cụ OCR trên Tiện Ích Số dùng Tesseract.js chạy trong trình duyệt (WebAssembly). Ảnh được xử lý trên thiết bị của bạn; kết quả hiện dạng text để sao chép. Hỗ trợ gói ngôn ngữ tiếng Việt và tuỳ chọn kết hợp tiếng Anh cho tài liệu song ngữ.
Khi nào nên dùng?
- Số hóa hóa đơn, biên lai, phiếu thu để dán vào Excel hoặc email.
- Copy chữ từ ảnh chụp giáo trình, slide, bảng thông báo.
- Lấy nội dung từ screenshot app / web khi không copy được.
- Chuẩn bị bản nháp trước khi dọn văn bản hoặc đếm ký tự.
Mẹo tăng độ chính xác
- Ảnh rõ, đủ sáng, chữ không bị nghiêng quá nhiều.
- Độ phân giải đủ lớn (tránh ảnh bị vỡ nét).
- Ưu tiên ảnh chữ in; chữ viết tay khó nhận hơn nhiều.
- Với tài liệu Việt có dấu, chọn chế độ tiếng Việt (hoặc Việt + Anh).
OCR không hoàn hảo 100% — luôn đọc lại kết quả trước khi dùng cho chứng từ quan trọng. Tool phục vụ tiện ích cá nhân; không thay thế phần mềm số hóa chuyên nghiệp cho kho tài liệu lớn.
Riêng tư
Ảnh và chữ trích xuất được xử lý phía client. Gói ngôn ngữ Tesseract (traineddata) và worker có thể tải từ CDN công khai lần đầu để nhận dạng — không gửi ảnh của bạn lên máy chủ Tiện Ích Số.