Ảnh sang văn bản (OCR)
OCR trực tuyến miễn phí: trích xuất văn bản từ ảnh, ảnh chụp màn hình, ảnh chụp và PDF scan bằng 24 ngôn ngữ. Chạy ngay trên trình duyệt, không tải tệp lên.
Công cụ này làm gì
Công cụ này dùng OCR (nhận dạng ký tự quang học) để biến chữ trong hình ảnh thành văn bản bạn có thể sao chép, chỉnh sửa và tìm kiếm. Công cụ hoạt động với ảnh chụp màn hình, ảnh chụp tài liệu, trang scan và PDF chỉ chứa hình ảnh. Việc nhận dạng do Tesseract, một công cụ OCR mã nguồn mở, thực hiện ngay trong trình duyệt của bạn, nên tệp không bao giờ rời khỏi thiết bị. Chữ nhỏ được tự động phóng to trước khi đọc, giúp giảm lỗi đáng kể.
Cách sử dụng
- Chọn một hoặc nhiều ảnh hoặc một tệp PDF, kéo thả vào đây hoặc dán ảnh chụp màn hình.
- Kiểm tra ngôn ngữ của văn bản. Quá trình đọc tự bắt đầu; nếu đổi ngôn ngữ, hãy nhấn Trích xuất văn bản lần nữa.
- Xem lại kết quả, sửa chỗ bị đọc sai, rồi sao chép hoặc tải về dưới dạng tệp .txt.
Câu hỏi thường gặp
Ảnh của tôi có bị tải lên không?
Không. Công cụ nhận dạng và dữ liệu ngôn ngữ được tải về trình duyệt của bạn, ảnh và PDF được xử lý ngay tại đó. Không có gì được gửi lên máy chủ, nên bạn có thể yên tâm dùng với tài liệu riêng tư.
Độ chính xác thế nào?
Với chữ in rõ ràng, các ngôn ngữ viết bằng chữ Latinh thường nhận đúng hơn 99% ký tự, các hệ chữ khác thường từ 93% đến 99%. Độ chính xác giảm khi ảnh mờ, độ tương phản thấp, trang bị cong, phông chữ trang trí và chữ viết tay. Để có kết quả tốt nhất, hãy dùng ảnh sắc nét, đủ sáng, thẳng và chọn đúng ngôn ngữ.
Hỗ trợ những ngôn ngữ nào?
24 ngôn ngữ: tiếng Anh, Bồ Đào Nha, Tây Ban Nha, Pháp, Đức, Ý, Thụy Điển, Afrikaans, Thổ Nhĩ Kỳ, Indonesia, Mã Lai, Filipino, Việt, Nga, Ả Rập, Urdu, Hindi, Tamil, Thái, Khmer, Nhật, Hàn, cùng tiếng Trung giản thể và phồn thể. Bạn có thể kết hợp hai ngôn ngữ khi văn bản dùng lẫn cả hai.
Có đọc được chữ viết tay không?
Chỉ ở mức kém. Công cụ được huấn luyện trên chữ in: chữ in hoa viết ngay ngắn đôi khi đọc được, nhưng chữ viết tay liền nét thường cho kết quả sai.
Có dùng được với PDF scan không?
Có. Mỗi trang được kết xuất ở độ phân giải cao và đọc lần lượt, bạn còn có thể đánh dấu chỗ bắt đầu của mỗi trang. Nếu PDF đã chứa văn bản có thể bôi chọn, công cụ PDF sang văn bản sẽ nhanh hơn và chính xác tuyệt đối.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)