Imej ke Teks (OCR)

OCR dalam talian percuma: ambil teks daripada imej, tangkapan skrin, foto dan PDF imbasan dalam 24 bahasa. Berjalan dalam pelayar anda, tiada fail dimuat naik.

Anda juga boleh seret fail ke sini atau tampal tangkapan skrin dengan Ctrl+V (⌘+V pada Mac). Teks dikenal pasti oleh pelayar anda. Fail tidak dihantar ke mana-mana: tiada muat naik, tiada simpanan.
Setiap bahasa dimuat turun sekali (1 hingga 3 MB) dan kemudian kekal disimpan dalam pelayar anda. Tambah bahasa Inggeris sebagai bahasa kedua jika teks bercampur dengan perkataan dalam abjad Rumi.

Apa yang ia lakukan


Alat ini menggunakan OCR (pengecaman aksara optik) untuk menukar teks dalam gambar kepada teks yang boleh anda salin, sunting dan cari. Ia berfungsi dengan tangkapan skrin, foto dokumen, halaman imbasan dan PDF yang hanya mengandungi imej. Pengecaman dilakukan oleh Tesseract, enjin OCR sumber terbuka, yang berjalan dalam pelayar anda sendiri, jadi fail tidak pernah meninggalkan peranti anda. Teks kecil dibesarkan secara automatik sebelum dibaca, yang mengurangkan kesilapan dengan ketara.

Cara menggunakannya


  1. Pilih satu atau lebih imej atau PDF, seret ke sini, atau tampal tangkapan skrin.
  2. Semak bahasa teks. Bacaan bermula dengan sendirinya; jika anda menukar bahasa, tekan Ekstrak teks sekali lagi.
  3. Semak hasilnya, betulkan apa-apa yang tersalah baca, kemudian salin atau muat turun sebagai fail .txt.

Soalan lazim


Adakah imej saya dimuat naik?
Tidak. Enjin pengecaman dan data bahasa dimuat turun ke pelayar anda, dan imej serta PDF diproses di situ. Tiada apa-apa dihantar ke pelayan, jadi selamat digunakan untuk dokumen peribadi.

Sejauh manakah ketepatannya?
Bagi teks bercetak yang jelas, bahasa yang ditulis dalam abjad Rumi biasanya mendapat lebih 99% aksara betul, dan tulisan lain lazimnya antara 93% hingga 99%. Ketepatan menurun dengan foto kabur, kontras rendah, halaman melengkung, fon hiasan dan tulisan tangan. Untuk hasil terbaik, gunakan imej yang tajam, terang dan lurus, serta pilih bahasa yang betul.

Bahasa apakah yang disokong?
24 bahasa: Inggeris, Portugis, Sepanyol, Perancis, Jerman, Itali, Sweden, Afrikaans, Turki, Indonesia, Melayu, Filipino, Vietnam, Rusia, Arab, Urdu, Hindi, Tamil, Thai, Khmer, Jepun, Korea, serta Cina Ringkas dan Tradisional. Anda boleh menggabungkan dua bahasa apabila teks mencampurkannya.

Bolehkah ia membaca tulisan tangan?
Kurang baik. Enjin ini dilatih dengan teks bercetak: huruf besar yang kemas kadangkala berjaya, tetapi tulisan tangan berangkai biasanya keluar salah.

Adakah ia berfungsi dengan PDF imbasan?
Ya. Setiap halaman dipaparkan pada resolusi tinggi dan dibaca satu demi satu, dan anda boleh menandakan permulaan setiap halaman. Jika PDF sudah mengandungi teks yang boleh dipilih, alat PDF ke Teks lebih pantas dan tepat.

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)