Larawan sa Teksto (OCR)
Libreng OCR online: kunin ang teksto mula sa mga larawan, screenshot, litrato at na-scan na PDF sa 24 na wika. Gumagana sa browser mo at walang ina-upload.
Ano ang ginagawa nito
Gumagamit ang tool na ito ng OCR (optical character recognition) para gawing tekstong puwede mong kopyahin, i-edit at hanapin ang teksto sa isang larawan. Gumagana ito sa mga screenshot, litrato ng dokumento, na-scan na pahina at PDF na puro larawan lang. Ang pagkilala ay ginagawa ng Tesseract, isang open-source na OCR engine, na tumatakbo sa sarili mong browser, kaya hindi kailanman umaalis ang mga file sa device mo. Awtomatikong pinalalaki ang maliit na teksto bago basahin, kaya kapansin-pansing nababawasan ang mga mali.
Paano ito gamitin
- Pumili ng isa o higit pang larawan o isang PDF, i-drag dito, o mag-paste ng screenshot.
- Tingnan ang wika ng teksto. Kusang nagsisimula ang pagbasa; kung papalitan mo ang wika, pindutin ulit ang Kunin ang teksto.
- Suriin ang resulta, ayusin ang anumang maling nabasa, saka kopyahin o i-download bilang .txt file.
Mga madalas itanong
Ina-upload ba ang mga larawan ko?
Hindi. Dina-download sa browser mo ang recognition engine at ang data ng wika, at doon pinoproseso ang mga larawan at PDF. Walang ipinapadala sa server, kaya ligtas itong gamitin sa mga pribadong dokumento.
Gaano ito katumpak?
Sa malinaw na nakalimbag na teksto, karaniwang tama ang higit sa 99% ng mga character sa mga wikang nakasulat sa alpabetong Latin, at karaniwang 93% hanggang 99% sa ibang sistema ng pagsulat. Bumababa ang katumpakan sa malabong litrato, mababang contrast, nakakurbang pahina, dekoratibong font at sulat-kamay. Para sa pinakamagandang resulta, gumamit ng malinaw, maliwanag at tuwid na larawan, at piliin ang tamang wika.
Anong mga wika ang suportado?
24 na wika: English, Portuges, Espanyol, Pranses, Aleman, Italyano, Swedish, Afrikaans, Turkish, Indonesian, Malay, Filipino, Vietnamese, Ruso, Arabe, Urdu, Hindi, Tamil, Thai, Khmer, Hapon, Koreano, at Chinese na Simplified at Traditional. Puwede mong pagsamahin ang dalawang wika kapag halo ang mga ito sa teksto.
Kaya ba nitong basahin ang sulat-kamay?
Hindi gaanong maayos. Sinanay ang engine sa nakalimbag na teksto: minsan gumagana ang maayos na malalaking titik, pero kadalasang mali ang lumalabas sa kabit-kabit na sulat-kamay.
Gumagana ba ito sa mga na-scan na PDF?
Oo. Nire-render ang bawat pahina sa mataas na resolution at binabasa nang isa-isa, at puwede mong markahan kung saan nagsisimula ang bawat pahina. Kung may teksto nang puwedeng i-select ang PDF, mas mabilis at eksakto ang tool na PDF to Text.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)