படத்திலிருந்து உரை (OCR)
இலவச ஆன்லைன் OCR: படங்கள், ஸ்கிரீன்ஷாட்கள், புகைப்படங்கள், ஸ்கேன் PDF-களிலிருந்து 24 மொழிகளில் உரையை எடுங்கள். உலாவியிலேயே இயங்கும், எதுவும் பதிவேற்றப்படாது.
இது என்ன செய்கிறது
இந்தக் கருவி OCR (ஒளியியல் எழுத்து அடையாளம்) மூலம் படத்தில் உள்ள உரையை நகலெடுக்க, திருத்த, தேடக்கூடிய உரையாக மாற்றுகிறது. ஸ்கிரீன்ஷாட்கள், ஆவணப் புகைப்படங்கள், ஸ்கேன் செய்த பக்கங்கள், படங்களை மட்டுமே கொண்ட PDF-கள் ஆகியவற்றுடன் இது செயல்படும். அடையாளம் காணும் பணியைத் திறந்த மூல OCR இயந்திரமான Tesseract உங்கள் உலாவியிலேயே செய்கிறது, எனவே கோப்புகள் உங்கள் சாதனத்தை விட்டு வெளியேறுவதில்லை. சிறிய உரை படிக்கப்படும் முன் தானாகப் பெரிதாக்கப்படுகிறது, இது பிழைகளைக் கணிசமாகக் குறைக்கிறது.
எப்படிப் பயன்படுத்துவது
- ஒன்று அல்லது அதற்கு மேற்பட்ட படங்கள் அல்லது ஒரு PDF-ஐத் தேர்ந்தெடுங்கள், இங்கே இழுத்து விடுங்கள், அல்லது ஸ்கிரீன்ஷாட்டை ஒட்டுங்கள்.
- உரையின் மொழியைச் சரிபார்க்கவும். படித்தல் தானாகத் தொடங்கும்; மொழியை மாற்றினால், உரையைப் பிரித்தெடு என்பதை மீண்டும் அழுத்தவும்.
- முடிவைப் பார்த்து, தவறாகப் படிக்கப்பட்டதைத் திருத்தி, பின்னர் நகலெடுக்கவும் அல்லது .txt கோப்பாகப் பதிவிறக்கவும்.
அடிக்கடி கேட்கப்படும் கேள்விகள்
என் படங்கள் பதிவேற்றப்படுமா?
இல்லை. அடையாளம் காணும் இயந்திரமும் மொழித் தரவும் உங்கள் உலாவியில் பதிவிறக்கப்படுகின்றன, படங்களும் PDF-களும் அங்கேயே செயலாக்கப்படுகின்றன. எதுவும் சேவையகத்துக்கு அனுப்பப்படுவதில்லை, எனவே தனிப்பட்ட ஆவணங்களுடனும் இதைப் பாதுகாப்பாகப் பயன்படுத்தலாம்.
இது எவ்வளவு துல்லியமானது?
தெளிவான அச்சு உரையில், லத்தீன் எழுத்துகளில் எழுதப்படும் மொழிகளில் பொதுவாக 99%-க்கும் மேற்பட்ட எழுத்துகள் சரியாக அடையாளம் காணப்படுகின்றன; பிற எழுத்துமுறைகளில் பொதுவாக 93% முதல் 99% வரை. மங்கலான புகைப்படங்கள், குறைந்த மாறுபாடு, வளைந்த பக்கங்கள், அலங்கார எழுத்துருக்கள், கையெழுத்து ஆகியவற்றால் துல்லியம் குறைகிறது. சிறந்த முடிவுக்கு, கூர்மையான, நல்ல வெளிச்சமுள்ள, நேரான படத்தைப் பயன்படுத்தி, சரியான மொழியைத் தேர்ந்தெடுங்கள்.
எந்த மொழிகள் ஆதரிக்கப்படுகின்றன?
24 மொழிகள்: ஆங்கிலம், போர்த்துகீசியம், ஸ்பானிஷ், பிரெஞ்சு, ஜெர்மன், இத்தாலியம், ஸ்வீடிஷ், ஆஃப்ரிகான்ஸ், துருக்கியம், இந்தோனேசியம், மலாய், ஃபிலிப்பினோ, வியட்நாமியம், ரஷ்யம், அரபு, உருது, இந்தி, தமிழ், தாய், கெமர், ஜப்பானியம், கொரியம், மற்றும் எளிய, பாரம்பரிய சீனம். ஓர் உரையில் இரண்டு மொழிகள் கலந்திருந்தால், இரண்டையும் சேர்த்துப் பயன்படுத்தலாம்.
இது கையெழுத்தைப் படிக்குமா?
மிகக் குறைவாகவே. இந்த இயந்திரம் அச்சு உரையில் பயிற்றுவிக்கப்பட்டது: நேர்த்தியான தனித்தனி பெரிய எழுத்துகள் சில நேரங்களில் சரியாக வரும், ஆனால் இணைந்த கையெழுத்து பொதுவாகத் தவறாகவே வரும்.
ஸ்கேன் செய்த PDF-களுடன் இது வேலை செய்யுமா?
ஆம். ஒவ்வொரு பக்கமும் உயர் தெளிவுத்திறனில் வரையப்பட்டு வரிசையாகப் படிக்கப்படுகிறது, ஒவ்வொரு பக்கமும் எங்கு தொடங்குகிறது என்பதையும் குறிக்கலாம். PDF-இல் ஏற்கெனவே தேர்ந்தெடுக்கக்கூடிய உரை இருந்தால், PDF-இலிருந்து உரை கருவி வேகமானதும் துல்லியமானதும் ஆகும்.
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)