படத்திலிருந்து உரை (OCR)

இலவச ஆன்லைன் OCR: படங்கள், ஸ்கிரீன்ஷாட்கள், புகைப்படங்கள், ஸ்கேன் PDF-களிலிருந்து 24 மொழிகளில் உரையை எடுங்கள். உலாவியிலேயே இயங்கும், எதுவும் பதிவேற்றப்படாது.

கோப்புகளை இங்கே இழுத்து விடலாம் அல்லது Ctrl+V (Mac-இல் ⌘+V) மூலம் ஸ்கிரீன்ஷாட்டை ஒட்டலாம். உரையை உங்கள் உலாவியே அடையாளம் காண்கிறது. கோப்புகள் எங்கும் அனுப்பப்படுவதில்லை: பதிவேற்றமும் இல்லை, சேமிப்பும் இல்லை.
ஒவ்வொரு மொழியும் ஒருமுறை மட்டுமே பதிவிறக்கப்படும் (1 முதல் 3 MB), பின்னர் உங்கள் உலாவியில் சேமிக்கப்பட்டிருக்கும். உரையில் லத்தீன் எழுத்துச் சொற்களும் கலந்திருந்தால், ஆங்கிலத்தை இரண்டாவது மொழியாகச் சேர்க்கவும்.

இது என்ன செய்கிறது


இந்தக் கருவி OCR (ஒளியியல் எழுத்து அடையாளம்) மூலம் படத்தில் உள்ள உரையை நகலெடுக்க, திருத்த, தேடக்கூடிய உரையாக மாற்றுகிறது. ஸ்கிரீன்ஷாட்கள், ஆவணப் புகைப்படங்கள், ஸ்கேன் செய்த பக்கங்கள், படங்களை மட்டுமே கொண்ட PDF-கள் ஆகியவற்றுடன் இது செயல்படும். அடையாளம் காணும் பணியைத் திறந்த மூல OCR இயந்திரமான Tesseract உங்கள் உலாவியிலேயே செய்கிறது, எனவே கோப்புகள் உங்கள் சாதனத்தை விட்டு வெளியேறுவதில்லை. சிறிய உரை படிக்கப்படும் முன் தானாகப் பெரிதாக்கப்படுகிறது, இது பிழைகளைக் கணிசமாகக் குறைக்கிறது.

எப்படிப் பயன்படுத்துவது


  1. ஒன்று அல்லது அதற்கு மேற்பட்ட படங்கள் அல்லது ஒரு PDF-ஐத் தேர்ந்தெடுங்கள், இங்கே இழுத்து விடுங்கள், அல்லது ஸ்கிரீன்ஷாட்டை ஒட்டுங்கள்.
  2. உரையின் மொழியைச் சரிபார்க்கவும். படித்தல் தானாகத் தொடங்கும்; மொழியை மாற்றினால், உரையைப் பிரித்தெடு என்பதை மீண்டும் அழுத்தவும்.
  3. முடிவைப் பார்த்து, தவறாகப் படிக்கப்பட்டதைத் திருத்தி, பின்னர் நகலெடுக்கவும் அல்லது .txt கோப்பாகப் பதிவிறக்கவும்.

அடிக்கடி கேட்கப்படும் கேள்விகள்


என் படங்கள் பதிவேற்றப்படுமா?
இல்லை. அடையாளம் காணும் இயந்திரமும் மொழித் தரவும் உங்கள் உலாவியில் பதிவிறக்கப்படுகின்றன, படங்களும் PDF-களும் அங்கேயே செயலாக்கப்படுகின்றன. எதுவும் சேவையகத்துக்கு அனுப்பப்படுவதில்லை, எனவே தனிப்பட்ட ஆவணங்களுடனும் இதைப் பாதுகாப்பாகப் பயன்படுத்தலாம்.

இது எவ்வளவு துல்லியமானது?
தெளிவான அச்சு உரையில், லத்தீன் எழுத்துகளில் எழுதப்படும் மொழிகளில் பொதுவாக 99%-க்கும் மேற்பட்ட எழுத்துகள் சரியாக அடையாளம் காணப்படுகின்றன; பிற எழுத்துமுறைகளில் பொதுவாக 93% முதல் 99% வரை. மங்கலான புகைப்படங்கள், குறைந்த மாறுபாடு, வளைந்த பக்கங்கள், அலங்கார எழுத்துருக்கள், கையெழுத்து ஆகியவற்றால் துல்லியம் குறைகிறது. சிறந்த முடிவுக்கு, கூர்மையான, நல்ல வெளிச்சமுள்ள, நேரான படத்தைப் பயன்படுத்தி, சரியான மொழியைத் தேர்ந்தெடுங்கள்.

எந்த மொழிகள் ஆதரிக்கப்படுகின்றன?
24 மொழிகள்: ஆங்கிலம், போர்த்துகீசியம், ஸ்பானிஷ், பிரெஞ்சு, ஜெர்மன், இத்தாலியம், ஸ்வீடிஷ், ஆஃப்ரிகான்ஸ், துருக்கியம், இந்தோனேசியம், மலாய், ஃபிலிப்பினோ, வியட்நாமியம், ரஷ்யம், அரபு, உருது, இந்தி, தமிழ், தாய், கெமர், ஜப்பானியம், கொரியம், மற்றும் எளிய, பாரம்பரிய சீனம். ஓர் உரையில் இரண்டு மொழிகள் கலந்திருந்தால், இரண்டையும் சேர்த்துப் பயன்படுத்தலாம்.

இது கையெழுத்தைப் படிக்குமா?
மிகக் குறைவாகவே. இந்த இயந்திரம் அச்சு உரையில் பயிற்றுவிக்கப்பட்டது: நேர்த்தியான தனித்தனி பெரிய எழுத்துகள் சில நேரங்களில் சரியாக வரும், ஆனால் இணைந்த கையெழுத்து பொதுவாகத் தவறாகவே வரும்.

ஸ்கேன் செய்த PDF-களுடன் இது வேலை செய்யுமா?
ஆம். ஒவ்வொரு பக்கமும் உயர் தெளிவுத்திறனில் வரையப்பட்டு வரிசையாகப் படிக்கப்படுகிறது, ஒவ்வொரு பக்கமும் எங்கு தொடங்குகிறது என்பதையும் குறிக்கலாம். PDF-இல் ஏற்கெனவே தேர்ந்தெடுக்கக்கூடிய உரை இருந்தால், PDF-இலிருந்து உரை கருவி வேகமானதும் துல்லியமானதும் ஆகும்.

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)