इमेज से टेक्स्ट (OCR)

मुफ़्त ऑनलाइन OCR: इमेज, स्क्रीनशॉट, फ़ोटो और स्कैन किए गए PDF से 24 भाषाओं में टेक्स्ट निकालें। यह आपके ब्राउज़र में चलता है, कुछ भी अपलोड नहीं होता।

आप फ़ाइलें यहाँ खींचकर भी ला सकते हैं या Ctrl+V (Mac पर ⌘+V) से स्क्रीनशॉट पेस्ट कर सकते हैं। टेक्स्ट की पहचान आपका ब्राउज़र करता है। फ़ाइलें कहीं नहीं भेजी जातीं: न अपलोड, न स्टोरेज।
हर भाषा एक बार डाउनलोड होती है (1 से 3 MB) और फिर आपके ब्राउज़र में सहेजी रहती है। अगर टेक्स्ट में लैटिन लिपि के शब्द भी हों, तो दूसरी भाषा के रूप में अंग्रेज़ी जोड़ें।

यह क्या करता है


यह टूल OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) से तस्वीर में मौजूद टेक्स्ट को ऐसे टेक्स्ट में बदलता है जिसे आप कॉपी, एडिट और सर्च कर सकें। यह स्क्रीनशॉट, दस्तावेज़ों की फ़ोटो, स्कैन किए गए पेज और सिर्फ़ इमेज वाले PDF के साथ काम करता है। पहचान का काम Tesseract करता है, जो एक ओपन-सोर्स OCR इंजन है और आपके अपने ब्राउज़र में चलता है, इसलिए फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं। छोटा टेक्स्ट पढ़ने से पहले अपने-आप बड़ा कर दिया जाता है, जिससे गलतियाँ काफ़ी कम हो जाती हैं।

इसका उपयोग कैसे करें


  1. एक या ज़्यादा इमेज या एक PDF चुनें, उन्हें यहाँ खींचें, या स्क्रीनशॉट पेस्ट करें।
  2. टेक्स्ट की भाषा जाँचें। पढ़ना अपने-आप शुरू हो जाता है; अगर आप भाषा बदलते हैं, तो फिर से टेक्स्ट निकालें दबाएँ।
  3. नतीजा देखें, गलत पढ़ी गई चीज़ें ठीक करें, फिर उसे कॉपी करें या .txt फ़ाइल के रूप में डाउनलोड करें।

अक्सर पूछे जाने वाले प्रश्न


क्या मेरी इमेज अपलोड होती हैं?
नहीं। पहचान इंजन और भाषा का डेटा आपके ब्राउज़र में डाउनलोड होता है, और इमेज व PDF वहीं प्रोसेस होते हैं। सर्वर पर कुछ नहीं भेजा जाता, इसलिए निजी दस्तावेज़ों के साथ भी इसका इस्तेमाल सुरक्षित है।

यह कितना सटीक है?
साफ़ छपे टेक्स्ट पर लैटिन लिपि वाली भाषाओं में आमतौर पर 99% से ज़्यादा अक्षर सही पहचाने जाते हैं, और दूसरी लिपियों में आमतौर पर 93% से 99% के बीच। धुंधली फ़ोटो, कम कंट्रास्ट, मुड़े हुए पेज, सजावटी फ़ॉन्ट और हाथ की लिखावट से सटीकता घटती है। सबसे अच्छे नतीजे के लिए साफ़, अच्छी रोशनी वाली और सीधी इमेज इस्तेमाल करें, और सही भाषा चुनें।

कौन-सी भाषाएँ समर्थित हैं?
24 भाषाएँ: अंग्रेज़ी, पुर्तगाली, स्पेनिश, फ़्रेंच, जर्मन, इतालवी, स्वीडिश, अफ़्रीकांस, तुर्की, इंडोनेशियाई, मलय, फ़िलिपिनो, वियतनामी, रूसी, अरबी, उर्दू, हिंदी, तमिल, थाई, ख़मेर, जापानी, कोरियाई, और सरलीकृत व पारंपरिक चीनी। अगर किसी टेक्स्ट में दो भाषाएँ मिली हों, तो आप दोनों को साथ इस्तेमाल कर सकते हैं।

क्या यह हाथ की लिखावट पढ़ सकता है?
बहुत अच्छे से नहीं। इंजन छपे हुए टेक्स्ट पर प्रशिक्षित है: साफ़-साफ़ अलग-अलग लिखे बड़े अक्षर कभी-कभी पढ़ लिए जाते हैं, लेकिन जुड़ी हुई लिखावट आमतौर पर गलत निकलती है।

क्या यह स्कैन किए गए PDF के साथ काम करता है?
हाँ। हर पेज हाई रिज़ॉल्यूशन में रेंडर करके बारी-बारी से पढ़ा जाता है, और आप चिह्नित कर सकते हैं कि हर पेज कहाँ से शुरू होता है। अगर PDF में पहले से चुना जा सकने वाला टेक्स्ट है, तो PDF से टेक्स्ट टूल ज़्यादा तेज़ और सटीक है।

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)