इमेज से टेक्स्ट (OCR)
मुफ़्त ऑनलाइन OCR: इमेज, स्क्रीनशॉट, फ़ोटो और स्कैन किए गए PDF से 24 भाषाओं में टेक्स्ट निकालें। यह आपके ब्राउज़र में चलता है, कुछ भी अपलोड नहीं होता।
यह क्या करता है
यह टूल OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) से तस्वीर में मौजूद टेक्स्ट को ऐसे टेक्स्ट में बदलता है जिसे आप कॉपी, एडिट और सर्च कर सकें। यह स्क्रीनशॉट, दस्तावेज़ों की फ़ोटो, स्कैन किए गए पेज और सिर्फ़ इमेज वाले PDF के साथ काम करता है। पहचान का काम Tesseract करता है, जो एक ओपन-सोर्स OCR इंजन है और आपके अपने ब्राउज़र में चलता है, इसलिए फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं। छोटा टेक्स्ट पढ़ने से पहले अपने-आप बड़ा कर दिया जाता है, जिससे गलतियाँ काफ़ी कम हो जाती हैं।
इसका उपयोग कैसे करें
- एक या ज़्यादा इमेज या एक PDF चुनें, उन्हें यहाँ खींचें, या स्क्रीनशॉट पेस्ट करें।
- टेक्स्ट की भाषा जाँचें। पढ़ना अपने-आप शुरू हो जाता है; अगर आप भाषा बदलते हैं, तो फिर से टेक्स्ट निकालें दबाएँ।
- नतीजा देखें, गलत पढ़ी गई चीज़ें ठीक करें, फिर उसे कॉपी करें या .txt फ़ाइल के रूप में डाउनलोड करें।
अक्सर पूछे जाने वाले प्रश्न
क्या मेरी इमेज अपलोड होती हैं?
नहीं। पहचान इंजन और भाषा का डेटा आपके ब्राउज़र में डाउनलोड होता है, और इमेज व PDF वहीं प्रोसेस होते हैं। सर्वर पर कुछ नहीं भेजा जाता, इसलिए निजी दस्तावेज़ों के साथ भी इसका इस्तेमाल सुरक्षित है।
यह कितना सटीक है?
साफ़ छपे टेक्स्ट पर लैटिन लिपि वाली भाषाओं में आमतौर पर 99% से ज़्यादा अक्षर सही पहचाने जाते हैं, और दूसरी लिपियों में आमतौर पर 93% से 99% के बीच। धुंधली फ़ोटो, कम कंट्रास्ट, मुड़े हुए पेज, सजावटी फ़ॉन्ट और हाथ की लिखावट से सटीकता घटती है। सबसे अच्छे नतीजे के लिए साफ़, अच्छी रोशनी वाली और सीधी इमेज इस्तेमाल करें, और सही भाषा चुनें।
कौन-सी भाषाएँ समर्थित हैं?
24 भाषाएँ: अंग्रेज़ी, पुर्तगाली, स्पेनिश, फ़्रेंच, जर्मन, इतालवी, स्वीडिश, अफ़्रीकांस, तुर्की, इंडोनेशियाई, मलय, फ़िलिपिनो, वियतनामी, रूसी, अरबी, उर्दू, हिंदी, तमिल, थाई, ख़मेर, जापानी, कोरियाई, और सरलीकृत व पारंपरिक चीनी। अगर किसी टेक्स्ट में दो भाषाएँ मिली हों, तो आप दोनों को साथ इस्तेमाल कर सकते हैं।
क्या यह हाथ की लिखावट पढ़ सकता है?
बहुत अच्छे से नहीं। इंजन छपे हुए टेक्स्ट पर प्रशिक्षित है: साफ़-साफ़ अलग-अलग लिखे बड़े अक्षर कभी-कभी पढ़ लिए जाते हैं, लेकिन जुड़ी हुई लिखावट आमतौर पर गलत निकलती है।
क्या यह स्कैन किए गए PDF के साथ काम करता है?
हाँ। हर पेज हाई रिज़ॉल्यूशन में रेंडर करके बारी-बारी से पढ़ा जाता है, और आप चिह्नित कर सकते हैं कि हर पेज कहाँ से शुरू होता है। अगर PDF में पहले से चुना जा सकने वाला टेक्स्ट है, तो PDF से टेक्स्ट टूल ज़्यादा तेज़ और सटीक है।
Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)