تصویر سے ٹیکسٹ (OCR)

مفت آن لائن OCR: تصاویر، اسکرین شاٹس، فوٹوز اور اسکین شدہ PDF سے 24 زبانوں میں ٹیکسٹ نکالیں۔ یہ آپ کے براؤزر میں چلتا ہے، کچھ بھی اپ لوڈ نہیں ہوتا۔

آپ فائلیں یہاں گھسیٹ بھی سکتے ہیں یا Ctrl+V (Mac پر ⌘+V) سے اسکرین شاٹ پیسٹ کر سکتے ہیں۔ ٹیکسٹ کی شناخت آپ کا براؤزر کرتا ہے۔ فائلیں کہیں نہیں بھیجی جاتیں: نہ اپ لوڈ، نہ محفوظ۔
ہر زبان ایک بار ڈاؤن لوڈ ہوتی ہے (1 سے 3 MB) اور پھر آپ کے براؤزر میں محفوظ رہتی ہے۔ اگر ٹیکسٹ میں لاطینی حروف والے الفاظ بھی ہوں تو دوسری زبان کے طور پر انگریزی شامل کریں۔

یہ کیا کرتا ہے


یہ ٹول OCR (آپٹیکل کریکٹر ریکگنیشن) کے ذریعے تصویر میں موجود ٹیکسٹ کو ایسے ٹیکسٹ میں بدلتا ہے جسے آپ کاپی، ایڈٹ اور تلاش کر سکیں۔ یہ اسکرین شاٹس، دستاویزات کی تصاویر، اسکین شدہ صفحات اور صرف تصاویر پر مشتمل PDF کے ساتھ کام کرتا ہے۔ شناخت Tesseract کرتا ہے، جو ایک اوپن سورس OCR انجن ہے اور آپ کے اپنے براؤزر میں چلتا ہے، اس لیے فائلیں کبھی آپ کے آلے سے باہر نہیں جاتیں۔ چھوٹا ٹیکسٹ پڑھنے سے پہلے خود بخود بڑا کر دیا جاتا ہے، جس سے غلطیاں نمایاں طور پر کم ہو جاتی ہیں۔

استعمال کا طریقہ


  1. ایک یا زیادہ تصاویر یا ایک PDF منتخب کریں، انہیں یہاں گھسیٹیں، یا اسکرین شاٹ پیسٹ کریں۔
  2. ٹیکسٹ کی زبان چیک کریں۔ پڑھائی خود بخود شروع ہو جاتی ہے؛ اگر آپ زبان بدلیں تو دوبارہ ٹیکسٹ نکالیں دبائیں۔
  3. نتیجہ دیکھیں، غلط پڑھی گئی چیزیں درست کریں، پھر اسے کاپی کریں یا .txt فائل کے طور پر ڈاؤن لوڈ کریں۔

عمومی سوالات


کیا میری تصاویر اپ لوڈ ہوتی ہیں؟
نہیں۔ شناخت کا انجن اور زبان کا ڈیٹا آپ کے براؤزر میں ڈاؤن لوڈ ہوتا ہے، اور تصاویر اور PDF وہیں پروسیس ہوتی ہیں۔ کچھ بھی سرور پر نہیں بھیجا جاتا، اس لیے نجی دستاویزات کے ساتھ بھی اسے استعمال کرنا محفوظ ہے۔

یہ کتنا درست ہے؟
صاف چھپے ہوئے ٹیکسٹ پر لاطینی حروفِ تہجی والی زبانوں میں عموماً 99% سے زیادہ حروف درست پہچانے جاتے ہیں، اور دوسرے رسم الخط میں عام طور پر 93% سے 99% کے درمیان۔ دھندلی تصاویر، کم کنٹراسٹ، مڑے ہوئے صفحات، آرائشی فونٹس اور ہاتھ کی لکھائی سے درستگی کم ہو جاتی ہے۔ بہترین نتیجے کے لیے واضح، اچھی روشنی والی اور سیدھی تصویر استعمال کریں اور درست زبان منتخب کریں۔

کون سی زبانیں دستیاب ہیں؟
24 زبانیں: انگریزی، پرتگالی، ہسپانوی، فرانسیسی، جرمن، اطالوی، سویڈش، افریکانز، ترکی، انڈونیشیائی، مالے، فلپینو، ویتنامی، روسی، عربی، اردو، ہندی، تامل، تھائی، خمیر، جاپانی، کوریائی، اور سادہ اور روایتی چینی۔ اگر ٹیکسٹ میں دو زبانیں ملی ہوں تو آپ دونوں کو ایک ساتھ استعمال کر سکتے ہیں۔

کیا یہ ہاتھ کی لکھائی پڑھ سکتا ہے؟
صرف کمزور طریقے سے۔ انجن چھپے ہوئے ٹیکسٹ پر تربیت یافتہ ہے: صاف الگ الگ لکھے بڑے حروف کبھی کبھار پڑھے جاتے ہیں، لیکن جڑی ہوئی لکھائی عموماً غلط نکلتی ہے۔

کیا یہ اسکین شدہ PDF کے ساتھ کام کرتا ہے؟
جی ہاں۔ ہر صفحہ ہائی ریزولوشن میں رینڈر کر کے باری باری پڑھا جاتا ہے، اور آپ نشان لگا سکتے ہیں کہ ہر صفحہ کہاں سے شروع ہوتا ہے۔ اگر PDF میں پہلے سے منتخب کیا جا سکنے والا ٹیکسٹ موجود ہو تو PDF سے ٹیکسٹ ٹول زیادہ تیز اور بالکل درست ہے۔

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)