PDF टेक्स्ट पहचान (OCR) — बिना अपलोड के
स्कैन किए हुए या इमेज के रूप में मौजूद PDF पेजों पर एक अदृश्य, खोजने योग्य टेक्स्ट लेयर लगाएँ। पहचान पूरी तरह आपके ब्राउज़र में होती है, आपकी फ़ाइल कभी अपलोड नहीं होती।
तीन चरणों में
PDF खोलें
स्कैन की गई या इमेज-आधारित PDF को खींचकर विंडो में लाएँ या चुनें।
भाषा और दायरा चुनें
पहचान की भाषा तय करें और फ़ैसला करें कि सिर्फ़ मौजूदा पेज पहचानना है या पूरा दस्तावेज़।
एक्सपोर्ट करें
खोजने योग्य, अदृश्य टेक्स्ट लेयर वाली PDF सेव करें — पेज की इमेज देखने में बिल्कुल वैसी ही रहती है।
आम मामला: स्कैन किए गए दस्तावेज़ों को खोजने योग्य बनाना
स्कैन किए गए अनुबंध, इनवॉइस या किताबों में अक्सर सिर्फ़ पेज की एक इमेज होती है, असली टेक्स्ट नहीं होता — उसमें न तो खोज की जा सकती है और न टेक्स्ट कॉपी किया जा सकता है। mousePDF ब्राउज़र में लोकल रूप से टेक्स्ट पहचानता है और उसे इमेज के ऊपर अदृश्य तरीक़े से लगा देता है, ताकि खोज और कॉपी करना काम करे, बिना पेज की दिखावट में कोई बदलाव किए।
ब्राउज़र में टेक्स्ट पहचान — और इसमें ख़ास क्या है
OCR उन कामों में से एक है जिनके लिए अक्सर कुछ न कुछ अपलोड करना ही पड़ता है: पहचान के लिए एक लैंग्वेज मॉडल चाहिए, और वह आमतौर पर किसी सर्वर पर होता है। यहाँ यह आपके ब्राउज़र में चलता है; सिर्फ़ मॉडल लोड होता है, आपकी फ़ाइल कभी नहीं।
यह ठीक उन्हीं दस्तावेज़ों के लिए ज़रूरी है जिन्हें लोग स्कैन करते हैं: अनुबंध, सैलरी स्लिप, डॉक्टर की पर्ची, पहचान-पत्र की कॉपी। एक स्कैन एक इमेज होती है — और उसके खोजने योग्य बनने से पहले, कुछ न कुछ उसे पढ़ना ज़रूरी है। यह "कुछ" आपकी अपनी डिवाइस पर आपके ब्राउज़र में चलता है, यही असली फ़र्क़ है।
OCR के लिए 28 भाषाएँ उपलब्ध हैं। चुनी हुई भाषा का मॉडल असली रन के समय ही लोड होता है — इससे पेज हल्का रहता है, और आप सिर्फ़ वही लोड करते हैं जिसकी आपको ज़रूरत है।
पहचान की सीमाएँ कहाँ हैं
ग़ैर-लैटिन लिपियाँ जान-बूझकर शामिल नहीं हैं। न सिरिलिक, न चीनी, जापानी या कोरियाई, न अरबी, हिब्रू, देवनागरी या थाई। इनके लिए मॉडल काफ़ी बड़े होते हैं और सटीकता काफ़ी कम — ऐसा नतीजा जिसे अक्षर-दर-अक्षर सुधारना पड़े, किसी के काम का नहीं। ग्रीक इसमें शामिल है, क्योंकि यह इस मामले में उसी श्रेणी में नहीं आता।
पहचान कभी पूरी तरह त्रुटिरहित नहीं होती। यह पिक्सल से वह पढ़ती है जो कभी टेक्स्ट था। एक सीधी दिशा वाला साफ़ स्कैन बहुत अच्छे नतीजे देता है; ख़राब रोशनी में खींचा गया टेढ़ा मोबाइल फ़ोटो, बिगड़ी हुई हस्तलिपि या कोई असामान्य सजावटी फ़ॉन्ट काफ़ी कमज़ोर नतीजे देते हैं। जो कोई टेक्स्ट को आगे इस्तेमाल करे, उसे दोबारा पढ़कर जाँच लेनी चाहिए — यह हर OCR-प्रोसेस्ड वर्शन के लिए सही है, सिर्फ़ इसके लिए नहीं।
पेज की दिखावट नहीं बदलती। पहचाना गया टेक्स्ट इमेज के ऊपर एक अदृश्य लेयर के रूप में रखा जाता है: आप अब भी अपना स्कैन ही देखते हैं, लेकिन उसमें खोज और हाइलाइट कर सकते हैं। पहचान की ग़लतियाँ इसलिए इमेज में नज़र नहीं आतीं — वे तभी सामने आती हैं जब आप टेक्स्ट कॉपी करते हैं।
OCR किसी PDF को छोटा करने के बाद भी काम आता है: इस दौरान पेज इमेज बन जाते हैं और अपनी टेक्स्ट लेयर खो देते हैं — टेक्स्ट पहचान उसे फिर से बना देती है।
अक्सर पूछे जाने वाले सवाल
क्या टेक्स्ट पहचान के लिए मेरा दस्तावेज़ अपलोड होता है? +
नहीं। पहचान पूरी तरह ब्राउज़र में, लोकल रूप से लोड की गई OCR-इंजन के ज़रिए होती है — फ़ाइल कभी आपकी डिवाइस से बाहर नहीं जाती।
कौन-सी भाषाएँ सपोर्ट होती हैं? +
लैटिन या ग्रीक लिपि वाली कई यूरोपीय भाषाओं का बड़ा चुनाव। चीनी, अरबी, सिरिलिक या देवनागरी जैसी लिपियाँ फ़िलहाल OCR के लिए सपोर्ट नहीं होतीं — इसमें देवनागरी लिपि भी शामिल है, जिसमें हिंदी लिखी जाती है।
पहचान में कितना समय लगता है? +
पेजों की संख्या और डिवाइस की क्षमता के हिसाब से कुछ सेकंड से लेकर कुछ मिनट तक।
क्या टेक्स्ट पहचान पेज की दिखावट बदल देती है? +
नहीं। पेज की इमेज बिल्कुल वैसी ही रहती है, पहचानी गई टेक्स्ट लेयर उसके ऊपर अदृश्य रूप से रहती है — इससे सिर्फ़ खोज और कॉपी करना मुमकिन होता है।
ख़राब स्कैन या हाथ से लिखे दस्तावेज़ों पर पहचान कितनी अच्छी है? +
पहचान साफ़-सुथरे छपे, अच्छी तरह पढ़े जा सकने वाले टेक्स्ट पर सबसे अच्छा काम करती है। हाथ से लिखे नोट्स या बहुत ज़्यादा शोर वाले स्कैन में सटीकता कम हो जाती है — तब कुछ अक्षर ग़लत पहचाने जा सकते हैं या छूट सकते हैं।
कौन-सी भाषाएँ पहचानी जाती हैं? +
28, सभी लैटिन लिपि की और साथ में ग्रीक। सिरिलिक, चीनी, अरबी, हिब्रू या थाई जैसी ग़ैर-लैटिन लिपियाँ जान-बूझकर शामिल नहीं हैं — इसमें देवनागरी भी शामिल है — वहाँ सटीकता काफ़ी कम होती।
पहचान कितनी सटीक है? +
साफ़, सीधे स्कैन पर बहुत अच्छी; टेढ़े मोबाइल फ़ोटो, ख़राब रोशनी या हस्तलिपि में साफ़ तौर पर कमज़ोर। जो कोई टेक्स्ट को आगे इस्तेमाल करे, उसे दोबारा पढ़कर जाँच लेनी चाहिए।
क्या टेक्स्ट पहचान के बाद मेरा दस्तावेज़ अलग दिखता है? +
नहीं। पहचाना गया टेक्स्ट इमेज के ऊपर एक अदृश्य लेयर के रूप में आता है — पेज पहले जैसा ही दिखता है, लेकिन अब खोजने योग्य है।
यह भी काम आ सकता है
PDF छोटा करें
ज़्यादा इमेज वाली PDF को काफ़ी छोटा करें — पेज इसमें इमेज बन जाते हैं।
PDF को PDF/A में बदलें
आर्काइव-फ्रेंडली PDF/A फ़ॉर्मैट में बदलें — सरकारी दफ़्तरों और लंबे समय तक सेव रखने के लिए।
PDF को Word में बदलें
PDF टेक्स्ट को एडिटेबल Word फ़ाइल के रूप में एक्सपोर्ट करें — बिना अपलोड के।
PDF टेक्स्ट एडिट करें
PDF में मौजूद टेक्स्ट पर क्लिक करें और उसे नए टेक्स्ट से बदलें।