mousePDF · PDF टेक्स्ट पहचान (OCR)
pdf ocr · टेक्स्ट पहचान · बिना अपलोड

PDF टेक्स्ट पहचान (OCR) — बिना अपलोड के

स्कैन किए हुए या इमेज के रूप में मौजूद PDF पेजों पर एक अदृश्य, खोजने योग्य टेक्स्ट लेयर लगाएँ। पहचान पूरी तरह आपके ब्राउज़र में होती है, आपकी फ़ाइल कभी अपलोड नहीं होती।

✓ कुछ भी अपलोड नहीं होता ✓ पूरी तरह मुफ़्त ✓ बिना अकाउंट के
विज्ञापन
mousePDF संपादक का स्क्रीनशॉट
तरीक़ा

तीन चरणों में

01

PDF खोलें

स्कैन की गई या इमेज-आधारित PDF को खींचकर विंडो में लाएँ या चुनें।

02

भाषा और दायरा चुनें

पहचान की भाषा तय करें और फ़ैसला करें कि सिर्फ़ मौजूदा पेज पहचानना है या पूरा दस्तावेज़।

03

एक्सपोर्ट करें

खोजने योग्य, अदृश्य टेक्स्ट लेयर वाली PDF सेव करें — पेज की इमेज देखने में बिल्कुल वैसी ही रहती है।

आम मामला: स्कैन किए गए दस्तावेज़ों को खोजने योग्य बनाना

स्कैन किए गए अनुबंध, इनवॉइस या किताबों में अक्सर सिर्फ़ पेज की एक इमेज होती है, असली टेक्स्ट नहीं होता — उसमें न तो खोज की जा सकती है और न टेक्स्ट कॉपी किया जा सकता है। mousePDF ब्राउज़र में लोकल रूप से टेक्स्ट पहचानता है और उसे इमेज के ऊपर अदृश्य तरीक़े से लगा देता है, ताकि खोज और कॉपी करना काम करे, बिना पेज की दिखावट में कोई बदलाव किए।

विज्ञापन

ब्राउज़र में टेक्स्ट पहचान — और इसमें ख़ास क्या है

OCR उन कामों में से एक है जिनके लिए अक्सर कुछ न कुछ अपलोड करना ही पड़ता है: पहचान के लिए एक लैंग्वेज मॉडल चाहिए, और वह आमतौर पर किसी सर्वर पर होता है। यहाँ यह आपके ब्राउज़र में चलता है; सिर्फ़ मॉडल लोड होता है, आपकी फ़ाइल कभी नहीं।

यह ठीक उन्हीं दस्तावेज़ों के लिए ज़रूरी है जिन्हें लोग स्कैन करते हैं: अनुबंध, सैलरी स्लिप, डॉक्टर की पर्ची, पहचान-पत्र की कॉपी। एक स्कैन एक इमेज होती है — और उसके खोजने योग्य बनने से पहले, कुछ न कुछ उसे पढ़ना ज़रूरी है। यह "कुछ" आपकी अपनी डिवाइस पर आपके ब्राउज़र में चलता है, यही असली फ़र्क़ है।

OCR के लिए 28 भाषाएँ उपलब्ध हैं। चुनी हुई भाषा का मॉडल असली रन के समय ही लोड होता है — इससे पेज हल्का रहता है, और आप सिर्फ़ वही लोड करते हैं जिसकी आपको ज़रूरत है।

पहचान की सीमाएँ कहाँ हैं

ग़ैर-लैटिन लिपियाँ जान-बूझकर शामिल नहीं हैं। न सिरिलिक, न चीनी, जापानी या कोरियाई, न अरबी, हिब्रू, देवनागरी या थाई। इनके लिए मॉडल काफ़ी बड़े होते हैं और सटीकता काफ़ी कम — ऐसा नतीजा जिसे अक्षर-दर-अक्षर सुधारना पड़े, किसी के काम का नहीं। ग्रीक इसमें शामिल है, क्योंकि यह इस मामले में उसी श्रेणी में नहीं आता।

पहचान कभी पूरी तरह त्रुटिरहित नहीं होती। यह पिक्सल से वह पढ़ती है जो कभी टेक्स्ट था। एक सीधी दिशा वाला साफ़ स्कैन बहुत अच्छे नतीजे देता है; ख़राब रोशनी में खींचा गया टेढ़ा मोबाइल फ़ोटो, बिगड़ी हुई हस्तलिपि या कोई असामान्य सजावटी फ़ॉन्ट काफ़ी कमज़ोर नतीजे देते हैं। जो कोई टेक्स्ट को आगे इस्तेमाल करे, उसे दोबारा पढ़कर जाँच लेनी चाहिए — यह हर OCR-प्रोसेस्ड वर्शन के लिए सही है, सिर्फ़ इसके लिए नहीं।

पेज की दिखावट नहीं बदलती। पहचाना गया टेक्स्ट इमेज के ऊपर एक अदृश्य लेयर के रूप में रखा जाता है: आप अब भी अपना स्कैन ही देखते हैं, लेकिन उसमें खोज और हाइलाइट कर सकते हैं। पहचान की ग़लतियाँ इसलिए इमेज में नज़र नहीं आतीं — वे तभी सामने आती हैं जब आप टेक्स्ट कॉपी करते हैं।

OCR किसी PDF को छोटा करने के बाद भी काम आता है: इस दौरान पेज इमेज बन जाते हैं और अपनी टेक्स्ट लेयर खो देते हैं — टेक्स्ट पहचान उसे फिर से बना देती है।

faq

अक्सर पूछे जाने वाले सवाल

क्या टेक्स्ट पहचान के लिए मेरा दस्तावेज़ अपलोड होता है? +

नहीं। पहचान पूरी तरह ब्राउज़र में, लोकल रूप से लोड की गई OCR-इंजन के ज़रिए होती है — फ़ाइल कभी आपकी डिवाइस से बाहर नहीं जाती।

कौन-सी भाषाएँ सपोर्ट होती हैं? +

लैटिन या ग्रीक लिपि वाली कई यूरोपीय भाषाओं का बड़ा चुनाव। चीनी, अरबी, सिरिलिक या देवनागरी जैसी लिपियाँ फ़िलहाल OCR के लिए सपोर्ट नहीं होतीं — इसमें देवनागरी लिपि भी शामिल है, जिसमें हिंदी लिखी जाती है।

पहचान में कितना समय लगता है? +

पेजों की संख्या और डिवाइस की क्षमता के हिसाब से कुछ सेकंड से लेकर कुछ मिनट तक।

क्या टेक्स्ट पहचान पेज की दिखावट बदल देती है? +

नहीं। पेज की इमेज बिल्कुल वैसी ही रहती है, पहचानी गई टेक्स्ट लेयर उसके ऊपर अदृश्य रूप से रहती है — इससे सिर्फ़ खोज और कॉपी करना मुमकिन होता है।

ख़राब स्कैन या हाथ से लिखे दस्तावेज़ों पर पहचान कितनी अच्छी है? +

पहचान साफ़-सुथरे छपे, अच्छी तरह पढ़े जा सकने वाले टेक्स्ट पर सबसे अच्छा काम करती है। हाथ से लिखे नोट्स या बहुत ज़्यादा शोर वाले स्कैन में सटीकता कम हो जाती है — तब कुछ अक्षर ग़लत पहचाने जा सकते हैं या छूट सकते हैं।

कौन-सी भाषाएँ पहचानी जाती हैं? +

28, सभी लैटिन लिपि की और साथ में ग्रीक। सिरिलिक, चीनी, अरबी, हिब्रू या थाई जैसी ग़ैर-लैटिन लिपियाँ जान-बूझकर शामिल नहीं हैं — इसमें देवनागरी भी शामिल है — वहाँ सटीकता काफ़ी कम होती।

पहचान कितनी सटीक है? +

साफ़, सीधे स्कैन पर बहुत अच्छी; टेढ़े मोबाइल फ़ोटो, ख़राब रोशनी या हस्तलिपि में साफ़ तौर पर कमज़ोर। जो कोई टेक्स्ट को आगे इस्तेमाल करे, उसे दोबारा पढ़कर जाँच लेनी चाहिए।

क्या टेक्स्ट पहचान के बाद मेरा दस्तावेज़ अलग दिखता है? +

नहीं। पहचाना गया टेक्स्ट इमेज के ऊपर एक अदृश्य लेयर के रूप में आता है — पेज पहले जैसा ही दिखता है, लेकिन अब खोजने योग्य है।

अन्य टूल

यह भी काम आ सकता है

PDF छोटा करें

ज़्यादा इमेज वाली PDF को काफ़ी छोटा करें — पेज इसमें इमेज बन जाते हैं।

PDF को PDF/A में बदलें

आर्काइव-फ्रेंडली PDF/A फ़ॉर्मैट में बदलें — सरकारी दफ़्तरों और लंबे समय तक सेव रखने के लिए।

PDF को Word में बदलें

PDF टेक्स्ट को एडिटेबल Word फ़ाइल के रूप में एक्सपोर्ट करें — बिना अपलोड के।

PDF टेक्स्ट एडिट करें

PDF में मौजूद टेक्स्ट पर क्लिक करें और उसे नए टेक्स्ट से बदलें।

विज्ञापन

एडिटर खोलें →