यह टूल स्कैन्ड PDFs को एडिटेबल टेक्स्ट में बदलता है ताकि आप आसानी से टेक्स्ट कॉपी, एडिट और जोड़ सकें।
या अपनी फ़ाइल खींचें, पेस्ट करें, या क्लाउड से चुनें
स्कैन किए गए PDF को टेक्स्ट में बदलना वास्तव में दो अलग-अलग काम हैं, और कनवर्टर आपको चुनने देता है कि कौन सा चलेगा। जिस PDF में पहले से असली अक्षर हैं, उसे बस पढ़ना होता है। जिस PDF में पेजों की तस्वीरें हैं, उसे पहले पहचाना जाता है, क्योंकि उसमें अभी तक कोई टेक्स्ट नहीं होता।
आप दोनों को एक नज़र में पहचान सकते हैं। फ़ाइल को किसी भी रीडर में खोलें और एक पंक्ति चुनने की कोशिश करें। अगर शब्द हाइलाइट होते हैं, तो PDF में टेक्स्ट लेयर है, इसलिए Convert चुनें और टेक्स्ट बिल्कुल वैसे ही निकलेगा जैसा लिखा गया था। अगर कुछ भी हाइलाइट नहीं होता, या पूरा पेज एक ब्लॉक की तरह हाइलाइट होता है, तो यह स्कैन है और इसे ऑप्टिकल कैरेक्टर रिकग्निशन की जरूरत है।
यही एक चुनाव ज़्यादातर निराशाजनक नतीजों की वजह समझा देता है जो लोगों को कहीं और मिलते हैं। कोई भी कनवर्टर जो हर अपलोड के लिए एक ही तरीका चलाता है, कुछ फाइलों के लिए साफ टेक्स्ट देता है और बाकी के लिए खाली पेज, बिना किसी स्पष्टीकरण के। खुद इंजन चुनने से अंदाज़ा लगाने की ज़रूरत नहीं रहती।
स्कैन आपको किसी वाक्य पर कर्सर खींचने नहीं देगा, क्योंकि चुनने के लिए वहाँ कुछ होता ही नहीं। स्कैन किए गए PDF से टेक्स्ट निकालने से यह समस्या हल होती है: फ़ाइल अपलोड करें, कन्वर्ज़न चलाएँ, और आपको एक सादा टेक्स्ट फ़ाइल मिलती है जिससे आप कॉपी कर सकते हैं, ईमेल में पेस्ट कर सकते हैं, या किसी भी एडिटर में Find कमांड से खोज सकते हैं।
आउटपुट एक .txt फ़ाइल होता है, इसलिए यह किसी भी कंप्यूटर या फ़ोन पर बिना खास सॉफ़्टवेयर के खुल जाता है। इसमें शब्द और लाइन ब्रेक रहते हैं और लेआउट पीछे छूट जाता है, जो सही संतुलन है जब आपको पेज की कॉपी नहीं, बल्कि सिर्फ़ सामग्री चाहिए।
एक साथ कई स्कैन डाले जा सकते हैं। हर PDF अलग से कन्वर्ट होती है और अपनी ही टेक्स्ट फ़ाइल के रूप में वापस आती है, जिसमें सभी पर एक ही इंजन और एक ही भाषा चयन लागू होता है।
.txt फ़ाइल एक्सटेंशन का उपयोग सादा टेक्स्ट फ़ाइलों के लिए किया जाता है। इन फ़ाइलों में टेक्स्ट कई पंक्तियों के रूप में होता है और इन्हें अलग-अलग प्लेटफ़ॉर्म और डिवाइस पर कई तरह के टेक्स्ट एडिटर में खोला जा सकता है। टेक्स्ट में कोई फ़ॉर्मैटिंग नहीं होती है।
इसी वजह से स्कैन से निकाले गए टेक्स्ट को रखने के लिए यह सबसे सुरक्षित फ़ॉर्मैट है। फ़ाइल के बारे में कुछ भी पुराना नहीं पड़ता, इसे खोलने के लिए किसी लाइसेंस की ज़रूरत नहीं होती, और शब्द उस प्रोग्राम के बदल जाने के बाद भी पढ़ने लायक रहते हैं जिसने मूल फ़ाइल बनाई थी।
फ़ाइल एक्सटेंशन: .txt, MIME टाइप: text/plain
विकिपीडिया पर TXTयहाँ स्कैन किए गए PDF को पढ़ने के 5 तरीके हैं, और सेटिंग्स पैनल के ज़रिए आप उनके बीच स्विच कर सकते हैं। वह चुनें जो आपकी फ़ाइल से मेल खाता हो।
| OCR इंजन | इसे कब चुनें |
|---|---|
| कनवर्ट करें | PDF में पहले से चयन करने योग्य टेक्स्ट है। कोई रिकग्निशन नहीं चलता, इसलिए शब्द बिल्कुल वैसे ही निकलते हैं जैसे लिखे गए थे। |
| स्टैंडर्ड OCR | स्कैन साफ, सीधा और तेज़ है। यह स्कैन किए गए PDF से टेक्स्ट तक पहुँचने का सबसे तेज़ रास्ता है। |
| एडवांस्ड AI-OCR | स्कैन हल्का, कम रेज़ोल्यूशन वाला या हल्का-सा तिरछा है, और स्टैंडर्ड इंजन अक्षर छोड़ देता है। |
| एडवांस्ड AI-OCR+ | पेज पर साया, असमान रोशनी या मुड़ी हुई रीढ़ है, जो किताब की फ़ोटो लेते समय आम होता है। |
| फोटो OCR | टेक्स्ट को स्कैन नहीं, बल्कि फ़ोटो के तौर पर लिया गया है, जैसे कोई साइन, लेबल या स्क्रीन। |
कनवर्टर 124 सोर्स भाषाओं को पहचानता है, जिनमें वर्टिकल लेआउट के साथ सिंप्लिफ़ाइड और ट्रेडिशनल चीनी, और अज़रबैजानी, सर्बियाई और उज़्बेक की सिरिलिक लिपियाँ शामिल हैं। अपनी फ़ाइल में जो भी भाषा दिखती है, सभी को चुनें।
स्कैन में शब्द एक इमेज के अंदर बंद रहते हैं। इन परिस्थितियों में उन्हें बाहर निकालना सबसे ज़्यादा काम बचाता है।
इनवॉइस, कॉन्ट्रैक्ट, रसीदें और चिट्ठियाँ आम तौर पर स्कैन के रूप में आती हैं। टेक्स्ट निकाल लेने के बाद आप हर पेज पढ़ने की बजाय कोई रकम, तारीख या नाम सीधे खोज सकते हैं।
लाइब्रेरी स्कैन, जर्नल आर्टिकल और किताबों के पेज उद्धृत करने योग्य बन जाते हैं। एक बार टेक्स्ट निकालें और ज़रूरी हिस्सों को दोबारा टाइप करने के बजाय अपनी नोट्स में पेस्ट करें।
पुरानी फाइलें अक्सर लंबी, मल्टी-पेज स्कैन के रूप में रखी जाती हैं। एक साथ कई फ़ाइलें अपलोड करें और कनवर्टर बैच को एक ही बार में प्रोसेस कर देता है।
जो कागज़ात आप स्कैन करते हैं और जो दस्तावेज़ आप कन्वर्ट करते हैं, वे निजी हो सकते हैं। यहाँ बताया है कि आपकी फाइलों को ठीक-ठीक कैसे संभाला जाता है।
हर अपलोड और डाउनलोड एन्क्रिप्टेड कनेक्शन पर चलता है, ताकि आपकी फाइलें ट्रांज़िट में पढ़ी न जा सकें।
टेक्स्ट पहचान पूरी तरह स्वचालित है। कोई भी आपके स्कैन या दस्तावेज़ नहीं पढ़ता, और कुछ भी थर्ड पार्टी के साथ साझा नहीं किया जाता।
प्रोसेसिंग यूरोपीय संघ के अंदर प्रमाणित डाटा सेंटरों में होती है।
अपना स्कैन किया हुआ PDF अपलोड करें।
अपनी फ़ाइल के अनुसार सही OCR इंजन चुनें। अगर PDF में टेक्स्ट पहले से चयन करने योग्य है, तो Convert का इस्तेमाल करें।
बेहतर परिणामों के लिए अपने PDF की भाषा चुनें (वैकल्पिक)।
कन्वर्ज़न शुरू करें और डाउनलोड तैयार होने तक प्रतीक्षा करें।
हाँ। स्कैन किए गए PDF को टेक्स्ट में बदलना मुफ़्त है और इसके लिए कोई अकाउंट नहीं चाहिए। फ़ाइल अपलोड करें, इंजन चुनें और नतीजा डाउनलोड करें। 100 MB तक की फाइलें फ्री लिमिट में आती हैं, और प्लान सिर्फ़ बड़ी फाइलों और लंबे बैच के लिए मायने रखता है।
हाँ। Standard OCR मुफ़्त इंजन है और यह सामान्य स्कैन को बिना साइन-अप के संभाल लेता है। 3 एडवांस्ड AI इंजन उन पेजों के लिए अपग्रेड हैं जिन्हें स्टैंडर्ड इंजन नहीं पढ़ पाता, जैसे फीकी कॉपियाँ या कमजोर रोशनी में ली गई तस्वीरें।
क्योंकि फ़ाइल अक्षरों की बजाय पेजों की तस्वीरें रखती है। स्कैनर कागज़ की फ़ोटो लेता है, इसलिए हर शब्द पिक्सेल का पैटर्न बन जाता है। ऑप्टिकल कैरेक्टर रिकग्निशन उन पिक्सेल को पढ़कर असली अक्षर लिखता है, जिससे टेक्स्ट चयन करने, खोजने और संपादित करने योग्य बनता है।
ऊपर PDF अपलोड करें, कोई OCR इंजन चुनें और कन्वर्ज़न शुरू करें। नतीजा एक सादा टेक्स्ट फ़ाइल होगा जिसे आप किसी भी एडिटर में खोलकर उसमें से कॉपी कर सकते हैं। सीधे PDF रीडर से कॉपी करना तभी काम करता है जब फ़ाइल में टेक्स्ट लेयर हो।
यह 124 सोर्स भाषाओं को पहचानता है, जिनमें सिंप्लिफ़ाइड और ट्रेडिशनल दोनों तरह की चीनी वर्टिकल लेआउट के साथ, और अज़रबैजानी, सर्बियाई व उज़्बेक की सिरिलिक वैरिएंट शामिल हैं। फ़ाइल में दिखने वाली हर भाषा चुनें, क्योंकि मिली-जुली भाषा वाले पेज तभी सबसे अच्छा पढ़े जाते हैं जब सभी को सूची में जोड़ा गया हो।
इस पेज से नहीं, जो सादा टेक्स्ट फ़ाइल लिखता है। यह शब्दों को रखता है और लेआउट हटा देता है। फ़ॉर्मैटिंग के साथ DOC या DOCX के लिए Convert to Word ऐप का उपयोग करें, जो वही टेक्स्ट रिकग्निशन चलाता है और Word डॉक्युमेंट बनाता है।
रिकग्निशन की क्वालिटी स्कैन की क्वालिटी पर निर्भर करती है। टेढ़ा पेज, कम रेज़ोल्यूशन, कागज़ पर पड़ा साया या हाथ से ली गई फ़ोटो, सभी सटीकता घटाते हैं। कमज़ोर स्कैन के लिए Advanced AI-OCR और खराब रोशनी के लिए Advanced AI-OCR+ आज़माएँ, और जहाँ संभव हो 300 dpi पर दोबारा स्कैन करें। पासवर्ड-प्रोटेक्टेड या क्षतिग्रस्त सोर्स फ़ाइल बिल्कुल कन्वर्ट नहीं होगी।
हाँ। अपलोड और डाउनलोड एन्क्रिप्टेड कनेक्शन पर चलते हैं, प्रोसेसिंग यूरोपीय संघ के अंदर प्रमाणित डेटा सेंटर्स में होती है, और पूरी पाइपलाइन ऑटोमेटेड है, इसलिए कोई भी आपके स्कैन नहीं पढ़ता। आपकी फाइलें कभी भी AI मॉडल ट्रेन करने के लिए इस्तेमाल नहीं की जातीं और उन पर आपके अधिकार बने रहते हैं।
स्कैन किए गए दस्तावेज़ों और छवियों से महत्वपूर्ण टेक्स्ट को OCR (Optिकल कैरेक्टर रिकग्निशन) के साथ डिजिटाइज़ करें। छवियों से टेक्स्ट को ऑनलाइन आसानी से निकालें।
लेख पढ़ेंइनमें से हर टूल ब्राउज़र में चलता है। न इंस्टॉल की जरूरत, न अकाउंट की, और इनके पीछे एक जैसा टेक्स्ट रिकग्निशन काम करता है।