स्कैन या फ़ोटो खींचे गए दस्तावेज़ों से टेक्स्ट निकालें।
या अपनी फ़ाइल खींचें, पेस्ट करें, या क्लाउड से चुनें
स्कैन किए दस्तावेज़ से टेक्स्ट का एक ही मतलब है: ऐसे पेज से शब्द निकालना जो सिर्फ एक तस्वीर है। स्कैनर या फोन कैमरा कागज़ को सपाट इमेज की तरह रिकॉर्ड करता है, इसलिए उसमें मौजूद अक्षर कैरेक्टर नहीं बल्कि पिक्सेल होते हैं। जब तक उस पेज को पढ़कर टेक्स्ट के रूप में लिखा न जाए, उस फ़ाइल में कुछ भी न तो चुना जा सकता है, न खोजा जा सकता है, न ठीक किया जा सकता है।
OCR क्या है? स्कैन किए गए दस्तावेज़ या छवि में अक्षर, संख्याएँ या विशेष वर्णों को पहचानने के लिए ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) का उपयोग किया जाता है। OCR कन्वर्टर की मदद से आप ऐसे फ़ाइलों से टेक्स्ट निकाल सकते हैं, ताकि आप उसे बदल, संपादित, प्रिंट या सहेज सकें।
जो वापस आता है वह एक सादा टेक्स्ट फ़ाइल होती है। इसमें दस्तावेज़ के शब्द और लाइन ब्रेक होते हैं, न कि पेज का लेआउट। ज़्यादातर कामों के लिए यही ज़रूरी होता है: आपको सिर्फ पत्र की बात, फ़ॉर्म के आंकड़े, या वह पैराग्राफ़ चाहिए होता है जिसका आपको जवाब देना है।
स्कैन किए दस्तावेज़ से टेक्स्ट कन्वर्ज़न एक समय में एक से ज़्यादा फ़ाइलों पर चलता है। रिपोर्ट के हर पेज को जोड़ें, या स्कैन किए पत्रों वाला कोई फ़ोल्डर, और हर फ़ाइल अलग से कन्वर्ट होती है और अपनी अलग टेक्स्ट फ़ाइल के रूप में मिलती है। बिना अकाउंट के आप एक ही अपलोड में 10 स्कैन भेज सकते हैं।
एक सेटिंग यह तय करती है कि पहचान कितनी अच्छी काम करेगी, और वह है दस्तावेज़ की भाषा। इंग्लिश पहले से चुनी हुई है, इसलिए इंग्लिश पेज के लिए किसी बदलाव की ज़रूरत नहीं। किसी और भाषा के लिए, शुरू करने से पहले 124 की सूची में से मिलती जुलती भाषा चुनें।
कागज़ की तस्वीरें भी यहां स्कैन मानी जाती हैं। इस पेज को फोन पर खोलें, कैमरा रोल से तस्वीर अपलोड करें और उसी तरह की पहचान उस पर भी चलेगी। अगर फोन ने पेज को इमेज की बजाय PDF के रूप में सेव किया है, तो PDF स्कैन के लिए बनी ऐप बेहतर विकल्प है।
स्कैन की हुई PDF को टेक्स्ट में कन्वर्ट करें.txt फ़ाइल एक्सटेंशन का उपयोग सादा टेक्स्ट फ़ाइलों के लिए किया जाता है। इन फ़ाइलों में टेक्स्ट कई पंक्तियों के रूप में होता है और इन्हें अलग-अलग प्लेटफ़ॉर्म और डिवाइस पर कई तरह के टेक्स्ट एडिटर में खोला जा सकता है। टेक्स्ट में कोई फ़ॉर्मैटिंग नहीं होती है।
ऐसे दस्तावेज़ के लिए जो कागज़ से शुरू हुआ हो, अंत में सादा टेक्स्ट सबसे पोर्टेबल रूप होता है। फ़ाइल बहुत छोटी रहती है, यह किसी भी कंप्यूटर या फोन पर बिना लाइसेंस के खुल जाती है, और इसके शब्द ईमेल, फॉर्म या ट्रांसलेशन टूल में इस तरह डाले जा सकते हैं कि मूल पेज की शक्ल साथ न आए।
फ़ाइल एक्सटेंशन: .txt, MIME टाइप: text/plain
विकिपीडिया पर TXTटेक्स्ट पहचान सिर्फ वही पढ़ सकती है जो स्कैन उसे दिखाता है। यहां बताया गया है कि लोग जो सबसे ज़्यादा तरह के दस्तावेज़ अपलोड करते हैं, उनका नतीजा आमतौर पर कैसा होता है।
| दस्तावेज़ | कैसे कैप्चर किया गया | क्या निकलता है |
|---|---|---|
| 300 dpi पर छपा हुआ पेज | ऑफिस स्कैनर या ऑल-इन-वन प्रिंटर | बहुत साफ़। पढ़ने के लिए यह सबसे आसान तरह का दस्तावेज़ है। |
| कई पेजों वाली रिपोर्ट | हर पेज का अलग स्कैन, साथ में अपलोड किया हुआ | हर पेज अपनी-अपनी टेक्स्ट फ़ाइल के रूप में, उसी क्रम में लौटता है जिसमें आपने उन्हें जोड़ा था। |
| दस्तावेज़ की फोटो | कागज़ के ऊपर से लिया गया फोन कैमरा | अच्छा, बशर्ते पेज सपाट हो, फ्रेम को भरे और उस पर कोई साया न हो। |
| फॉर्म या टेबल | कोई भी स्कैनर या कैमरा | शब्द तो निकल जाते हैं, कॉलम नहीं। सादा टेक्स्ट में टेबल स्ट्रक्चर नहीं होता। |
| फीका, टेढ़ा या हाथ से लिखा पेज | पुरानी कॉपी, तिरछा फीड, या पेन से लिखा | भरोसेमंद नहीं। यह ऐप पेज को सीधा नहीं करती, और हाथ की लिखावट के लिए पहचान बनी नहीं है। |
स्कैन किया हुआ दस्तावेज़ अगर ठीक से नहीं पढ़ा जा रहा हो तो लगभग हमेशा वजह कैप्चर की होती है। उसी पेज को दोबारा, सपाट और 300 dpi पर स्कैन करना, इस पेज की किसी भी सेटिंग से ज़्यादा नतीजे सुधार देता है।
इस कन्वर्टर पर लोग सबसे ज़्यादा ये काम लेकर आते हैं।
किसी ने स्कैन भेजा है और आपको तस्वीर नहीं, उसका लिखा चाहिए। स्कैन किए दस्तावेज़ को टेक्स्ट में बदलें और पैराग्राफ़ जवाब, फॉर्म या रिपोर्ट में पेस्ट करने के लिए तैयार हो जाते हैं।
यह पहचान 124 दस्तावेज़ भाषाओं को कवर करती है, इसलिए इंडोनेशियन, अरबी, हिंदी या जापानी में स्कैन टेक्स्ट के रूप में वापस आता है, जिसे आप सीधे ट्रांसलेटर या सर्च बॉक्स में पेस्ट कर सकते हैं।
ढेर को स्कैन करें, इमेज को साथ में अपलोड करें और हर दस्तावेज़ अपनी अलग टेक्स्ट फ़ाइल के रूप में मिलता है। कुछ इंस्टॉल नहीं करना पड़ता और इसके लिए अकाउंट की ज़रूरत नहीं है।
हर अपलोड और हर डाउनलोड एन्क्रिप्टेड कनेक्शन के ज़रिए चलता है, इसलिए दस्तावेज़ न तो कन्वर्टर तक पहुंचते समय पढ़ा जा सकता है, न वापस आते समय। आपकी तैयार टेक्स्ट फ़ाइल का लिंक यादृच्छिक रूप से बनाया जाता है और उसे अनुमान से नहीं ढूंढा जा सकता।
यहां टेक्स्ट पहचान पूरी तरह स्वचालित है। आप जो दस्तावेज़ भेजते हैं, कोई उन्हें पढ़ता, खोलता या कॉपी नहीं करता, कुछ भी मॉनिटर नहीं किया जाता, और आपकी फ़ाइलों का कभी भी AI मॉडल ट्रेन करने में इस्तेमाल नहीं होता।
कन्वर्ज़न यूरोप में स्थित सर्वर पर चलता है, जो डेटा प्रोसेसिंग एग्रीमेंट के तहत ऑपरेट होते हैं। फ़ाइल के साथ सिर्फ आपका IP पता और तारीख व समय हैंडल किए जाते हैं, वह भी सिर्फ सेवा के दुरुपयोग को रोकने के लिए।
आप स्कैन किए गए दस्तावेज़ और उससे बनने वाली टेक्स्ट फ़ाइल के कॉपीराइट और स्वामित्व को अपने पास ही रखते हैं। यहां फ़ाइल को कनवर्ट करने से किसी और को कुछ भी हस्तांतरित नहीं होता।
अपना स्कैन किया हुआ दस्तावेज़ अपलोड करें।
ड्रॉपडाउन मेनू से स्कैन किए गए दस्तावेज़ की भाषा चुनें (वैकल्पिक)।
"Start" पर क्लिक करें और थोड़ी प्रतीक्षा के बाद अपना कनवर्ट किया हुआ टेक्स्ट फ़ाइल डाउनलोड करें।
हां। हर प्लान पर स्कैन किए गए दस्तावेज़ को टेक्स्ट में बदलना मुफ्त है, इसके लिए न अकाउंट चाहिए न ही क्रेडिट्स। स्कैन अपलोड करें, Start दबाएं और टेक्स्ट फ़ाइल डाउनलोड करें। पेड प्लान सिर्फ फ़ाइल साइज और बैच लिमिट बढ़ाता है।
ऊपर स्कैन किया हुआ दस्तावेज़ अपलोड करें, वह जिस भाषा में लिखा है उसे चुनें, फिर Start दबाएं। कनवर्टर पेज को पढ़ता है और एक साधारण टेक्स्ट फ़ाइल लौटाता है, जिसे आप किसी भी एडिटर में खोल, खोज और संपादित कर सकते हैं। कुछ भी इंस्टॉल करने की ज़रूरत नहीं है।
हां। बिना अकाउंट के भी एक बार में 10 स्कैन जोड़ें, और हर दस्तावेज़ अलग से कनवर्ट होकर अपनी टेक्स्ट फ़ाइल के रूप में वापस आता है। आप जो भाषा चुनते हैं, वही उन सब पर लागू होती है।
PDF स्कैन के लिए scanned PDF to text ऐप बेहतर है। यह खास तौर पर PDF पेजों के लिए बना है और आपको रिकग्निशन इंजन चुनने देता है, जो लंबे दस्तावेज़ पर फर्क डालता है। बाकी सब कुछ उसी तरह काम करता है।
124 दस्तावेज़ भाषाएं, अंग्रेजी, इंडोनेशियाई और स्पैनिश से लेकर अरबी, हिंदी, जापानी और कोरियाई तक। वह भाषा चुनें जो पेज पर लिखे शब्दों से मेल खाती हो। अंग्रेजी पहले से चुनी हुई है, इसलिए अंग्रेजी दस्तावेज़ के लिए कुछ बदलने की जरूरत नहीं।
नहीं, और यही टेक्स्ट फ़ाइल का मकसद है। शब्द और लाइन ब्रेक तो आएंगे, लेकिन कॉलम, टेबल, हेडर और पेज नंबर नहीं, क्योंकि साधारण टेक्स्ट में पेज जैसा कुछ नहीं होता। जब आपको लेआउट वापस चाहिए, तो convert to Word ऐप का इस्तेमाल करें।
दो चीजें जांचें। पहली, चुनी हुई भाषा दस्तावेज़ से मेल खाती है या नहीं। दूसरी, खुद स्कैन: फीका, टेढ़ा या कम रेज़ोल्यूशन वाला पेज अक्षर खो देता है, और यह ऐप आपके लिए पेज को सीधा या साफ नहीं करता। 300 dpi पर दोबारा स्कैन करने से ज्यादातर गलती ठीक हो जाती है।
हां। वे एन्क्रिप्टेड कनेक्शन के जरिए भेजे जाते हैं और यूरोपीय संघ में स्थित सर्वरों पर अपने आप प्रोसेस होते हैं। कोई उन्हें पढ़ता या कॉपी नहीं करता, उन्हें कभी भी AI मॉडल ट्रेनिंग के लिए इस्तेमाल नहीं किया जाता, और डाउनलोड लिंक रैंडम होता है, इसलिए उसे अनुमान से नहीं पाया जा सकता।
स्कैन किए गए दस्तावेज़ों और छवियों से महत्वपूर्ण टेक्स्ट को OCR (Optिकल कैरेक्टर रिकग्निशन) के साथ डिजिटाइज़ करें। छवियों से टेक्स्ट को ऑनलाइन आसानी से निकालें।
लेख पढ़ेंइनमें से हर टूल ब्राउज़र में ही चलता है, एक ही टेक्स्ट रिकग्निशन का उपयोग करता है और कुछ भी इंस्टॉल करने की जरूरत नहीं होती।