স্ক্যান করা বা তোলা ডকুমেন্ট থেকে টেক্সট বের করুন।
অথবা ড্র্যাগ ও ড্রপ করুন, পেস্ট করুন, বা ক্লাউড থেকে নির্বাচন করুন
স্ক্যান করা ডকুমেন্ট থেকে টেক্সটে রূপান্তরের মানে একটাই: শুধু ছবি হিসেবে থাকা পেজ থেকে শব্দ বের করে আনা। স্ক্যানার বা ফোনের ক্যামেরা কাগজকে সমতল ইমেজ হিসেবে রেকর্ড করে, তাই ভেতরের অক্ষরগুলো ক্যারেক্টার নয়, পিক্সেল। পেজটি টেক্সট হিসেবে পড়ে লেখা না হওয়া পর্যন্ত সেই ফাইলে থাকা কিছুই নির্বাচন, অনুসন্ধান বা সংশোধন করা যায় না।
OCR কী? Optical character recognition হলো এমন একটি প্রযুক্তি যা স্ক্যান করা ডকুমেন্ট বা ছবিতে থাকা অক্ষর, সংখ্যা বা বিশেষ চিহ্ন শনাক্ত করতে ব্যবহৃত হয়। একটি OCR কনভার্টার ব্যবহার করে আপনি এমন ফাইল থেকে লেখা বের করে তা পরিবর্তন, সম্পাদনা, প্রিন্ট বা সংরক্ষণ করতে পারেন.
ফিরে যা আসে তা হলো একটি সাদামাটা টেক্সট ফাইল। এতে ডকুমেন্টের শব্দ আর লাইন ব্রেক থাকে, পেজের ডিজাইন থাকে না। বেশির ভাগ কাজের জন্য এটিই মূল উদ্দেশ্য: আপনার দরকার ছিল চিঠির শব্দগুলো, ফর্মের সংখ্যাগুলো, বা যে অনুচ্ছেদের জবাব দিতে হবে তা।
স্ক্যান করা ডকুমেন্ট থেকে টেক্সটে রূপান্তর একসঙ্গে একাধিক ফাইলে চলে। একটি প্রতিবেদনের প্রতিটি পেজ, বা স্ক্যান করা চিঠির একটি ফোল্ডার যোগ করুন, এবং প্রতিটি ফাইল আলাদাভাবে কনভার্ট হয়ে আলাদা টেক্সট ফাইল হিসেবে ফিরে আসে। অ্যাকাউন্ট ছাড়াই এক আপলোডে আপনি 10টি স্ক্যান পাঠাতে পারেন।
একটি সেটিং ঠিক করে দেয় রিকগনিশন কত ভালো কাজ করবে, আর তা হলো ডকুমেন্টের ভাষা। ইংরেজি আগেই নির্বাচন করা থাকে, তাই একটি ইংরেজি পেজের জন্য কিছুই বদলাতে হয় না। অন্য যেকোনো ভাষার জন্য, শুরুর আগে তালিকা থেকে 124টির মধ্যে মিল থাকা ভাষাটি বেছে নিন।
কাগজের ছবি এখানে স্ক্যানের মতোই ধরা হয়। ফোনে এই পেজ খুলুন, ক্যামেরা রোল থেকে ছবি আপলোড করুন, আর একই রিকগনিশন তাতেও চলবে। যদি ফোন পেজটিকে ইমেজের বদলে PDF হিসেবে সেভ করে থাকে, তাহলে PDF স্ক্যানের জন্য বানানো অ্যাপটি ভালো পথ।
স্ক্যান করা PDF থেকে টেক্সটে কনভার্ট করুন.txt ফাইল এক্সটেনশনটি সাধারণ টেক্সট ফাইলের জন্য ব্যবহৃত হয়। এসব ফাইলে লাইনে লাইনে লেখা থাকে এবং বিভিন্ন প্ল্যাটফর্ম ও ডিভাইসে নানা টেক্সট এডিটরে খোলা যায়। এই টেক্সটে কোনো ফরম্যাটিং থাকে না।
যে ডকুমেন্টের শুরু কাগজে, তার জন্য সাদামাটা টেক্সটই শেষ পর্যন্ত সবচেয়ে বহনযোগ্য জিনিস। ফাইলটি খুব ছোট, এটি যে কোনো কম্পিউটার বা ফোনে লাইসেন্স ছাড়াই খোলে, আর শব্দগুলো ইমেইল, ফর্ম বা অনুবাদ টুলে চলে যায়, আসল পেজের চেহারা টেনে না এনে।
ফাইল এক্সটেনশন: .txt, MIME টাইপ: text/plain
উইকিপিডিয়ায় TXTটেক্সট রিকগনিশন শুধুই স্ক্যান যা দেখায় তাই পড়তে পারে। মানুষ যে ধরনের ডকুমেন্ট সবচেয়ে বেশি আপলোড করে, সেগুলো সাধারণত এমন ফল দেয়:
| ডকুমেন্ট | যেভাবে কেপচার করা হয়েছে | ফলাফল কেমন আসে |
|---|---|---|
| 300 dpi তে প্রিন্টেড একটি পেজ | অফিস স্ক্যানার বা অল-ইন-ওয়ান প্রিন্টার | খুবই পরিষ্কার। পড়ার জন্য এটিই সবচেয়ে সহজ ধরনের ডকুমেন্ট। |
| একটি বহু-পৃষ্ঠার প্রতিবেদন | প্রতি পেজে একটি করে স্ক্যান, একসঙ্গে আপলোড করা | আপনি যেভাবে যোগ করেছেন সেই ক্রমে প্রতিটি পেজ নিজের আলাদা টেক্সট ফাইল হিসেবে ফিরে আসে। |
| একটি ডকুমেন্টের ছবি | কাগজের উপরে ধরে রাখা ফোনের ক্যামেরা | ভালো, যতক্ষণ পেজটি সমতল, ফ্রেম ভরে থাকে এবং কোনো ছায়া না থাকে। |
| একটি ফর্ম বা টেবিল | যে কোনো স্ক্যানার বা ক্যামেরা | শব্দগুলো বেরিয়ে আসে, কলামগুলো নয়। সাদামাটা টেক্সটে কোনো টেবিল স্ট্রাকচার থাকে না। |
| ফ্যাকাশে, কাত হয়ে থাকা বা হাতে লেখা পেজ | পুরনো কপি, কাত হওয়া ফিড বা কলমে লেখা | অবিশ্বস্ত। এই অ্যাপ পেজ সোজা করে না, আর হাতের লেখা এই রিকগনিশনের জন্য বানানো নয়। |
খারাপভাবে পড়া স্ক্যান করা ডকুমেন্ট প্রায় সব সময়ই কেপচার সমস্যা। একই পেজ আবার স্ক্যান করা, সমতল ও 300 dpi তে, এই পেজের যেকোনো সেটিং-এর চেয়ে বেশি ফল ঠিক করে।
এই কনভার্টারে মানুষ সাধারণত যে কাজগুলো নিয়ে আসে সেগুলো হলো:
কেউ একটি স্ক্যান পাঠিয়েছে আর আপনার দরকার এর কথা, ছবিটা নয়। স্ক্যান করা ডকুমেন্টকে টেক্সটে কনভার্ট করুন, আর অনুচ্ছেদগুলো উত্তর, ফর্ম বা প্রতিবেদনে পেস্ট করার জন্য প্রস্তুত।
এই রিকগনিশন 124টি ডকুমেন্ট ভাষা কভার করে, তাই ইন্দোনেশিয়ান, আরবি, হিন্দি বা জাপানি যে কোনো স্ক্যান টেক্সট হিসেবে ফিরে আসে, যা আপনি সরাসরি ট্রান্সলেটর বা সার্চ বক্সে পেস্ট করতে পারেন।
গাদা কাগজ স্ক্যান করুন, ইমেজগুলো একসঙ্গে আপলোড করুন, আর প্রতিটি ডকুমেন্ট নিজের আলাদা টেক্সট ফাইল হিসেবে ফিরে আসবে। কিছুই ইনস্টল করতে হয় না এবং এটি করতে কোনো অ্যাকাউন্টেরও দরকার নেই।
প্রতিটি আপলোড এবং প্রতিটি ডাউনলোড এনক্রিপ্টেড কানেকশনে চলে, তাই কনভার্টারে যাওয়া বা ফিরে আসার পথে ডকুমেন্ট পড়া যায় না। আপনার প্রস্তুত টেক্সট ফাইলের লিঙ্ক এলোমেলোভাবে তৈরি হয় এবং অনুমান করে বের করা যায় না।
এখানকার টেক্সট রিকগনিশন সম্পূর্ণ স্বয়ংক্রিয়। আপনি যে ডকুমেন্ট পাঠান কেউ তা পড়ে না, খোলে না বা কপি করে না, কিছুই মনিটর করা হয় না, এবং আপনার ফাইল কখনোই AI মডেল ট্রেইন করতে ব্যবহৃত হয় না।
কনভার্সনটি কেবলমাত্র ইউরোপে অবস্থিত সার্ভারে চলে, যা একটি ডাটা প্রসেসিং এগ্রিমেন্টের অধীনে পরিচালিত। ফাইলের পাশে শুধু আপনার IP ঠিকানা এবং তারিখ ও সময় হ্যান্ডেল করা হয়, এবং কেবল সেবার অপব্যবহার রোধের জন্য।
স্ক্যান করা নথি এবং সেখান থেকে যে টেক্সট ফাইল তৈরি হয়, তার স্বত্ব ও মালিকানা আপনারই থাকে। এখানে কোনো ফাইল রূপান্তর করলে তা কারও কাছে হস্তান্তর হয় না।
আপনার স্ক্যান করা ডকুমেন্ট আপলোড করুন।
ড্রপডাউন মেনু থেকে স্ক্যান করা ডকুমেন্টের ভাষা নির্বাচন করুন (ঐচ্ছিক)।
"Start" ক্লিক করুন এবং কিছুক্ষণ অপেক্ষার পর আপনার কনভার্ট করা টেক্সট ফাইলটি ডাউনলোড করুন।
হ্যাঁ। সব ধরনের প্ল্যানে স্ক্যান করা নথিকে টেক্সটে রূপান্তর করা বিনামূল্যে, কোনো অ্যাকাউন্ট লাগে না এবং কোনো ক্রেডিট খরচ হয় না। শুধু স্ক্যান আপলোড করুন, Start চাপুন এবং টেক্সট ফাইল ডাউনলোড করুন। পেইড প্ল্যানে কেবল ফাইল সাইজ ও ব্যাচ সীমা বাড়ে।
উপরে আপনার স্ক্যান করা নথি আপলোড করুন, এটি যেই ভাষায় লেখা সেই ভাষা বেছে নিন, তারপর Start চাপুন। কনভার্টার পৃষ্ঠাটি পড়ে এবং একটি সাধারণ টেক্সট ফাইল দেয়, যা আপনি যেকোনো এডিটরে খুলতে, খুঁজতে ও সম্পাদনা করতে পারবেন। কিছুই ইনস্টল করতে হয় না।
হ্যাঁ। অ্যাকাউন্ট ছাড়া এক আপলোডে 10টি স্ক্যান যোগ করতে পারেন, এবং প্রতিটি নথি আলাদা ভাবে রূপান্তরিত হয়ে নিজস্ব টেক্সট ফাইল হিসেবে ফিরে আসে। আপনি যে ভাষা বেছে নেন, তা সবার ক্ষেত্রেই প্রযোজ্য হয়।
PDF স্ক্যানের জন্য scanned PDF to text app ব্যবহার করাই ভালো। এটি PDF পৃষ্ঠাকে কেন্দ্র করে তৈরি এবং আপনাকে রিকগনিশন ইঞ্জিন বেছে নিতে দেয়, যা বড় নথির ক্ষেত্রে পার্থক্য আনে। এর বাকি সব কাজ করার ধরণ একই।
124টি নথি ভাষা, ইংরেজি, ইন্দোনেশিয়ান ও স্প্যানিশ থেকে শুরু করে আরবি, হিন্দি, জাপানি ও কোরিয়ান পর্যন্ত। পৃষ্ঠায় থাকা শব্দের সঙ্গে মেলে এমন ভাষাটি বেছে নিন। ইংরেজি আগেই সিলেক্ট করা থাকে, তাই ইংরেজি নথির জন্য কিছু বদলাতে হয় না।
না, এবং সেটাই একটি টেক্সট ফাইলের বৈশিষ্ট্য। শব্দ ও লাইন ব্রেক ঠিক থাকে; কলাম, টেবিল, হেডার এবং পৃষ্ঠা নম্বর থাকে না, কারণ সাধারণ টেক্সটে কোনো পৃষ্ঠা থাকে না। লেআউট দরকার হলে convert to Word app ব্যবহার করুন।
দুটি বিষয় দেখুন। প্রথমত, সিলেক্ট করা ভাষা নথির ভাষার সঙ্গে মেলে কি না। দ্বিতীয়ত, স্ক্যানটি নিজে: ফ্যাকাশে, কাত হওয়া বা কম রেজোলিউশনের পৃষ্ঠায় অক্ষর হারিয়ে যায়, আর এই অ্যাপ পৃষ্ঠা সোজা বা পরিষ্কার করে না। 300 dpi তে আবার স্ক্যান করলে বেশিরভাগ ক্ষেত্রে ঠিক হয়ে যায়।
হ্যাঁ। এগুলো এনক্রিপ্টেড সংযোগের মাধ্যমে পাঠানো হয় এবং ইউরোপীয় ইউনিয়নের সার্ভারে স্বয়ংক্রিয়ভাবে প্রক্রিয়াকৃত হয়। কেউ এগুলো পড়ে বা কপি করে না, এগুলো কখনোই AI মডেল প্রশিক্ষণে ব্যবহার করা হয় না, এবং ডাউনলোড লিঙ্কটি এলোমেলোভাবে তৈরি হয়, তাই অনুমান করা যায় না।
স্ক্যান করা ডকুমেন্ট ও ছবি থেকে OCR (Optical Character Recognition) ব্যবহার করে মূল্যবান লেখা ডিজিটাইজ করুন। অনলাইনে সহজেই ছবির থেকে লেখা বের করুন।
প্রবন্ধটি পড়ুনএগুলোর প্রতিটি ব্রাউজারেই চলে, একই টেক্সট রিকগনিশন ব্যবহার করে এবং কিছুই ইনস্টল করতে হয় না।