ছবি, ইমেজ এবং স্ক্যান করা পেজকে সম্পাদনাযোগ্য ওয়ার্ড ডকুমেন্টে রূপান্তর করুন। টেক্সট শনাক্তকরণ অনলাইনে চলে, কোনো সফটওয়্যার ইনস্টল বা অ্যাকাউন্টের প্রয়োজন নেই।
অথবা ড্র্যাগ ও ড্রপ করুন, পেস্ট করুন, বা ক্লাউড থেকে নির্বাচন করুন
Word এ একটি ইমেজ যোগ করলে সেটি ইমেজই থাকে। টেক্সট রিকগনিশন JPG এর অক্ষরগুলো পড়ে এবং সেগুলোকে ডকুমেন্টে লিখে, যাতে আপনি প্রতিটি লাইন সিলেক্ট, ঠিক ও রিফরম্যাট করতে পারেন।
বর্তমান সংস্করণের Word এর জন্য Microsoft Word (*.docx) বেছে নিন, অথবা পুরোনো কম্পিউটারে ফাইল খুলতে হলে Word 2003 বা আগের (*.doc) নির্বাচন করুন। এই অপশন আপলোডারের পাশে থাকে।
টেক্সট রিকগনিশন ১২৪টি ভাষায় কাজ করে এবং একটি পেজে একাধিক ভাষা থাকলে একসাথে কয়েকটি ভাষা বেছে নেওয়া যায়। ভাষা নির্দিষ্ট করাই যথার্থতা বাড়ানোর সবচেয়ে বড় বিষয়।
দুটি OCR পদ্ধতি দেওয়া আছে, এবং আপনি ফাইলের জন্য যেটি মানায় সেটি বেছে নেবেন। Layout পেজের জিওমেট্রি ধরে রাখে: কলাম, টেবিল এবং প্রতিটি ব্লকের অবস্থান ছবির মতোই থাকে। Text recognition জিওমেট্রি উপেক্ষা করে এবং যতটা সম্ভব ভালোভাবে অক্ষরগুলো পড়ে।
একটি ফর্ম, ইনভয়েস বা ডেস্কে তোলা টেবিলের ছবির জন্য Layout সঠিক পছন্দ, যেখানে পেজের গঠন নিজেই অর্থ বহন করে। ঘন লেখা, তির্যকভাবে তোলা ছবি বা কম কনট্রাস্ট স্ক্যানের ক্ষেত্রে Text recognition ভালো কাজ করে, যেখানে লেআউট ধরে রাখলে যথার্থতা কমে যায়।
Layout নির্বাচন করা থাকলে আরও একটি সুইচ থাকে, Improve OCR, যা পড়ার আগে পেজকে সাদাকালো করে। এতে হালকা বা অসম আলোতে তোলা ছবিতে যথার্থতা বাড়ে, তবে রং চলে যায়, তাই আপনি না চাইলে এটি বন্ধই থাকে।
Conversion Method, OCR Method, OCR Language এবং Improve OCR - সবই আপলোডারের পাশে থাকা সেটিংস প্যানেলে থাকে।
সবচেয়ে বেশি জিজ্ঞেস করা হয় JPG নিয়ে, আর এটি মোটেই একমাত্র ফরম্যাট নয় যা কাজ করে। PNG, GIF ও TIF ইমেজ একইভাবে কনভার্ট হয়, JPEG আসলে একই ফরম্যাটের লম্বা এক্সটেনশন, এবং একটি PDF - স্ক্যান করা বা ডিজিটাল - এখানেও কনভার্ট হয়।
এক্সটেনশনের চেয়ে ছবির ভেতরের বিষয় বেশি গুরুত্বপূর্ণ। সমতল, ভালো আলোতে, সোজা করে তোলা পেজ প্রায় নিখুঁতভাবে পড়া যায়। তির্যক কোণ, কাগজের ওপর ছায়া, ঝাপসা ছবি বা হাতের লেখা - সবই যথার্থতা কমিয়ে দেয়, এবং কোনো কনভার্টারই তা এড়াতে পারে না।
একটি স্ক্যান ছবির মতোই আচরণ করে। পেজ যেভাবেই আসুক, টেক্সট রিকগনিশন পড়ার আগে এটি কেবল টেক্সটের একটি ছবি, এবং যেসব সেটিং এতে সাহায্য করে, সেগুলোও একই।
DOC হলো Microsoft Word দ্বারা চালু করা ডকুমেন্ট ফাইল ফরম্যাট, যেখানে .DOC ফাইল এক্সটেনশন ব্যবহার করা হয়। টেক্সটের পাশাপাশি, এই ফাইলগুলোতে হাইপারলিংক, ছবি, গ্রাফিক্স, টেবিল, উন্নত ফরম্যাটিং এবং অন্যান্য উপাদান থাকতে পারে।
Microsoft Office 2007 এর সাথে .DOCX ফাইল এক্সটেনশন চালু হয়। এটি Microsoft Office Open XML আন্তর্জাতিক মান ব্যবহার করে, যা ফরম্যাটটিকে আরও সহজে অ্যাক্সেসযোগ্য এবং ব্যবহারযোগ্য করে।
Microsoft Word এর নতুন সংস্করণগুলো পুরোনো DOC ফরম্যাট খুলতে পারে, কিন্তু DOCX ফাইল পুরোনো সংস্করণে খোলা যায় না। খোলা গেলেও ফরম্যাটিং ভুল হতে পারে বা ডকুমেন্টের কিছু অংশ অনুপস্থিত থাকতে পারে।
ফাইল এক্সটেনশন: .docx এবং .doc. MIME type: application/vnd.openxmlformats-officedocument.wordprocessingml.document
একটি ইমেজকে Word এ কনভার্ট করা ফ্রি এবং এর জন্য কোনো অ্যাকাউন্ট লাগে না। একাধিক ফাইল যোগ করলে সেগুলো একবারেই কনভার্ট হয়, প্রতিটি নিজস্ব ডকুমেন্ট হিসেবে ফেরত আসে একই সেটিংস নিয়ে।
প্রতিটি আপলোড আর ডাউনলোড এনক্রিপ্টেড কানেকশনের মাধ্যমে হয়, তাই পথিমধ্যে আপনার পেজ পড়া যায় না। প্রক্রিয়াটি সম্পূর্ণ স্বয়ংক্রিয়: কেউ আপনার ফাইল দেখে না এবং সেগুলো কখনোই AI মডেল ট্রেন করতে ব্যবহার করা হয় না।
আপনি আপলোড করা ইমেজ এবং ফিরে পাওয়া Word ডকুমেন্ট উভয়ের কপিরাইট ও মালিকানা আপনারই থাকে, এবং যেসব সার্ভার কাজটি করে সেগুলো ইউরোপে অবস্থিত।
টেক্সট রিকগনিশন যতটা ভালো হয়, তা নির্ভর করে যে ছবি থেকে এটি পড়ছে তার মানের ওপর। কী আশা করবেন এবং কোন সেটিং ব্যবহার করবেন, তা নিচে আছে।
| আপনি যা আপলোড করেন | যে সেটিং ব্যবহার করবেন | আপনি যা পাবেন |
|---|---|---|
| ছাপা লেখা থাকা সমতল, ভালো আলোতে তোলা একটি ছবি | Convert with OCR, OCR Method এ Layout সেট করুন | সম্পাদনাযোগ্য টেক্সট, যেখানে কলাম ও টেবিল আগের জায়গাতেই থাকে |
| কোণ থেকে তোলা ফোনের ছবি, বা ঘন লেখা থাকা পেজ | Convert with OCR, OCR Method এ Text recognition সেট করুন | সম্পাদনাযোগ্য টেক্সট, তবে মূল অবস্থান অক্ষুণ্ণ থাকবে না |
| হালকা, ধূসর বা অসম আলোতে তোলা পেজ | Convert with OCR, Layout, তারপর Improve OCR চালু করুন | ভালো যথার্থতা, আর পেজটি রঙ ছাড়া ফিরে আসবে |
| হাতের লেখা | যেকোনো সেটিং | খুব অল্প, বা প্রায় কিছুই না। টেক্সট রিকগনিশন ছাপা অক্ষর পড়ে, হাতের লেখা নয় |
| শুধু ডকুমেন্টের ভেতরে বসানোর জন্য রাখা কোনো ইমেজ | Convert, ডিফল্ট | Word ফাইলের ভেতরে থাকা ছবি, যার পেছনে কোনো টেক্সট লেয়ার নেই |
পেজের ভাষা নির্দিষ্ট করা অন্য যেকোনো সেটিংয়ের চেয়ে বেশি যথার্থতা বাড়ায়। ১২৪টি ভাষা দেওয়া আছে এবং একসাথে একাধিকও বেছে নেওয়া যায়।
আপনার ছবি বা স্ক্যান আপলোড করুন। এটি PNG, JPG, অন্য কোনো ইমেজ ফাইল, বা PDF ডকুমেন্ট হতে পারে.
ড্রপডাউন মেনু থেকে আপনার Microsoft Word ফরম্যাট (DOC বা DOCX) নির্বাচন করুন.
Conversion Method এ Convert with OCR সেট করুন, যাতে ছবির টেক্সট সম্পাদনাযোগ্য হয়।
OCR ফলাফল উন্নত করতে আপনার ফাইলের ভাষা নির্বাচন করুন.
"Start" এ ক্লিক করুন.
ইমেজ আপলোড করুন, Microsoft Word (*.docx) অথবা Word 2003 or older (*.doc) নির্বাচন করুন, Conversion Method এ Convert with OCR সেট করুন, পেজের ভাষা বেছে নিন এবং Start চাপুন। ছবির অক্ষরগুলো পড়ে একটি Word ফাইলে লেখা হবে, যা আপনি এডিট করতে পারবেন।
হ্যাঁ। একটি ইমেজকে Word এ কনভার্ট করা ফ্রি, এর জন্য কোনো অ্যাকাউন্ট লাগে না, এবং কোনো ক্রেডিটও খরচ হয় না। খুব বড় ফাইল, লম্বা ব্যাচ এবং প্রায়োরিটি প্রসেসিংয়ের জন্য পেইড প্ল্যান আছে, তবে সাধারণ কনভার্সনের জন্য এগুলোর দরকার নেই।
শুধুমাত্র তখনই, যখন Conversion Method এ Convert with OCR সেট করা থাকে। Convert এ রেখে দিলে ইমেজটি Word ফাইলে একটি ছবি হিসেবে বসে, এবং ভেতরের কিছুই সিলেক্ট করা যায় না। OCR চালু থাকলে অক্ষরগুলো পড়ে আসল টেক্সট হিসেবে লেখা হয়, যা আপনি এডিট, সার্চ ও রিফরম্যাট করতে পারবেন।
JPG, PNG, GIF এবং TIF ইমেজ সবই একইভাবে কনভার্ট হয়, ফোনে তোলা ছবি থেকেও কাজ হয়, এবং স্ক্যান করা পেজ বা PDF ও গ্রহণ করা হয়। এক্সটেনশনের চেয়ে ফাইলের ভেতরের বিষয় বেশি গুরুত্বপূর্ণ: সমতল, ভালো আলোতে তোলা পেজ সবচেয়ে ভালোভাবে পড়া যায়, আর ছায়া, তির্যক কোণ বা ঝাপসা ছবি যথার্থতা কমিয়ে দেয়।
ফাইলটি যদি Word 2003 বা তারও পুরোনো কোনো প্রোগ্রামে খোলার প্রয়োজন না হয়, তাহলে Microsoft Word (*.docx) বেছে নিন। DOCX বর্তমানে মানক ফরম্যাট এবং ফরম্যাটিং আরও নির্ভরযোগ্যভাবে ধরে রাখে। DOC ফরম্যাটটি সেই পুরোনো সফটওয়্যারের জন্য, যা DOCX পড়তে পারে না।
এখানে 124টি সোর্স ভাষা রয়েছে, আরবি ও হিন্দি থেকে শুরু করে রাশিয়ান, তুর্কি এবং ভিয়েতনামিজ পর্যন্ত। কোনো পৃষ্ঠায় যদি একাধিক ভাষা মিশে থাকে, তাহলে একাধিক ভাষাও একসাথে নির্বাচন করা যায়। কনভার্ট করার আগে ভাষার নাম নির্বাচন করা যে কোনো অন্য সেটিংয়ের চেয়ে নির্ভুলতা বেশি বাড়ায়।
না। আপনি যদি কোনো JPG ফাইল Word ডকুমেন্টে যোগ করেন, সেটি ছবি হিসেবেই থাকে: এর ভেতরের শব্দগুলো নির্বাচন, খোঁজা বা সম্পাদনা করা যায় না। ছবির ভেতরের অক্ষর পড়তে হলে তা Word-এ পৌঁছানোর আগেই করতে হয়, আর এ কাজটাই এই কনভার্টার করে।
হ্যাঁ। সংযোগটি দুই দিক থেকেই এনক্রিপ্টেড থাকে, তাই ট্রান্সফার চলাকালীন কেউ আপনার ফাইল পড়তে পারে না। টেক্সট শনাক্তকরণের পুরো প্রক্রিয়াটাই স্বয়ংক্রিয়, তাই কোনো ব্যক্তি আপনার পেজ খোলে না, এবং ফাইলগুলো কখনও AI মডেল প্রশিক্ষণের জন্য ব্যবহার করা হয় না। ছবির এবং ডকুমেন্টের সব অধিকার আপনার কাছেই থাকে।
স্ক্যান করা ডকুমেন্ট ও ছবি থেকে OCR (Optical Character Recognition) ব্যবহার করে মূল্যবান লেখা ডিজিটাইজ করুন। অনলাইনে সহজেই ছবির থেকে লেখা বের করুন।
প্রবন্ধটি পড়ুন