কোনো ছবি থেকে লেখাগুলো বের করতে চান? স্ক্যান করা রসিদ, হোয়াইটবোর্ডের ছবি, কোনো নথির স্ক্রিনশট কিংবা সাইনবোর্ডের ছবি, যা-ই হোক, OCR (Optical Character Recognition, অর্থাৎ অপটিক্যাল ক্যারেক্টার রিকগনিশন) ছবির পিক্সেলকে আসল টেক্সটে বদলে দেয়, যা আপনি কপি, এডিট ও সার্চ করতে পারেন। এই গাইডে দেখানো হয়েছে এই সাইটের বিনামূল্যের ইমেজ থেকে টেক্সট (OCR) টুলটি কীভাবে ব্যবহার করবেন। শনাক্তকরণ আমাদের সার্ভারে চলে: আপনার ফাইল এনক্রিপ্টেড সংযোগের মাধ্যমে পাঠানো হয় এবং টেক্সট বের হওয়ার সাথে সাথেই মুছে ফেলা হয়।
OCR কী?
OCR মানে Optical Character Recognition। এটি এমন প্রযুক্তি, যা কোনো ছবি বিশ্লেষণ করে অক্ষর, সংখ্যা ও যতিচিহ্নের আকার চিনে নেয় এবং মেশিন-পাঠযোগ্য টেক্সট তৈরি করে।
আধুনিক OCR ইঞ্জিন নিউরাল নেটওয়ার্ক ব্যবহার করে, যেগুলোকে কোটি কোটি ছাপা ও হাতে লেখা অক্ষর দিয়ে প্রশিক্ষণ দেওয়া হয়েছে। এগুলো বিভিন্ন ফন্ট, আকার, ভাষা ও ছবির অবস্থায় টেক্সট চিনতে পারে, এমনকি সামান্য কাত বা কিছুটা ঝাপসা হলেও।
OCR-এর কারণেই:
- ব্যাংকগুলো চেক ও পরিচয়পত্র ডিজিটাল করতে পারে
- Google Search ছবির ভেতরের টেক্সট ইনডেক্স করতে পারে
- ডাক সেবা খামের ওপর হাতে লেখা ঠিকানা পড়তে পারে
- আর্কাইভিস্টরা স্ক্যান করা লক্ষ লক্ষ বইকে সার্চযোগ্য করতে পারেন
একই প্রযুক্তি এখানে বিনামূল্যে পাওয়া যায়।
ছবি থেকে টেক্সট বের করার উপায়, ধাপে ধাপে
ইমেজ থেকে টেক্সট (OCR) টুলটি আমাদের সার্ভারে Tesseract OCR চালায়। আপনার ছবি এনক্রিপ্টেড HTTPS সংযোগের মাধ্যমে আপলোড হয়, টেক্সট বের করা হয় এবং এরপর আপলোড করা ফাইলটি সার্ভার থেকে মুছে ফেলা হয়।
ধাপ ১: ইমেজ থেকে টেক্সট (OCR) টুলটি খুলুন
want2convert.com/image-to-text পাতায় যান। একটি সাধারণ আপলোড জোন ও একটি ভাষা নির্বাচক দেখতে পাবেন।
ধাপ ২: ছবি আপলোড করুন
ছবিটি আপলোড জোনে টেনে এনে ছেড়ে দিন, অথবা ক্লিক করে আপনার ডিভাইস থেকে বেছে নিন। সমর্থিত ফরম্যাট হলো JPG, PNG, TIFF, BMP, WebP ও PDF, সর্বোচ্চ 50 MB। স্ক্যান করা নথির জন্য সর্বোচ্চ রেজোলিউশনের স্ক্যান ব্যবহার করুন: 300 DPI বা তার বেশি হলে সবচেয়ে ভালো ফল পাওয়া যায়।
ধাপ ৩: ভাষা নির্বাচন করুন (প্রয়োজন হলে)
ডিফল্টভাবে ইঞ্জিন ইংরেজি চেনে। টুলটি সোয়াহিলি (কিসোয়াহিলি), ফরাসি ও আরবিও সমর্থন করে: টেক্সট বের করার আগে ড্রপডাউন থেকে আপনার ছবির টেক্সটের ভাষা বেছে নিন। সঠিক ভাষার মডেল ব্যবহার করলে অ্যাকসেন্টযুক্ত অক্ষর ও ভাষাভিত্তিক অক্ষরবিন্যাসে নির্ভুলতা উল্লেখযোগ্যভাবে বাড়ে। অন্যান্য ভাষা বর্তমানে সমর্থিত নয়।
ধাপ ৪: “টেক্সট বের করুন” ক্লিক করুন
বোতামটি ক্লিক করুন। আপনার ফাইল আমাদের সার্ভারে পাঠানো হয়, সেখানে শনাক্তকরণ ভালো করার জন্য সেটি বড় করা ও গ্রেস্কেলে রূপান্তর করা হয়, তারপর Tesseract সেটি পড়ে। প্রক্রিয়াকরণে সাধারণত কয়েক সেকেন্ড লাগে, ছবির আকার ও টেক্সটের ঘনত্বের ওপর নির্ভর করে; অনুরোধ প্রায় দুই মিনিট পরে টাইম-আউট হয়ে যায়।
ধাপ ৫: ফলাফল কপি বা ডাউনলোড করুন
বের করা টেক্সট একটি টেক্সট এরিয়ায় দেখা যায়। আপনি করতে পারেন:
- ক্লিপবোর্ডে কপি করুন — সরাসরি Word, Google Docs বা যেকোনো টেক্সট এডিটরে পেস্ট করুন
- .txt ডাউনলোড করুন — ফলাফল
.txtফাইল হিসেবে সেভ করুন
OCR-এর জন্য ভালো সোর্স ছবির বৈশিষ্ট্য
OCR-এর নির্ভুলতা ইনপুট ছবির মানের ওপর অনেকটা নির্ভর করে। সবচেয়ে বেশি পার্থক্য গড়ে যে বিষয়গুলো:
রেজোলিউশন: টেক্সট পড়ার মতো থাকতে যথেষ্ট পিক্সেল দরকার। ভালো আলোয় ও যুক্তিসংগত দূরত্ব (30–50 সেমি) থেকে মোবাইলে তোলা নথির ছবি সাধারণত ভালো কাজ করে। পরিষ্কার ছোট লেখার জন্য ব্যবহারিক ন্যূনতম রেজোলিউশন প্রায় 150–200 DPI; আর্কাইভ স্ক্যানিংয়ের জন্য 300 DPI হলো OCR-এর মানদণ্ড।
কনট্রাস্ট: হালকা ব্যাকগ্রাউন্ডে গাঢ় টেক্সট ইঞ্জিনকে সবচেয়ে স্পষ্ট সংকেত দেয়। ফ্যাকাশে কালি, সাদা কাগজে হালকা ধূসর টেক্সট, কিংবা নকশা করা ব্যাকগ্রাউন্ডে রঙিন টেক্সট নির্ভুলতা কমিয়ে দেয়।
স্পষ্টতা: ক্যামেরা কাঁপা বা ফোকাসের সমস্যার কারণে ঝাপসা ছবি OCR ভুলের সবচেয়ে বড় কারণ। নথির ছবি তোলার সময় স্থির কোনো তলে ফোন রাখুন। ছোট লেখার নথির জন্য ফোনের ম্যাক্রো মোড ভালো কাজ করে।
ওরিয়েন্টেশন: অনেক কাত বা ঘোরানো টেক্সট নির্ভুলতা কমায়। OCR ইঞ্জিন সামান্য কাত (কয়েক ডিগ্রি) সামলাতে পারে, তবে খাড়া কোণ থেকে তোলা পাতার ফল খারাপ হয়। দরকার হলে আগে ছবি ঘোরান টুল দিয়ে ছবিটি সঠিক দিকে ঘুরিয়ে নিন।
নয়েজ ও ছায়া: ভাঁজ, পাতার ওপর ছায়া এবং ব্যাকগ্রাউন্ডের টেক্সচার নির্ভুলতা কমায়। নথির ছবি হালকা রঙের টেবিলে সমতলভাবে রেখে, সমান আলোয় তুলুন।
নির্ভুলতা: OCR কী পারে আর কী পারে না
পরিষ্কার, উচ্চ কনট্রাস্টের ছাপা নথিতে OCR অত্যন্ত নির্ভুল, ভালো ইনপুটে প্রায়ই 99%+ অক্ষর সঠিক হয়। তবু এই প্রযুক্তির কিছু বাস্তব সীমাবদ্ধতা আছে যা জেনে রাখা দরকার:
| ইনপুটের ধরন | প্রত্যাশিত নির্ভুলতা | |------------|------------------| | পরিষ্কার স্ক্যান করা ছাপা নথি (300 DPI) | 98–99%+ | | ছাপা টেক্সটের স্পষ্ট ফোনের ছবি | 90–97% | | ফ্যাকাশে বা কম কনট্রাস্টের ছাপা | 70–85% | | হাতের লেখা (গোছানো, সামঞ্জস্যপূর্ণ) | 60–80% | | হাতের লেখা (জোড়া হাতের, অসম) | 40–65% | | খুব অলংকৃত ফন্ট বা লোগো | 30–60% | | অনেক নয়েজ বা ব্যাকগ্রাউন্ডওয়ালা ছবির টেক্সট | 50–75% |
ভালো পরিস্থিতিতে ছাপা টেক্সটের ক্ষেত্রে প্রায় নিখুঁত ফল আশা করুন। আউটপুট সবসময় আবার পড়ে দেখুন: কোনো সংখ্যা বা নামে একটি অক্ষরের ভুলও বাস্তব সমস্যা ডেকে আনতে পারে।
ইমেজ থেকে টেক্সটের সাধারণ ব্যবহার
স্ক্যান করা নথি ও PDF
অফিসে এখনও কাগজের স্তূপ সামলাতে হয়। স্ক্যান করা চুক্তি, ফর্ম বা চিঠি PDF বা ছবি হিসেবে পেলে OCR সেটিকে সার্চযোগ্য ও এডিটযোগ্য নথিতে বদলে দেয়। টেক্সট বের করার পর এডিট করতে Word বা Google Docs-এ পেস্ট করুন, অথবা এমন ফাইল হিসেবে সেভ করুন যেখানে Ctrl+F দিয়ে খুঁজতে পারবেন।
রসিদ ও ইনভয়েস
খরচের হিসাব রাখতে রসিদের ছবি তোলা একটি প্রচলিত পদ্ধতি। OCR আইটেম, মোট অঙ্ক ও বিক্রেতার নাম বের করে দেয়, ফলে আবার টাইপ না করেই সরাসরি স্প্রেডশিট বা খরচের রিপোর্টে পেস্ট করতে পারেন।
ভিজিটিং কার্ড
ফোনে তোলা ভিজিটিং কার্ডের একটি দ্রুত ছবি OCR-এ চালালে যোগাযোগের ব্যক্তির নাম, পদবি, ফোন নম্বর, ইমেইল ও কোম্পানির নাম পেয়ে যাবেন, যা কনট্যাক্টস অ্যাপে কপি করার জন্য তৈরি।
প্রবন্ধ ও ওয়েব পেজের স্ক্রিনশট
কোনো স্ক্রিনশট থেকে উদ্ধৃতি নিতে বা ছবিভিত্তিক PDF (স্ক্যান করা বই, যে PDF-এর টেক্সট সিলেক্ট করা যায় না) থেকে টেক্সট কপি করতে চাইলে OCR সেটি আসল টেক্সট হিসেবে বের করে দেয়, যা আপনি ব্যবহার করতে পারবেন।
হোয়াইটবোর্ডের ছবি
মিটিংয়ের পর হোয়াইটবোর্ডের নোটের ছবি প্রায়ই ক্যামেরা রোলে পড়ে থাকে, কোনো কাজে লাগে না। OCR সেগুলোকে টেক্সট ফাইল বা সার্চযোগ্য নোটে বদলে দেয়।
বই ও আর্কাইভ ডিজিটালাইজেশন
পুরোনো বই, সংবাদপত্র ও ঐতিহাসিক নথি স্ক্যান করা গবেষক ও বংশলতিকা অনুসন্ধানকারীরা এই আর্কাইভগুলোকে সার্চযোগ্য করতে OCR ব্যবহার করেন। এখানে ব্যবহৃত ওপেন-সোর্স ইঞ্জিন Tesseract আর্কাইভ ডিজিটালাইজেশনের প্রকল্পে ব্যাপকভাবে ব্যবহৃত হয়।
অনুবাদের কাজের ধারা
আগে ছবি থেকে টেক্সট বের করুন, তারপর সেটি অনুবাদ টুলে পেস্ট করুন। বিদেশি ভাষার নথি, মেনু বা সাইনের ছবি থেকে হাতে টাইপ করার চেয়ে এটি অনেক দ্রুত।
OCR বনাম কপি-পেস্ট: কখন কোনটি ব্যবহার করবেন
যদি টেক্সট লেয়ারযুক্ত ডিজিটাল PDF নিয়ে কাজ করেন, তবে Ctrl+A + Ctrl+C (সব সিলেক্ট করুন, কপি করুন) OCR-এর চেয়ে দ্রুত ও বেশি নির্ভুল। OCR ব্যবহার করুন যখন:
- PDF-টি স্ক্যান করা ছবি (কোনো টেক্সট লেয়ার নেই)
- সোর্সটি একটি ছবি বা স্ক্রিনশট
- নথিতে টেক্সট সিলেক্ট করা যায় না (লক করা PDF, যদিও আপনি আগে সেটি আনলক করতেও চাইতে পারেন)
- টেক্সটটি কোনো বাস্তব নথি, সাইন বা হোয়াইটবোর্ডে আছে
সচরাচর জিজ্ঞাসা
OCR টুলটি কি সত্যিই বিনামূল্যে?
হ্যাঁ, সম্পূর্ণ বিনামূল্যে। কোনো অ্যাকাউন্ট নেই, সাবস্ক্রিপশন নেই, আউটপুটে কোনো ওয়াটারমার্ক নেই।
আমার ছবি কি নিরাপদ?
আপনার ছবি বা PDF এনক্রিপ্টেড (HTTPS) সংযোগের মাধ্যমে আমাদের সার্ভারে পাঠানো হয়, সেখানে Tesseract OCR দিয়ে প্রক্রিয়া করা হয় এবং টেক্সট বের হওয়ার সাথে সাথেই মুছে ফেলা হয়। আমরা কোনো কপি রাখি না এবং অ্যাকাউন্টও লাগে না। যেহেতু ফাইল সার্ভারে প্রক্রিয়া হয়, তাই যে নথি ইন্টারনেটে পাঠাতে স্বস্তি বোধ করেন না, তা আপলোড করবেন না।
কোন কোন ভাষা সমর্থিত?
ইংরেজি ডিফল্ট। ভাষা নির্বাচক থেকে আপনি সোয়াহিলি (কিসোয়াহিলি), ফরাসি বা আরবিও বেছে নিতে পারেন। অন্যান্য ভাষা বর্তমানে সমর্থিত নয়।
এটি কতটা নির্ভুল?
যথেষ্ট রেজোলিউশনের পরিষ্কার ছাপা টেক্সটে নির্ভুলতা সাধারণত অনেক বেশি। হাতের লেখা বা নিম্নমানের ছবিতে এটি কম। গুরুত্বপূর্ণ নথির ক্ষেত্রে আউটপুট সবসময় আবার পড়ে দেখুন।
এটি কি হাতের লেখা পড়তে পারে?
OCR-এর হাতের লেখা চেনার ক্ষমতা সীমিত। ছাপা টেক্সটে এটি সবচেয়ে ভালো কাজ করে, আর হাতে লেখা নোটে ফল খারাপ হতে পারে, বিশেষ করে জোড়া হাতের লেখায়।
ছবির সর্বোচ্চ আকার কত?
আপলোড 50 MB পর্যন্ত সীমিত, এবং অনুরোধ প্রায় দুই মিনিট পরে টাইম-আউট হয়ে যায়। খুব বড় ছবি ধীর হতে পারে; OCR-এর আগে ছবির সাইজ পরিবর্তন টুল দিয়ে প্রস্থ 2000–3000 পিক্সেলে নামিয়ে আনলে নির্ভুলতা না কমিয়েই প্রায়ই কাজ দ্রুত হয়।
আমি কি PDF থেকে টেক্সট বের করতে পারি?
হ্যাঁ, আপনি সরাসরি PDF আপলোড করতে পারেন; এর পাতাগুলো রেন্ডার করে একটি একটি করে পড়া হয়। PDF বড় হলে বা বেশি নিয়ন্ত্রণ চাইলে আপনি আগে পিডিএফ থেকে জেপিজি টুল দিয়ে পাতাগুলো JPG বা PNG হিসেবে সেভ করে ছবিগুলোর ওপর OCR চালাতে পারেন।
কিছু অক্ষর ভুল আসে কেন?
OCR ভুল সাধারণত কম রেজোলিউশন, ঝাপসা ভাব, কম কনট্রাস্ট বা অস্বাভাবিক ফন্ট থেকে হয়। ইনপুট ছবির মান উন্নত করে আবার চালিয়ে দেখুন। বারবার হওয়া ভুলের (যেমন l-কে 1 পড়া) ক্ষেত্রে টেক্সট বের করার পর আউটপুট হাতে ঠিক করে নিন।
সম্পর্কিত টুল
- ছবির সাইজ পরিবর্তন — নির্ভুলতা বাড়াতে OCR-এর আগে ছোট ছবিকে বড় করুন
- ছবি ঘোরান — OCR-এর আগে কাত হয়ে থাকা ছবি সোজা করুন
- পিডিএফ থেকে জেপিজি — OCR-এর জন্য স্ক্যান করা PDF-এর পাতাগুলোকে ছবিতে রূপান্তর করুন
- ছবির সাইজ কমান — OCR-এর প্রয়োজনীয় রেজোলিউশন না হারিয়ে ছবির আকার কমান
- JPG থেকে PNG — ছোট লেখার নথিতে OCR-এর আগে লসলেস মানের জন্য PNG-তে রূপান্তর করুন
- ছবি ক্রপ — OCR চালানোর আগে ছবির টেক্সটের অংশটি আলাদা করুন
বিনামূল্যে ব্যবহার করে দেখুন — সাইনআপ লাগবে না
বেশিরভাগ টুল আপনার ব্রাউজারেই চলে, তাই ফাইল আপনার ডিভাইসেই থাকে। কয়েকটি টুলে ফাইল আমাদের সার্ভারে আপলোড হয় এবং পরে মুছে ফেলা হয়।