সরকারি ও আর্কাইভ প্রতিষ্ঠানগুলো সামলায় স্ক্যান করা রেকর্ড, গেজেট, আইন ও বিজ্ঞপ্তি, দীর্ঘ PDF, এবং কয়েক দশকের পুরনো সরকারি নথি। এই সংগ্রহগুলো প্রায়ই বহু ভাষায় থাকে এবং সবসময় উদ্ধৃতির প্রতি সংবেদনশীল। এদের জন্য কাঁচা OCR বা কিওয়ার্ড সার্চের চেয়ে বেশি কিছু দরকার: গঠনবদ্ধ, উৎস-সচেতন, পাতা-সচেতন সিস্টেম।
OEP কীভাবে খাপ খায়
- উৎসসহ স্বাক্ষরিত প্যাক: প্রতিটি রেকর্ড নিজের উৎস, পাতার অ্যাঙ্কর এবং OCR আস্থার মাত্রা বহন করে; কারসাজিতে স্পষ্টভাবে ব্যর্থ হয়।
- পাতাভিত্তিক উদ্ধার: উত্তর ঠিক প্রাসঙ্গিক অংশ ও পাতা পর্যন্ত নিয়ে যায়, কেবল "গেজেট পাওয়া গেছে" নয়।
- সংস্করণ-সচেতন নেভিগেশন: কোন আইন কোনটি সংশোধন করেছে, কোনটি বাতিল করেছে - প্রমাণে নোঙর করা গ্রাফ হিসেবে, অনুমান হিসেবে নয়।
- স্থাপনার সীমা আপনার হাতে: বিচ্ছিন্ন রিডিং রুম, বিভাগীয় ওয়ার্কস্টেশন, বা পাবলিক কিয়স্ক; কোনো ধাপেই ক্লাউডে যাওয়ার দরকার নেই।
- বহুভাষিক ভিত্তি: ডান-থেকে-বাম লিপি এবং দ্বিভাষিক উপস্থাপনা প্ল্যাটফর্মে প্রথম-শ্রেণির বৈশিষ্ট্য।
আজ যা আছে
প্ল্যাটফর্মটি একাধিক এখতিয়ারের প্রকৃত আইন ও গেজেট কর্পাস ডিজিটাইজ ও প্যাক করেছে, এমন পাইপলাইনে যা পুনরাবৃত্তিযোগ্য এবং GPU ছাড়াই চলে। নতুন সংযুক্তির জন্য এটি সবচেয়ে শক্তিশালী নিকট-মেয়াদি দিক; বাকি থাকে আপনার সংগ্রহের নির্দিষ্ট প্যাকেজিং, যাচাই, এবং প্রকাশনার সীমা, যা আমরা আপনার সঙ্গে মিলে ঠিক করি।
আমরা যা বলব না
আমরা দাবি করব না যে এটি সম্পূর্ণ স্থাপিত সরকারি পণ্য, প্রাতিষ্ঠানিক অনুমোদন, বা সরকারি খাতের সার্টিফিকেশন। সৎ প্রস্তাবটি এই: এমন একটি স্থাপত্য যা স্পষ্টভাবে খাপ খায়, একটি চলমান পাইপলাইন, এবং আপনার সংগ্রহ পর্যন্ত একটি নির্দিষ্ট পথ।