Çoğu yapay zeka tartışması modelle başlar. Belge yoğun kuruluşlarda güven daha önce kırılır. OCR bir maddeyi yanlış okur. Parçalama sayfayı kaybeder. Arama doğru belgeyi ama yanlış bölümü getirir ve atıf hiçbir yere çıkmaz. Model çalışmaya başladığında zemin çoktan kaymıştır.
OEP nasıl uyuyor
- İş mantığı olarak OCR kalitesi: birden fazla motor, güven puanları, kalite kontrolleri, onarım geçişleri ve inceleme kuyrukları. Varsayılmaz, ölçülür.
- Yapı iş mantığıdır: bölümler, tablolar, formlar ve şekiller, düzleştirilmiş metin olarak değil, yapı olarak çıkarımdan sağ çıkar.
- Her yerde sayfa referansları: çıkarılan her nesne kendi kaynağını ve bölgesini bilir. Kanıt, güvenilmesi gereken bir açıklama değil, takip edilebilen bir işaretçidir.
- Sadık şekiller: gerektiğinde vektör olarak yeniden çizilir; özgünlüğün önemli olduğu yerlerde (mühürler, imzalar) orijinal, kriptografik doğrulama ile korunur ve asla yeniden çizilmez.
- Belge türüne göre yapılandırılmış çıkarım: makbuzlar, faturalar, sözleşmeler, garantiler; yönetişimli ve doğrulanmış şemalardan.
Bugün var olan
Gerçek hukuki ve eğitim külliyatlarının milyonlarca sayfasında kanıtlanmış, üretimde çalışan bir OCR işlem hattı; yukarıda anlatılan tüm kalite mekaniği baştan sona inşa edilmiş durumda. ScanVecta bunun tüketiciye yönelik ifadesidir; aynı işlem hattı kurumsal koleksiyonları da barındırır.
Söylemeyeceklerimiz
Hiçbir OCR mükemmel değildir. Bizimki, tersini iddia etmek yerine güven puanlarını, inceleme kuyruklarını ve kabul edilen eksiklikleri gösterir.