Popüler açık kaynak OCR modelleri ve çalışma şekilleri
Popüler OCR modellerini, görüntüleri metne nasıl dönüştürdüklerini ve yapay zekâ ile bilgisayarlı görü uygulamalarındaki rollerini birlikte keşfedelim.

Bu makalede ele alınan kavramları görsel olarak adım adım incelemek için aşağıdaki videoyu izle.
Birçok işletme ve dijital sistem; taranmış faturalar, kimlik kartları veya el yazısıyla doldurulmuş formlar gibi belgelerdeki bilgilere dayanır. Ancak bu bilgiler bir görüntü olarak depolandığında bilgisayarların bunlarda arama yapması, bilgileri çıkarması veya çeşitli görevlerde kullanması zordur.
Bununla birlikte, makinelerin görsel bilgileri yorumlamasını ve anlamasını sağlayan bir yapay zeka alanı olan bilgisayarlı görü gibi araçlar sayesinde görüntüleri metne dönüştürmek çok daha kolay hale geliyor. Özellikle Optik Karakter Tanıma (OCR), metni algılamak ve çıkarmak için kullanılabilen bir bilgisayarlı görü teknolojisidir.
OCR modelleri, çeşitli biçimlerdeki metinleri tanıyacak ve bunları düzenlenebilir, aranabilir verilere dönüştürecek şekilde eğitilir. Belge otomasyonu, kimlik doğrulama ve gerçek zamanlı tarama sistemlerinde yaygın olarak kullanılırlar.
Bu makalede OCR modellerinin nasıl çalıştığını, popüler açık kaynaklı modelleri, nerelerde kullanıldıklarını, yaygın uygulamaları ve gerçek dünya kullanımı için önemli noktaları inceleyeceğiz.
OCR nedir?#
OCR modelleri, tıpkı basılı veya el yazısı metinleri okuduğumuz gibi, makinelerin görsel kaynaklardaki metinleri okumasına yardımcı olmak için tasarlanmıştır. Bu modeller; taranmış belgeler, görüntüler veya el yazısıyla yazılmış notların fotoğrafları gibi girdileri alır ve bunları aranabilen, düzenlenebilen veya yazılım sistemlerinde kullanılabilen dijital metinlere dönüştürür.
Önceki OCR sistemleri katı şablonları izlerken modern OCR modelleri metni tanımak için derin öğrenmeden yararlanır. Düşük kaliteli görüntülerle çalışırken farklı yazı tiplerini, dilleri ve hatta okunaksız el yazılarını kolayca tanıyabilirler. Bu gelişmeler, OCR modellerini finans, sağlık, lojistik ve kamu hizmetleri gibi metin yoğun sektörlerde otomasyonun önemli bir parçası haline getirmiştir.
OCR modelleri, metnin net ve düzenli olduğu görüntülerde başarılı olsa da metin karmaşık görsellerin yanında veya dinamik sahnelerin içinde göründüğünde zorluklarla karşılaşabilir. Bu durumlarda OCR modelleri, Ultralytics YOLO11 gibi bilgisayarlı görü modelleriyle birlikte kullanılabilir.
Ultralytics YOLO11, bir görüntüdeki işaretler, belgeler veya etiketler gibi belirli nesneleri algılayarak OCR kullanılmadan önce metin bölgelerinin konumlandırılmasına yardımcı olabilir.
Örneğin, otonom araçlarda Ultralytics YOLO11 bir dur işaretini algılayabilir, ardından OCR metni okuyarak sistemin hem nesneyi hem de anlamını doğru şekilde yorumlamasını sağlayabilir.

Şekil 1. OCR kullanımına bir örnek (kaynak).
OCR modellerinin nasıl çalıştığına genel bakış#
OCR'ın ne olduğunu ele aldığımıza göre, şimdi OCR modellerinin gerçekte nasıl çalıştığına daha yakından bakalım.
Bir OCR modeli görüntüden metin okumak ve çıkarmak için kullanılmadan önce görüntü genellikle iki önemli adımdan geçirilir: ön işleme ve nesne algılama.
İlk olarak görüntü, ön işleme yoluyla temizlenir ve iyileştirilir. Görüntünün genel kalitesini artırmak ve metnin algılanmasını kolaylaştırmak için keskinleştirme, gürültü azaltma ve parlaklık ya da kontrast ayarlama gibi temel görüntü işleme teknikleri uygulanır.
Ardından nesne algılama gibi bilgisayarlı görü görevleri kullanılır. Bu adımda, plaka, sokak tabelası, form veya kimlik kartı gibi metin içeren belirli ilgi nesneleri bulunur. Sistem bu nesneleri belirleyerek anlamlı metnin bulunduğu alanları izole eder ve bunları tanımaya hazırlar.
OCR modeli ancak bu adımlardan sonra çalışmaya başlar. Önce algılanan bölgeleri alır ve bunları daha küçük parçalara ayırarak tek tek karakterleri, kelimeleri veya metin satırlarını belirler.
Model, derin öğrenme tekniklerini kullanarak harflerin şekillerini, desenlerini ve aralıklarını analiz eder, bunları eğitim sırasında öğrendikleriyle karşılaştırır ve en olası karakterleri tahmin eder. Ardından tanınan karakterleri daha ileri işlemler için anlamlı bir metin halinde yeniden oluşturur.

Şekil 2. OCR'ın nasıl çalıştığını anlama. Görsel: yazar.
Popüler açık kaynaklı OCR modelleri#
Metin çıkarma içeren bir bilgisayarlı görü uygulaması geliştirirken doğru OCR modelini seçmek; doğruluk, dil desteği ve gerçek dünya sistemlerine ne kadar kolay entegre edilebildiği gibi faktörlere bağlıdır.
Günümüzde birçok açık kaynaklı model, geliştiricilerin ihtiyaç duyduğu esnekliği, güçlü topluluk desteğini ve güvenilir performansı sunuyor. En popüler seçeneklerden bazılarını ve öne çıkan özelliklerini inceleyelim.
Tesseract OCR#
Tesseract, günümüzde mevcut olan en yaygın kullanılan açık kaynaklı OCR modellerinden biridir. İlk olarak 1985 ile 1994 yılları arasında İngiltere'nin Bristol kentinde ve Colorado'nun Greeley kentinde Hewlett-Packard Laboratuvarları tarafından geliştirildi. HP, 2005 yılında Tesseract'ı açık kaynaklı yazılım olarak yayımladı ve model, 2006'dan bu yana açık kaynak topluluğunun katkılarıyla Google tarafından sürdürülüyor.
Tesseract'ın temel özelliklerinden biri, 100'den fazla dili işleyebilmesidir; bu da onu çok dilli projeler için güvenilir bir seçenek haline getirir. Sürekli iyileştirmeler, özellikle formlar ve raporlar gibi yapılandırılmış belgelerde basılı metinleri okuma güvenilirliğini artırmıştır.

Şekil 3. Tesseract OCR kullanılarak metin tanıma (kaynak).
Tesseract; fatura tarama, evrak arşivleme veya standart yerleşimlere sahip belgelerden metin çıkarma içeren projelerde yaygın olarak kullanılır. Belge kalitesi iyi olduğunda ve yerleşim önemli ölçüde değişmediğinde en iyi performansı gösterir.
EasyOCR#
Benzer şekilde EasyOCR, Jaided AI tarafından geliştirilen Python tabanlı, açık kaynaklı bir OCR kütüphanesidir. Latin, Çince, Arapça ve Kiril alfabeleri dahil olmak üzere 80'den fazla dili destekler ve bu da onu çok dilli metin tanıma için çok yönlü bir araç haline getirir.
Hem basılı hem de el yazısı metinleri işlemek üzere tasarlanan EasyOCR, yerleşimi, yazı tipi veya yapısı değişen belgelerde iyi çalışır. Bu esneklik, onu fişler, sokak tabelaları ve farklı dillerin bir arada bulunduğu formlar gibi çeşitli kaynaklardan metin çıkarmak için mükemmel bir seçenek haline getirir.
PyTorch üzerine kurulu EasyOCR, doğru metin algılama ve tanıma için derin öğrenme tekniklerinden yararlanır. Hem CPU'larda hem de GPU'larda verimli şekilde çalışarak göreve bağlı olarak ölçeklenebilir; ister yerel olarak birkaç görüntüyü işleyebilir ister daha güçlü sistemlerde büyük dosya gruplarını ele alabilir.
Açık kaynaklı bir araç olan EasyOCR, düzenli güncellemelerden ve topluluk odaklı iyileştirmelerden yararlanarak çok çeşitli gerçek dünya OCR ihtiyaçlarına güncel ve uyarlanabilir biçimde yanıt vermeyi sürdürür.
PaddleOCR#
PaddleOCR, Baidu tarafından geliştirilen ve metin algılama ile tanımayı tek bir akıcı işlem hattında birleştiren yüksek performanslı bir OCR araç setidir. 80 dil desteği sayesinde fişler, tablolar ve formlar gibi karmaşık belgeleri işleyebilir.
PaddleOCR'ı farklı kılan, PaddlePaddle derin öğrenme çerçevesi üzerine kurulmuş olmasıdır. PaddlePaddle çerçevesi, yapay zeka modellerinin kolay, güvenilir ve ölçeklenebilir şekilde geliştirilmesi ve dağıtılması için tasarlanmıştır. Ayrıca PaddleOCR, düşük kaliteli veya karmaşık görüntülerde bile yüksek doğruluk sunar; bu da onu hassasiyet ve güvenilirliğin önemli olduğu gerçek dünya OCR görevleri için iyi bir seçenek haline getirir.

Şekil 4. PaddleOCR iş akışı (kaynak).
Bunun yanı sıra PaddleOCR son derece modülerdir ve geliştiricilerin belirli algılama, tanıma ve sınıflandırma bileşenlerini seçerek işlem hatlarını özelleştirmesine olanak tanır. İyi belgelenmiş Python API'leri ve güçlü topluluk desteğiyle çok çeşitli OCR uygulamaları için esnek ve üretime hazır bir çözümdür.
Diğer popüler açık kaynaklı OCR modelleri#
Yaygın olarak kullanılan diğer açık kaynaklı OCR modellerinden bazıları şunlardır:
- MMOCR: Daha karmaşık projeler için tasarlanan MMOCR, metni algılamanın yanı sıra sayfadaki düzenini de anlayabilir. Tablolar, çok sütunlu yerleşimler ve görsel açıdan karmaşık diğer belgelerle çalışmak için idealdir.
- TrOCR: Metin dizilerini anlamada özellikle başarılı bir derin öğrenme modeli türü olan Transformer'lar üzerine kurulan TrOCR, daha uzun pasajları ve düzensiz, yapılandırılmamış yerleşimleri işleme konusunda başarılıdır. İçeriğin birbirinden ayrı etiketler yerine sürekli bir dil olarak okunduğu durumlarda güvenilir bir seçenektir.
OCR modellerinin yaygın uygulamaları#
OCR teknolojisi geliştikçe rolü temel sayısallaştırmanın çok ötesine genişledi. Aslında OCR modelleri artık metinsel bilgilere dayanan çeşitli sektörlerde kullanılıyor. OCR'ın günümüzde gerçek dünya sistemlerinde nasıl uygulandığına dair bazı örnekler şöyle:
- Hukuk sektörü ve elektronik keşif: Hukuk firmaları, binlerce sayfalık hukuki belgeyi taramak için OCR kullanır; böylece sözleşmeler, mahkeme başvuruları ve deliller daha hızlı keşif ve analiz için aranabilir hale gelir.
- Sağlık: Hastaneler hasta kayıtlarını dijitalleştirmek, el yazısıyla yazılmış reçeteleri yorumlamak ve laboratuvar raporlarını verimli şekilde yönetmek için OCR modellerini kullanıyor. Bu, idari görevleri kolaylaştırır ve tıbbi iş akışlarının genelinde doğruluğu artırır.
- Tarihi mirasın korunması: Müzeler, kütüphaneler ve arşivler eski kitapları, el yazmalarını ve gazeteleri dijitalleştirmek için OCR kullanır; böylece değerli kültürel mirası korur ve araştırmacıların bu içeriklerde arama yapmasını sağlar.
- Kimlik ve pasaport doğrulama: Birçok dijital işe alım ve seyahat sistemi, devlet tarafından düzenlenen belgelerden önemli verileri çıkarmak için OCR'a dayanır. Daha hızlı kimlik kontrolleri ve daha az manuel veri girişi hatası, daha sorunsuz kullanıcı deneyimleri ve daha yüksek güvenlik sağlar.

Şekil 5. Pasaport kimlik doğrulama için OCR tabanlı tarayıcı. (kaynak).
OCR modellerinin avantajları ve dezavantajları#
OCR modelleri 1950'lerde ilk kez ortaya çıktıklarından bu yana büyük ilerleme kaydetti. Artık daha erişilebilir, doğru ve farklı içeriklere ve platformlara uyarlanabilir durumdalar. Günümüz OCR modellerinin sunduğu temel güçlü yönler şunlardır:
- Erişilebilirlik iyileştirmeleri: OCR, basılı materyalleri görme engelli kullanıcılar için ekran okuyucuların okuyabileceği biçimlere dönüştürerek içeriğin daha erişilebilir olmasına yardımcı olur.
- Makine öğrenimi işlem hatlarını geliştirir: Yapılandırılmamış görsel verileri yapılandırılmış metne dönüştüren bir köprü görevi görür ve bunların sonraki aşamalardaki makine öğrenimi modelleri tarafından kullanılmasını sağlar.
- Şablonsuz çıkarma: Gelişmiş OCR artık katı şablonlar gerektirmez; belgeler arasında yerleşimler değişse bile bilgileri akıllı bir şekilde çıkarabilir.
Avantajlarına rağmen OCR modelleri, özellikle girdi kusursuz olmadığında, hâlâ bazı zorluklarla karşılaşır. Akılda tutulması gereken yaygın sınırlamalardan bazıları şunlardır:
- Görüntü kalitesine duyarlıdır: OCR net görüntülerde en iyi şekilde çalışır; bulanık veya karanlık fotoğraflar sonuçları etkileyebilir.
- Belirli el yazıları veya yazı tiplerinde zorlanır: Süslü veya düzensiz yazılar en iyi modellerin bile kafasını karıştırabilir.
- Son işleme hâlâ gereklidir: Yüksek doğrulukta bile OCR çıktıları, özellikle kritik belgeler için, çoğu zaman insan tarafından incelenmeyi veya temizlenmeyi gerektirir.
Önemli çıkarımlar#
OCR, bilgisayarların görüntülerdeki metinleri okumasını sağlayarak bu bilgilerin dijital sistemlerde kullanılmasını mümkün kılar. Belgelerin, işaretlerin ve el yazısıyla yazılmış notların işlenmesinde önemli bir rol oynar ve hız ile doğruluğun kritik olduğu alanlarda büyük etki sağlar.
OCR modelleri, görüntülerdeki nesneleri algılayabilen Ultralytics YOLO11 gibi modellerle de sıklıkla birlikte çalışır. Birlikte kullanıldıklarında sistemlerin ne yazıldığını ve bunun nerede göründüğünü anlamasını sağlarlar. Bu teknolojiler gelişmeye devam ettikçe OCR, makinelerin dünyayı yorumlama ve dünyayla etkileşim kurma biçiminin temel bir parçası haline geliyor.
Görsel yapay zekaya mı meraklısın? Keşfetmeye devam etmek için GitHub depomuzu ziyaret et ve topluluğumuza katıl. Çözümler sayfalarımızda otonom araçlarda yapay zeka ve tarımda görsel yapay zeka gibi yenilikler hakkında bilgi edin. Lisans seçeneklerimize göz at ve bir bilgisayarlı görü projesine başla!









