YOLO Vision 2026:
Entegrasyonlar

Popüler açık kaynaklı OCR modelleri ve nasıl çalıştıkları

Popüler OCR modellerini, görüntüleri nasıl metne dönüştürdüklerini ve yapay zeka ve bilgisayarlı görü uygulamalarındaki rollerini keşfederken bize katıl.

ABAbirami Vina5 min read
Görüntüleri metne dönüştüren açık kaynaklı OCR modelleri

Bu makalede ele alınan kavramların görsel bir anlatımı için aşağıdaki videoyu izle.

Birçok işletme ve dijital sistem, taranmış faturalar, kimlik kartları veya el yazısı formlar gibi belgelerden gelen bilgilere dayanır. Ancak bu bilgiler bir görüntü olarak saklandığında, bilgisayarların bunları araması, çıkarması veya çeşitli görevler için kullanması zordur.

Ancak makinelerin görsel bilgileri yorumlayıp anlamasını sağlayan bir yapay zeka alanı olan computer vision gibi araçlarla, görüntüleri metne dönüştürmek çok daha kolay hale geliyor. Özellikle Optical Character Recognition (OCR), metinleri algılamak ve çıkarmak için kullanılabilen bir computer vision teknolojisidir.

OCR modelleri, metni çeşitli biçimlerde tanımak ve düzenlenebilir, aranabilir verilere dönüştürmek üzere eğitilirler. Belge otomasyonu, kimlik doğrulama ve gerçek zamanlı tarama sistemlerinde yaygın olarak kullanılırlar.

Bu makalede OCR modellerinin nasıl çalıştığını, popüler open-source modelleri, nerelerde kullanıldıklarını, yaygın uygulama alanlarını ve gerçek dünyadaki kullanımlarına yönelik temel hususları inceleyeceğiz.

OCR nedir?#

OCR modelleri, basılı veya el yazısı metinleri okuduğumuz gibi, makinelerin de görsel kaynaklardan metin okumasına yardımcı olmak için tasarlanmıştır. Bu modeller, taranmış belgeler, görüntüler veya el yazısı notların fotoğrafları gibi girdileri alır ve bunları aranabilir, düzenlenebilir veya yazılım sistemlerinde kullanılabilir dijital metinlere dönüştürür.

Eski OCR sistemleri katı şablonları takip etse de, modern OCR modelleri metni tanımak için derin öğrenmeyi kullanır. Farklı metin fontlarını, dilleri ve hatta karmaşık el yazılarını kolayca tanıyabilir, düşük kaliteli görüntüleri işleyebilirler. Bu gelişmeler, OCR modellerini finans, sağlık, lojistik ve devlet hizmetleri gibi metin yoğunluklu sektörlerde otomasyonun önemli bir parçası haline getirmiştir.

OCR modelleri, metnin net ve yapılandırılmış olduğu görüntüler için harika olsa da, metin karmaşık görsellerin yanında veya dinamik sahnelerin içinde yer aldığında zorluklarla karşılaşabilir. Bu gibi durumlarda OCR modelleri, Ultralytics YOLO11 gibi computer vision modelleriyle birlikte kullanılabilir.

Ultralytics YOLO11, tabela, belge veya etiket gibi bir görseldeki belirli nesneleri tespit edebilir ve gerçek içeriği çıkarmak için OCR kullanılmadan önce metin bölgelerinin konumunu belirlemeye yardımcı olur.

Örneğin, autonomous vehicles içinde Ultralytics YOLO11 bir dur tabelasını tespit edebilir ve ardından OCR metni okuyarak sistemin hem nesneyi hem de anlamını doğru bir şekilde yorumlamasını sağlayabilir.

Example of OCR extracting text from a document image

Şekil 1. OCR kullanımına dair bir örnek (source).

OCR modellerinin nasıl çalıştığına genel bir bakış#

OCR'ın ne olduğunu anlattığımıza göre, şimdi OCR modellerinin gerçekte nasıl çalıştığına daha yakından bakalım.

Bir OCR modeli, bir görüntüden metin okumak ve çıkarmak için kullanılmadan önce, görüntü genellikle iki önemli adımdan geçirilir: ön işleme ve nesne algılama.

İlk olarak görüntü, ön işleme yoluyla temizlenir ve iyileştirilir. Görüntünün genel kalitesini artırmak ve metnin algılanmasını kolaylaştırmak için keskinleştirme, gürültü azaltma ve parlaklık veya kontrastı ayarlama gibi temel image processing teknikleri uygulanır.

Ardından nesne tespiti gibi computer vision tasks kullanılır. Bu adımda plaka, sokak tabelası, form veya kimlik kartı gibi içinde metin barındıran belirli hedef nesneler konumlandırılır. Bu nesneler belirlenerek sistem, anlamlı metnin bulunduğu alanları izole eder ve bunları tanıma işlemine hazırlar.

OCR modeli ancak bu adımlardan sonra işine başlar. İlk olarak, algılanan bölgeleri alır ve daha küçük parçalara ayırarak karakterleri, kelimeleri veya metin satırlarını tek tek tanımlar.

Derin öğrenme tekniklerini kullanarak model; harflerin şekillerini, desenlerini ve aralıklarını analiz eder, bunları eğitim sırasında öğrendikleriyle karşılaştırır ve en olası karakterleri tahmin eder. Daha sonra, tanınan karakterleri daha fazla işleme için tutarlı bir metin halinde yeniden birleştirir.

Diagram explaining how OCR works

Şekil 2. OCR'ın çalışma mantığını anlamak. Görüntü yazara aittir.

Popüler açık kaynak OCR modelleri#

Metin çıkarma içeren bir bilgisayarlı görü uygulaması oluştururken, doğru OCR modelini seçmek; doğruluk, dil desteği ve gerçek dünya sistemlerine ne kadar kolay entegre edilebildiği gibi faktörlere bağlıdır.

Günümüzde birçok açık kaynak modeli; geliştiricilerin ihtiyaç duyduğu esnekliği, güçlü topluluk desteğini ve güvenilir performansı sağlıyor. En popüler seçeneklerden bazılarını ve onları öne çıkaran özellikleri gözden geçirelim.

Tesseract OCR#

Tesseract, bugün en yaygın kullanılan open-source OCR modellerinden biridir. İlk olarak 1985 ve 1994 yılları arasında İngiltere'nin Bristol kentindeki ve Colorado'nun Greeley kasabasındaki Hewlett-Packard Laboratuvarlarında geliştirilmiştir. 2005 yılında HP, Tesseract'ı open-source yazılım olarak yayınlamış olup, 2006 yılından bu yana open-source topluluğunun sürekli katkılarıyla Google tarafından sürdürülmektedir.

Tesseract'ın temel özelliklerinden biri, 100'den fazla dili işleyebilme yeteneğidir, bu da onu çok dilli projeler için güvenilir bir seçenek haline getirir. Sürekli yapılan iyileştirmeler, özellikle formlar ve raporlar gibi yapılandırılmış belgelerde basılı metinleri okumadaki güvenilirliğini artırmıştır.

Text recognition using Tesseract OCR

Şekil 3. Tesseract OCR kullanarak metin tanıma (source).

Tesseract genellikle scanning invoices, evrak arşivleme veya standart düzenlere sahip belgelerden metin çıkarma içeren projelerde kullanılır. Belge kalitesi iyi olduğunda ve düzen önemli ölçüde değişiklik göstermediğinde en iyi performansı gösterir.

EasyOCR#

Benzer şekilde EasyOCR, Jaided AI tarafından geliştirilen Python tabanlı bir open-source OCR kütüphanesidir. Latin, Çince, Arapça ve Kiril alfabeleri dahil 80'den fazla dili destekler, bu da onu çok dilli metin tanıma için çok yönlü bir araç haline getirir.

Hem basılı hem de el yazısı metinleri işlemek üzere tasarlanan EasyOCR, düzeni, yazı tipi veya yapısı değişkenlik gösteren belgelerle iyi çalışır. Bu esneklik; makbuzlar, sokak tabelaları ve karma dilli girdilere sahip formlar gibi çeşitli kaynaklardan metin çıkarmak için onu harika bir seçenek haline getirir.

PyTorch üzerine inşa edilen EasyOCR, doğru metin tespiti ve tanıma için derin öğrenme tekniklerinden yararlanır. Hem CPU'larda hem de GPU'larda verimli bir şekilde çalışarak, ister yerel olarak birkaç görüntüyü işleme ister daha güçlü sistemlerde büyük dosya gruplarını yönetme olsun, göreve bağlı olarak ölçeklenebilmesine olanak tanır.

Açık kaynaklı bir araç olan EasyOCR, düzenli güncellemelerden ve topluluk odaklı iyileştirmelerden yararlanarak güncel kalmasını ve gerçek dünyadaki çok çeşitli OCR ihtiyaçlarına uyum sağlamasını kolaylaştırır.

PaddleOCR#

PaddleOCR, metin tespiti ve tanımasını tek bir düzenli akışta birleştiren, Baidu tarafından geliştirilmiş yüksek performanslı bir OCR araç setidir. 80 dili desteklemesi sayesinde fiş, tablo ve form gibi karmaşık belgeleri işleyebilir.

PaddleOCR'ı farklı kılan özellik, PaddlePaddle derin öğrenme çerçevesi üzerine kurulmuş olmasıdır. PaddlePaddle çerçevesi, kolay, güvenilir ve ölçeklenebilir yapay zeka modeli geliştirme ve dağıtımı için tasarlanmıştır. Ayrıca PaddleOCR, düşük kaliteli veya kalabalık görüntülerde bile yüksek doğruluk sağlayarak hassasiyet ve güvenilirliğin önemli olduğu gerçek dünya OCR görevleri için iyi bir seçim olmasını sağlar.

Diagram of the PaddleOCR workflow

Şekil 4. PaddleOCR'ın iş akışı (source).

Bunun da ötesinde PaddleOCR son derece modülerdir; geliştiricilerin belirli algılama, tanıma ve sınıflandırma bileşenlerini seçerek hatlarını özelleştirmelerine olanak tanır. İyi belgelenmiş Python API'leri ve güçlü topluluk desteğiyle, çok çeşitli OCR uygulamaları için esnek ve üretime hazır bir çözümdür.

Diğer popüler açık kaynak OCR modelleri#

İşte yaygın olarak kullanılan diğer bazı açık kaynak OCR modelleri:

  • MMOCR: Daha karmaşık projeler için tasarlanan MMOCR, metni tespit edebilir ve ayrıca bunun bir sayfada nasıl düzenlendiğini anlayabilir. Tablolarla, çok sütunlu düzenlerle ve görsel olarak karmaşık diğer belgelerle çalışmak için idealdir.
  • TrOCR: Özellikle metin dizilerini anlamada başarılı olan bir derin öğrenme modeli türü olan transformer'lar üzerine inşa edilen TrOCR, daha uzun metin pasajlarını ve dağınık, yapılandırılmamış düzenleri ele almada üstündür. İçerik izole etiketler yerine sürekli bir dil akışı şeklinde olduğunda güvenilir bir seçenektir.

OCR modellerinin yaygın uygulamaları#

OCR teknolojisi daha gelişmiş hale geldikçe, rolü temel dijitalleştirmenin çok ötesine geçti. Aslında OCR modelleri artık metinsel bilgilere dayanan çeşitli sektörlerde benimseniyor. İşte OCR'ın günümüzde gerçek dünya sistemlerinde uygulanma biçimlerinden bazılarına bir bakış:

  • Legal industry ve e-keşif: Hukuk büroları, binlerce sayfalık yasal belgeyi taramak için OCR uygulayarak sözleşmeleri, mahkeme dosyalarını ve delilleri daha hızlı keşif ve analiz için aranabilir hale getirir.
  • Sağlık hizmetleri: Hastaneler, hasta kayıtlarını dijitalleştirmek, el yazısı reçeteleri yorumlamak ve laboratuvar raporlarını verimli bir şekilde yönetmek için OCR modellerini kullanıyor. Bu, idari görevleri kolaylaştırır ve tıbbi iş akışlarında doğruluğu artırır.
  • Tarihsel koruma: Müzeler, kütüphaneler ve arşivler; eski kitapları, el yazmalarını ve gazeteleri dijitalleştirmek, değerli kültürel mirası korumak ve araştırmacılar için aranabilir hale getirmek için OCR uygular.
  • Kimlik ve pasaport doğrulama: Birçok dijital işe alım ve seyahat sistemi, devlet tarafından verilen belgelerden önemli verileri çıkarmak için OCR'a güvenir. Daha hızlı kimlik kontrolleri ve daha az manuel giriş hatası, daha sorunsuz kullanıcı deneyimleri ve daha yüksek güvenlik sağlar.

OCR-based scanner reading a passport for identity verification

Şekil 5. Kimlik doğrulama için pasaport okuyan OCR tabanlı tarayıcı. (source).

OCR modellerinin artıları ve eksileri#

OCR modelleri, 1950'lerde ilk tasarlandıklarından bu yana çok yol kat etti. Artık farklı içerikler ve platformlar için daha erişilebilir, doğru ve uyarlanabilir durumdalar. İşte günümüzün OCR modellerinin sunduğu temel güçler:

  • Erişilebilirlik iyileştirmeleri: OCR, basılı materyalleri görme engelli kullanıcılar için ekran okuyucular tarafından okunabilir formatlara dönüştürerek içeriği daha erişilebilir hale getirmeye yardımcı olur.
  • machine learning boru hatlarını geliştirir: Yapılandırılmamış görsel verileri yapılandırılmış metne dönüştüren ve bunu alt akıştaki makine öğrenimi modelleri için kullanılabilir kılan bir köprü görevi görür.
  • Şablonsuz çıkarma: Gelişmiş OCR artık katı şablonlar gerektirmez; belgeler arasında düzenler farklılık gösterse bile bilgileri akıllıca çıkarabilir.

Avantajlarına rağmen, OCR modelleri özellikle girdi mükemmel olmadığında hala birkaç zorlukla karşı karşıyadır. İşte akılda tutulması gereken bazı yaygın sınırlamalar:

  • Görüntü kalitesine duyarlılık: OCR, net görüntülerle en iyi şekilde çalışır; bulanık veya karanlık fotoğraflar sonuçları etkileyebilir.
  • Bazı el yazıları veya yazı tipleriyle zorlanma: Süslü veya karmaşık yazılar en iyi modelleri bile şaşırtabilir.
  • Son işleme hala gereklidir: Yüksek doğrulukta bile, özellikle kritik belgeler için OCR çıktıları genellikle bir miktar insan incelemesi veya temizlik gerektirir.

Öne çıkanlar#

OCR, bilgisayarların görüntülerdeki metni okumasını sağlayarak bu bilgilerin dijital sistemlerde kullanılmasını mümkün kılar. Belgeleri, tabelaları ve el yazısı notları işlemede kilit bir rol oynar ve hız ile doğruluğun kritik olduğu alanlarda etkilidir.

OCR modelleri ayrıca genellikle görüntülerdeki nesneleri algılayabilen Ultralytics YOLO11 gibi modellerle birlikte çalışır. Birlikte, sistemlerin neyin yazılı olduğunu ve nerede göründüğünü anlamalarını sağlarlar. Bu teknolojiler gelişmeye devam ettikçe, OCR makinelerin dünyayı yorumlama ve dünyayla etkileşim kurma biçiminin temel bir parçası haline geliyor.

Görsel yapay zekasını merak ediyor musun? Keşfetmeye devam etmek için our GitHub repository adresini ziyaret et ve our community ile bağlantı kur. Çözüm sayfalarımızda AI in self-driving cars ve vision AI in agriculture gibi yenilikler hakkında bilgi edin. our licensing options seçeneklerimize göz at ve bir computer vision projesine başla!

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla