Optical Character Recognition (OCR)
Optik Karakter Tanımanın (OCR) görüntüleri aranabilir verilere nasıl dönüştürdüğünü keşfet. Metin algılama için Ultralytics YOLO26 kullanarak OCR işlem hatları oluşturmayı öğren.
Optik Karakter Tanıma (OCR), farklı belge türlerinin (taranmış kâğıt belgeler, PDF dosyaları veya dijital kamerayla çekilmiş görüntüler gibi) düzenlenebilir ve aranabilir verilere dönüştürülmesini sağlayan, bilgisayarlı görü alanındaki kritik bir teknolojidir. Metnin görsel temsillerini makine tarafından kodlanmış karakterlere dönüştüren OCR, fiziksel ve dijital dünyalar arasındaki boşluğu kapatır ve yapay zekâ (AI) sistemlerinin daha önce statik piksellere hapsolmuş metinsel bilgileri yorumlayıp işlemesine olanak tanır. OCR'nin ilk sürümleri depolanan şablonlarla basit örüntü eşleştirmeye dayanırken, modern sistemler farklı yazı tiplerini, karmaşık düzenleri ve hatta el yazısını yüksek doğrulukla işlemek için gelişmiş derin öğrenme mimarilerinden yararlanır.
OCR İşlem Hattı#
Günümüz OCR sistemleri genellikle ham görüntü verilerini birkaç farklı adım üzerinden yapılandırılmış bilgilere dönüştüren çok aşamalı bir işlem hattı olarak çalışır. Bu süreç çoğu zaman standart görüntü işlemeyi gelişmiş sinir ağlarıyla birleştirir.
- Görüntü Ön İşleme: Metin tanınmadan önce ham girdi, kaliteyi artırmak için veri ön işleme sürecinden geçirilir. Eşikleme gibi teknikler görüntüleri ikili siyah-beyaz biçime dönüştürürken gürültü azaltma, karakter çizgilerini karmaşık arka planlardan ayırmaya yardımcı olur.
- Metin Algılama: Bu kritik adım, görüntü içinde metin içeren belirli bölgelerin konumlandırılmasını kapsar. Ultralytics YOLO26 gibi yüksek performanslı nesne algılama modelleri, kelimelerin, satırların veya paragrafların çevresine sınırlayıcı kutular çizmek için burada sıkça kullanılır. Bu konumlandırma, sonraki tanıma motorunun yalnızca ilgili alanlara odaklanmasını sağlar.
- Metin Tanıma: Metin bölgeleri kırpıldıktan sonra bir tanıma modeline aktarılır. Özellik çıkarımı için Evrişimli Sinir Ağlarını (CNN) ve dizi modelleme için Tekrarlayan Sinir Ağlarını (RNN) birleştiren mimariler, piksel örüntülerini karakter dizilerine dönüştürmek için standarttır.
- Son İşleme: Nihai çıktı çoğu zaman Doğal Dil İşleme (NLP) teknikleri kullanılarak iyileştirilir. Sözlükler ve dil modelleri, yazım hatalarını düzeltmeye ve tanınan metnin anlamsal açıdan tutarlı olmasını sağlamaya yardımcı olarak genel doğruluğu önemli ölçüde artırır.
Gerçek Dünya Uygulamaları#
OCR'nin diğer yapay zekâ disiplinleriyle bütünleştirilmesi, çeşitli sektörlerde yaygın otomasyonu mümkün kılarak işletmelerin verileri işleme biçimini dönüştürmüştür.
Otomatik Plaka Tanıma (ANPR)#
Akıllı şehir altyapısında OCR, Otomatik Plaka Tanıma sistemlerinin temel motoru olarak görev yapar. Bir nesne algılayıcı, video karesi içindeki aracı ve plakayı önce belirler. Ardından OCR algoritmaları, otomatik geçiş ücreti tahsilatı veya güvenlik izleme amacıyla alfasayısal karakterleri çıkarır ve veritabanlarıyla karşılaştırır. Bunun için yüksek hızlı trafik verilerini etkili bir şekilde işleyebilen güçlü gerçek zamanlı çıkarım yetenekleri gerekir.
Akıllı Belge İşleme (IDP)#
Finans ve hukuk sektörleri, akıllı belge analizi için OCR'den yararlanır. AI sistemleri, manuel veri girişi yerine faturaları, makbuzları ve sözleşmeleri tarar. OCR'yi Adlandırılmış Varlık Tanıma (NER) ile birleştiren bu sistemler; tarih, tedarikçi adı ve toplam tutar gibi belirli alanları otomatik olarak çıkarabilir, idari iş yükünü azaltabilir ve iş akışlarını hızlandırabilir.
OCR'yi İlgili Terimlerden Ayırma#
OCR'yi görüntü sınıflandırmadan ayırmak önemlidir. Görüntü sınıflandırma, görüntünün tamamını kategorilere ayırırken (örneğin bir görüntüyü "belge" veya "fatura" olarak etiketlerken), OCR daha ayrıntılı çalışır; görüntü içindeki belirli karakter dizisini konumlandırır ve tanımlar. Benzer şekilde OCR, genel nesne algılamadan farklıdır. Nesne algılama, "dur" işaretini genel bir nesne sınıfı olarak belirleyebilirken OCR, işaretin üzerine basılmış belirli "D-U-R" harflerini okur.
Ultralytics ile Metin Algılama#
Yaygın bir modern iş akışında, metin bölgelerini algılamak için bir YOLO modeli kullanılır ve bu bölgeler ardından Tesseract veya PaddleOCR gibi özel bir tanıma motoruna aktarılır. Ultralytics Platformu, bu algılama modellerinin özel veri kümeleri üzerinde eğitilmesini kolaylaştırır. Aşağıdaki örnek, plakalar gibi genellikle metin içeren nesneleri algılamak için önceden eğitilmiş bir Ultralytics YOLO26 modelinin nasıl kullanılacağını gösterir.
from ultralytics import YOLO
# Load a pre-trained YOLO26 model (ideal for locating text regions)
model = YOLO("yolo26n.pt")
# Perform inference on an image containing text objects (e.g., a street sign)
results = model.predict(source="https://ultralytics.com/images/bus.jpg")
# Display detected classes, acting as the localization step in an OCR pipeline
for r in results:
print(f"Detected classes: {r.boxes.cls}")
# Further processing would pass these crops to an OCR engineİleri Okuma ve Kaynaklar#
İlk OCR araştırmalarını yönlendiren temel veri kümelerini incelemek için el yazısı rakamlardan oluşan MNIST veri tabanı, kıyaslama açısından hâlâ klasik bir kaynaktır. Teknolojinin açık kaynaklı gelişimiyle ilgilenenler için Tesseract projesinin geçmişi, topluluk tarafından yürütülen katkılar hakkında fikir verir. Google Cloud Vision API ve Amazon Textract gibi modern bulut tabanlı çözümler, yönetilen OCR hizmetlerinde günümüzün en gelişmiş uygulamalarını temsil eder. Ayrıca Sahne Metni Tanıma araştırmaları, aydınlatma ve perspektifin değişken olduğu, kısıtlanmamış "doğal" ortamlarda AI'nin metin okuyabilmesini sağlayarak sınırları zorlamayı sürdürüyor.









