YOLO Vision 2026:
Yapay Zeka Görüşü

RAG ve bilgisayarlı görü ile yapay zeka uygulamalarını geliştirme

Bilgi getirme destekli üretim (RAG) yönteminin bilgisayarlı görü ile birleştirilmesinin, yapay zeka sistemlerinin belgeleri, görselleri ve karmaşık gerçek dünya içeriğini yorumlamasına nasıl yardımcı olduğunu öğren.

ABAbirami Vina4 min read
RAG ve bilgisayarlı görü ile yapay zeka uygulamalarını geliştirme

ChatGPT veya Gemini gibi yapay zeka araçlarını kullanmak, bilgi bulmanın hızlı bir yolu haline geliyor. Bir mesaj taslağı hazırlarken, bir belgeyi özetlerken veya bir soruyu yanıtlarken, bu araçlar genellikle daha hızlı ve daha kolay bir çözüm sunar.

Ancak large language models (LLMs) modelini birkaç kez kullandıysan, muhtemelen sınırlamalarını fark etmişsindir. Son derece özel veya zamana duyarlı sorgular yöneltildiğinde, sıklıkla kendilerinden son derece emin bir şekilde yanlış yanıtlar verebilirler.

Bu durum, bağımsız LLM'lerin yalnızca eğitildikleri verilere güvenmelerinden kaynaklanır. Bu veri kümesinin ötesindeki en son güncellemelere veya uzmanlık bilgisine erişimleri yoktur. Sonuç olarak, verdikleri yanıtlar güncelliğini yitirmiş veya hatalı olabilir.

Bunu çözmeye yardımcı olmak için araştırmacılar retrieval-augmented generation (RAG) adı verilen bir yöntem geliştirdiler. RAG, dil modellerine, sorgulara yanıt verirken güvenilir kaynaklardan güncel ve ilgili bilgileri çekebilme yeteneği kazandırarak onları güçlendirir.

Bu makalede, RAG'ın nasıl çalıştığını ve ilgili, güncel bilgileri getirerek AI araçlarını nasıl geliştirdiğini inceleyeceğiz. Ayrıca, sistemlerin yalnızca metni değil, aynı zamanda görüntüleri, düzenleri ve görsel açıdan karmaşık belgeleri anlamasına yardımcı olmak için görsel verileri yorumlamaya odaklanan bir yapay zeka alanı olan computer vision ile birlikte nasıl çalıştığına da bakacağız.

Erişim destekli üretimi (RAG) anlamak#

Bir AI chatbot'a soru sorarken, genellikle kulağa hoş gelen bir yanıttan fazlasını bekleriz. İdeal olarak, iyi bir yanıt net, doğru ve gerçekten yardımcı olmalıdır. Bunu sunmak için AI model yalnızca dil becerilerine değil, özellikle belirli veya zamana duyarlı konularda doğru bilgilere erişime de ihtiyaç duyar.

RAG, bu boşluğu doldurmaya yardımcı olan bir tekniktir. Dil modelinin metni anlama ve oluşturma yeteneğini, harici kaynaklardan ilgili bilgileri alma gücüyle birleştirir. Model, yalnızca eğitim verilerine güvenmek yerine, yanıtını oluştururken güvenilir bilgi tabanlarından destekleyici içerikleri aktif olarak çeker.

Key RAG use cases

Şekil 1. Temel RAG kullanım durumları. Görsel: yazar.

Bunu, birine soru sormak ve yanıtlamadan önce güvenilir bir kaynağa danışmasını sağlamak gibi düşünebilirsin. Yanıtları yine kendi kelimeleriyle olur ancak en ilgili ve güncel bilgilerle desteklenmiştir.

Bu yaklaşım, LLM'lerin daha eksiksiz, doğru ve kullanıcının sorgusuna göre uyarlanmış yanıtlar vermesine yardımcı olur ve onları doğruluğun gerçekten önemli olduğu gerçek dünya uygulamalarında çok daha güvenilir hale getirir.

RAG'ın nasıl çalıştığına bir bakış#

RAG, iki temel adımı tanıtarak büyük bir dil modelinin nasıl yanıt verdiğini geliştirir: erişim ve üretim. İlk olarak, harici bir bilgi tabanından ilgili bilgileri alır. Ardından, bu bilgiyi iyi biçimlendirilmiş, bağlama duyarlı bir yanıt oluşturmak için kullanır.

Bu sürecin nasıl çalıştığını görmek için basit bir örnek ele alalım. Kişisel finances işlemlerini yönetmek için bir AI asistanı kullandığını ve ay için belirlediğin harcama hedefinin içinde kalıp kalmadığını kontrol etmek istediğini hayal et.

Süreç, asistana "Bu ay bütçeme sadık kaldım mı?" gibi bir soru sorduğunda başlar. Sistem, eğitim sırasında öğrendiklerine güvenmek yerine, en son finansal kayıtlarını (banka ekstreleri veya işlem özetleri gibi) aramak için bir erişim aracı kullanır. Sorununun arkasındaki niyeti anlamaya odaklanır ve en ilgili bilgileri toplar.

Bu bilgi alındıktan sonra, dil modeli kontrolü devralır. Hem sorunu hem de kayıtlarından çekilen verileri işleyerek net ve yardımcı bir yanıt oluşturur. Yanıt, ham detayları listelemek yerine harcamalarını özetler ve sana doğrudan, anlamlı bir içgörü sunar; örneğin hedefine ulaşıp ulaşmadığını doğrular ve temel harcama alanlarına dikkat çeker.

Bu yaklaşım, LLM'nin yalnızca doğru değil, aynı zamanda gerçek ve güncel bilgilerinle temellendirilmiş yanıtlar vermesine yardımcı olur ve deneyimi yalnızca statik eğitim verileriyle çalışan bir modele göre çok daha kullanışlı hale getirir.

Understanding how RAG works

Fig 2. RAG'ın nasıl çalıştığını anlamak.

Çok modlu RAG sistemlerine duyulan ihtiyaç#

Genellikle bilgiler her zaman düz metin olarak paylaşılmaz. Tıbbi taramalardan diyagramlara, sunum slaytlarından taranmış belgelere kadar görseller genellikle önemli detaylar taşır. Çoğunlukla metni okumak ve anlamak için oluşturulan geleneksel LLM'ler, bu tür içeriklerle zorlanabilir.

Ancak RAG, bu boşluğu doldurmak için bilgisayarlı görü ile birlikte kullanılabilir. İkisi bir araya getirildiğinde, hem metni hem de görselleri işleyebilen, yapay zeka sohbet robotlarının daha doğru ve eksiksiz yanıtlar vermesine yardımcı olan çok modlu bir RAG sistemi oluştururlar.

Bu yaklaşımın merkezinde, her iki giriş türünü de işlemek ve bunlar üzerinde akıl yürütmek üzere tasarlanmış vision-language models (VLMs) yer alır. Bu kurulumda RAG, büyük veri kaynaklarından en ilgili bilgileri alırken, computer vision tarafından desteklenen VLM ise görüntüleri, düzenleri ve diyagramları yorumlar.

Bu, özellikle taranmış formlar, tıbbi raporlar veya sunum slaytları gibi gerçek dünya belgeleri için yararlıdır; çünkü hayati detaylar hem metinde hem de görsellerde bulunabilir. Örneğin, görsellerin tablolar ve paragrafların yanı sıra yer aldığı bir belgeyi analiz ederken, çok modlu bir sistem görsel unsurları çıkarabilir, ne gösterdiklerine dair bir özet oluşturabilir ve daha eksiksiz ve yararlı bir yanıt sunmak için bunu çevreleyen metinle birleştirebilir.

Multimodal RAG using images and text to provide better answers

Fig 3. Multimodal RAG, daha iyi yanıtlar sağlamak için görüntüleri ve metni kullanır.

Görsel veriler için RAG uygulamaları#

RAG'ın ne olduğunu ve bilgisayarlı görü ile nasıl çalıştığını tartıştığımıza göre, bu yaklaşımın nasıl kullanıldığını gösteren bazı gerçek dünya örneklerine ve araştırma projelerine göz atalım.

VisRAG ile görsel belgeleri anlamak#

Diyelim ki finansal bir rapor veya taranmış bir legal document dosyasından içgörüler çıkarmaya çalışıyorsun. Bu tür dosyalar genellikle yalnızca metin içermez; aynı zamanda bilgileri açıklamaya yardımcı olan tablolar, grafikler ve düzenler de barındırır. Basit bir dil modeli bu görsel öğeleri göz ardı edebilir veya yanlış yorumlayabilir, bu da eksik veya hatalı yanıtlara yol açabilir.

VisRAG bu zorluğun üstesinden gelmek için araştırmacılar tarafından oluşturuldu. Yalnızca metni işlemek yerine her sayfayı bir görüntü olarak ele alan VLM tabanlı bir RAG boru hattıdır. Bu, sistemin hem içeriği hem de görsel yapısını anlamasını sağlar. Sonuç olarak, en ilgili bölümleri bulabilir ve belgenin tam bağlamına dayalı olarak daha net, daha doğru yanıtlar verebilir.

VisRAG reading documents as images to capture content and layout

Şekil 4. VisRAG, metin içeriğini ve mizanpajı yakalamak için belgeleri görsel olarak okuyabilir.

RAG ile görsel soru cevaplama#

Görsel soru cevaplama (VQA), bir yapay zeka sisteminin görseller hakkındaki soruları yanıtladığı bir görevdir. Mevcut birçok VQA sistemi, ek bilgi arama ihtiyacı duymadan tek bir belge hakkındaki soruları yanıtlamaya odaklanır; buna kapalı ayar denir.

VDocRAG, daha gerçekçi bir yaklaşım benimseyen bir RAG çerçevesidir. VQA'yı, önce ilgili belgeleri getirme yeteneğiyle entegre eder. Bu, bir kullanıcının sorusunun birçok belgeden birine ait olabileceği ve sistemin yanıt vermeden önce doğru olanı bulması gereken gerçek dünya senaryolarında kullanışlıdır. Bunu yapmak için VDocRAG, belgeleri görüntü olarak analiz etmek ve hem metinlerini hem de görsel yapılarını korumak için VLM'leri kullanır.

Bu durum, VDocRAG'ı kurumsal arama, belge otomasyonu ve customer support gibi uygulamalarda özellikle etkili kılar. Düzeni anlamanın kelimeleri okumak kadar önemli olduğu kılavuzlar veya politika dosyaları gibi karmaşık, görsel olarak biçimlendirilmiş belgelerden ekiplerin yanıtları hızlı bir şekilde çıkarmasına yardımcı olabilir.

The difference between VDocRAG and LLM-based solutions

Fig 5. VDocRAG ile LLM tabanlı çözümler arasındaki fark.

RAG ile görsel altyazılamayı iyileştirmek#

Image captioning, bir görüntüde neler olup bittiğine dair yazılı bir açıklama oluşturmayı içerir. Çevrimiçi içeriği daha erişilebilir hale getirmekten görsel arama sağlamaya, içerik moderasyonunu ve öneri sistemlerini desteklemeye kadar çeşitli uygulamalarda kullanılır.

Ancak doğru altyazılar oluşturmak yapay zeka modelleri için her zaman kolay değildir. Özellikle görsel, modelin eğitildiğinden farklı bir şey gösterdiğinde bu durum daha da zorlaşır. Birçok altyazılama sistemi eğitim verilerine yoğun bir şekilde güvenir, bu nedenle alışılmadık sahnelerle karşılaştıklarında altyazıları belirsiz veya hatalı olabilir.

Bununla başa çıkmak için araştırmacılar, retrieval-augmented generation (RAG) yöntemini image captioning alanına getiren Re-ViLM adlı bir yöntem geliştirdiler. Sıfırdan bir açıklama oluşturmak yerine Re-ViLM, bir veritabanından benzer görüntü-metin çiftlerini alır ve bunları açıklama çıktısına rehberlik etmek için kullanır.

Bu erişim tabanlı yaklaşım, modelin açıklamalarını ilgili örneklerle temellendirmesine yardımcı olarak hem doğruluğu hem de akıcılığı artırır. İlk sonuçlar, Re-ViLM'in gerçek örnekleri kullanarak daha doğal, bağlama duyarlı altyazılar oluşturduğunu ve belirsiz veya hatalı açıklamaların azaltılmasına yardımcı olduğunu göstermektedir.

Re-ViLM improving image captions by retrieving visual-text examples

Şekil 6. Re-ViLM, görsel-metin örnekleri alarak görsel altyazılarını iyileştirir.

Görsel verileri anlamak için RAG kullanmanın avantajları ve dezavantajları#

Görsel bilgileri almak ve kullanmak için erişim destekli üretim tekniklerini uygulamanın faydalarına hızlı bir bakış:

  • Gelişmiş summarization özellikleri: Özetler, yalnızca metni değil, görsellerden elde edilen içgörüleri de (grafik trendleri veya infografik öğeleri gibi) içerebilir.
  • Daha sağlam arama ve erişim: Erişim adımları, görsel tabanlı anlamayı kullanarak metinde anahtar kelimeler bulunmadığında bile ilgili görsel sayfaları tanımlayabilir.
  • Taranmış, el yazısı veya görsel tabanlı belgeler için destek: VLM'ler tarafından desteklenen RAG işlem hatları, yalnızca metin tabanlı modellerin okuyamayacağı içerikleri işleyebilir.

Bu avantajlara rağmen, görsel verilerle çalışmak için RAG kullanırken akılda tutulması gereken birkaç sınırlama hala mevcuttur. İşte ana olanlardan bazıları:

  • Yüksek bilgi işlem gereksinimleri: Hem görselleri hem de metni analiz etmek daha fazla bellek ve işlem gücü kullanır, bu da performansı yavaşlatabilir veya maliyetleri artırabilir.
  • Data privacy ve güvenlik endişeleri: Özellikle sağlık veya finans gibi sektörlerdeki görsel belgeler, alma ve işleme iş akışlarını karmaşıklaştıran hassas bilgiler içerebilir.
  • Daha uzun çıkarım süreleri: Görsel işleme karmaşıklığı artırdığından, yanıt oluşturmak yalnızca metin tabanlı sistemlere kıyasla daha fazla zaman alabilir.

Öne çıkanlar#

Erişim destekli üretim, büyük dil modellerinin harici kaynaklardan ilgili, güncel bilgileri almasına izin vererek soruları yanıtlama biçimini iyileştiriyor. Bilgisayarlı görü ile eşleştirildiğinde, bu sistemler sadece metni değil, aynı zamanda grafikler, tablolar, görseller ve taranmış belgeler gibi görsel içerikleri de işleyebilir, bu da daha doğru ve çok yönlü yanıtlara yol açar.

Bu yaklaşım, LLM'leri karmaşık belgeler içeren gerçek dünya görevleri için daha uygun hale getirir. Erişimi ve görsel anlayışı bir araya getirerek, bu modeller çeşitli formatları daha etkili bir şekilde yorumlayabilir ve pratik, günlük bağlamlarda daha yararlı içgörüler sağlayabilir.

Büyüyen community topluluğumuza katıl! Yapay zekayı daha derinlemesine incelemek için GitHub repository depomuzu keşfet. Kendi computer vision projelerini başlatmaya hazır mısın? licensing options seçeneklerimize göz at. Çözüm sayfalarımızda AI in healthcare ve computer vision in retail hakkında daha fazla bilgi keşfet!

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla