RAG ve bilgisayarla görmeyle yapay zekâ uygulamalarını geliştirme
Geri getirmeyle zenginleştirilmiş üretimin (RAG) bilgisayarla görmeyle birleştirilmesinin, yapay zekâ sistemlerinin belgeleri, görselleri ve karmaşık gerçek dünya içeriklerini yorumlamasına nasıl yardımcı olduğunu öğren.

ChatGPT veya Gemini gibi yapay zekâ araçlarını kullanmak, bilgi bulmanın yaygın bir yolu hâline hızla geliyor. İster bir mesaj taslağı hazırlıyor, ister bir belgeyi özetliyor, ister bir soruyu yanıtlıyor ol, bu araçlar çoğu zaman daha hızlı ve kolay bir çözüm sunuyor.
Ancak büyük dil modellerini (LLMs) birkaç kez kullandıysan, muhtemelen sınırlamalarını fark etmişsindir. Onlara son derece özgül veya zamana duyarlı sorular yöneltildiğinde, çoğu zaman kendinden emin bir şekilde yanlış yanıtlar verebilirler.
Bunun nedeni, bağımsız LLM'lerin yalnızca eğitildikleri verilere dayanmasıdır. Bu veri kümesinin ötesindeki en son güncellemelere veya uzmanlık bilgilerine erişimleri yoktur. Sonuç olarak yanıtları güncelliğini yitirmiş veya hatalı olabilir.
Bu sorunun çözümüne yardımcı olmak için araştırmacılar getirme destekli üretim (RAG) adı verilen bir yöntem geliştirdi. RAG, sorgulara yanıt verirken güvenilir kaynaklardan güncel ve ilgili bilgileri alabilmelerini sağlayarak dil modellerini geliştirir.
Bu makalede RAG'nin nasıl çalıştığını ve ilgili, güncel bilgileri alarak yapay zekâ araçlarını nasıl geliştirdiğini inceleyeceğiz. Ayrıca yapay zekânın bir alanı olan ve görsel verileri yorumlamaya odaklanan bilgisayarlı görü ile birlikte nasıl çalıştığına da bakacağız. Bu sayede sistemler yalnızca metni değil, görüntüleri, yerleşimleri ve görsel açıdan karmaşık belgeleri de anlayabilir.
Getirme destekli üretimi (RAG) anlama#
Bir yapay zekâ sohbet robotuna soru sorduğumuzda genellikle kulağa hoş gelen bir yanıttan fazlasını bekleriz. İdeal olarak iyi bir yanıt açık, doğru ve gerçekten yararlı olmalıdır. Bunu sunabilmek için yapay zekâ modelinin dil becerilerinden fazlasına, özellikle özgül veya zamana duyarlı konularda doğru bilgilere erişime de ihtiyacı vardır.
RAG, bu boşluğu kapatmaya yardımcı olan bir tekniktir. Dil modelinin metni anlama ve üretme yeteneğini, harici kaynaklardan ilgili bilgileri alma gücüyle bir araya getirir. Model yalnızca eğitim verilerine dayanmak yerine, yanıtını oluştururken güvenilir bilgi tabanlarından destekleyici içerikleri etkin bir şekilde alır.

Şekil 1. Temel RAG kullanım alanları. Görsel yazara aittir.
Bunu, birine soru sorduğunu ve yanıt vermeden önce güvenilir bir kaynağa başvurduğunu düşünerek anlayabilirsin. Yanıt hâlâ kendi kelimeleriyledir, ancak en ilgili ve güncel bilgilerden yararlanır.
Bu yaklaşım, LLM'lerin kullanıcının sorgusuna daha eksiksiz, doğru ve uygun yanıtlar vermesine yardımcı olur; böylece doğruluğun gerçekten önemli olduğu gerçek dünya uygulamalarında çok daha güvenilir hâle gelirler.
RAG'nin nasıl çalıştığına bir bakış#
RAG, iki temel adım sunarak büyük dil modelinin yanıt verme biçimini geliştirir: getirme ve üretim. Önce harici bir bilgi tabanından ilgili bilgileri alır. Ardından bu bilgileri kullanarak iyi yapılandırılmış, bağlamı dikkate alan bir yanıt üretir.
Bu sürecin nasıl çalıştığını görmek için basit bir örneğe bakalım. Kişisel finansını yönetmek üzere bir yapay zekâ asistanı kullandığını ve ay boyunca harcama hedefin içinde kalıp kalmadığını kontrol etmek istediğini düşün.
Süreç, asistana "Bu ay bütçeme uydum mu?" gibi bir soru sormanla başlar. Sistem yalnızca eğitim sırasında öğrendiklerine güvenmek yerine, en güncel finansal kayıtlarını (banka hesap özetleri veya işlem özetleri gibi) taramak için bir getirici kullanır. Sorunun ardındaki amacı anlamaya odaklanır ve en ilgili bilgileri toplar.
Bu bilgiler alındıktan sonra dil modeli devreye girer. Sorunu ve kayıtlarından alınan verileri işleyerek açık ve yararlı bir yanıt oluşturur. Yanıt, ham ayrıntıları sıralamak yerine harcamalarını özetler ve hedefe ulaşıp ulaşmadığını doğrulamak, temel harcama alanlarını belirtmek gibi doğrudan ve anlamlı bir içgörü sunar.
Bu yaklaşım, LLM'nin yalnızca statik eğitim verileriyle çalışan bir modele kıyasla çok daha yararlı bir deneyim sunarak yalnızca doğru değil, aynı zamanda gerçek ve güncel bilgilerine dayanan yanıtlar vermesine yardımcı olur.

Şekil 2. RAG'nin nasıl çalıştığını anlama.
Çok modlu RAG sistemlerine duyulan ihtiyaç#
Bilgi genellikle yalnızca düz metin olarak paylaşılmaz. Tıbbi taramalardan ve diyagramlardan sunum slaytlarına ve taranmış belgelere kadar görseller çoğu zaman önemli ayrıntılar taşır. Temel olarak metni okumak ve anlamak üzere tasarlanmış geleneksel LLM'ler bu tür içeriklerde zorlanabilir.
Ancak RAG, bu boşluğu kapatmak için bilgisayarlı görüyle birlikte kullanılabilir. İkisi bir araya getirildiğinde, hem metinleri hem de görselleri işleyebilen çok modlu RAG sistemi olarak bilinen bir yapı oluşturur ve yapay zekâ sohbet robotlarının daha doğru ve eksiksiz yanıtlar vermesine yardımcı olur.
Bu yaklaşımın merkezinde, her iki girdi türünü de işlemek ve bunlar üzerinde akıl yürütmek üzere tasarlanmış görü-dil modelleri (VLMs) bulunur. Bu yapıda RAG, büyük veri kaynaklarından en ilgili bilgileri alırken bilgisayarlı görüyle etkinleştirilen VLM, görüntüleri, yerleşimleri ve diyagramları yorumlar.
Bu yaklaşım; hayati ayrıntıların hem metinde hem de görsellerde bulunabildiği taranmış formlar, tıbbi raporlar veya sunum slaytları gibi gerçek dünya belgeleri için özellikle yararlıdır. Örneğin görüntülerin tablolar ve paragraflarla birlikte yer aldığı bir belgeyi analiz ederken çok modlu bir sistem görsel öğeleri çıkarabilir, bunların ne gösterdiğine dair bir özet oluşturabilir ve daha eksiksiz ve yararlı bir yanıt sunmak için bunu çevredeki metinle birleştirebilir.

Şekil 3. Çok modlu RAG, daha iyi yanıtlar sunmak için görüntüleri ve metni kullanır.
Görsel veriler için RAG uygulamaları#
RAG'nin ne olduğunu ve bilgisayarlı görüyle nasıl çalıştığını ele aldığımıza göre, şimdi bu yaklaşımın nasıl kullanıldığını gösteren bazı gerçek dünya örneklerine ve araştırma projelerine bakalım.
VisRAG ile görsel belgeleri anlama#
Bir finansal rapordan veya taranmış bir hukuki belgeden içgörüler çıkarmaya çalıştığını düşün. Bu tür dosyalar çoğu zaman yalnızca metin değil, bilgiyi açıklamaya yardımcı olan tablolar, grafikler ve yerleşimler de içerir. Basit bir dil modeli bu görsel öğeleri gözden kaçırabilir veya yanlış yorumlayabilir; bu da eksik ya da hatalı yanıtlar verilmesine yol açar.
VisRAG, bu zorluğun üstesinden gelmek için araştırmacılar tarafından oluşturuldu. Bu, yalnızca metni işlemek yerine her sayfayı bir görüntü olarak ele alan VLM tabanlı bir RAG işlem hattıdır. Bu sayede sistem hem içeriği hem de görsel yapısını anlayabilir. Sonuç olarak belgenin en ilgili bölümlerini bulabilir ve tüm belge bağlamına dayanan daha açık ve doğru yanıtlar verebilir.

Şekil 4. VisRAG, metinsel içeriği ve yerleşimi yakalamak için belgeleri görüntü olarak okuyabilir.
RAG ile görsel soru yanıtlama#
Görsel soru yanıtlama (VQA), bir yapay zekâ sisteminin görüntülerle ilgili soruları yanıtladığı bir görevdir. Mevcut birçok VQA sistemi, ek bilgi aramaya gerek duymadan tek bir belge hakkındaki soruları yanıtlamaya odaklanır; bu, kapalı ortam olarak bilinir.
VDocRAG, daha gerçekçi bir yaklaşım sunan bir RAG çerçevesidir. VQA'yı, önce ilgili belgeleri alma yeteneğiyle birleştirir. Bu, kullanıcının sorusunun birçok belgeden biriyle ilgili olabileceği ve sistemin yanıt vermeden önce doğru belgeyi bulması gereken gerçek dünya durumlarında yararlıdır. VDocRAG bunu yapmak için belgeleri görüntü olarak analiz eden, hem metinlerini hem de görsel yapılarını koruyan VLM'leri kullanır.
Bu, VDocRAG'yi kurumsal arama, belge otomasyonu ve müşteri desteği gibi uygulamalarda özellikle etkili kılar. Yerleşimi anlamanın kelimeleri okumak kadar önemli olduğu kılavuzlar veya politika belgeleri gibi karmaşık ve görsel olarak biçimlendirilmiş belgelerden ekiplerin hızlıca yanıtlar çıkarmasına yardımcı olabilir.

Şekil 5. VDocRAG ile LLM tabanlı çözümler arasındaki fark.
RAG ile görüntü açıklamalarını iyileştirme#
Görüntü açıklaması oluşturma, bir görüntüde ne olduğunu yazılı olarak açıklamayı içerir. Çevrim içi içeriği daha erişilebilir hâle getirmekten görüntü aramayı güçlendirmeye, içerik denetleme ve öneri sistemlerini desteklemeye kadar çeşitli uygulamalarda kullanılır.
Ancak yapay zekâ modelleri için doğru açıklamalar oluşturmak her zaman kolay değildir. Görüntü, modelin eğitim sırasında öğrendiklerinden farklı bir şey gösterdiğinde bu özellikle zorlaşır. Birçok açıklama sistemi büyük ölçüde eğitim verilerine dayanır; bu nedenle alışılmadık sahnelerle karşılaştıklarında açıklamaları belirsiz veya hatalı olabilir.
Araştırmacılar bu sorunun üstesinden gelmek için görüntü açıklaması oluşturmaya getirme destekli üretimi (RAG) dahil eden bir yöntem olan Re-ViLM'i geliştirdi. Re-ViLM, açıklamayı sıfırdan oluşturmak yerine bir veritabanından benzer görüntü-metin çiftlerini alır ve bunları açıklama çıktısına rehberlik etmek için kullanır.
Getirmeye dayalı bu yaklaşım, modelin açıklamalarını ilgili örneklere dayandırmasına yardımcı olarak hem doğruluğu hem de akıcılığı geliştirir. İlk sonuçlar, Re-ViLM'nin gerçek örnekleri kullanarak daha doğal ve bağlamı dikkate alan açıklamalar oluşturduğunu ve belirsiz veya hatalı açıklamaları azaltmaya yardımcı olduğunu gösteriyor.

Şekil 6. Re-ViLM, görsel-metin örneklerini alarak görüntü açıklamalarını iyileştirir.
Görsel verileri anlamak için RAG kullanmanın artıları ve eksileri#
Getirme destekli üretim tekniklerini görsel bilgileri almak ve kullanmak için uygulamanın faydalarına kısaca göz atalım:
- Gelişmiş özetleme yetenekleri: Özetler yalnızca metni değil, görsellerden elde edilen içgörüleri (grafik eğilimleri veya infografik öğeleri gibi) de içerebilir.
- Daha güçlü arama ve getirme: Getirme adımları, görüntü tabanlı anlayışı kullanarak metinde anahtar kelimeler bulunmasa bile ilgili görsel sayfaları belirleyebilir.
- Taranmış, el yazısıyla yazılmış veya görüntü tabanlı belgeler için destek: VLM'lerle etkinleştirilen RAG işlem hatları, yalnızca metinle çalışan modellerin okuyamayacağı içerikleri işleyebilir.
Bu faydalara rağmen, görsel verilerle çalışmak için RAG kullanırken akılda tutulması gereken bazı sınırlamalar hâlâ vardır. Başlıca sınırlamalardan bazıları şunlardır:
- Yüksek bilgi işlem gereksinimleri: Hem görüntülerin hem de metnin analiz edilmesi daha fazla bellek ve işlem gücü kullanır; bu da performansı yavaşlatabilir veya maliyetleri artırabilir.
- Veri gizliliği ve güvenlik endişeleri: Özellikle sağlık hizmetleri veya finans gibi sektörlerdeki görsel belgeler, getirme ve işleme iş akışlarını karmaşıklaştıran hassas bilgiler içerebilir.
- Daha uzun çıkarım süreleri: Görsel işleme karmaşıklık kattığı için yanıt oluşturmak yalnızca metinle çalışan sistemlere kıyasla daha uzun sürebilir.
Önemli çıkarımlar#
Getirme destekli üretim, büyük dil modellerinin harici kaynaklardan ilgili ve güncel bilgileri almasını sağlayarak soruları yanıtlama biçimini geliştiriyor. Bilgisayarlı görüyle birleştirildiğinde bu sistemler yalnızca metni değil; grafikler, tablolar, görüntüler ve taranmış belgeler gibi görsel içerikleri de işleyebilir ve daha doğru, kapsamlı yanıtlar sunabilir.
Bu yaklaşım, LLM'leri karmaşık belgeler içeren gerçek dünya görevleri için daha uygun hâle getirir. Getirmeyi ve görsel anlayışı bir araya getiren bu modeller, çeşitli biçimleri daha etkili yorumlayabilir ve pratik, günlük bağlamlarda daha yararlı içgörüler sunabilir.
Büyüyen topluluğumuza katıl! Yapay zekâyı daha derinlemesine keşfetmek için GitHub depomuzu incele. Kendi bilgisayarlı görü projene başlamaya hazır mısın? Lisanslama seçeneklerimize göz at. Çözüm sayfalarımızda sağlık hizmetlerinde yapay zekâ ve perakendede bilgisayarlı görü hakkında daha fazla bilgi edin!









