Doğal dil işleme ile bilgisayarlı görü arasında köprü kurma
Doğal dil işlemenin (NLP) ve bilgisayarlı görünün (CV) daha akıllı, çapraz modlu yapay zekâ sistemleriyle sektörleri nasıl dönüştürebileceğini öğren.

Doğal dil işleme (NLP) ve bilgisayarlı görü (CV), son yıllarda büyük popülerlik kazanan yapay zekânın (AI) iki farklı dalıdır. Yapay zekâdaki gelişmeler sayesinde bu iki dal artık hiç olmadığı kadar bağlantılıdır.
Bunun harika bir örneği otomatik görüntü açıklaması oluşturmadır. Bilgisayarlı görü, bir görüntünün içeriğini analiz etmek ve anlamak için kullanılabilirken doğal dil işleme, görüntüyü açıklayan bir başlık oluşturmak için kullanılabilir. Otomatik görüntü açıklaması oluşturma, sosyal medya platformlarında [erişilebilirliği](https://ultralytics-translation-4.invalid artırmak ve içerik yönetim sistemlerinde görüntüleri verimli şekilde düzenlemeye ve etiketlemeye yardımcı olmak için yaygın olarak kullanılır.
NLP ve Vision AI alanındaki yenilikler, çeşitli sektörlerde bu tür birçok kullanım alanının ortaya çıkmasını sağladı. Bu makalede NLP ve bilgisayarlı görü konularını daha yakından inceleyecek ve ikisinin de nasıl çalıştığını ele alacağız. Ayrıca bu iki teknolojiyi birlikte kullanan ilgi çekici uygulamaları keşfedeceğiz. Hadi başlayalım!
NLP ve Vision AI'ı anlamak#
NLP, bilgisayarlar ile insan dili arasındaki etkileşime odaklanır. Makinelerin anlamlı bir şekilde metni veya konuşmayı anlamasını, yorumlamasını ve üretmesini sağlar. Çeviri, duygu analizi veya özetleme gibi görevleri gerçekleştirmek için kullanılabilir.
Bilgisayarlı görü ise makinelerin görüntüleri ve videoları analiz etmesine ve bunlarla çalışmasına yardımcı olur. Bir fotoğrafta nesneleri algılama, yüz tanıma, nesne takibi veya görüntü sınıflandırma gibi görevlerde kullanılabilir. Vision AI teknolojisi, makinelerin görsel dünyayı daha iyi anlamasını ve onunla etkileşim kurmasını sağlar.

Şekil 1. Görüntü sınıflandırma örneği.
Bilgisayarlı görü ile entegre edildiğinde NLP, metin ve görüntüleri birleştirerek görsel verilere anlam katabilir ve daha derin bir anlayış sağlayabilir. Söylendiği gibi, "bir resim bin kelimeye bedeldir"; metinle birleştirildiğinde daha da güçlü hâle gelir ve daha zengin içgörüler sunar.
NLP ve bilgisayarlı görünün birlikte çalışmasına örnekler#
Telefonun bir görüntüdeki metni çevirmesi gibi, farkında bile olmadan NLP ile bilgisayarlı görünün birlikte çalıştığı günlük araçları muhtemelen görmüşsündür.
Aslında Google Translate, görüntülerdeki metinleri çevirmek için hem doğal dil işleme hem de bilgisayarlı görü kullanır. Başka bir dildeki bir sokak tabelasının fotoğrafını çektiğinde bilgisayarlı görü metni tanımlar ve çıkarır, NLP ise metni tercih ettiğin dile çevirir.
NLP ve CV, süreci sorunsuz ve verimli hâle getirmek için birlikte çalışarak kullanıcıların diller arasındaki bilgileri gerçek zamanlı olarak anlamasını ve bunlarla etkileşim kurmasını sağlar. Teknolojilerin bu kusursuz entegrasyonu iletişim engellerini ortadan kaldırır.

Şekil 2. Google'ın Translate özelliği.
NLP ve bilgisayarlı görünün birlikte çalıştığı diğer bazı uygulamalar şunlardır:
- Otonom araçlar: CV, yol işaretlerini, şeritleri ve engelleri algılamak için kullanılabilirken NLP, sesli komutları veya yol işaretlerindeki metni işleyebilir.
- Belge okuyucuları: Vision AI, taranmış belgelerdeki veya el yazısındaki metni tanıyabilir; doğal dil işleme ise bilgileri yorumlayıp özetleyebilir.
- Alışveriş uygulamalarında görsel arama: Bilgisayarlı görü, fotoğraflardaki ürünleri tanımlayabilir; NLP ise önerileri iyileştirmek için arama terimlerini işler.
- Eğitim araçları: CV, el yazısıyla yazılmış notları veya görsel girdileri tanıyabilir; NLP ise içeriğe göre açıklamalar veya geri bildirim sağlayabilir.
Bilgisayarlı görü ile NLP'yi birleştiren temel kavramlar#
Bilgisayarlı görü ve doğal dil işlemenin nasıl kullanıldığını gördüğümüze göre, şimdi çapraz modlu yapay zekâyı mümkün kılmak için nasıl bir araya geldiklerini inceleyelim.
Çapraz modlu yapay zekâ, metin ve görüntüler arasındaki bilgileri işlemek ve birbirine bağlamak için bilgisayarlı görünün görsel anlayışını NLP'nin dil kavrayışıyla birleştirir. Örneğin sağlık hizmetlerinde çapraz modlu yapay zekâ, bir röntgeni analiz etmeye ve olası sorunların açık, yazılı bir özetini oluşturmaya yardımcı olarak doktorların daha hızlı ve doğru kararlar almasını sağlayabilir.
Doğal Dil Anlama (NLU)#
Doğal Dil Anlama, metni niyetini, bağlamını, anlambilimini, tonunu ve yapısını analiz ederek yorumlamaya ve anlam çıkarmaya odaklanan özel bir NLP alt kümesidir. NLP ham metni işlerken NLU, makinelerin insan dilini daha etkili şekilde kavramasını sağlar. Örneğin ayrıştırma, yazılı metni makinelerin anlayabileceği yapılandırılmış bir biçime dönüştüren bir NLU tekniğidir.

Şekil 3. NLP ile NLU arasındaki ilişki.
Görsel verilerde anlaşılması gereken metin bulunduğunda NLU, bilgisayarlı görü ile birlikte çalışır. Bilgisayarlı görü, optik karakter tanıma (OCR) gibi teknolojileri kullanarak görüntülerden, belgelerden veya videolardan metin çıkarır. Bu işlem bir makbuzu tarama, bir tabeladaki metni okuma veya el yazısıyla yazılmış notları dijitalleştirme gibi görevleri içerebilir.
NLU daha sonra çıkarılan metni işleyerek anlamını, bağlamını ve niyetini kavrar. Bu birleşim, sistemlerin yalnızca metni tanımanın ötesine geçmesini sağlar. Sistemler makbuzlardaki harcamaları kategorilere ayırabilir veya tonu ve duyguyu analiz edebilir. Bilgisayarlı görü ve NLU birlikte, görsel metni anlamlı ve eyleme dönüştürülebilir bilgilere çevirir.
İstem mühendisliği#
İstem mühendisliği, büyük dil modelleri (LLMs) ve görsel-dil modelleri (VLMs) gibi üretken yapay zekâ sistemlerini istenen çıktıları üretmeye yönlendirmek için açık, kesin ve ayrıntılı girdiler tasarlama sürecidir. Bu istemler, yapay zekâ modelinin kullanıcının niyetini anlamasına yardımcı olan talimatlar görevi görür.
Etkili istem mühendisliği, modelin yeteneklerini anlamayı ve doğru, yaratıcı veya içgörülü yanıtlar üretme kapasitesini en üst düzeye çıkaran girdiler oluşturmayı gerektirir. Bu, özellikle hem metin hem de görüntülerle çalışan yapay zekâ modelleri için önemlidir.
Örnek olarak OpenAI'nin DALL·E modelini ele alalım. Ondan “ata binen bir astronotun fotogerçekçi bir görüntüsünü” oluşturmasını istersen, açıklamana dayanarak tam olarak bunu üretebilir. Bu beceri, profesyonellerin metinsel fikirleri hızla görsel taslaklara dönüştürerek zamandan tasarruf edebildiği ve verimliliği artırabildiği grafik tasarım gibi alanlarda son derece kullanışlıdır.

Şekil 4. OpenAI’nin DALL-E'si kullanılarak oluşturulmuş bir görüntü.
Bunun bilgisayarlı görüyle nasıl bağlantılı olduğunu merak ediyor olabilirsin; sonuçta bu yalnızca üretken yapay zekâ değil mi? Aslında ikisi birbiriyle yakından ilişkilidir. Üretken yapay zekâ, tamamen yeni görsel çıktılar oluşturmak için bilgisayarlı görünün temelleri üzerine kuruludur.
Metin istemlerinden görüntüler oluşturan üretken yapay zekâ modelleri, metinsel açıklamalarla eşleştirilmiş geniş görüntü veri kümeleri üzerinde eğitilir. Bu sayede nesneler, dokular ve uzamsal ilişkiler gibi dil ile görsel kavramlar arasındaki ilişkileri öğrenebilirler.
Bu modeller, geleneksel bilgisayarlı görü sistemlerinin yaptığı gibi görsel verileri, örneğin gerçek dünya görüntülerindeki nesneleri tanımak şeklinde yorumlamaz. Bunun yerine, istemlere dayalı yeni görseller oluşturmak için bu kavramlara ilişkin öğrendikleri anlayışı kullanırlar. Üretken yapay zekâ, bu bilgiyi iyi hazırlanmış istemlerle birleştirerek kullanıcının girdisiyle eşleşen gerçekçi ve ayrıntılı görüntüler üretebilir.
Soru yanıtlama (QA)#
Soru yanıtlama sistemleri, doğal dildeki soruları anlamak ve doğru, ilgili yanıtlar sağlamak üzere tasarlanmıştır. Sorguları yorumlamak ve yanıtlamak için bilgi erişimi, anlamsal anlama ve derin öğrenme gibi teknikleri kullanırlar.
OpenAI’nin GPT-4o'su gibi gelişmiş modeller, görsel soru yanıtlamayı (VQA) gerçekleştirebilir; yani görüntüleri analiz edip bunlarla ilgili soruları yanıtlayabilir. Ancak GPT-4o doğrudan bilgisayarlı görü görevlerini gerçekleştirmez. Bunun yerine görüntüleri işlemek, özellikleri çıkarmak ve yanıtlar sağlamak üzere bunları dil anlayışıyla birleştirmek için özel bir görüntü kodlayıcı kullanır.

Şekil 5. ChatGPT’nin görsel soru yanıtlama yeteneği. Görüntü yazara aittir.
Diğer sistemler bilgisayarlı görü yeteneklerini tamamen entegre ederek bir adım daha ileri gidebilir. Bu sistemler nesneleri, sahneleri veya metinleri tanımlamak için görüntüleri ya da videoları doğrudan analiz edebilir. Doğal dil işleme ile birleştirildiklerinde görsel içerikle ilgili daha karmaşık soruları ele alabilirler. Örneğin görsel öğeleri algılayıp yorumlayarak “Bu görüntüde hangi nesneler var?” veya “Bu görüntüde kim var?” sorularını yanıtlayabilirler.
Sıfır atışlı öğrenme (ZSL)#
Sıfır atışlı öğrenme (ZSL), yapay zekâ modellerinin yeni ve daha önce görülmemiş görevleri, bu görevler üzerinde özel olarak eğitilmeden gerçekleştirmesini sağlayan bir makine öğrenmesi yöntemidir. Modelin zaten bildiklerini (görülmüş sınıfları) yeni ve daha önce görülmemiş kategorilerle ilişkilendirmek için açıklamalar veya anlamsal ilişkiler gibi ek bilgiler kullanır.
Doğal dil işlemede ZSL, modellerin kelimeler ve kavramlar arasındaki ilişkilere dayanarak eğitim almadıkları konuları anlamasına ve bunlarla çalışmasına yardımcı olur. Benzer şekilde bilgisayarlı göründe ZSL, görsel özellikleri (kanatlar veya tüyler gibi) kuşlar gibi bilinen kavramlarla ilişkilendirerek modellerin daha önce hiç karşılaşmadıkları nesneleri veya sahneleri tanımasını sağlar.
ZSL, dil anlayışını görsel tanımayla birleştirerek NLP ve CV'yi birbirine bağlar ve her ikisini de içeren görevlerde özellikle kullanışlı hâle gelir. Örneğin görsel soru yanıtlamada model, doğru bir yanıt sağlamak için bir görüntüyü analiz ederken bununla ilişkili bir soruyu anlayabilir. Görüntü açıklaması oluşturma gibi görevlerde de kullanışlıdır.
Önemli çıkarımlar#
Doğal dil işleme ile bilgisayarlı görünün bir araya getirilmesi, hem metinleri hem de görüntüleri anlayabilen yapay zekâ sistemlerinin ortaya çıkmasını sağladı. Bu birleşim, otonom araçların yol işaretlerini okumasına yardımcı olmaktan tıbbi teşhisleri iyileştirmeye ve sosyal medyayı daha güvenli hâle getirmeye kadar birçok sektörde kullanılıyor. Bu teknolojiler geliştikçe hayatı kolaylaştırmaya ve çok çeşitli alanlarda yeni fırsatlar sunmaya devam edecekler. Daha fazla bilgi edinmek için GitHub depomuzu ziyaret et ve topluluğumuzla etkileşim kur. Çözüm sayfalarımızda otonom araçlar ve tarım alanlarındaki yapay zekâ uygulamalarını keşfet. 🚀









