Bilgisayarlı görü görevleri için Google Gemini 2.5'i uygulamalı olarak kullan
Nesne tespiti, görüntü açıklaması oluşturma ve Vision AI çözümleri için OCR gibi bilgisayarlı görü görevlerinde Google Gemini 2.5'i nasıl uygulamalı olarak kullanabileceğini gör.

Yapay zekâ alanındaki gelişmeler hızla ilerliyor ve yeni yenilikler neredeyse her gün manşetlere çıkıyor. Bu yeniliklerden biri, Google DeepMind’ın 26 Mart’ta kullanıma sunduğu en yeni çok modlu modeli Gemini 2.5’tir. Geleneksel Büyük Dil Modelleri (LLMs), insan benzeri metinler oluşturmak için çok büyük miktarda veriden öğrenebilirken Gemini 2.5 bunun ötesine geçiyor.
Bir “düşünen model” olarak tasarlanan Gemini 2.5; görüntüleri, sesi ve videoyu işleyebilir. Gelişmiş akıl yürütme ve kodlama becerilerine sahiptir. İlginç şekilde, makinelerin nesne algılama, görüntü açıklama ve optik karakter tanıma (OCR) gibi görsel verileri yorumlayıp analiz ettiği bilgisayarlı görü görevlerinde de olağanüstü performans gösterir.

Şekil 1. Bir görüntünün içeriğini anlamak için Gemini 2.5 kullanımına örnek.
Bu makalede, Gemini 2.5’in bilgisayarlı görü yeteneklerini uygulamalı olarak keşfetmene yardımcı olabilecek Ultralytics not defterlerinden birini adım adım inceleyeceğiz. Ayrıca Gemini 2.5’in temel özelliklerine daha yakından bakacak ve gerçek dünya uygulamaları için bilgisayarlı görü çözümleri oluşturmak üzere nasıl kullanılabileceğini göstereceğiz. Hadi başlayalım!
Gemini 2.5’e genel bakış: özellikler ve yetenekler#
Yeni yayımlanan Gemini 2.5 model serisinin ilk sürümü, Gemini 2.5 Pro’nun deneysel sürümüdür. Yanıt vermeden önce yanıtları üzerinde düşünerek karmaşık sorunları ele alacak şekilde tasarlanmıştır. Pekiştirmeli öğrenme (modelin geri bildirimlerden öğrendiği yöntem) ve düşünce zinciri istemleri (sorunları adım adım çözme yaklaşımı) gibi yöntemleri kullanır.
Temel özelliklerinden biri, 1 milyon token (yaklaşık 1 milyon kelime veya kelime parçası) alabilen ve 2 milyona çıkması beklenen devasa bağlam penceresidir. Bu, modelin aynı anda çok miktarda bilgi alabilmesi ve bunun sonucunda daha ayrıntılı ve doğru sonuçlar üretebilmesi anlamına gelir.
Dil işlemenin yanı sıra Gemini 2.5, aşağıdaki bilgisayarlı görü görevleri için kullanılabilir:
-
Nesne algılama: Bir görüntüdeki nesneleri tanımlama ve konumlandırma işlemidir. Gözetim veya otonom araçlar gibi uygulamalarda kullanılabilir.
-
Görüntü açıklama: Bu görev, bir görüntü için açıklayıcı metin oluşturmayı içerir. Görsel içeriği daha erişilebilir ve anlaşılır hâle getirir.
-
Optik karakter tanıma: Bu teknoloji, görüntülerde bulunan metinleri düzenlenebilir ve makine tarafından okunabilir metne dönüştürür. Belgeleri dijitalleştirmek ve veri girişini otomatikleştirmek için kullanışlıdır.
Google Gemini 2.5’in diğer modellerle kıyaslanması ve karşılaştırılması#
Günümüzde yapay zekâ alanında kullanılabilen çeşitli çok modlu modeller bulunuyor; bu nedenle Gemini 2.5 Pro’nun bunlarla nasıl karşılaştırıldığını anlamak önemlidir. Google DeepMind tarafından paylaşılan kıyaslama sonuçlarına göre Gemini 2.5 Pro, çeşitli görevlerde etkileyici bir performans sergiliyor.
Örneğin, birçok konuyu kapsayan zorlu bir sınavı simüle eden ve ileri düzey akıl yürütme ile genel bilgiyi test eden Humanity’s Last Exam adlı testte Gemini 2.5 Pro yaklaşık %18,8 puan alırken OpenAI’nin yaklaşık %14 puan alan o3-mini gibi modellerini geride bırakıyor.

Şekil 2. Gemini 2.5 Pro’nun kıyaslama performansına genel bakış.
Matematik ve kodlama alanındaki zorluklarda da çok iyi performans gösterir; çoğu zaman OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta ve DeepSeek R1 gibi modellerin performansına yetişir veya onları geçer. Bu da karmaşık görevleri ele alma ve büyük miktarda veriyi işleme becerisini gösterir.
Gemini 2.5’i uygulamalı olarak keşfetme: Google Gemini API nasıl kullanılır?#
Gemini 2.5 Pro birden fazla platformda kullanılabilir. Google AI Studio’da deneyebilir ve Gemini Advanced kullanıcıları için Gemini uygulaması üzerinden erişebilirsin. Google DeepMind, lansman duyurusunda modelin yakında Vertex AI üzerinde de destekleneceğini belirtti. Bu erişim noktaları, geliştiricilerin Gemini 2.5 Pro’yu gerçek dünya yapay zekâ uygulamalarında kullanmasını kolaylaştırıyor.
Ancak Google Gemini API’yi kullanmak, karmaşık bir kurulumla uğraşmadan birkaç dakika içinde başlamak ve bilgisayarlı görü yeteneklerini daha iyi anlamak istiyorsan nesne algılama ve görüntü açıklama gibi görevleri Gemini 2.5 Pro ile gösteren Ultralytics not defterine göz atabilirsin. Not defterinde seni nelerin beklediğini ayrıntılı olarak inceleyelim.
Google Gemini 2.5 not defteriyle çıkarım kurulumu#
Başlamak ve Ultralytics not defteriyle Google Gemini 2.5’i kullanmak için öncelikle Google AI Studio üzerinden bir API anahtarı oluşturman gerekir. Bu anahtar, modeli kullanabilmen için Gemini API’ye erişim sağlar.
API anahtarını aldıktan sonra ortamında gerekli kitaplıkların yüklü olduğundan emin ol; bunlar arasında Ultralytics ve Google’ın yapay zekâ araç setine ait paketler bulunur. Bu adım not defterinde açıkça anlatıldığı için çalışma alanını kurarken talimatları kolayca takip edebilirsin.
Her şeyi yapılandırdıktan sonra, aşağıda gösterildiği gibi API anahtarını girerek Gemini API’ye bağlanabilirsin; bu işlem çalışma alanın ile model arasında bir bağlantı oluşturur. Ardından görüntüleri ve metin istemlerini Gemini 2.5’e göndermeye hazır olursun.
Temel olarak modele bir görüntü ve basit bir talimat (“bu görüntüdeki nesneleri algıla” veya “gördüklerini açıkla” gibi) verebilirsin; model de ihtiyacın olan sonuçları döndürür. Bu basit süreç, Gemini 2.5’in bilgisayarlı görü yeteneklerini keşfetmeye başlamanı kolaylaştırır.
Google Gemini 2.5 ile nesne algılama#
Not defterindeki temel örneklerden biri, Gemini 2.5 Pro kullanarak nesne algılamadır. Bu örnekte modele bir görüntü ve nesneleri algılamasını isteyen basit bir istem verirsin.
Model görüntüyü işler ve bulduğu her nesne için bir dizi koordinat ile etiket döndürür; bu koordinatlar normalize edilmiş biçimdedir. Ardından Ultralytics Python paketindeki işlevler, bu normalize edilmiş değerleri görüntünün gerçek boyutlarıyla eşleşecek şekilde dönüştürmek ve aşağıda gösterildiği gibi her nesnenin çevresine net sınırlayıcı kutular çizmek için kullanılır.

Şekil 3. Google Gemini 2.5 ile nesne algılama.
Gemini 2.5 ile görüntü açıklama#
Not defterindeki bir diğer ilginç örnek, Gemini 2.5 Pro kullanarak görüntü açıklamadır. Bu örnekte modele bir görüntü ve görüntüde ne olduğunu ayrıntılı şekilde açıklayan bir alt yazı oluşturmasını isteyen bir istem verirsin.
Model daha sonra görsel içeriği analiz eder ve görüntünün hem içeriğini hem de bağlamını yansıtan, çoğu zaman birden fazla cümle şeklinde biçimlendirilmiş bir anlatı döndürür. Bu özellik erişilebilirliği geliştirmek, görsel bilgileri özetlemek ve hatta yaratıcı hikâye anlatımını zenginleştirmek için kullanışlıdır.
Google Gemini modelleriyle OCR doğruluğunu artırma#
Gemini 2.5 Pro’nun görüntülerdeki metinleri okuma yeteneğinden yararlanan bir bilgisayarlı görü görevi OCR’dir. Not defterinde modele metin içeren bir görüntüyle birlikte bu metni çıkarmasını isteyen bir istem verebilirsin. Model görüntüyü işler ve aşağıda gösterildiği gibi hem algılanan metni hem de metnin bulunduğu koordinatları döndürür.
Ardından Ultralytics Python paketindeki işlevler, bu normalize edilmiş koordinatları görüntünün gerçek boyutlarına dönüştürmek ve metin bölgelerinin çevresine sınırlayıcı kutular çizmek için kullanılır. Bu işaretlenmiş çıktı, metnin nerede bulunduğunu net bir şekilde gösterir; bu da belgeleri dijitalleştirmek, veri girişini otomatikleştirmek ve erişilebilirliği geliştirmek için kullanışlıdır.

Şekil 4. Google Gemini 2.5 ile görüntüdeki metinsel verileri çıkarma.
Google Gemini 2.5’in gerçek dünya uygulamaları#
Google Gemini 2.5 Pro’nun çeşitli bilgisayarlı görü görevlerinde nasıl kullanılabildiğini incelediğimize göre, şimdi bu yeteneklerden yararlanılabilecek bazı gerçek dünya uygulamalarını keşfedelim.
Örneğin Gemini 2.5 Pro’nun nesne algılama yeteneği, büyük görüntü kümelerini otomatik olarak etiketlemeye ve düzenlemeye yardımcı olarak veri kümeleri oluşturma veya içerik yönetimi gibi görevleri çok daha hızlı hâle getirebilir. Ayrıca perakende ve tarım gibi alanlarda görüntüleri analiz etmek için de kullanılabilir; örneğin raflardaki ürünleri algılayabilir veya tarla fotoğraflarında bitkilerdeki stres belirtilerini tespit edebilir.

Şekil 5. Gemini 2.5 Pro bir bitkinin sağlığını analiz ediyor.
Bu sırada modelin görüntü açıklama özelliği, görme engelli kullanıcıların bir görüntüde ne olduğunu anlamasına yardımcı olabilir. Örneğin yoğun bir caddenin fotoğrafına sahipsen model; araç türlerinden, yayaların hareketliliğinden ve hatta ışık ipuçlarına dayanarak günün hangi saati olduğundan bahsederek sahneyi ayrıntılı şekilde açıklayan bir alt yazı oluşturabilir.
Buna ek olarak Gemini 2.5’in OCR işlevi çeşitli uygulamalarda kullanılabilir. Örneğin sayfaları veya fişleri tarayarak basılı belgeleri dijitalleştirebilirsin. Bu yetenek, veri girişi görevlerini otomatikleştirmek, formları işlemek veya kartvizitler ile tabelalardaki metinleri okumak için idealdir.
Genel olarak Google Gemini 2.5 Pro, çok çeşitli pratik yapay zekâ uygulamasının önünü açıyor.
Önemli çıkarımlar#
Google Gemini 2.5 Pro, metin oluşturmaya ve analiz etmeye ek olarak nesne algılama, görüntü açıklama ve OCR gibi bilgisayarlı görü görevleri için de kullanılabilir. Devasa bağlam penceresi ve gelişmiş akıl yürütme yetenekleri sayesinde gerçek dünya senaryolarında iyi çalışan, ayrıntılı ve bağlamı dikkate alan sonuçlar üretir.
Yapay zekâ modelleri gelişmeye devam ederken Gemini 2.5 Pro gibi araçlar, sektörler genelindeki karmaşık sorunları çözmeyi kolaylaştırıyor. Daha fazla kuruluş görsel anlamadan dil işlemeye kadar geniş bir görev yelpazesini ele alabilen esnek ve çok modlu çözümler aradıkça yapay zekânın daha geniş ölçekte benimsenmesi muhtemel.
Topluluğumuzun bir parçası ol ve en yeni yapay zekâ projeleri hakkında GitHub depomuzdan bilgi edin. Çözümler sayfalarımızda tarımda Vision AI uygulamalarını ve üretimde yapay zekânın rolünü keşfet. Lisans planlarımızı incele ve bugün bilgisayarlı görü çözümleri geliştir!









