Ultralytics YOLO27:
Görüntü Yapay Zekâsı

Bilgisayarlı görü görevleri için Google Gemini 2.5'i uygulamalı olarak kullan

Nesne tespiti, görüntü açıklaması oluşturma ve Vision AI çözümleri için OCR gibi bilgisayarlı görü görevlerinde Google Gemini 2.5'i nasıl uygulamalı olarak kullanabileceğini gör.

ABAbirami Vina7 min read
Bilgisayarlı görü görevleri için Google Gemini 2.5 kullanımı

Yapay zekâ alanındaki gelişmeler hızla ilerliyor ve yeni yenilikler neredeyse her gün manşetlere çıkıyor. Bu yeniliklerden biri, Google DeepMind’ın 26 Mart’ta kullanıma sunduğu en yeni çok modlu modeli Gemini 2.5’tir. Geleneksel Büyük Dil Modelleri (LLMs), insan benzeri metinler oluşturmak için çok büyük miktarda veriden öğrenebilirken Gemini 2.5 bunun ötesine geçiyor.

Bir “düşünen model” olarak tasarlanan Gemini 2.5; görüntüleri, sesi ve videoyu işleyebilir. Gelişmiş akıl yürütme ve kodlama becerilerine sahiptir. İlginç şekilde, makinelerin nesne algılama, görüntü açıklama ve optik karakter tanıma (OCR) gibi görsel verileri yorumlayıp analiz ettiği bilgisayarlı görü görevlerinde de olağanüstü performans gösterir.

Bir görüntünün içeriğini anlamak için Gemini 2.5 kullanımı

Şekil 1. Bir görüntünün içeriğini anlamak için Gemini 2.5 kullanımına örnek.

Bu makalede, Gemini 2.5’in bilgisayarlı görü yeteneklerini uygulamalı olarak keşfetmene yardımcı olabilecek Ultralytics not defterlerinden birini adım adım inceleyeceğiz. Ayrıca Gemini 2.5’in temel özelliklerine daha yakından bakacak ve gerçek dünya uygulamaları için bilgisayarlı görü çözümleri oluşturmak üzere nasıl kullanılabileceğini göstereceğiz. Hadi başlayalım!

Gemini 2.5’e genel bakış: özellikler ve yetenekler#

Yeni yayımlanan Gemini 2.5 model serisinin ilk sürümü, Gemini 2.5 Pro’nun deneysel sürümüdür. Yanıt vermeden önce yanıtları üzerinde düşünerek karmaşık sorunları ele alacak şekilde tasarlanmıştır. Pekiştirmeli öğrenme (modelin geri bildirimlerden öğrendiği yöntem) ve düşünce zinciri istemleri (sorunları adım adım çözme yaklaşımı) gibi yöntemleri kullanır.

Temel özelliklerinden biri, 1 milyon token (yaklaşık 1 milyon kelime veya kelime parçası) alabilen ve 2 milyona çıkması beklenen devasa bağlam penceresidir. Bu, modelin aynı anda çok miktarda bilgi alabilmesi ve bunun sonucunda daha ayrıntılı ve doğru sonuçlar üretebilmesi anlamına gelir.

Dil işlemenin yanı sıra Gemini 2.5, aşağıdaki bilgisayarlı görü görevleri için kullanılabilir:

  • Nesne algılama: Bir görüntüdeki nesneleri tanımlama ve konumlandırma işlemidir. Gözetim veya otonom araçlar gibi uygulamalarda kullanılabilir.

  • Görüntü açıklama: Bu görev, bir görüntü için açıklayıcı metin oluşturmayı içerir. Görsel içeriği daha erişilebilir ve anlaşılır hâle getirir.

  • Optik karakter tanıma: Bu teknoloji, görüntülerde bulunan metinleri düzenlenebilir ve makine tarafından okunabilir metne dönüştürür. Belgeleri dijitalleştirmek ve veri girişini otomatikleştirmek için kullanışlıdır.

Google Gemini 2.5’in diğer modellerle kıyaslanması ve karşılaştırılması#

Günümüzde yapay zekâ alanında kullanılabilen çeşitli çok modlu modeller bulunuyor; bu nedenle Gemini 2.5 Pro’nun bunlarla nasıl karşılaştırıldığını anlamak önemlidir. Google DeepMind tarafından paylaşılan kıyaslama sonuçlarına göre Gemini 2.5 Pro, çeşitli görevlerde etkileyici bir performans sergiliyor.

Örneğin, birçok konuyu kapsayan zorlu bir sınavı simüle eden ve ileri düzey akıl yürütme ile genel bilgiyi test eden Humanity’s Last Exam adlı testte Gemini 2.5 Pro yaklaşık %18,8 puan alırken OpenAI’nin yaklaşık %14 puan alan o3-mini gibi modellerini geride bırakıyor.

Gemini 2.5 Pro’nun kıyaslama performansına genel bakış

Şekil 2. Gemini 2.5 Pro’nun kıyaslama performansına genel bakış.

Matematik ve kodlama alanındaki zorluklarda da çok iyi performans gösterir; çoğu zaman OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta ve DeepSeek R1 gibi modellerin performansına yetişir veya onları geçer. Bu da karmaşık görevleri ele alma ve büyük miktarda veriyi işleme becerisini gösterir.

Gemini 2.5’i uygulamalı olarak keşfetme: Google Gemini API nasıl kullanılır?#

Gemini 2.5 Pro birden fazla platformda kullanılabilir. Google AI Studio’da deneyebilir ve Gemini Advanced kullanıcıları için Gemini uygulaması üzerinden erişebilirsin. Google DeepMind, lansman duyurusunda modelin yakında Vertex AI üzerinde de destekleneceğini belirtti. Bu erişim noktaları, geliştiricilerin Gemini 2.5 Pro’yu gerçek dünya yapay zekâ uygulamalarında kullanmasını kolaylaştırıyor.

Ancak Google Gemini API’yi kullanmak, karmaşık bir kurulumla uğraşmadan birkaç dakika içinde başlamak ve bilgisayarlı görü yeteneklerini daha iyi anlamak istiyorsan nesne algılama ve görüntü açıklama gibi görevleri Gemini 2.5 Pro ile gösteren Ultralytics not defterine göz atabilirsin. Not defterinde seni nelerin beklediğini ayrıntılı olarak inceleyelim.

Google Gemini 2.5 not defteriyle çıkarım kurulumu#

Başlamak ve Ultralytics not defteriyle Google Gemini 2.5’i kullanmak için öncelikle Google AI Studio üzerinden bir API anahtarı oluşturman gerekir. Bu anahtar, modeli kullanabilmen için Gemini API’ye erişim sağlar.

API anahtarını aldıktan sonra ortamında gerekli kitaplıkların yüklü olduğundan emin ol; bunlar arasında Ultralytics ve Google’ın yapay zekâ araç setine ait paketler bulunur. Bu adım not defterinde açıkça anlatıldığı için çalışma alanını kurarken talimatları kolayca takip edebilirsin.

Her şeyi yapılandırdıktan sonra, aşağıda gösterildiği gibi API anahtarını girerek Gemini API’ye bağlanabilirsin; bu işlem çalışma alanın ile model arasında bir bağlantı oluşturur. Ardından görüntüleri ve metin istemlerini Gemini 2.5’e göndermeye hazır olursun.

Temel olarak modele bir görüntü ve basit bir talimat (“bu görüntüdeki nesneleri algıla” veya “gördüklerini açıkla” gibi) verebilirsin; model de ihtiyacın olan sonuçları döndürür. Bu basit süreç, Gemini 2.5’in bilgisayarlı görü yeteneklerini keşfetmeye başlamanı kolaylaştırır.

Google Gemini 2.5 ile nesne algılama#

Not defterindeki temel örneklerden biri, Gemini 2.5 Pro kullanarak nesne algılamadır. Bu örnekte modele bir görüntü ve nesneleri algılamasını isteyen basit bir istem verirsin.

Model görüntüyü işler ve bulduğu her nesne için bir dizi koordinat ile etiket döndürür; bu koordinatlar normalize edilmiş biçimdedir. Ardından Ultralytics Python paketindeki işlevler, bu normalize edilmiş değerleri görüntünün gerçek boyutlarıyla eşleşecek şekilde dönüştürmek ve aşağıda gösterildiği gibi her nesnenin çevresine net sınırlayıcı kutular çizmek için kullanılır.

Google Gemini 2.5 ile nesne algılama

Şekil 3. Google Gemini 2.5 ile nesne algılama.

Gemini 2.5 ile görüntü açıklama#

Not defterindeki bir diğer ilginç örnek, Gemini 2.5 Pro kullanarak görüntü açıklamadır. Bu örnekte modele bir görüntü ve görüntüde ne olduğunu ayrıntılı şekilde açıklayan bir alt yazı oluşturmasını isteyen bir istem verirsin.

Model daha sonra görsel içeriği analiz eder ve görüntünün hem içeriğini hem de bağlamını yansıtan, çoğu zaman birden fazla cümle şeklinde biçimlendirilmiş bir anlatı döndürür. Bu özellik erişilebilirliği geliştirmek, görsel bilgileri özetlemek ve hatta yaratıcı hikâye anlatımını zenginleştirmek için kullanışlıdır.

Google Gemini modelleriyle OCR doğruluğunu artırma#

Gemini 2.5 Pro’nun görüntülerdeki metinleri okuma yeteneğinden yararlanan bir bilgisayarlı görü görevi OCR’dir. Not defterinde modele metin içeren bir görüntüyle birlikte bu metni çıkarmasını isteyen bir istem verebilirsin. Model görüntüyü işler ve aşağıda gösterildiği gibi hem algılanan metni hem de metnin bulunduğu koordinatları döndürür.

Ardından Ultralytics Python paketindeki işlevler, bu normalize edilmiş koordinatları görüntünün gerçek boyutlarına dönüştürmek ve metin bölgelerinin çevresine sınırlayıcı kutular çizmek için kullanılır. Bu işaretlenmiş çıktı, metnin nerede bulunduğunu net bir şekilde gösterir; bu da belgeleri dijitalleştirmek, veri girişini otomatikleştirmek ve erişilebilirliği geliştirmek için kullanışlıdır.

Google Gemini 2.5 ile görüntüdeki metinsel verileri çıkarma

Şekil 4. Google Gemini 2.5 ile görüntüdeki metinsel verileri çıkarma.

Google Gemini 2.5’in gerçek dünya uygulamaları#

Google Gemini 2.5 Pro’nun çeşitli bilgisayarlı görü görevlerinde nasıl kullanılabildiğini incelediğimize göre, şimdi bu yeteneklerden yararlanılabilecek bazı gerçek dünya uygulamalarını keşfedelim.

Örneğin Gemini 2.5 Pro’nun nesne algılama yeteneği, büyük görüntü kümelerini otomatik olarak etiketlemeye ve düzenlemeye yardımcı olarak veri kümeleri oluşturma veya içerik yönetimi gibi görevleri çok daha hızlı hâle getirebilir. Ayrıca perakende ve tarım gibi alanlarda görüntüleri analiz etmek için de kullanılabilir; örneğin raflardaki ürünleri algılayabilir veya tarla fotoğraflarında bitkilerdeki stres belirtilerini tespit edebilir.

Gemini 2.5 Pro bir bitkinin sağlığını analiz ediyor

Şekil 5. Gemini 2.5 Pro bir bitkinin sağlığını analiz ediyor.

Bu sırada modelin görüntü açıklama özelliği, görme engelli kullanıcıların bir görüntüde ne olduğunu anlamasına yardımcı olabilir. Örneğin yoğun bir caddenin fotoğrafına sahipsen model; araç türlerinden, yayaların hareketliliğinden ve hatta ışık ipuçlarına dayanarak günün hangi saati olduğundan bahsederek sahneyi ayrıntılı şekilde açıklayan bir alt yazı oluşturabilir.

Buna ek olarak Gemini 2.5’in OCR işlevi çeşitli uygulamalarda kullanılabilir. Örneğin sayfaları veya fişleri tarayarak basılı belgeleri dijitalleştirebilirsin. Bu yetenek, veri girişi görevlerini otomatikleştirmek, formları işlemek veya kartvizitler ile tabelalardaki metinleri okumak için idealdir.

Genel olarak Google Gemini 2.5 Pro, çok çeşitli pratik yapay zekâ uygulamasının önünü açıyor.

Önemli çıkarımlar#

Google Gemini 2.5 Pro, metin oluşturmaya ve analiz etmeye ek olarak nesne algılama, görüntü açıklama ve OCR gibi bilgisayarlı görü görevleri için de kullanılabilir. Devasa bağlam penceresi ve gelişmiş akıl yürütme yetenekleri sayesinde gerçek dünya senaryolarında iyi çalışan, ayrıntılı ve bağlamı dikkate alan sonuçlar üretir.

Yapay zekâ modelleri gelişmeye devam ederken Gemini 2.5 Pro gibi araçlar, sektörler genelindeki karmaşık sorunları çözmeyi kolaylaştırıyor. Daha fazla kuruluş görsel anlamadan dil işlemeye kadar geniş bir görev yelpazesini ele alabilen esnek ve çok modlu çözümler aradıkça yapay zekânın daha geniş ölçekte benimsenmesi muhtemel.

Topluluğumuzun bir parçası ol ve en yeni yapay zekâ projeleri hakkında GitHub depomuzdan bilgi edin. Çözümler sayfalarımızda tarımda Vision AI uygulamalarını ve üretimde yapay zekânın rolünü keşfet. Lisans planlarımızı incele ve bugün bilgisayarlı görü çözümleri geliştir!

Explore solutions

Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin

Yapay zekânın geleceğini birlikte inşa edelim!

Makine öğreniminin geleceğiyle yolculuğuna başla