YOLO Vision 2026:
Yapay Zeka Görüşü

Bilgisayarlı görü görevleri için Google Gemini 2.5 ile uygulamalı çalışmaya başla

Nesne tespiti, görsel altyazı oluşturma ve Görüntüleme Yapay Zekası çözümleri için OCR gibi bilgisayarlı görü görevlerinde Google Gemini 2.5 ile nasıl uygulamalı çalışabileceğini gör.

ABAbirami Vina5 min read
Bilgisayarlı görü görevleri için Google Gemini 2.5 kullanma

Yapay zeka alanındaki gelişmeler hızla ilerliyor ve neredeyse her gün yeni yenilikler manşetlere taşıyor. Bu tür yakın dönüm noktalarından biri de Google DeepMind'ın 26 Mart'ta piyasaya sürdüğü en son çok modlu modeli Gemini 2.5'tir. Geleneksel Large Language Models (LLMs), insan benzeri metinler üretmek amacıyla devasa veri miktarlarından öğrenebilirken, Gemini 2.5 bunun çok ötesine geçiyor.

Görselleri, sesleri ve videoları işleyebilen bir "düşünme modeli" olarak tasarlanmıştır. Gelişmiş akıl yürütme ve kodlama becerilerine sahiptir. İlginç bir şekilde, makinelerin nesne tespiti, görsel açıklaması ve optik karakter tanıma (OCR) gibi görsel verileri yorumlayıp analiz ettiği computer vision tasks konusunda da son derece iyi performans gösteriyor.

Using Gemini 2.5 to understand the contents of an image

Şekil 1. Bir görüntünün içeriğini anlamak için Gemini 2.5 kullanımına bir örnek.

Bu makalede, Gemini 2.5'in bilgisayarla görü yeteneklerini uygulamalı olarak deneyimlemene yardımcı olabilecek Ultralytics not defterlerinden birini inceleyeceğiz. Ayrıca Gemini 2.5'in temel özelliklerine daha yakından bakacak ve gerçek dünya uygulamaları için computer vision solutions oluşturmak amacıyla nasıl kullanılabileceğini göstereceğiz. Haydi başlayalım!

Gemini 2.5'e genel bakış: özellikler ve yetenekler#

Gemini 2.5 model serisinde piyasaya sürülen ilk sürüm, Gemini 2.5 Pro'nun deneysel bir sürümüdür. Cevap vermeden önce yanıtları üzerinde düşünerek karmaşık sorunları çözmek üzere tasarlanmıştır. Pekiştirmeli öğrenme (modelin geri bildirimden öğrendiği yer) ve düşünce zinciri istemi (sorunları çözmeye yönelik adım adım bir yaklaşım) gibi yöntemler kullanır.

Temel özelliklerinden biri, 1 milyon token (kabaca bir milyon kelime veya kelime parçası) tutabilen ve 2 milyona çıkması beklenen devasa bağlam penceresidir. Bu, modelin aynı anda çok fazla bilgiyi alabileceği ve daha ayrıntılı ve doğru sonuçlar verebileceği anlamına gelir.

Dili işlemenin yanı sıra, Gemini 2.5 aşağıdaki bilgisayarlı görü görevleri için kullanılabilir:

  • Object detection: Bir görsel içindeki nesneleri tanımlama ve konumlandırma sürecidir. Gözetim veya sürücüsüz araçlar gibi uygulamalarda kullanılabilir.

  • Görüntü altyazılama: Bu görev, bir görüntü için açıklayıcı bir metin oluşturmayı içerir. Görsel içeriği daha erişilebilir ve anlaşılması kolay hale getirir.

  • Optical character recognition: Bu teknoloji, görsellerde bulunan metinleri düzenlenebilir, makine tarafından okunabilir metne dönüştürür. Belgeleri dijitalleştirmek ve veri girişini otomatikleştirmek için faydalıdır.

Google Gemini 2.5'i diğer modellerle kıyaslama ve karşılaştırma#

Günümüzde yapay zeka alanında mevcut olan birkaç çok modlu model olduğundan, Gemini 2.5 Pro'nun bunlarla nasıl kıyaslandığını anlamak önemlidir. Google'ın DeepMind'ı tarafından paylaşılan kıyaslama sonuçlarına göre, Gemini 2.5 Pro bir dizi görevde etkileyici bir performans sergiliyor.

Örneğin, birçok konuyu kapsayan zorlu bir sınavı simüle eden ve ileri düzey muhakeme ve genel bilgiyi test eden İnsanlığın Son Sınavı adlı bir testte, Gemini 2.5 Pro yaklaşık %18,8 puan alarak, %14 civarında puan alan OpenAI'ın o3-mini gibi modellerden daha iyi performans gösteriyor.

An overview of Gemini 2.5 Pro's benchmark performance

Fig 2. Gemini 2.5 Pro'nun kıyaslama performansına genel bir bakış.

Ayrıca matematik ve kodlama zorluklarında da çok iyi performans göstererek genellikle OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta ve DeepSeek R1 gibi modellerin performansıyla eşleşiyor veya onları aşıyor; bu da karmaşık görevleri ele alma ve büyük miktarda veriyi işleme yeteneğini kanıtlıyor.

Gemini 2.5 ile uygulamalı çalışma: Google Gemini API nasıl kullanılır?#

Gemini 2.5 Pro birden fazla platformda mevcuttur. Google AI Studio'da deneyebilir ve Gemini Advanced kullanıcıları için Gemini uygulaması üzerinden erişebilirsiniz. Google DeepMind lansman duyurusunda, modelin yakında Vertex AI'da destekleneceğinden de bahsetti. Bu erişim noktaları, geliştiricilerin Gemini 2.5 Pro'yu gerçek dünya yapay zeka uygulamaları için kullanmasını kolaylaştırıyor.

Ancak Google Gemini API'yi kullanmak, karmaşık bir kurulum olmadan sadece birkaç dakika içinde başlamak ve bilgisayarla görü yeteneklerini daha iyi anlamak istiyorsan, Gemini 2.5 Pro kullanarak nesne tespiti ve görsel açıklaması gibi görevleri sergileyen Ultralytics notebook inceleyebilirsin. Notebook'ta seni nelerin beklediğini ayrıntılı olarak inceleyelim.

Google Gemini 2.5 not defteri ile çıkarım kurulumu#

Ultralytics notebook ile çalışmaya başlamak ve Google Gemini 2.5'i kullanmak için öncelikle Google AI Studio üzerinden bir API anahtarı oluşturman gerekecek. Bu anahtar, modeli kullanabilmen için sana Gemini API erişimi sağlar.

API anahtarını aldıktan sonra, ortamında gerekli kütüphanelerin yüklü olduğundan emin ol; bunlar Ultralytics paketlerini ve Google'ın AI araç setini içerir. Bu adım notebook içinde açıkça belirtilmiştir, böylece çalışma alanını kurmak için talimatları kolayca takip edebilirsin.

Her şey yapılandırıldığında, API anahtarını (aşağıda gösterildiği gibi) girerek Gemini API'sine bağlanabilirsin, bu da çalışma alanın ile model arasında bir bağlantı kurar. Bundan sonra, Gemini 2.5'e görüntü ve metin istemleri göndermeye hazır olacaksın.

Esasen, bir görüntü ve basit bir talimat (örneğin "bu görüntüdeki nesneleri tespit et" veya "ne gördüğünü tarif et") sağlayabilirsin ve model ihtiyacın olan sonuçları döndürür. Bu basit süreç, Gemini 2.5'in bilgisayarlı görü yeteneklerini keşfetmeye başlamayı kolaylaştırır.

Google Gemini 2.5 ile nesne tespiti#

Not defterindeki temel örneklerden biri, Gemini 2.5 Pro kullanarak nesne tespitidir. Bu örnekte, modele bir görüntü ve nesneleri tespit etmesi için basit bir istem sağlarsın.

Model görseli işler ve bulduğu her nesne için bir dizi koordinat ve etiket döndürür; bu koordinatlar normalleştirilmiş biçimde verilir. Ultralytics Python package fonksiyonları daha sonra bu normalleştirilmiş değerleri görselin gerçek boyutlarıyla eşleşecek şekilde dönüştürmek ve aşağıda gösterildiği gibi her nesnenin etrafına net BBox çizmek için kullanılır.

Using Google Gemini 2.5 for object detection

Şekil 3. Nesne tespiti için Google Gemini 2.5 kullanılıyor.

Gemini 2.5 kullanarak görüntü altyazılama#

Notebook'taki bir diğer ilginç örnek ise Gemini 2.5 Pro kullanan image captioning uygulamasıdır. Bu örnekte modele bir görsel ve görselde ne olduğunu açıklayan ayrıntılı bir açıklama oluşturmasını isteyen bir komut (prompt) sağlarsın.

Model daha sonra görsel içeriği analiz eder ve genellikle birden fazla cümle şeklinde biçimlendirilmiş, görüntünün hem içeriğini hem de bağlamını yakalayan bir anlatı döndürür. Bu özellik, erişilebilirliği artırmak, görsel bilgileri özetlemek ve hatta yaratıcı hikaye anlatımını geliştirmek için kullanışlıdır.

Google Gemini modelleri ile OCR doğruluğunu artırma#

Gemini 2.5 Pro'nun görüntülerdeki metni okuma yeteneğini kullanan bir bilgisayarlı görü görevi OCR'dir. Not defterinde, modele metin içeren bir görüntü ve bu metni çıkarması için bir istem sağlayabilirsin. Model görüntüyü işler ve aşağıda gösterildiği gibi hem tespit edilen metni hem de metnin bulunduğu koordinatları döndürür.

Ultralytics Python paketinden alınan fonksiyonlar daha sonra bu normalleştirilmiş koordinatları görselin gerçek boyutlarına dönüştürmek ve metin bölgelerinin etrafına bounding boxes çizmek için kullanılır. Bu açıklama eklenmiş çıktı, metnin nerede bulunduğunu netleştirir; bu da belgeleri dijitalleştirmek, veri girişini otomatikleştirmek ve erişilebilirliği artırmak için faydalıdır.

Extracting textual data in an image using Google Gemini 2.5

Şekil 4. Google Gemini 2.5 kullanarak bir görüntüdeki metinsel verileri çıkarma.

Google Gemini 2.5'in gerçek dünya uygulamaları#

Google Gemini 2.5 Pro'nun çeşitli bilgisayarlı görü görevleri için nasıl kullanılabileceğini incelediğimize göre, bu yeteneklerin kullanılabileceği bazı gerçek dünya uygulamalarını keşfedelim.

Örneğin Gemini 2.5 Pro'nun nesne tespiti yeteneği, büyük görsel setlerini otomatik olarak etiketlemeye ve organize etmeye yardımcı olabilir; bu da dataset oluşturma veya içerik yönetimi gibi görevleri çok daha hızlı hale getirir. Ayrıca perakende ve tarım gibi alanlarda görselleri analiz etmek için de kullanılabilir; örneğin raflardaki ürünleri tespit etmek veya çiftlik fotoğraflarında mahsul stres belirtilerini belirlemek gibi.

Gemini 2.5 Pro analyzing a plant's health

Şekil 5. Gemini 2.5 Pro bir bitkinin sağlığını analiz ediyor.

Bu arada, modelin görüntü altyazılama özelliği, görme engelli kullanıcıların bir görüntüde ne olduğunu anlamalarına yardımcı olabilir. Örneğin, kalabalık bir caddenin fotoğrafına sahipsen, model sahneyi ayrıntılı olarak tanımlayan, araç türlerinden, yayaların hareketlerinden ve hatta ışık ipuçlarına dayalı olarak günün saatinden bahseden bir altyazı üretebilir.

Buna ek olarak, Gemini 2.5'in OCR işlevselliği çeşitli uygulamalarda kullanılabilir. Örneğin, sayfaları veya makbuzları tarayarak basılı belgeleri dijitalleştirebilirsin. Bu yetenek, veri girişi görevlerini otomatikleştirmek, formları işlemek ve hatta kartvizitlerden ve tabelalardan metin okumak için idealdir.

Genel olarak, Google Gemini 2.5 Pro çok çeşitli pratik yapay zeka uygulamalarının kapılarını aralıyor.

Öne çıkanlar#

Metin üretmenin ve analiz etmenin ötesine geçen Google Gemini 2.5 Pro, nesne tespiti, görüntü altyazılama ve OCR gibi bilgisayarlı görü görevleri için kullanılabilir. Devasa bağlam penceresi ve gelişmiş muhakeme yetenekleri ile gerçek dünya senaryolarında iyi çalışan ayrıntılı, bağlama duyarlı sonuçlar üretir.

Yapay zeka modelleri gelişmeye devam ettikçe, Gemini 2.5 Pro gibi araçlar endüstriler genelinde karmaşık sorunları çözmeyi kolaylaştırıyor. Daha fazla organizasyon görsel anlayıştan dil işlemeye kadar çok çeşitli görevleri yerine getirebilen esnek, çok modlu çözümler aradıkça, yapay zekanın daha geniş bir şekilde benimsendiğini görmemiz muhtemeldir.

our community bir parçası ol ve GitHub repository adresimizdeki son teknoloji yapay zeka projeleri hakkında bilgi edin. Çözüm sayfalarımızda Vision AI in agriculture uygulamalarını ve AI in manufacturing rolünü incele. our licensing plans göz at ve hemen computer vision solutions oluşturmaya başla!

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla