Ultralytics YOLO27:
Görüntü Yapay Zekâsı

FastVLM: Apple Yeni Hızlı Görü-Dil Modelini Tanıtıyor

Apple, CVPR 2025'te FastVLM'yi tanıttı. Bu açık kaynaklı görü-dil modeli, ilk belirtece kadar geçen sürede 85 kata varan hız sağlayan FastViTHD kodlayıcısına sahip.

ABAbirami Vina7 min read
Apple'ın hızlı görü-dil modeli FastVLM

CVPR 2025 konferansında Apple, FastVLM adlı yeni bir açık kaynaklı AI modelini tanıttı. Model, hem görüntüleri hem de dili anlamak üzere tasarlandı ve iPhone, iPad ve Mac gibi Apple cihazlarında çalışıyor. Bu sayede verilerini buluta göndermeden hızlı ve akıllı sonuçlar sunabiliyor.

FastVLM'yi özellikle ilgi çekici kılan şey, ne kadar hızlı ve verimli olduğudur. Apple, modelin yüksek kaliteli görüntüleri daha az bellek ve güç kullanarak yorumlamasına yardımcı olan FastViTHD adlı yeni bir görsel kodlayıcı geliştirdi. Tüm işlemler cihazda yerel olarak gerçekleştirilir; böylece kullanıcı gizliliği korunurken daha hızlı yanıt süreleri elde edilir.

Bu makalede FastVLM'nin nasıl çalıştığını, onu farklı kılan özellikleri ve Apple'ın bu sürümünün cihazlarındaki günlük AI uygulamaları için neden önemli bir ilerleme olabileceğini inceleyeceğiz.

Görsel-dil modellerini (VLM'ler) anlama#

FastVLM'yi özel kılan şeylere geçmeden önce, adındaki “VLM” kısaltmasının ne anlama geldiğine bakalım. Bu ifade, görsel içeriği dille anlamak ve ilişkilendirmek üzere tasarlanmış bir görsel-dil modelini ifade eder.

VLM'ler görsel anlama ile dili bir araya getirerek fotoğraf açıklama, ekran görüntüsüyle ilgili soruları yanıtlama veya bir belgeden metin çıkarma gibi görevleri gerçekleştirebilir. Görsel-dil modelleri genellikle iki bölümden oluşur: biri görüntüyü işler ve veriye dönüştürür, diğeri ise bu veriyi yorumlayarak okuyabileceğin veya duyabileceğin bir yanıt oluşturur.

Farkında olmadan bu tür bir AI yeniliğini zaten kullanmış olabilirsin. Fişleri tarayan, kimlik kartlarını okuyan, görüntü açıklamaları oluşturan veya görme yetisi düşük kişilerin ekranlarıyla etkileşim kurmasına yardımcı olan uygulamalar, genellikle arka planda sessizce çalışan görsel-dil modellerine dayanır.

FastVLM nedir?#

Apple, FastVLM'yi diğer görsel-dil modelleriyle aynı görevleri daha yüksek hız, daha güçlü gizlilik ve kendi cihazlarında optimize edilmiş performansla gerçekleştirecek şekilde geliştirdi. Bir görüntünün içeriğini anlayıp metinle yanıt verebilir; ancak bulut sunucularına dayanan birçok modelin aksine FastVLM tamamen iPhone, iPad veya Mac'inde çalışabilir.

VLM'ler genellikle yüksek çözünürlüklü görüntülerle daha iyi performans gösterir. Örneğin aşağıda gösterildiği gibi FastVLM, bir sokak levhasını “Girilmez” olarak yalnızca görüntünün yüksek çözünürlüklü sürümü verildiğinde doğru şekilde tanımlayabildi. Ancak yüksek çözünürlüklü girdiler genellikle modelleri yavaşlatır. FastViTHD tam da bu noktada fark yaratır.

FastVLM'nin düşük ve yüksek çözünürlüklü görüntülerdeki performansı

Şekil 1. FastVLM'nin düşük ve yüksek çözünürlüklü görüntülerdeki performansı. (Kaynak)

Apple'ın yeni görsel kodlayıcısı FastViTHD, FastVLM'nin yüksek kaliteli görüntüleri daha az bellek ve güç kullanarak daha verimli işlemesine yardımcı olur. FastViTHD, özellikle küçük cihazlarda bile sorunsuz çalışabilecek kadar hafiftir.

FastVLM ayrıca FastVLM GitHub deposunda herkese açık olarak sunuluyor. Geliştiriciler burada kaynak koduna erişebilir, değişiklikler yapabilir ve Apple'ın lisans koşullarına uygun olarak bu modeli kendi uygulamalarında kullanabilir.

FastVLM'yi diğer VLM modelleriyle karşılaştırma#

Diğer görsel-dil modelleriyle karşılaştırıldığında FastVLM, akıllı telefonlar ve dizüstü bilgisayarlar gibi günlük cihazlarda çalışacak şekilde optimize edilmiştir. Performans testlerinde FastVLM, ilk kelimesini veya çıktısını LLaVA-OneVision-0.5B gibi modellere kıyasla 85 kata kadar daha hızlı oluşturdu.

FastVLM'nin diğer modellerle performans karşılaştırması

Şekil 2. FastVLM'nin diğer modellerle performans karşılaştırması. (Kaynak)

FastVLM'nin değerlendirildiği standart kıyaslamalardan bazılarına göz atalım:

  • DocVQA (Belgelerde Görsel Soru Yanıtlama): Bu kıyaslama, modelin taranmış formlar veya sayfalar gibi belgelerdeki metinsel bilgileri ne kadar iyi okuyup anlayabildiğini değerlendirir.
  • TextVQA (Metin Tabanlı Görsel Soru Yanıtlama): Modelin gömülü metin içeren görüntüleri yorumlama ve ilgili soruları doğru şekilde yanıtlama becerisini ölçer.
  • GQA (Grafik Soru Yanıtlama): Bu görev, modelin bir görüntü içindeki nesneler ve sahneler arasındaki ilişkileri anlamasını gerektirerek akıl yürütme becerilerini test eder.
  • MMMU (Kapsamlı Çok Disiplinli Çok Modlu Anlama): Görsel ve metinsel kavrayışı bir araya getirerek modelin çok çeşitli akademik konu ve formatlardaki performansını ölçer.
  • SeedBench (Kıyaslama için Geliştirilmiş Verilerin Standart Değerlendirmesi): Bu kıyaslama, modelin birden çok alandaki genel görsel anlama ve akıl yürütme yeteneklerini inceler.

FastVLM, bu kıyaslamalar genelinde daha az kaynak kullanırken rekabetçi sonuçlar elde etti. Telefonlar, tabletler ve dizüstü bilgisayarlar gibi günlük cihazlara pratik görsel AI özellikleri getiriyor.

FastVLM'nin verimli görsel kodlayıcısı: FastViTHD#

Şimdi, FastVLM'nin görüntü işleme performansında kritik bir rol oynayan görsel kodlayıcı FastViTHD'ye daha yakından bakalım.

Görsel-dil modellerinin çoğu, görüntüyü token adı verilen binlerce küçük parçaya böler. Token sayısı arttıkça modelin görüntüyü anlamak için ihtiyaç duyduğu zaman ve güç de artar. Bu durum özellikle telefonlarda veya dizüstü bilgisayarlarda işlemleri yavaşlatabilir.

Bir görsel kodlayıcının görüntüyü işleme şekli

Şekil 3. Bir görsel kodlayıcının görüntüyü işleme şekli. (Kaynak)

FastViTHD, görüntünün tamamını anlamaya devam ederken daha az token kullanarak çok fazla token işlemekten kaynaklanan yavaşlamayı önler. İki yaklaşımı birleştirir: örüntüleri ve ilişkileri modellemede başarılı olan Transformer'ları ve görsel verileri işlemede verimli olan evrişimli katmanları. Sonuç, daha hızlı çalışan ve daha az bellek kullanan bir sistemdir.

Apple'a göre FastViTHD, yüksek doğruluğu korurken bazı geleneksel görsel kodlayıcılardan 3,4 kata kadar daha küçüktür. İşlemeyi hızlandırmak için daha az önemli görüntü parçalarını kaldıran token budama gibi model optimizasyon tekniklerine güvenmek yerine, verimliliği daha basit ve daha yalın bir mimariyle sağlar.

FastVLM'nin model varyantları ve eğitim işlem hattı#

Apple, FastVLM'yi üç farklı boyutta yayımladı: 0.5B, 1.5B ve 7B parametre (buradaki "B", modeldeki eğitilebilir ağırlıkların sayısını ifade eden milyar anlamına gelir). Her sürüm, farklı cihaz türlerine uyacak şekilde tasarlanmıştır. Küçük modeller telefonlarda ve tabletlerde çalışabilirken daha büyük 7B modeli masaüstü bilgisayarlar veya daha zorlu görevler için daha uygundur.

Bu, geliştiricilere uygulamaları için en uygun seçeneği seçme esnekliği sağlar. Aynı temel model mimarisini kullanarak mobil cihazlar için hızlı ve hafif ya da daha büyük sistemler için daha karmaşık çözümler geliştirebilirler.

Apple, FastVLM model varyantlarını görsel ve dil modellerini uyumlandırmaya yönelik bir çerçeve olan LLaVA‑1.5 işlem hattını kullanarak eğitti. Dil bileşeni için FastVLM'yi, doğal ve tutarlı metinler oluşturmasıyla bilinen Qwen ve Vicuna gibi mevcut açık kaynaklı modelleri kullanarak değerlendirdiler. Bu yapı, FastVLM'nin hem basit hem de karmaşık görüntüleri işlemesine ve okunabilir, ilgili yanıtlar üretmesine olanak tanır.

FastVLM'nin önemi: Apple'ın verimli AI yaklaşımı#

FastVLM'nin verimli görüntü işlemesinin neden önemli olduğunu merak ediyor olabilirsin. Bunun nedeni, uygulamaların buluta ihtiyaç duymadan gerçek zamanlı olarak ne kadar sorunsuz çalışabildiğidir. FastVLM, 1152'ye 1152 piksele kadar yüksek çözünürlüklü görüntüleri işlerken doğrudan cihazında çalışabilecek kadar hızlı ve hafif kalabilir.

Bu, uygulamaların kameranın gördüklerini açıklayabilmesini, fişleri çekildikleri anda tarayabilmesini veya ekrandaki değişikliklere yanıt verebilmesini sağlar; tüm bunlar veriler yerel tutulurken gerçekleşir. Eğitim, erişilebilirlik, üretkenlik ve fotoğrafçılık gibi alanlarda özellikle yararlıdır.

FastViTHD büyük görüntüler söz konusu olduğunda bile verimli olduğu için cihazların hızlı yanıt vermesine ve serin kalmasına yardımcı olur. En küçük model de dahil olmak üzere tüm model boyutlarıyla çalışır; en küçük model giriş seviyesi iPhone'larda çalışabilir. Bu, aynı AI özelliklerinin telefonlar, tabletler ve Mac'ler genelinde kullanılabilmesini sağlar.

FastVLM uygulamaları#

FastVLM; hız, verimlilik ve cihaz üzeri gizlilik gibi temel avantajları sayesinde çok çeşitli uygulamalara güç verebilir. Kullanılabileceği birkaç alan şunlardır:

  • Belge okuma: Fişleri, formları veya kimlik kartlarını tarayabilir ve yalnızca ilgili bilgileri çıkarabilir. Görüntüdeki belirli alanlara odaklanabildiği için hızlı ve doğru metin çıkarma özelliğine ihtiyaç duyan uygulamalar için kullanışlıdır.

  • Görüntü açıklamaları: Bir fotoğrafı analiz ederek görüntüde ne olduğuna dair anlaşılır bir açıklama oluşturabilir. Bu özellik, kamera uygulamalarında, fotoğraf galerilerinde veya gerçek zamanlı görsel anlamadan yararlanan diğer araçlarda kullanılabilir.

  • Erişilebilirlik desteği: FastVLM, görme engelli veya görme yetisi düşük kullanıcılar için ekrandaki içeriği açıklayabilir ve düğmelerin, menülerin ve düzen öğelerinin daha kolay gezinilip kullanılmasını sağlar.

  • Cihaz üzeri AI asistanları: FastVLM, ekranda ne olduğunu hızlıca anlaması gereken AI asistanlarıyla iyi çalışabilir. Doğrudan cihazda çalıştığı ve verileri gizli tuttuğu için metin okuma, düğmeleri veya simgeleri tanımlama ve bilgileri buluta göndermeden kullanıcılara gerçek zamanlı rehberlik etme gibi görevlerde yardımcı olabilir.

FastVLM metin tanıma ve görsel soru yanıtlama için kullanılabilir

Şekil 4. FastVLM metin tanıma ve görsel soru yanıtlama için kullanılabilir. (Kaynak)

Önemli çıkarımlar#

FastVLM, hız, gizlilik ve verimliliği bir araya getirerek cihaz üzeri görsel-dil AI özelliklerini Apple cihazlarına getiriyor. Hafif tasarımı ve açık kaynaklı sürümü sayesinde mobil ve masaüstü uygulamalarında gerçek zamanlı görüntü anlama olanağı sunuyor.

Bu, AI'ı günlük kullanım için daha pratik ve erişilebilir hale getirmeye yardımcı olurken geliştiricilere yararlı ve gizlilik odaklı uygulamalar geliştirmek için sağlam bir temel sunar. Geleceğe baktığımızda, görsel-dil modellerinin teknolojiyle nasıl etkileşim kurduğumuzda önemli bir rol oynaması ve AI'ı günlük durumlarda daha duyarlı, bağlam farkındalığı yüksek ve yararlı hale getirmesi olasıdır.

AI hakkında daha fazla bilgi edinmek için GitHub depomuzu incele. Aktif topluluğumuza katıl ve otomotiv sektöründe AI ile üretimde görsel AI gibi alanlardaki yenilikleri keşfet. Bilgisayarlı görüye bugün başlamak için lisanslama seçeneklerimize göz at.

Explore solutions

Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin

Yapay zekânın geleceğini birlikte inşa edelim!

Makine öğreniminin geleceğiyle yolculuğuna başla