FastVLM: Apple Yeni Hızlı Görü-Dil Modelini Tanıtıyor
Apple, CVPR 2025'te FastVLM'yi tanıttı. Bu açık kaynaklı görü-dil modeli, ilk belirtece kadar geçen sürede 85 kata varan hız sağlayan FastViTHD kodlayıcısına sahip.

CVPR 2025 konferansında Apple, FastVLM adlı yeni bir açık kaynaklı AI modelini tanıttı. Model, hem görüntüleri hem de dili anlamak üzere tasarlandı ve iPhone, iPad ve Mac gibi Apple cihazlarında çalışıyor. Bu sayede verilerini buluta göndermeden hızlı ve akıllı sonuçlar sunabiliyor.
FastVLM'yi özellikle ilgi çekici kılan şey, ne kadar hızlı ve verimli olduğudur. Apple, modelin yüksek kaliteli görüntüleri daha az bellek ve güç kullanarak yorumlamasına yardımcı olan FastViTHD adlı yeni bir görsel kodlayıcı geliştirdi. Tüm işlemler cihazda yerel olarak gerçekleştirilir; böylece kullanıcı gizliliği korunurken daha hızlı yanıt süreleri elde edilir.
Bu makalede FastVLM'nin nasıl çalıştığını, onu farklı kılan özellikleri ve Apple'ın bu sürümünün cihazlarındaki günlük AI uygulamaları için neden önemli bir ilerleme olabileceğini inceleyeceğiz.
Görsel-dil modellerini (VLM'ler) anlama#
FastVLM'yi özel kılan şeylere geçmeden önce, adındaki “VLM” kısaltmasının ne anlama geldiğine bakalım. Bu ifade, görsel içeriği dille anlamak ve ilişkilendirmek üzere tasarlanmış bir görsel-dil modelini ifade eder.
VLM'ler görsel anlama ile dili bir araya getirerek fotoğraf açıklama, ekran görüntüsüyle ilgili soruları yanıtlama veya bir belgeden metin çıkarma gibi görevleri gerçekleştirebilir. Görsel-dil modelleri genellikle iki bölümden oluşur: biri görüntüyü işler ve veriye dönüştürür, diğeri ise bu veriyi yorumlayarak okuyabileceğin veya duyabileceğin bir yanıt oluşturur.
Farkında olmadan bu tür bir AI yeniliğini zaten kullanmış olabilirsin. Fişleri tarayan, kimlik kartlarını okuyan, görüntü açıklamaları oluşturan veya görme yetisi düşük kişilerin ekranlarıyla etkileşim kurmasına yardımcı olan uygulamalar, genellikle arka planda sessizce çalışan görsel-dil modellerine dayanır.
FastVLM nedir?#
Apple, FastVLM'yi diğer görsel-dil modelleriyle aynı görevleri daha yüksek hız, daha güçlü gizlilik ve kendi cihazlarında optimize edilmiş performansla gerçekleştirecek şekilde geliştirdi. Bir görüntünün içeriğini anlayıp metinle yanıt verebilir; ancak bulut sunucularına dayanan birçok modelin aksine FastVLM tamamen iPhone, iPad veya Mac'inde çalışabilir.
VLM'ler genellikle yüksek çözünürlüklü görüntülerle daha iyi performans gösterir. Örneğin aşağıda gösterildiği gibi FastVLM, bir sokak levhasını “Girilmez” olarak yalnızca görüntünün yüksek çözünürlüklü sürümü verildiğinde doğru şekilde tanımlayabildi. Ancak yüksek çözünürlüklü girdiler genellikle modelleri yavaşlatır. FastViTHD tam da bu noktada fark yaratır.

Şekil 1. FastVLM'nin düşük ve yüksek çözünürlüklü görüntülerdeki performansı. (Kaynak)
Apple'ın yeni görsel kodlayıcısı FastViTHD, FastVLM'nin yüksek kaliteli görüntüleri daha az bellek ve güç kullanarak daha verimli işlemesine yardımcı olur. FastViTHD, özellikle küçük cihazlarda bile sorunsuz çalışabilecek kadar hafiftir.
FastVLM ayrıca FastVLM GitHub deposunda herkese açık olarak sunuluyor. Geliştiriciler burada kaynak koduna erişebilir, değişiklikler yapabilir ve Apple'ın lisans koşullarına uygun olarak bu modeli kendi uygulamalarında kullanabilir.
FastVLM'yi diğer VLM modelleriyle karşılaştırma#
Diğer görsel-dil modelleriyle karşılaştırıldığında FastVLM, akıllı telefonlar ve dizüstü bilgisayarlar gibi günlük cihazlarda çalışacak şekilde optimize edilmiştir. Performans testlerinde FastVLM, ilk kelimesini veya çıktısını LLaVA-OneVision-0.5B gibi modellere kıyasla 85 kata kadar daha hızlı oluşturdu.

Şekil 2. FastVLM'nin diğer modellerle performans karşılaştırması. (Kaynak)
FastVLM'nin değerlendirildiği standart kıyaslamalardan bazılarına göz atalım:
- DocVQA (Belgelerde Görsel Soru Yanıtlama): Bu kıyaslama, modelin taranmış formlar veya sayfalar gibi belgelerdeki metinsel bilgileri ne kadar iyi okuyup anlayabildiğini değerlendirir.
- TextVQA (Metin Tabanlı Görsel Soru Yanıtlama): Modelin gömülü metin içeren görüntüleri yorumlama ve ilgili soruları doğru şekilde yanıtlama becerisini ölçer.
- GQA (Grafik Soru Yanıtlama): Bu görev, modelin bir görüntü içindeki nesneler ve sahneler arasındaki ilişkileri anlamasını gerektirerek akıl yürütme becerilerini test eder.
- MMMU (Kapsamlı Çok Disiplinli Çok Modlu Anlama): Görsel ve metinsel kavrayışı bir araya getirerek modelin çok çeşitli akademik konu ve formatlardaki performansını ölçer.
- SeedBench (Kıyaslama için Geliştirilmiş Verilerin Standart Değerlendirmesi): Bu kıyaslama, modelin birden çok alandaki genel görsel anlama ve akıl yürütme yeteneklerini inceler.
FastVLM, bu kıyaslamalar genelinde daha az kaynak kullanırken rekabetçi sonuçlar elde etti. Telefonlar, tabletler ve dizüstü bilgisayarlar gibi günlük cihazlara pratik görsel AI özellikleri getiriyor.
FastVLM'nin verimli görsel kodlayıcısı: FastViTHD#
Şimdi, FastVLM'nin görüntü işleme performansında kritik bir rol oynayan görsel kodlayıcı FastViTHD'ye daha yakından bakalım.
Görsel-dil modellerinin çoğu, görüntüyü token adı verilen binlerce küçük parçaya böler. Token sayısı arttıkça modelin görüntüyü anlamak için ihtiyaç duyduğu zaman ve güç de artar. Bu durum özellikle telefonlarda veya dizüstü bilgisayarlarda işlemleri yavaşlatabilir.

Şekil 3. Bir görsel kodlayıcının görüntüyü işleme şekli. (Kaynak)
FastViTHD, görüntünün tamamını anlamaya devam ederken daha az token kullanarak çok fazla token işlemekten kaynaklanan yavaşlamayı önler. İki yaklaşımı birleştirir: örüntüleri ve ilişkileri modellemede başarılı olan Transformer'ları ve görsel verileri işlemede verimli olan evrişimli katmanları. Sonuç, daha hızlı çalışan ve daha az bellek kullanan bir sistemdir.
Apple'a göre FastViTHD, yüksek doğruluğu korurken bazı geleneksel görsel kodlayıcılardan 3,4 kata kadar daha küçüktür. İşlemeyi hızlandırmak için daha az önemli görüntü parçalarını kaldıran token budama gibi model optimizasyon tekniklerine güvenmek yerine, verimliliği daha basit ve daha yalın bir mimariyle sağlar.
FastVLM'nin model varyantları ve eğitim işlem hattı#
Apple, FastVLM'yi üç farklı boyutta yayımladı: 0.5B, 1.5B ve 7B parametre (buradaki "B", modeldeki eğitilebilir ağırlıkların sayısını ifade eden milyar anlamına gelir). Her sürüm, farklı cihaz türlerine uyacak şekilde tasarlanmıştır. Küçük modeller telefonlarda ve tabletlerde çalışabilirken daha büyük 7B modeli masaüstü bilgisayarlar veya daha zorlu görevler için daha uygundur.
Bu, geliştiricilere uygulamaları için en uygun seçeneği seçme esnekliği sağlar. Aynı temel model mimarisini kullanarak mobil cihazlar için hızlı ve hafif ya da daha büyük sistemler için daha karmaşık çözümler geliştirebilirler.
Apple, FastVLM model varyantlarını görsel ve dil modellerini uyumlandırmaya yönelik bir çerçeve olan LLaVA‑1.5 işlem hattını kullanarak eğitti. Dil bileşeni için FastVLM'yi, doğal ve tutarlı metinler oluşturmasıyla bilinen Qwen ve Vicuna gibi mevcut açık kaynaklı modelleri kullanarak değerlendirdiler. Bu yapı, FastVLM'nin hem basit hem de karmaşık görüntüleri işlemesine ve okunabilir, ilgili yanıtlar üretmesine olanak tanır.
FastVLM'nin önemi: Apple'ın verimli AI yaklaşımı#
FastVLM'nin verimli görüntü işlemesinin neden önemli olduğunu merak ediyor olabilirsin. Bunun nedeni, uygulamaların buluta ihtiyaç duymadan gerçek zamanlı olarak ne kadar sorunsuz çalışabildiğidir. FastVLM, 1152'ye 1152 piksele kadar yüksek çözünürlüklü görüntüleri işlerken doğrudan cihazında çalışabilecek kadar hızlı ve hafif kalabilir.
Bu, uygulamaların kameranın gördüklerini açıklayabilmesini, fişleri çekildikleri anda tarayabilmesini veya ekrandaki değişikliklere yanıt verebilmesini sağlar; tüm bunlar veriler yerel tutulurken gerçekleşir. Eğitim, erişilebilirlik, üretkenlik ve fotoğrafçılık gibi alanlarda özellikle yararlıdır.
FastViTHD büyük görüntüler söz konusu olduğunda bile verimli olduğu için cihazların hızlı yanıt vermesine ve serin kalmasına yardımcı olur. En küçük model de dahil olmak üzere tüm model boyutlarıyla çalışır; en küçük model giriş seviyesi iPhone'larda çalışabilir. Bu, aynı AI özelliklerinin telefonlar, tabletler ve Mac'ler genelinde kullanılabilmesini sağlar.
FastVLM uygulamaları#
FastVLM; hız, verimlilik ve cihaz üzeri gizlilik gibi temel avantajları sayesinde çok çeşitli uygulamalara güç verebilir. Kullanılabileceği birkaç alan şunlardır:
-
Belge okuma: Fişleri, formları veya kimlik kartlarını tarayabilir ve yalnızca ilgili bilgileri çıkarabilir. Görüntüdeki belirli alanlara odaklanabildiği için hızlı ve doğru metin çıkarma özelliğine ihtiyaç duyan uygulamalar için kullanışlıdır.
-
Görüntü açıklamaları: Bir fotoğrafı analiz ederek görüntüde ne olduğuna dair anlaşılır bir açıklama oluşturabilir. Bu özellik, kamera uygulamalarında, fotoğraf galerilerinde veya gerçek zamanlı görsel anlamadan yararlanan diğer araçlarda kullanılabilir.
-
Erişilebilirlik desteği: FastVLM, görme engelli veya görme yetisi düşük kullanıcılar için ekrandaki içeriği açıklayabilir ve düğmelerin, menülerin ve düzen öğelerinin daha kolay gezinilip kullanılmasını sağlar.
-
Cihaz üzeri AI asistanları: FastVLM, ekranda ne olduğunu hızlıca anlaması gereken AI asistanlarıyla iyi çalışabilir. Doğrudan cihazda çalıştığı ve verileri gizli tuttuğu için metin okuma, düğmeleri veya simgeleri tanımlama ve bilgileri buluta göndermeden kullanıcılara gerçek zamanlı rehberlik etme gibi görevlerde yardımcı olabilir.

Şekil 4. FastVLM metin tanıma ve görsel soru yanıtlama için kullanılabilir. (Kaynak)
Önemli çıkarımlar#
FastVLM, hız, gizlilik ve verimliliği bir araya getirerek cihaz üzeri görsel-dil AI özelliklerini Apple cihazlarına getiriyor. Hafif tasarımı ve açık kaynaklı sürümü sayesinde mobil ve masaüstü uygulamalarında gerçek zamanlı görüntü anlama olanağı sunuyor.
Bu, AI'ı günlük kullanım için daha pratik ve erişilebilir hale getirmeye yardımcı olurken geliştiricilere yararlı ve gizlilik odaklı uygulamalar geliştirmek için sağlam bir temel sunar. Geleceğe baktığımızda, görsel-dil modellerinin teknolojiyle nasıl etkileşim kurduğumuzda önemli bir rol oynaması ve AI'ı günlük durumlarda daha duyarlı, bağlam farkındalığı yüksek ve yararlı hale getirmesi olasıdır.
AI hakkında daha fazla bilgi edinmek için GitHub depomuzu incele. Aktif topluluğumuza katıl ve otomotiv sektöründe AI ile üretimde görsel AI gibi alanlardaki yenilikleri keşfet. Bilgisayarlı görüye bugün başlamak için lisanslama seçeneklerimize göz at.









