Hugging Face’in açık kaynak araçlarıyla CV projelerini güçlendirme
Hugging Face’in açık kaynak araçlarının AI geliştirmeyi nasıl ilerlettiğini ele alan YOLO Vision 2024 açılış konuşmasına birlikte yeniden göz atalım.

Doğru algoritmaları seçmek, etkili bilgisayarlı görü çözümleri geliştirmenin yalnızca bir parçasıdır. Yapay zekâ mühendisleri genellikle büyük veri kümeleriyle çalışır, modelleri belirli görevlere göre ince ayarlar ve yapay zekâ sistemlerini gerçek dünya performansı için optimize eder. Yapay zekâ uygulamaları daha hızlı benimsendikçe, bu süreçleri kolaylaştıran araçlara duyulan ihtiyaç da artıyor.
Ultralytics tarafından desteklenen yıllık hibrit etkinlik YOLO Vision 2024 (YV24)'te yapay zekâ uzmanları ve teknoloji meraklıları, bilgisayarlı görü alanındaki en son yenilikleri keşfetmek üzere bir araya geldi. Etkinlikte, yapay zekâ uygulaması geliştirmeyi hızlandırma yöntemleri gibi çeşitli konular ele alındı.
Etkinliğin öne çıkan bölümlerinden biri, model eğitimi, optimizasyonu ve dağıtımını kolaylaştıran açık kaynaklı yapay zekâ platformu Hugging Face üzerine yapılan açılış konuşmasıydı. Hugging Face'te Makine Öğrenimi Mühendisi olan Pavel Iakubovskii, araçlarının görüntülerde nesne algılama, görüntüleri farklı gruplara kategorilere ayırma ve belirli örnekler üzerinde önceden eğitim olmadan tahmin yapma (zero-shot learning) gibi bilgisayarlı görü görevlerindeki iş akışlarını nasıl iyileştirdiğini anlattı.
Hugging Face Hub, Ultralytics YOLO11 gibi çeşitli yapay zekâ ve bilgisayarlı görü modellerini barındırır ve bunlara erişim sağlar. Bu makalede, Pavel'in konuşmasından öne çıkanları özetleyecek ve geliştiricilerin yapay zekâ modellerini hızlıca oluşturup dağıtmak için Hugging Face'in açık kaynak araçlarını nasıl kullanabileceğini göreceğiz.

Şekil 1. YV24'te sahnede Pavel.
Hugging Face Hub daha hızlı yapay zekâ geliştirmeyi destekliyor#
Pavel, konuşmasına Hugging Face'i çeşitli uygulamalar için önceden eğitilmiş modeller sunan açık kaynaklı bir yapay zekâ platformu olarak tanıtarak başladı. Bu modeller; doğal dil işleme (NLP), bilgisayarlı görü ve çok modlu yapay zekâ dahil olmak üzere yapay zekânın çeşitli dalları için tasarlanmıştır ve sistemlerin metin, görüntü ve ses gibi farklı veri türlerini işlemesini sağlar.
Pavel, Hugging Face Hub'ın artık 1 milyondan fazla modele ev sahipliği yaptığını ve geliştiricilerin kendi projelerine uygun modelleri kolayca bulabildiğini belirtti. Hugging Face; model eğitimi, ince ayarı ve dağıtımı için araçlar sunarak yapay zekâ geliştirmeyi kolaylaştırmayı amaçlıyor. Geliştiriciler farklı modelleri deneyebildiğinde, yapay zekâyı gerçek dünya uygulamalarına entegre etme süreci de kolaylaşıyor.
Hugging Face başlangıçta NLP ile tanınsa da o zamandan beri bilgisayarlı görü ve çok modlu yapay zekâ alanlarına genişleyerek geliştiricilerin daha geniş bir yapay zekâ görevi yelpazesini ele almasını sağladı. Ayrıca geliştiricilerin iş birliği yapabildiği, içgörülerini paylaşabildiği ve forumlar, Discord ve GitHub üzerinden destek alabildiği güçlü bir topluluğa sahip.
Bilgisayarlı görü uygulamaları için Hugging Face modellerini keşfetme#
Pavel, ayrıntılara girerek Hugging Face araçlarının bilgisayarlı görü uygulamaları geliştirmeyi nasıl kolaylaştırdığını açıkladı. Geliştiriciler bu araçları görüntü sınıflandırma, nesne algılama ve görü-dil uygulamaları gibi görevlerde kullanabilir.
Ayrıca bu bilgisayarlı görü görevlerinin çoğunun Hugging Face Hub'da bulunan önceden eğitilmiş modellerle gerçekleştirilebileceğini ve bunun sıfırdan eğitim ihtiyacını azaltarak zaman kazandırdığını belirtti. Hugging Face, görüntü sınıflandırma görevleri için yiyecek sınıflandırma, evcil hayvan sınıflandırma ve duygu algılama modelleri de dahil olmak üzere 13.000'den fazla önceden eğitilmiş model sunuyor.
Bu modellerin erişilebilirliğini vurgulayarak şöyle dedi: "Projen için bir model eğitmen gerekmeyebilir bile; Hub'da topluluktan birinin zaten eğittiği bir model bulabilirsin."
Nesne algılama için Hugging Face modelleri#
Başka bir örnek veren Pavel, bilgisayarlı görünün temel işlevlerinden biri olan ve görüntülerdeki nesneleri tanımlayıp konumlandırmak için kullanılan nesne algılama konusunda Hugging Face'in nasıl yardımcı olabileceğini açıkladı. Etiketli verilerin sınırlı olduğu durumlarda bile Hugging Face Hub'da bulunan önceden eğitilmiş modeller nesne algılamayı daha verimli hâle getirebilir.
Ayrıca Hugging Face'te bulabileceğin, bu görev için geliştirilmiş birkaç modele kısaca göz attı:
- Gerçek zamanlı nesne algılama modelleri: Hızın kritik olduğu dinamik ortamlarda Detection Transformer (DETR) gibi modeller gerçek zamanlı nesne algılama özellikleri sunar. DETR, COCO veri kümesi üzerinde eğitilmiştir ve çok ölçekli özellikleri verimli bir şekilde işlemek üzere tasarlanmıştır; bu da onu zamana duyarlı uygulamalar için uygun hâle getirir.
- Görü-dil modelleri: Bu modeller, görüntü ve metin işlemeyi birleştirerek yapay zekâ sistemlerinin görüntüleri açıklamalarla eşleştirmesini veya eğitim verilerinin ötesindeki nesneleri tanımasını mümkün kılar. Örnekler arasında, metni görsellerle ilişkilendirerek görüntü aramayı iyileştiren ve bağlamlarını anlayarak yapay zekâ çözümlerinin yeni nesneleri tanımlamasını sağlayan CLIP ve SigLIP bulunur.
- Zero-shot nesne algılama modelleri: Görüntüler ve metin arasındaki ilişkiyi anlayarak daha önce görmedikleri nesneleri tanımlayabilirler. OwlVit, GroundingDINO ve OmDet; etiketli eğitim verilerine ihtiyaç duymadan yeni nesneleri algılamak için zero-shot learning kullanan örneklerdir.
Hugging Face modelleri nasıl kullanılır?#
Pavel daha sonra odağı Hugging Face modelleriyle uygulamalı çalışmaya kaydırarak geliştiricilerin bu modellerden yararlanabileceği üç yolu açıkladı: modelleri keşfetmek, hızlıca test etmek ve daha ileri düzeyde özelleştirmek.
Geliştiricilerin herhangi bir kod yazmadan doğrudan Hugging Face Hub'da modellere göz atabileceğini ve etkileşimli bir arayüz üzerinden modelleri anında test edebileceğini gösterdi. Pavel ekledi: "Tek satır kod yazmadan veya modeli bilgisayarına indirmeden deneyebilirsin." Bazı modeller büyük olduğundan, bunları Hub'da çalıştırmak depolama ve işlem sınırlamalarının aşılmasına yardımcı olur.

Şekil 2. Hugging Face modelleri nasıl kullanılır.
Ayrıca Hugging Face Inference API, geliştiricilerin basit API çağrılarıyla yapay zekâ modellerini çalıştırmasına olanak tanır. Karmaşık bir kurulum gerektirmeden hızlı testler, kavram kanıtlama projeleri ve hızlı prototip oluşturma için oldukça kullanışlıdır.
Daha ileri kullanım senaryoları için geliştiriciler, hem PyTorch hem de TensorFlow'u desteklerken metin, görü ve ses görevleri için önceden eğitilmiş modeller sağlayan açık kaynaklı bir araç olan Hugging Face Transformers çatısını kullanabilir. Pavel, yalnızca iki satır kodla geliştiricilerin Hugging Face Hub'dan bir model alıp görüntü işlemcisi gibi bir ön işleme aracına bağlayarak Vision AI uygulamaları için görüntü verilerini analiz edebileceğini açıkladı.
Hugging Face ile yapay zekâ iş akışlarını optimize etme#
Ardından Pavel, Hugging Face'in yapay zekâ iş akışlarını nasıl kolaylaştırabileceğini açıkladı. Ele aldığı temel konulardan biri, derin öğrenme modellerinin girdideki en ilgili bölümlere odaklanmasına yardımcı olan temel bir özellik olan Transformers'taki attention mekanizmasını optimize etmekti. Bu, dil işleme ve bilgisayarlı görü görevlerinin doğruluğunu artırır. Ancak bu mekanizma yoğun kaynak kullanabilir.
Attention mekanizmasını optimize etmek, hızı artırırken bellek kullanımını önemli ölçüde azaltabilir. Pavel şöyle belirtti: "Örneğin, daha verimli bir attention uygulamasına geçerek performansta 1,8 kata kadar hızlanma görebilirsin."
Hugging Face, Transformers çatısı içinde daha verimli attention uygulamaları için yerleşik destek sağlar. Geliştiriciler, model yüklerken alternatif bir attention uygulaması belirleyerek bu optimizasyonları etkinleştirebilir.
Optimum ve Torch Compile#
Ayrıca, yapay zekâ modellerinin kullandığı sayıların kesinliğini performansı fazla etkilemeden azaltarak modelleri küçülten bir teknik olan quantization'dan bahsetti. Bu, modellerin daha az bellek kullanıp daha hızlı çalışmasını sağlayarak onları akıllı telefonlar ve gömülü sistemler gibi işlem gücü sınırlı cihazlar için daha uygun hâle getirir.
Verimliliği daha da artırmak için Pavel, modelleri optimize edip dağıtmak üzere tasarlanmış bir araç seti olan Hugging Face Optimum kütüphanesini tanıttı. Geliştiriciler yalnızca birkaç satır kodla quantization tekniklerini uygulayabilir ve modelleri ONNX (Açık Sinir Ağı Değişimi) gibi verimli biçimlere dönüştürebilir. Böylece modeller bulut sunucuları ve edge cihazlar dahil olmak üzere farklı donanım türlerinde sorunsuz çalışabilir.

Şekil 3. Pavel, Optimum kütüphanesi ve özellikleri hakkında konuştu.
Son olarak Pavel, yapay zekâ modellerinin verileri işleme biçimini optimize ederek daha hızlı ve verimli çalışmalarını sağlayan PyTorch özelliği Torch Compile'ın faydalarından bahsetti. Hugging Face, Torch Compile'ı Transformers ve Optimum kütüphanelerine entegre ederek geliştiricilerin minimum kod değişikliğiyle bu performans iyileştirmelerinden yararlanmasına olanak tanıyor.
Torch Compile, modelin hesaplama yapısını optimize ederek çıkarım sürelerini hızlandırabilir ve doğruluktan veya kaliteden ödün vermeden kare hızını saniyede 29'dan 150 kareye çıkarabilir.
Hugging Face araçlarıyla model dağıtma#
Pavel daha sonra, doğru modeli seçip geliştirme için en iyi yaklaşımı belirledikten sonra Hugging Face araçlarını kullanarak Vision AI modellerinin nasıl genişletilebileceğine ve dağıtılabileceğine kısaca değindi.
Örneğin geliştiriciler, Gradio ve Streamlit kullanarak etkileşimli yapay zekâ uygulamaları dağıtabilir. Gradio, geliştiricilerin makine öğrenimi modelleri için web tabanlı arayüzler oluşturmasını sağlarken Streamlit, basit Python betikleriyle etkileşimli veri uygulamaları geliştirmeye yardımcı olur.
Pavel ayrıca, Hugging Face'in sağladığı kılavuzlara, eğitim not defterlerine ve örnek betiklere atıfta bulunarak “Her şeyi sıfırdan yazmaya başlaman gerekmiyor,” dedi. Bu kaynaklar, geliştiricilerin her şeyi baştan oluşturmak zorunda kalmadan hızlıca başlamasına yardımcı olur.

Şekil 4. Pavel, YV24'te Hugging Face'in yeteneklerini tartışırken.
Hugging Face Hub'ın faydaları#
Pavel, açılış konuşmasını sonlandırırken Hugging Face Hub kullanmanın avantajlarını özetledi. Model yönetimini ve iş birliğini nasıl kolaylaştırdığını vurguladı. Ayrıca hem yeni başlayanların hem de uzmanların yapay zekâ modellerini anlamasına ve uygulamasına yardımcı olabilecek kılavuzların, not defterlerinin ve eğitimlerin erişilebilir olduğuna dikkat çekti.
Geliştiricileri platformun esnekliğinden yararlanmaya teşvik ederek şöyle açıkladı: "Hub'da zaten pek çok harika alan var. Benzer olanları bulabilir, paylaşılan kodu klonlayabilir, birkaç satırı değiştirebilir, modeli kendi modelinle değiştirebilir ve tekrar gönderebilirsin."
Önemli çıkarımlar#
Pavel, YV24'teki konuşması sırasında Hugging Face'in yapay zekâ modeli eğitimi, optimizasyonu ve dağıtımını destekleyen araçlar sağladığını anlattı. Örneğin Transformers, Optimum ve Torch Compile gibi yenilikler geliştiricilerin model performansını artırmasına yardımcı olabilir.
Yapay zekâ modelleri daha verimli hâle geldikçe quantization ve edge dağıtımındaki ilerlemeler, bunları kaynakları sınırlı cihazlarda çalıştırmayı kolaylaştırıyor. Bu iyileştirmeler, Hugging Face gibi araçlar ve Ultralytics YOLO11 gibi gelişmiş bilgisayarlı görü modelleriyle bir araya geldiğinde ölçeklenebilir, yüksek performanslı Vision AI uygulamaları geliştirmek için temel oluşturuyor.
Büyüyen topluluğumuza katıl! Yapay zekâ hakkında bilgi edinmek için GitHub depomuzu keşfet ve Vision AI projelerine başlamak için YOLO lisanslarımıza göz at. Sağlık hizmetlerinde bilgisayarlı görü veya tarımda bilgisayarlı görü gibi yeniliklerle ilgileniyor musun? Daha fazlasını keşfetmek için çözüm sayfalarımızı ziyaret et!









