YOLO Vision 2026:
Yapay Zeka Görüşü

2024 üretken yapay zeka dalgasıyla başlıyor

2024'ün ilk çeyreğinden heyecan verici yapay zeka inovasyonlarına bir bakış. OpenAI'ın Sora AI'ı, Neuralink'in beyin çipi ve en yeni LLM'ler gibi atılımları ele alacağız.

ABAbirami Vina6 min read
2024 başından üretken yapay zeka atılımları

Yapay zeka topluluğu neredeyse her gün manşetlere çıkıyor gibi. 2024'ün ilk birkaç ayı heyecan vericiydi ve yeni yapay zeka inovasyonlarıyla doluydu. Güçlü yeni büyük dil modellerinden insan beyni implantlarına kadar 2024, harika bir yıl olmaya aday.

Yapay zekanın endüstrileri dönüştürdüğünü, bilgiyi daha erişilebilir kıldığını ve hatta zihinlerimizi makinelerle birleştirme yolunda ilk adımları attığını görüyoruz. 2024'ün ilk çeyreğini geriye saralım ve sadece birkaç ay içinde yapay zeka alanında kaydedilen ilerlemeye daha yakından bakalım.

LLM'ler trend oluyor#

Büyük miktarda metin verisine dayalı olarak insan dilini anlamak, üretmek ve işlemek için tasarlanan büyük dil modelleri (LLM'ler), 2024'ün ilk çeyreğinde sahneye çıktı. Birçok büyük teknoloji şirketi, her biri kendine has yeteneklere sahip kendi LLM modellerini yayınladı. GPT-3 gibi önceki LLM'lerin inanılmaz başarısı bu trende ilham verdi. İşte 2024'ün başlarından en dikkat çekici LLM sürümlerinden bazıları.

Anthropic'ten Claude 3#

Anthropic, 14 Mart 2024 tarihinde Claude 3 modelini yayınladı. Claude 3 modeli, her biri farklı pazarlara ve amaçlara hizmet eden Opus, Sonnet ve Haiku olmak üzere üç sürüm halinde gelir. En hızlı model olan Haiku, hızlı ve temel yanıtlar için optimize edilmiştir. Sonnet, hızı zeka ile dengeler ve kurumsal uygulamaları hedefler. En gelişmiş sürüm olan Opus, benzersiz bir zeka ve akıl yürütme sunar; karmaşık görevler ve en üst düzey kıyaslamalara ulaşmak için idealdir.

Claude 3 birçok gelişmiş özellik ve iyileştirme ile övünüyor:

  • Gelişmiş Çok Dilli Sohbetler: İspanyolca, Japonca ve Fransızca dahil olmak üzere dillerde geliştirilmiş yetenekler.
  • Gelişmiş Görüntü Özellikleri: Çeşitli görsel formatları işleme yeteneğine sahip.
  • En Aza İndirilmiş Reddetmeler: Daha iyi bağlamsal kavrayış göstererek, gereksiz reddetmelerin azaldığı daha fazla anlayış sergiliyor.
  • Genişletilmiş Bağlam Penceresi: 200K bağlam penceresi sunuyor, ancak müşteri ihtiyaçlarına göre 1 milyon tokenın üzerinde girişi işleyebiliyor.

Claude 3'ün önceki sürümlere kıyasla bağlamsal farkındalığını gösteren grafik

Şekil 1. Claude 3, önceki sürümlere göre daha fazla bağlamsal farkındalığa sahiptir.

Databricks'ten DBRX#

Databricks DBRX, Databricks tarafından 27 Mart 2024'te yayınlanan açık ve genel amaçlı bir LLM'dir. DBRX; dil anlama, programlama ve matematik dahil olmak üzere çeşitli kıyaslamalarda gerçekten çok iyi performans gösterir. Benzer modellerden yaklaşık %40 daha küçük olmasına rağmen diğer köklü modelleri geride bırakmaktadır.

DBRX'in diğer modellerle karşılaştırılması

Şekil 2. DBRX'in diğer modellerle karşılaştırılması.

DBRX, ince taneli bir uzman karışımı (MoE) mimarisi ile bir sonraki token tahmini kullanılarak eğitildi, bu nedenle eğitim ve çıkarım performansında önemli gelişmeler görüyoruz. Mimarisi, modelin çeşitli uzmanlaşmış alt modeller (

Google'dan Gemini 1.5#

Google, 15 Şubat 2024'te kapsamlı metin, video ve ses verilerini analiz edebilen, hesaplama açısından verimli, çok modlu bir yapay zeka modeli olan Gemini 1.5'i tanıttı. En son model; performans, verimlilik ve yetenekler açısından daha gelişmiş durumda. Gemini 1.5'in temel bir özelliği, uzun bağlam anlamadaki çığır açan başarısıdır. Model, 1 milyon tokena kadar tutarlı bir şekilde işleme yeteneğine sahip. Gemini 1.5'in yetenekleri, yeni bir MoE tabanlı mimariye de borçludur.

Popüler LLM'lerin bağlam uzunluklarının karşılaştırılması

Şekil 3. Popüler LLM'lerin Bağlam Uzunluklarının Karşılaştırılması

İşte Gemini 1.5 modelinin en ilginç özelliklerinden bazıları:

  • Gelişmiş Veri İşleme: Büyük PDF'lerin, kod depolarının veya uzun videoların doğrudan komut olarak yüklenmesine izin verir. Model, modlar arasında akıl yürütebilir ve metin çıktısı verebilir.
  • Çoklu Dosya Yükleme ve Sorgulama: Geliştiriciler artık birden fazla dosya yükleyebilir ve sorular sorabilir.
  • Farklı Görevler İçin Kullanılabilir: Çeşitli görevler arasında ölçeklenecek şekilde optimize edilmiştir ve matematik, bilim, akıl yürütme, çok dillilik, video anlama ve kod gibi alanlarda gelişmeler gösterir.

Yapay zekadan çarpıcı görseller#

2024'ün ilk çeyreği, sosyal medyanın geleceği ve yapay zekanın ilerleyişi üzerine tartışmaları başlatan, gerçek görseller oluşturabilen üretken yapay zeka modellerini gün yüzüne çıkardı. Konuşmaları alevlendiren modellere dalalım.

OpenAI'dan Sora#

ChatGPT'nin yaratıcısı OpenAI, 15 Şubat 2024'te Sora adında son teknoloji bir metinden videoya derin öğrenme modelini duyurdu. Sora, kullanıcıların metinsel komutlarına dayalı olarak yüksek görsel kalitede bir dakikalık videolar oluşturabilen bir metinden videoya dönüştürücüdür.

Örneğin, aşağıdaki komuta bir göz atın.

"Renkli balıklar ve deniz canlılarıyla dolu, harika bir şekilde işlenmiş bir kağıt sanatı mercan kayalığı dünyası."

Ve işte çıktı videosundan bir kare.

OpenAI Sora tarafından oluşturulan bir videodan kare

Şekil 4. Sora tarafından oluşturulan bir videodan kare.

Sora'nın mimarisi; doku oluşturma için difüzyon modellerini ve yapısal tutarlılık için Transformer modellerini harmanlayarak bunu mümkün kılar. Şimdiye kadar Sora'ya erişim; riskleri anlamak ve geri bildirim almak amacıyla kırmızı takım uzmanlarına (red teamers) ve seçkin bir görsel sanatçılar, tasarımcılar ve film yapımcıları grubuna verilmiştir.

Stability AI'dan Stable Diffusion 3#

Stability AI, 22 Şubat 2024'te bir metinden görsele üretim modeli olan Stable Diffusion 3 modelinin çıkışını duyurdu. Model, difüzyon Transformer mimarisini akış eşleme (flow matching) ile harmanlıyor. Henüz teknik bir makale yayınlamadılar ancak dikkat edilmesi gereken birkaç temel özellik bulunuyor.

Stable Diffusion 3 tarafından kozmik bir büyü yapan bir büyücü temalı oluşturulmuş görsel

Şekil 5. Şu isteme dayalı çıktı görseli: “Renkli enerjiden yapılmış "Stable Diffusion 3" yazısını karanlık gökyüzüne yayan, geceleri dağın tepesindeki bir büyücünün destansı anime çizim tarzı eseri” (Kaynak)

Stable Diffusion'ın en son modeli; geliştirilmiş performans, görüntü kalitesi ve birden fazla özneli görüntüler oluşturmada doğruluk sunuyor. Stable Diffusion 3 ayrıca 800 milyondan 8 milyara kadar değişen parametrelere sahip çeşitli modeller sunacak. Kullanıcıların ölçeklenebilirlik ve detay konusundaki özel ihtiyaçlarına göre seçim yapmalarına olanak tanıyacak.

Google'dan Lumiere#

Google, 23 Ocak 2024'te bir metinden videoya difüzyon modeli olan Lumiere modelini kullanıma sundu. Lumiere, kısaca STUNet olarak adlandırılan Space-Time-U-Net adlı bir mimari kullanır. Bu mimari, Lumiere'in nesnelerin nerede olduğunu ve bir videoda nasıl hareket ettiklerini anlamasına yardımcı olur. Bu sayede pürüzsüz ve gerçekçi videolar üretebilir.

Google Lumiere tarafından ukulele çalan bir pandanın yer aldığı videodan bir kare

Şekil 6. “Panda play ukulele at home.” istemine dayanarak oluşturulan videodan bir kare.

Video başına 80 kare oluşturma yeteneğiyle Lumiere, sınırları zorluyor ve yapay zeka alanında video kalitesi için yeni standartlar belirliyor. İşte Lumiere'in bazı özellikleri:

  • Görüntüden Videoya: Bir görüntüden ve bir komuttan başlayarak, Lumiere görüntüleri videolara animasyon haline getirebilir.
  • Stilize Oluşturma: Lumiere, tek bir referans görsel kullanarak belirli stillerde videolar oluşturabilir.
  • Cinemagraphs: Lumiere, sahnelerin geri kalanı sabit kalırken belirli bir nesnenin hareket etmesi gibi dinamik sahneler oluşturmak için bir görüntü içindeki belirli bölgeleri canlandırabilir.
  • Video Onarımı (Inpainting): Videodaki kişilerin kıyafetlerini değiştirmek veya arka plan detaylarını değiştirmek gibi videonun bölümlerini değiştirebilir.

Gelecek gelmiş gibi görünüyor#

2024'ün başlangıcı, bilim kurgu filminden fırlamış gibi hissettiren birçok yapay zeka inovasyonunu da beraberinde getirdi. Daha önce imkansız olduğunu söyleyeceğimiz şeyler üzerinde artık çalışılıyor. Gelecek, aşağıdaki keşiflerle pek de uzak görünmüyor.

Elon Musk'ın şirketi Neuralink, kablosuz beyin çipini 29 Ocak 2024'te başarılı bir şekilde bir insana yerleştirdi. Bu, insan beyinlerini bilgisayarlara bağlama yolunda büyük bir adımdır. Elon Musk, Neuralink'in ‘Telepati’ adını taşıyan ilk ürününün hazırlık aşamasında olduğunu paylaştı.

Neuralink implantı

Şekil 7. Neuralink İmplantı

Amaç, özellikle uzuv işlevini kaybetmiş kullanıcıların cihazları düşünceleriyle zahmetsizce kontrol etmelerini sağlamaktır. Potansiyel uygulamalar kolaylığın ötesine uzanıyor. Elon Musk, felçli bireylerin kolayca iletişim kurabildiği bir gelecek hayal ediyor.

Disney'in HoloTile Zemin'i#

18 Ocak 2024'te Walt Disney Imagineering, HoloTile Floor'u tanıttı. Dünyanın ilk çok kişili, çok yönlü koşu bandı zemini olarak adlandırıldı.

HoloTile zemin üzerinde Disney Hayal Gücü Mimarı (Imagineer) Lanny Smoot

Şekil 8. Disney Hayal Gücü Mimarı (Imagineer) Lanny Smoot, en son inovasyonu olan HoloTile zemin üzerinde poz veriyor.

Sürükleyici bir sanal ve artırılmış gerçeklik deneyimi için telekinezi gibi herhangi bir kişi veya nesnenin altında hareket edebilir. Üzerindeyken her yöne yürüyebilir ve çarpışmalardan kaçınabilirsin. Disney'in HoloTile Floor'u, tiyatro sahnelerinde yaratıcı yollarla dans etmek ve hareket etmek için de kurulabilir.

Apple'ın Vision Pro'su#

2 Şubat 2024'te Apple'ın merakla beklenen Vision Pro kulaklığı piyasaya sürüldü. Sanal ve artırılmış gerçeklik deneyimini yeniden tanımlamak için tasarlanmış bir dizi özelliğe ve uygulamaya sahip. Vision Pro kulaklığı; eğlence, üretkenlik ve uzamsal bilişimi harmanlayarak çeşitli bir kitleye hitap ediyor. Apple, üretkenlik araçlarından oyun ve eğlence hizmetlerine kadar 600'den fazla uygulamanın piyasaya sürüldüğünde Vision Pro için optimize edildiğini gururla duyurdu.

Cognition'dan Devin#

12 Mart 2024'te Cognition, Devin adında bir yazılım mühendisliği asistanı yayınladı. Devin, dünyanın ilk otonom yapay zeka yazılım mühendisi girişimidir. Öneriler sunan veya belirli görevleri tamamlayan geleneksel kodlama asistanlarının aksine, Devin ilk konseptten tamamlanmaya kadar tüm yazılım geliştirme projelerini ele almak üzere tasarlanmıştır.

Yeni teknolojiler öğrenebilir, tam uygulamalar oluşturup dağıtabilir, hataları bulup düzeltebilir, kendi modellerini eğitebilir, açık kaynaklı ve üretim kod tabanlarına katkıda bulunabilir ve hatta Upwork gibi sitelerden gerçek geliştirme işleri alabilir.

Devin'in diğer modellerle karşılaştırılması

Şekil 9. Devin'in diğer modellerle karşılaştırılması.

Devin, Django ve scikit-learn gibi açık kaynaklı projelerde bulunan gerçek dünya GitHub sorunlarını çözmeleri için ajanlardan talep eden zorlu bir benchmark olan SWE-bench üzerinde değerlendirildi. Önceki %1.96'lık son teknolojiye kıyasla sorunların %13.86'sını uçtan uca doğru bir şekilde çözdü.

Önemli diğer gelişmeler#

O kadar çok şey oluyor ki, her şeyi bu makalede ele almak mümkün değil. Ancak, işte bahsedilmesi gereken daha fazla konu.

  • NVIDIA'nın 21 Mart 2024'te duyurduğu LATTE3D modeli, metin istemlerinden anında 3 boyutlu temsiller oluşturan bir metinden 3D'ye yapay zeka modelidir.
  • CEO David Holz tarafından ipucu verilen Midjourney'nin yeni metinden videoya dönüştürücüsü Ocak ayında eğitime başladı ve yakında piyasaya sürülmesi bekleniyor.
  • Yapay zeka PC devrimini ilerleten Lenovo, 8 Ocak 2024'te E Ink Prism teknolojisine sahip ThinkBook 13x ve yüksek performanslı yapay zeka dizüstü bilgisayarlarını piyasaya sürdü.

Yapay zeka trendlerini bizimle takip et!#

2024'ün başlangıcı, yapay zekada çığır açan gelişmelere ve birçok önemli teknolojik kilometre taşına sahne oldu. Ancak bu, yapay zekanın yapabileceklerinin sadece başlangıcı. En son yapay zeka gelişmeleri hakkında daha fazla bilgi edinmek istiyorsan, Ultralytics yanında.

Bilgisayarla görü ve yapay zeka alanındaki en son katkılarımızı görmek için GitHub deposu sayfamıza göz atabilirsin. Ayrıca üretim ve sağlık gibi sektörlerde yapay zekanın nasıl kullanıldığını görmek için çözümler sayfalarımızı inceleyebilirsin.

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla