2024, üretken yapay zekâ dalgasıyla başlıyor
2024'ün ilk çeyreğindeki heyecan verici yapay zekâ inovasyonlarına göz at. OpenAI'ın Sora yapay zekâsı, Neuralink'in beyin çipi ve en yeni LLM'ler gibi çığır açan gelişmeleri ele alacağız.

Yapay zekâ topluluğu neredeyse her gün manşetlere çıkıyor. 2024'ün ilk birkaç ayı heyecan verici geçti ve yeni yapay zekâ yenilikleriyle doluydu. Güçlü yeni büyük dil modellerinden insan beyni implantlarına kadar 2024 muhteşem bir yıl olacağa benziyor.
Yapay zekânın sektörleri dönüştürdüğünü, bilgiyi daha erişilebilir hâle getirdiğini ve hatta zihinlerimizi makinelerle birleştirmeye yönelik ilk adımları attığını görüyoruz. 2024'ün ilk çeyreğini geriye saralım ve yalnızca birkaç ay içinde yapay zekâ alanında kaydedilen ilerlemeye daha yakından bakalım.
Büyük dil modelleri (LLMs) gündemde#
Büyük miktarda metin verisine dayanarak insan dilini anlamak, üretmek ve işlemek üzere tasarlanan büyük dil modelleri (LLMs), 2024'ün ilk çeyreğinde başrolü üstlendi. Birçok büyük teknoloji şirketi, her biri benzersiz yeteneklere sahip kendi LLM modellerini yayımladı. GPT-3 gibi önceki LLM'lerin inanılmaz başarısı bu eğilime ilham verdi. İşte 2024'ün başlarında yayımlanan en dikkat çekici LLM'lerden bazıları.
Anthropic'in Claude 3'ü#
Anthropic, 14 Mart 2024'te Claude 3'ü yayımladı. Claude 3 modeli üç sürümle geliyor: Opus, Sonnet ve Haiku; her biri farklı pazarlara ve amaçlara hizmet ediyor. En hızlı model olan Haiku, hızlı ve temel yanıtlar için optimize edilmiştir. Sonnet, hızı zekâyla dengeler ve kurumsal uygulamaları hedefler. En gelişmiş sürüm olan Opus, eşsiz bir zekâ ve akıl yürütme sunar; karmaşık görevler ve en iyi kıyaslama sonuçlarını elde etmek için idealdir.
Claude 3 birçok gelişmiş özellik ve iyileştirme sunuyor:
- Geliştirilmiş Çok Dilli Görüşmeler: İspanyolca, Japonca ve Fransızca dâhil olmak üzere çeşitli dillerde iyileştirilmiş yetenekler.
- Gelişmiş Görüntü Özellikleri: Çeşitli görsel biçimleri işleyebilir.
- Azaltılmış Retler: Gereksiz retlerin azalmasıyla daha iyi bir anlayış sergiler ve bağlamsal kavrayışın geliştiğini gösterir.
- Genişletilmiş Bağlam Penceresi: 200K'lık bir bağlam penceresi sunar; ancak müşteri ihtiyaçlarına bağlı olarak 1 milyondan fazla belirteç içeren girdileri işleyebilir.

Şekil 1. Claude 3, önceki sürümlere kıyasla bağlamın daha fazla farkındadır.
Databricks'in DBRX'i#
Databricks DBRX, Databricks tarafından 27 Mart 2024'te yayımlanan açık, genel amaçlı bir LLM'dir. DBRX; dil anlama, programlama ve matematik dâhil olmak üzere çeşitli kıyaslamalarda gerçekten başarılıdır. Benzer modellere kıyasla yaklaşık %40 daha küçük olmasına rağmen diğer yerleşik modelleri geride bırakır.

Şekil 2. DBRX'in diğer modellerle karşılaştırılması.
DBRX, ince ayrıntılı uzmanlar karışımı (MoE) mimarisiyle sonraki belirteç tahmini kullanılarak eğitildi; bu nedenle eğitim ve çıkarım performansında önemli iyileştirmeler görebiliyoruz. Mimarisi, çeşitli uzmanlaşmış alt modellerden ("uzmanlar") oluşan bir kümeye danışarak modelin bir dizideki sonraki kelimeyi daha doğru tahmin etmesini sağlar. Bu alt modeller, farklı bilgi türlerini veya görevleri işleme konusunda başarılıdır.
Google'ın Gemini 1.5'i#
Google, kapsamlı metin, video ve ses verilerini analiz edebilen, hesaplama açısından verimli, çok modlu bir yapay zekâ modeli olan Gemini 1.5'i 15 Şubat 2024'te tanıttı. En yeni model; performans, verimlilik ve yetenekler açısından daha gelişmiştir. Gemini 1.5'in temel özelliklerinden biri, uzun bağlamı anlamadaki çığır açan başarısıdır. Model, 1 milyona kadar belirteci tutarlı biçimde işleyebilir. Gemini 1.5'in yetenekleri, yeni bir MoE tabanlı mimariden de yararlanır.

Şekil 3. Popüler LLM'lerin bağlam uzunluklarının karşılaştırılması
İşte Gemini 1.5'in en ilgi çekici özelliklerinden bazıları:
- Geliştirilmiş Veri İşleme: Büyük PDF'leri, kod depolarını veya uzun videoları istem olarak doğrudan yüklemene olanak tanır. Model, farklı veri türleri arasında akıl yürütebilir ve metin çıktısı verebilir.
- Birden Çok Dosya Yükleme ve Sorgu: Geliştiriciler artık birden fazla dosya yükleyip soru sorabilir.
- Farklı Görevlerde Kullanılabilir: Çeşitli görevlerde ölçeklenmek üzere optimize edilmiştir ve matematik, bilim, akıl yürütme, çok dillilik, video anlama ve kod gibi alanlarda iyileştirmeler sergiler.
Yapay zekâdan büyüleyici görseller#
2024'ün ilk çeyreği, o kadar gerçekçi görseller oluşturabilen üretken yapay zekâ modellerini ortaya çıkardı ki bu modeller sosyal medyanın geleceği ve yapay zekânın ilerlemesi hakkında tartışmalara yol açtı. Gel, bu tartışmayı alevlendiren modellere göz atalım.
OpenAI'ın Sora'sı#
ChatGPT'nin yaratıcısı OpenAI, 15 Şubat 2024'te Sora adlı, son teknoloji bir metinden videoya derin öğrenme modelini duyurdu. Sora, kullanıcı istemlerine dayalı olarak yüksek görsel kaliteye sahip, bir dakika uzunluğunda videolar oluşturabilen bir metinden videoya üreticidir.
Örneğin aşağıdaki isteme bir göz at.
“Renkli balıklar ve deniz canlılarıyla dolu, mercan resifinden oluşan muhteşem şekilde işlenmiş bir kâğıt el işi dünyası.”
İşte çıktı videosundan bir kare.

Şekil 4. Sora tarafından oluşturulan bir videodan kare.
Sora'nın mimarisi, doku üretimi için difüzyon modellerini ve yapısal tutarlılık için Transformer modellerini harmanlayarak bunu mümkün kılar. Şimdiye kadar Sora'ya erişim, riskleri anlamak ve geri bildirim almak amacıyla kırmızı takım üyelerine ve seçilmiş bir grup görsel sanatçıya, tasarımcıya ve film yapımcısına verildi.
Stability AI'ın Stable Diffusion 3'ü#
Stability AI, metinden görüntü üretme modeli olan Stable Diffusion 3'ün gelişini 22 Şubat 2024'te duyurdu. Model, difüzyon Transformer mimarisini ve akış eşleştirmeyi bir araya getiriyor. Henüz teknik bir makale yayımlanmadı; ancak dikkat edilmesi gereken birkaç temel özellik var.

Şekil 5. “Geceleyin bir dağın tepesinde, karanlık gökyüzüne "Stable Diffusion 3" yazan renkli enerjiden oluşan kozmik bir büyü yapan bir büyücünün destansı anime çizimi” istemine dayalı çıktı görüntüsü (Kaynak)
Stable Diffusion'ın en yeni modeli; birden fazla özne içeren görüntüler oluştururken gelişmiş performans, görüntü kalitesi ve doğruluk sunuyor. Stable Diffusion 3 ayrıca 800 milyondan 8 milyara kadar parametre içeren çeşitli modeller sunacak. Kullanıcıların ölçeklenebilirlik ve ayrıntı ihtiyaçlarına göre seçim yapmasına olanak tanıyacak.
Google'ın Lumiere'i#
Google, 23 Ocak 2024'te metinden videoya difüzyon modeli olan Lumiere'i kullanıma sundu. Lumiere, kısaca STUNet olarak adlandırılan Space-Time-U-Net adlı bir mimari kullanır. Bu mimari, Lumiere'in videodaki nesnelerin nerede olduğunu ve nasıl hareket ettiğini anlamasına yardımcı olur. Böylece akıcı ve gerçeğe yakın videolar üretebilir.

Şekil 6. “Evde ukulele çalan panda.” istemine dayalı olarak oluşturulan bir videodan kare.
Video başına 80 kare oluşturabilen Lumiere, sınırları zorluyor ve yapay zekâ alanında video kalitesi için yeni standartlar belirliyor. İşte Lumiere'in bazı özellikleri:
- Görüntüden Videoya: Lumiere, bir görüntü ve istemden başlayarak görüntüleri videolara dönüştürebilir.
- Stilize Üretim: Lumiere, tek bir referans görüntü kullanarak belirli stillerde videolar oluşturabilir.
- Sinemagraflar: Lumiere, bir nesnenin hareket ederken sahnenin geri kalanının sabit kalması gibi dinamik sahneler oluşturmak için görüntü içindeki belirli bölgeleri canlandırabilir.
- Video İç Boyama: Videonun bölümlerini, örneğin içindeki kişilerin kıyafetlerini veya arka plan ayrıntılarını değiştirecek şekilde düzenleyebilir.
Gelecek burada gibi görünüyor#
2024'ün başlangıcı, bilim kurgu filminden çıkmış gibi görünen birçok yapay zekâ yeniliğini de beraberinde getirdi. Daha önce imkânsız olduğunu söyleyeceğimiz şeyler üzerinde artık çalışılıyor. Aşağıdaki keşiflerle gelecek artık o kadar uzak görünmüyor.
Elon Musk'ın Neuralink'i#
Elon Musk'ın Neuralink'i, 29 Ocak 2024'te kablosuz beyin çipini bir insana başarıyla yerleştirdi. Bu, insan beyinlerini bilgisayarlara bağlama yolunda büyük bir adım. Elon Musk, Neuralink'in ‘Telepathy’ adlı ilk ürününün geliştirme sürecinde olduğunu paylaştı.

Şekil 7. Neuralink implantı
Amaç, özellikle uzuv işlevlerini kaybetmiş kullanıcıların cihazları düşünceleriyle zahmetsizce kontrol edebilmesini sağlamak. Olası uygulamalar kolaylığın ötesine geçiyor. Elon Musk, felçli bireylerin kolayca iletişim kurabildiği bir gelecek hayal ediyor.
Disney'in HoloTile Zemini#
Walt Disney Imagineering, 18 Ocak 2024'te HoloTile Zemini tanıttı. Dünyanın ilk çok kişili, çok yönlü koşu bandı zemini olarak adlandırıldı.

Şekil 8. Disney Imagineer Lanny Smoot, en yeni yeniliği olan HoloTile zemini üzerinde poz veriyor.
Sürükleyici bir sanal ve artırılmış gerçeklik deneyimi için herhangi bir kişinin veya nesnenin altında telekinezi gibi hareket edebilir. Üzerindeyken her yöne yürüyebilir ve çarpışmalardan kaçınabilirsin. Disney'in HoloTile Zemini, yaratıcı şekillerde dans etmek ve hareket etmek için tiyatro sahnelerine de yerleştirilebilir.
Apple'ın Vision Pro'su#
2 Şubat 2024'te Apple'ın merakla beklenen Vision Pro başlığı piyasaya çıktı. Sanal ve artırılmış gerçeklik deneyimini yeniden tanımlamak üzere tasarlanmış çeşitli özellik ve uygulamalara sahip. Vision Pro başlığı; eğlenceyi, üretkenliği ve mekânsal bilişimi bir araya getirerek farklı bir kitleye hitap ediyor. Apple, piyasaya sürüldüğünde üretkenlik araçlarından oyun ve eğlence hizmetlerine kadar 600'den fazla uygulamanın Vision Pro için optimize edildiğini gururla duyurdu.
Cognition'ın Devin'i#
Cognition, 12 Mart 2024'te Devin adlı bir yazılım mühendisliği asistanını yayımladı. Devin, dünyanın ilk otonom yapay zekâ yazılım mühendisi olma girişimidir. Öneriler sunan veya belirli görevleri tamamlayan geleneksel kodlama asistanlarının aksine Devin, ilk fikirden tamamlanmaya kadar tüm yazılım geliştirme projelerini ele alacak şekilde tasarlanmıştır.
Yeni teknolojileri öğrenebilir, eksiksiz uygulamalar oluşturup dağıtabilir, hataları bulup düzeltebilir, kendi modellerini eğitebilir, açık kaynaklı ve üretim kod tabanlarına katkıda bulunabilir ve hatta Upwork gibi sitelerden gerçek geliştirme işlerini üstlenebilir.

Şekil 9. Devin'in diğer modellerle karşılaştırılması.
Devin, Django ve scikit-learn gibi açık kaynaklı projelerde bulunan gerçek dünya GitHub sorunlarını çözmeleri istenen ajanlar için zorlu bir kıyaslama olan SWE-bench üzerinde değerlendirildi. Önceki son teknoloji sonucu olan %1,96'ya kıyasla sorunların uçtan uca %13,86'sını doğru şekilde çözdü.
Dikkate değer diğer gelişmeler#
O kadar çok şey oldu ki bu makalede her şeyi ele almak mümkün değil. Ancak işte dikkate değer birkaç gelişme daha.
- 21 Mart 2024'te duyurulan NVIDIA'nın LATTE3D'si, metin istemlerinden anında 3B temsiller oluşturan bir metinden 3B'ye yapay zekâ modelidir.
- CEO David Holz'un ipuçlarını verdiği Midjourney'in yeni metinden videoya üreticisi, ocak ayında eğitime başladı ve yakında kullanıma sunulması bekleniyor.
- Lenovo, yapay zekâ PC devrimini ilerletmek amacıyla 8 Ocak 2024'te E Ink Prism teknolojisine ve yüksek performanslı yapay zekâ dizüstü bilgisayarlara sahip ThinkBook 13x'i piyasaya sürdü.
Yapay zekâ trendlerini bizimle takip et!#
2024'ün başlangıcı, yapay zekâ alanında çığır açan ilerlemelere ve birçok önemli teknolojik dönüm noktasına sahne oldu. Ancak bu, yapay zekânın yapabileceklerinin yalnızca başlangıcı. En son yapay zekâ gelişmeleri hakkında daha fazla bilgi edinmek istersen Ultralytics senin için burada.
Bilgisayarlı görü ve yapay zekâ alanındaki en son katkılarımızı görmek için GitHub depomuza göz at. Yapay zekânın üretim ve sağlık gibi sektörlerde nasıl kullanıldığını görmek için çözüm sayfalarımıza da göz atabilirsin.









