2024 beginnt mit einer Welle generativer KI
Ein Blick auf die spannenden KI-Innovationen des ersten Quartals 2024. Wir behandeln Durchbrüche wie OpenAIs Sora AI, Neuralinks Gehirnchip und die neuesten LLMs.

Die KI-Community scheint fast täglich Schlagzeilen zu machen. Die ersten Monate des Jahres 2024 waren aufregend und voller neuer KI-Innovationen. Von leistungsstarken neuen großen Sprachmodellen bis hin zu Implantaten im menschlichen Gehirn entwickelt sich 2024 zu einem erstaunlichen Jahr.
Wir erleben, wie KI Branchen verändert, Informationen zugänglicher macht und sogar die ersten Schritte zur Verschmelzung unserer Gedanken mit Maschinen ermöglicht. Werfen wir einen Blick zurück auf das erste Quartal 2024 und betrachten wir die Fortschritte, die in nur wenigen Monaten im Bereich KI erzielt wurden.
LLMs liegen im Trend#
Große Sprachmodelle (LLMs), die darauf ausgelegt sind, menschliche Sprache auf Grundlage riesiger Mengen an Textdaten zu verstehen, zu erzeugen und zu verarbeiten, standen im ersten Quartal 2024 im Mittelpunkt. Viele große Technologieunternehmen veröffentlichten eigene LLM-Modelle mit jeweils einzigartigen Fähigkeiten. Der beeindruckende Erfolg früherer LLMs wie GPT-3 hat diesen Trend inspiriert. Hier sind einige der bemerkenswertesten LLM-Veröffentlichungen von Anfang 2024.
Claudes 3 von Anthropic#
Anthropic veröffentlichte Claude 3 am 14. März 2024. Das Modell Claude 3 ist in drei Versionen erhältlich: Opus, Sonnet und Haiku, die jeweils für unterschiedliche Märkte und Zwecke entwickelt wurden. Haiku, das schnellste Modell, ist für schnelle, einfache Antworten optimiert. Sonnet verbindet Geschwindigkeit mit Intelligenz und richtet sich an Anwendungen in Unternehmen. Opus, die fortschrittlichste Version, bietet unübertroffene Intelligenz und Schlussfolgerungsfähigkeiten und eignet sich ideal für komplexe Aufgaben und Spitzenwerte in Benchmarks.
Claude 3 bietet zahlreiche fortschrittliche Funktionen und Verbesserungen:
- Verbesserte mehrsprachige Gespräche: Verbesserte Fähigkeiten in Sprachen wie Spanisch, Japanisch und Französisch.
- Fortschrittliche Bildverarbeitungsfunktionen: Kann verschiedene visuelle Formate verarbeiten.
- Weniger Verweigerungen: Zeigt mehr Verständnis und verweigert Anfragen seltener unnötig, was auf ein verbessertes Kontextverständnis hindeutet.
- Erweitertes Kontextfenster: Es bietet ein Kontextfenster von 200.000 Tokens, kann je nach Bedarf des Kunden jedoch Eingaben mit mehr als 1 Million Tokens verarbeiten.

Abb. 1: Claude 3 verfügt über ein besseres Kontextverständnis als frühere Versionen.
DBRX von Databricks#
Databricks DBRX ist ein offenes, universell einsetzbares LLM, das Databricks am 27. März 2024 veröffentlicht hat. DBRX erzielt in verschiedenen Benchmarks, darunter Sprachverständnis, Programmierung und Mathematik, sehr gute Ergebnisse. Es übertrifft andere etablierte Modelle und ist dabei etwa 40 % kleiner als vergleichbare Modelle.

Abb. 2: Vergleich von DBRX mit anderen Modellen.
DBRX wurde mithilfe der Vorhersage des nächsten Tokens und einer fein abgestuften Mixture-of-Experts-Architektur (MoE) trainiert. Dadurch sind deutliche Verbesserungen bei der Trainings- und Inferenzleistung möglich. Die Architektur ermöglicht es dem Modell, das nächste Wort einer Sequenz genauer vorherzusagen, indem es eine vielfältige Gruppe spezialisierter Teilmodelle (die „Experten“) konsultiert. Diese Teilmodelle sind auf die Verarbeitung verschiedener Informationsarten oder Aufgaben spezialisiert.
Gemini 1.5 von Google#
Google stellte am 15. Februar 2024 Gemini 1.5 vor, ein rechenressourceneffizientes, multimodales KI-Modell, das umfangreiche Text-, Video- und Audiodaten analysieren kann. Das neueste Modell ist hinsichtlich Leistung, Effizienz und Fähigkeiten fortschrittlicher. Ein wichtiges Merkmal von Gemini 1.5 ist sein Durchbruch beim Verständnis langer Kontexte. Das Modell kann konsistent bis zu 1 Million Tokens verarbeiten. Die Fähigkeiten von Gemini 1.5 sind auch der neuen MoE-basierten Architektur zu verdanken.

Abb. 3: Vergleich der Kontextlängen beliebter LLMs
Hier sind einige der interessantesten Funktionen von Gemini 1.5:
- Verbesserte Datenverarbeitung: Ermöglicht das direkte Hochladen großer PDFs, von Code-Repositorien oder langer Videos als Prompts. Das Modell kann über verschiedene Modalitäten hinweg schlussfolgern und Text ausgeben.
- Hochladen und Abfragen mehrerer Dateien: Entwickler können jetzt mehrere Dateien hochladen und Fragen stellen.
- Für verschiedene Aufgaben geeignet: Das Modell ist darauf optimiert, auf vielfältige Aufgaben skaliert zu werden, und zeigt Verbesserungen in Bereichen wie Mathematik, Naturwissenschaften, Schlussfolgerungen, Mehrsprachigkeit, Videoverständnis und Code.
Beeindruckende Bilder aus KI#
Im ersten Quartal 2024 wurden generative KI-Modelle vorgestellt, die Bilder und Videos so realistisch erzeugen können, dass sie Debatten über die Zukunft sozialer Medien und die Entwicklung von KI ausgelöst haben. Sehen wir uns die Modelle an, die diese Diskussion maßgeblich beeinflussen.
Sora von OpenAI#
OpenAI, das Unternehmen hinter ChatGPT, kündigte am 15. Februar 2024 ein hochmodernes Deep-Learning-Modell zur Erzeugung von Videos aus Text namens Sora an. Sora ist ein Text-zu-Video-Generator, der auf Grundlage von Text-Prompts der Nutzer Videos von bis zu einer Minute Länge mit hoher visueller Qualität erzeugen kann.
Sieh dir zum Beispiel den folgenden Prompt an.
„Eine wunderschön gerenderte Bastelpapierwelt eines Korallenriffs voller farbenfroher Fische und Meeresbewohner.“
Und hier ist ein Einzelbild aus dem Ausgabevideo.

Abb. 4: Ein Einzelbild aus einem von Sora erzeugten Video.
Die Architektur von Sora macht dies möglich, indem sie Diffusionsmodelle zur Texterzeugung und Transformer-Modelle für strukturelle Kohärenz kombiniert. Bisher wurde der Zugang zu Sora Red-Teamern sowie einer ausgewählten Gruppe von bildenden Künstlern, Designern und Filmemachern gewährt, um die Risiken zu verstehen und Feedback zu erhalten.
Stable Diffusion 3 von Stability AI#
Stability AI kündigte am 22. Februar 2024 die Veröffentlichung von Stable Diffusion 3 an, einem Modell zur Erzeugung von Bildern aus Text. Das Modell kombiniert eine Diffusions-Transformer-Architektur mit Flow Matching. Ein technisches Paper wurde bislang noch nicht veröffentlicht, aber es gibt einige wichtige Funktionen, auf die du achten solltest.

Abb. 5. Das auf dem Prompt „Episches Anime-Kunstwerk eines Zauberers auf einem Berg bei Nacht, der einen kosmischen Zauber in den dunklen Himmel wirkt, auf dem „Stable Diffusion 3“ aus farbenfroher Energie steht“ basierende Ausgabebild (Quelle)
Das neueste Modell von Stable Diffusion bietet eine verbesserte Leistung, Bildqualität und Genauigkeit bei der Erstellung von Bildern mit mehreren Motiven. Stable Diffusion 3 wird außerdem verschiedene Modelle mit 800 Millionen bis 8 Milliarden Parametern anbieten. Nutzer können je nach ihren spezifischen Anforderungen an Skalierbarkeit und Detailgrad auswählen.
Lumiere von Google#
Google brachte am 23. Januar 2024 Lumiere auf den Markt, ein Diffusionsmodell zur Erzeugung von Videos aus Text. Lumiere verwendet eine Architektur namens Space-Time-U-Net oder kurz STUNet. Dadurch versteht Lumiere, wo sich Dinge befinden und wie sie sich in einem Video bewegen. So kann das Modell flüssige und lebensechte Videos erzeugen.

Abb. 6: Ein Einzelbild aus einem Video, das auf dem Prompt „Panda play ukulele at home.“ basiert.
Mit der Fähigkeit, 80 Einzelbilder pro Video zu erzeugen, verschiebt Lumiere die Grenzen und setzt neue Maßstäbe für die Videoqualität im KI-Bereich. Hier sind einige Funktionen von Lumiere:
- Bild-zu-Video: Ausgehend von einem Bild und einem Prompt kann Lumiere Bilder in Videos animieren.
- Stilisierte Erzeugung: Lumiere kann mithilfe eines einzigen Referenzbilds Videos in bestimmten Stilen erzeugen.
- Cinemagraphs: Lumiere kann bestimmte Bereiche innerhalb eines Bildes animieren, um dynamische Szenen zu erzeugen, etwa wenn sich ein bestimmtes Objekt bewegt, während der Rest der Szene statisch bleibt.
- Video-Inpainting: Das Modell kann Teile eines Videos verändern, beispielsweise die Kleidung von Personen oder Details im Hintergrund.
Die Zukunft scheint bereits da zu sein#
Der Beginn des Jahres 2024 brachte auch viele KI-Innovationen hervor, die wie aus einem Science-Fiction-Film wirken. Dinge, die wir früher als unmöglich bezeichnet hätten, werden heute entwickelt. Durch die folgenden Entdeckungen scheint die Zukunft nicht mehr weit entfernt.
Neuralink von Elon Musk#
Neuralink von Elon Musk implantierte am 29. Januar 2024 erfolgreich einen drahtlosen Gehirnchip in einen Menschen. Dies ist ein großer Schritt auf dem Weg, menschliche Gehirne mit Computern zu verbinden. Elon Musk teilte mit, dass sich Neuralinks erstes Produkt namens „Telepathy“ in der Entwicklung befindet.

Abb. 7: Das Neuralink-Implantat
Ziel ist es, Nutzern, insbesondere Menschen, die die Funktionalität ihrer Gliedmaßen verloren haben, zu ermöglichen, Geräte mühelos mit ihren Gedanken zu steuern. Die möglichen Anwendungen gehen über bloße Bequemlichkeit hinaus. Elon Musk stellt sich eine Zukunft vor, in der Menschen mit Lähmungen problemlos kommunizieren können.
HoloTile-Boden von Disney#
Am 18. Januar 2024 stellte Walt Disney Imagineering den HoloTile-Boden vor. Er wurde als weltweit erster omnidirektionaler Laufbandboden für mehrere Personen bezeichnet.

Abb. 8: Disney Imagineer Lanny Smoot präsentiert seine neueste Innovation, den HoloTile-Boden.
Er kann sich wie bei Telekinese unter jeder Person oder jedem Objekt bewegen und so ein immersives Erlebnis in virtueller und erweiterter Realität ermöglichen. Du kannst in jede Richtung gehen und dabei Kollisionen vermeiden. Der HoloTile-Boden von Disney kann auch auf Theaterbühnen eingesetzt werden, um sich auf kreative Weise zu bewegen und Tänze zu ermöglichen.
Vision Pro von Apple#
Am 2. Februar 2024 kam Apples heiß erwartetes Vision Pro-Headset auf den Markt. Es bietet eine Vielzahl von Funktionen und Anwendungen, die das Erlebnis in virtueller und erweiterter Realität neu definieren sollen. Das Vision Pro-Headset richtet sich an ein vielfältiges Publikum, indem es Unterhaltung, Produktivität und räumliches Rechnen miteinander verbindet. Apple gab stolz bekannt, dass zum Marktstart mehr als 600 Apps – von Produktivitätswerkzeugen bis hin zu Spielen und Unterhaltungsdiensten – für Vision Pro optimiert waren.
Devin von Cognition#
Am 12. März 2024 veröffentlichte Cognition einen Assistenten für Softwareentwicklung namens Devin. Devin ist der weltweit erste Versuch eines autonomen KI-Softwareentwicklers. Anders als herkömmliche Programmierassistenten, die Vorschläge liefern oder bestimmte Aufgaben erledigen, ist Devin darauf ausgelegt, ganze Softwareentwicklungsprojekte vom ersten Konzept bis zum Abschluss zu bearbeiten.
Das System kann neue Technologien erlernen, vollständige Apps erstellen und bereitstellen, Fehler finden und beheben, eigene Modelle trainieren, zu Open-Source- und Produktivcodebasen beitragen und sogar echte Entwicklungsaufträge von Websites wie Upwork übernehmen.

Abb. 9: Vergleich von Devin mit anderen Modellen.
Devin wurde anhand von SWE-bench evaluiert, einem anspruchsvollen Benchmark, bei dem Agenten reale GitHub-Probleme aus Open-Source-Projekten wie Django und scikit-learn lösen müssen. Devin löste 13,86 % der Probleme durchgängig korrekt, verglichen mit 1,96 % beim bisherigen Stand der Technik.
Weitere erwähnenswerte Entwicklungen#
Es ist so viel passiert, dass es nicht möglich ist, in diesem Artikel alles abzudecken. Hier sind jedoch einige weitere erwähnenswerte Entwicklungen.
- NVIDIAs am 21. März 2024 angekündigtes LATTE3D ist ein Text-zu-3D-KI-Modell, das aus Text-Prompts sofort 3D-Darstellungen erzeugt.
- Der neue Text-zu-Video-Generator von Midjourney, den CEO David Holz angekündigt hat, begann im Januar mit dem Training und soll bald veröffentlicht werden.
- Lenovo brachte am 8. Januar 2024 das ThinkBook 13x mit E Ink Prism-Technologie und leistungsstarke KI-Laptops auf den Markt und trieb damit die Revolution der KI-PCs voran.
Bleib gemeinsam mit uns über KI-Trends auf dem Laufenden!#
Zu Beginn des Jahres 2024 gab es bahnbrechende Fortschritte in der KI und zahlreiche wichtige technologische Meilensteine. Doch das ist erst der Anfang dessen, was KI leisten kann. Wenn du mehr über die neuesten Entwicklungen im Bereich KI erfahren möchtest, bist du bei Ultralytics genau richtig.
Sieh dir unser GitHub-Repository an, um unsere neuesten Beiträge zu Computer Vision und KI zu entdecken. Du kannst dir auch unsere Lösungsseiten ansehen, um zu erfahren, wie KI in Branchen wie Fertigung und Gesundheitswesen eingesetzt wird.









