Meta Llama 3 kennenlernen
Llama 3 von Meta wurde kürzlich veröffentlicht und von der KI-Community begeistert aufgenommen. Erfahre mehr über Llama 3 – die neuesten Fortschritte von Meta im Bereich KI.

Als wir die (AI-)Innovationen der künstlichen Intelligenz im ersten Quartal 2024 zusammengetragen haben, stellten wir fest, dass verschiedene Organisationen laufend neue LLMs, also große Sprachmodelle, veröffentlichten. Diesem Trend folgend veröffentlichte Meta am 18. April 2024 Llama 3, ein hochmodernes Open-Source-LLM der nächsten Generation.
Du denkst vielleicht: Es ist doch nur ein weiteres LLM. Warum ist die AI-Community davon so begeistert?
Du kannst zwar Modelle wie GPT-3 oder Gemini für angepasste Antworten feinabstimmen, aber sie bieten keine vollständige Transparenz hinsichtlich ihrer internen Funktionsweise, etwa in Bezug auf Trainingsdaten, Modellparameter oder Algorithmen. Im Gegensatz dazu ist Meta's Llama 3 transparenter, da seine Architektur und Gewichte zum Download bereitstehen. Für die AI-Community bedeutet das mehr Freiheit zum Experimentieren.
In diesem Artikel erfährst du, was Llama 3 kann, wie es entstanden ist und welche Auswirkungen es auf den Bereich der AI hat. Legen wir direkt los!
Die Entwicklung von Meta's Llama-Modellen#
Bevor wir uns Llama 3 widmen, werfen wir einen Blick auf seine früheren Versionen.
Meta brachte Llama 1 im Februar 2023 auf den Markt. Es erschien in vier Varianten mit 7 bis 65 Milliarden Parametern. Im maschinellen Lernen bezeichnet „Parameter“ die Elemente eines Modells, die aus den Trainingsdaten gelernt werden. Aufgrund der geringeren Parameteranzahl hatte Llama 1 manchmal Schwierigkeiten mit einem nuancierten Verständnis und lieferte uneinheitliche Antworten.
Kurz nach Llama 1 brachte Meta im Juli 2023 Llama 2 auf den Markt. Das Modell wurde mit 2 Billionen Tokens trainiert. Ein Token ist ein Textbestandteil, etwa ein Wort oder ein Wortteil, der als grundlegende Dateneinheit für die Verarbeitung im Modell dient. Das Modell verfügte außerdem über Verbesserungen wie ein auf 4096 Tokens verdoppeltes Kontextfenster, um längere Textpassagen zu verstehen, sowie über mehr als 1 Million menschliche Annotationen zur Verringerung von Fehlern. Trotz dieser Verbesserungen benötigte Llama 2 weiterhin viel Rechenleistung – ein Problem, das Meta mit Llama 3 lösen wollte.
Meta's Llama 3 im Überblick#
Llama 3 umfasst vier Varianten, die mit beeindruckenden 15 Billionen Tokens trainiert wurden. Mehr als 5 % dieser Trainingsdaten, etwa 800 Millionen Tokens, entfielen auf Daten in 30 verschiedenen Sprachen. Alle Llama-3-Varianten können auf verschiedenen Typen von Consumer-Hardware ausgeführt werden und verfügen über eine Kontextlänge von 8.000 Tokens.

Abb. 1: Llama 3 im Vergleich zu Llama 2.
Die Modellvarianten sind in zwei Größen verfügbar: 8B und 70B, was jeweils 8 Milliarden beziehungsweise 70 Milliarden Parameter bedeutet. Außerdem gibt es zwei Versionen: Base und Instruct. „Base“ bezeichnet die standardmäßig vortrainierte Version. „Instruct“ ist eine feinabgestimmte Version, die durch zusätzliches Training mit relevanten Daten für bestimmte Anwendungen oder Fachbereiche optimiert wurde.
Dies sind die Modellvarianten von Llama 3:
- Meta-Llama-3-8b: Das 8B-Basismodell bietet grundlegende AI-Funktionen und eignet sich ideal für allgemeine Aufgaben, etwa die Entwicklung von Chatbots für den Kundenservice.
- Meta-Llama-3-8b-instruct: Eine feinabgestimmte Instruct-Version des 8B-Modells, die für bestimmte Aufgaben optimiert ist. Sie kann beispielsweise zur Erstellung von Lernwerkzeugen eingesetzt werden, die komplexe Themen erklären.
- Meta-Llama-3-70b: Das 70B-Basismodell wurde für leistungsstarke AI-Anwendungen entwickelt. Es eignet sich beispielsweise für die Verarbeitung umfangreicher biomedizinischer Literatur zur Wirkstoffentwicklung.
- Meta-Llama-3-70b-instruct: Diese Version wurde ausgehend vom 70B-Modell für hochpräzise Anwendungen feinabgestimmt, etwa zur Analyse juristischer oder medizinischer Dokumente, bei denen Genauigkeit entscheidend ist.
Die Architektur von Meta's Llama 3#
Wie bei allen anderen AI-Fortschritten von Meta wurden während der Entwicklung von Llama 3 strenge Maßnahmen zur Qualitätskontrolle eingesetzt, um die Datenintegrität zu wahren und Verzerrungen zu minimieren. Das Ergebnis ist daher ein leistungsstarkes Modell, das verantwortungsvoll entwickelt wurde.
Die Architektur des Llama-3-Modells zeichnet sich durch ihren Fokus auf Effizienz und Leistung bei Aufgaben der Verarbeitung natürlicher Sprache aus. Sie basiert auf einem Transformer-Framework und legt besonderen Wert auf Recheneffizienz, insbesondere bei der Texterzeugung, indem sie eine reine Decoder-Architektur verwendet.
Das Modell erzeugt Ausgaben ausschließlich auf Grundlage des vorausgehenden Kontexts und verfügt über keinen Encoder zur Kodierung der Eingaben, wodurch es deutlich schneller ist.

Abb. 2: Verantwortungsvolle Modellarchitektur von Llama 3.
Die Llama-3-Modelle verfügen über einen Tokenizer mit einem Vokabular von 128K Tokens. Ein größeres Vokabular ermöglicht es den Modellen, Texte besser zu verstehen und zu verarbeiten. Außerdem verwenden die Modelle jetzt gruppierte Abfrageaufmerksamkeit (GQA), um die Effizienz der Inferenz zu verbessern. GQA kannst du dir als einen Scheinwerfer vorstellen, der den Modellen hilft, sich auf relevante Teile der Eingabedaten zu konzentrieren und dadurch schnellere und genauere Antworten zu erzeugen.
Hier sind einige weitere interessante Details zur Modellarchitektur von Llama 3:
- Dokumentenverarbeitung mit Berücksichtigung von Begrenzungen: Llama 3 bewahrt die Klarheit über Dokumentgrenzen hinweg, was für Aufgaben wie die Zusammenfassung entscheidend ist.
- Besseres Codeverständnis: Die Trainingsdaten von Llama 3 enthalten viermal mehr Codebeispiele, wodurch sich seine Fähigkeiten beim Programmieren verbessern.
- Robuste Qualitätskontrolle: Strenge Maßnahmen, darunter heuristische Filter und die Entfernung von NSFW-Inhalten, gewährleisten die Datenintegrität und minimieren Verzerrungen.
Llama 3 verändert die Art und Weise, wie wir das Training von Modellen angehen#
Für das Training der größten Llama-3-Modelle wurden drei Arten der Parallelisierung kombiniert: Datenparallelisierung, Modellparallelisierung und Pipeline-Parallelisierung.
Bei der Datenparallelisierung werden die Trainingsdaten auf mehrere GPUs verteilt, während bei der Modellparallelisierung die Modellarchitektur aufgeteilt wird, um die Rechenleistung jeder GPU zu nutzen. Die Pipeline-Parallelisierung unterteilt den Trainingsprozess in aufeinanderfolgende Stufen und optimiert dabei Berechnung und Kommunikation.
Die effizienteste Implementierung erreichte eine bemerkenswerte Rechenauslastung von mehr als 400 TFLOPS pro GPU, während gleichzeitig auf 16.000 GPUs trainiert wurde. Diese Trainingsläufe wurden auf zwei eigens entwickelten GPU-Clustern durchgeführt, die jeweils 24.000 GPUs umfassten. Diese umfangreiche Recheninfrastruktur lieferte die erforderliche Leistung, um die groß angelegten Llama-3-Modelle effizient zu trainieren.
Um die GPU-Auslastung zu maximieren, wurde ein neuer fortschrittlicher Trainings-Stack entwickelt, der die Fehlererkennung, Fehlerbehandlung und Wartung automatisiert. Die Zuverlässigkeit der Hardware und die Erkennungsmechanismen wurden erheblich verbessert, um die Risiken einer unbemerkten Datenbeschädigung zu verringern. Außerdem wurden neue skalierbare Speichersysteme entwickelt, um den Aufwand für Checkpoints und Rollbacks zu reduzieren.
Diese Verbesserungen führten zu einer Gesamteffektivität der Trainingszeit von mehr als 95 %. Zusammengenommen steigerten sie die Effizienz des Llama-3-Trainings im Vergleich zu Llama 2 um etwa das Dreifache. Diese Effizienz ist nicht nur beeindruckend, sondern eröffnet auch neue Möglichkeiten für Trainingsmethoden im Bereich der AI.
Mit Llama 3 neue Möglichkeiten eröffnen#
Da Llama 3 Open Source ist, können Forschende und Studierende den Code untersuchen, Experimente durchführen und sich über ethische Fragen und Verzerrungen austauschen. Llama 3 richtet sich jedoch nicht nur an die akademische Welt. Auch in praktischen Anwendungen sorgt es für Aufsehen. Es bildet zunehmend das Rückgrat der Chat-Oberfläche von Meta AI und wird nahtlos in Plattformen wie Facebook, Instagram, WhatsApp und Messenger integriert. Mit Meta AI können Nutzer in natürlicher Sprache kommunizieren, personalisierte Empfehlungen erhalten, Aufgaben erledigen und sich einfach mit anderen verbinden.

Abb. 3: Meta AI – unterstützt von Llama 3.
Llama 3 im Vergleich zu anderen LLMs#
Llama 3 erzielt bei mehreren wichtigen Benchmarks, die komplexes Sprachverständnis und Schlussfolgerungsfähigkeiten bewerten, außergewöhnlich gute Ergebnisse. Hier sind einige Benchmarks, die verschiedene Aspekte der Fähigkeiten von Llama 3 testen:
- Massive Multitask Language Understanding (MMLU) – misst das Wissen des Modells in verschiedenen Fachbereichen.
- General Purpose Question Answering (GPQA) – bewertet die Fähigkeit des Modells, zusammenhängende und korrekte Antworten auf eine Vielzahl von Fragen zum Allgemeinwissen zu erzeugen.
- HumanEval – konzentriert sich auf Programmier- und Problemlösungsaufgaben und prüft die Fähigkeit des Modells, funktionierenden Programmcode zu erzeugen und algorithmische Herausforderungen zu lösen.
Die herausragenden Ergebnisse von Llama 3 in diesen Tests heben es klar von Wettbewerbern wie Google's Gemma 7B, Mistral's Mistral 7B und Anthropic's Claude 3 Sonnet ab. Den veröffentlichten Statistiken zufolge übertrifft Llama 3, insbesondere das 70B-Modell, diese Modelle in allen genannten Benchmarks.

Abb. 4: Llama 3 im Vergleich zu anderen LLMs.
Meta Llama 3 wird breitem Publikum zugänglich gemacht#
Meta erweitert die Reichweite von Llama 3, indem das Modell auf einer Vielzahl von Plattformen für allgemeine Nutzer und Entwickler verfügbar gemacht wird. Für den Alltag ist Llama 3 in beliebte Plattformen von Meta wie WhatsApp, Instagram, Facebook und Messenger integriert. Nutzer können direkt in diesen Apps auf fortschrittliche Funktionen wie die Suche in Echtzeit und die Erstellung kreativer Inhalte zugreifen.
Llama 3 wird außerdem in tragbare Technologien wie die smarten Ray-Ban Meta-Brillen und das Meta Quest VR-Headset integriert, um interaktive Erlebnisse zu ermöglichen.
Llama 3 ist für Entwickler auf verschiedenen Plattformen verfügbar, darunter AWS, Databricks, Google Cloud, Hugging Face, Kaggle, IBM WatsonX, Microsoft Azure, NVIDIA NIM und Snowflake. Du kannst auch direkt über Meta auf diese Modelle zugreifen. Die große Auswahl an Optionen macht es Entwicklern leicht, diese fortschrittlichen Funktionen von AI-Modellen in ihre Projekte zu integrieren – unabhängig davon, ob sie direkt mit Meta oder über andere beliebte Plattformen arbeiten möchten.
Das Wichtigste in Kürze#
Fortschritte im maschinellen Lernen verändern weiterhin die Art und Weise, wie wir täglich mit Technologie interagieren. Meta's Llama 3 zeigt, dass es bei LLMs nicht mehr nur um die Erzeugung von Text geht. LLMs bewältigen komplexe Probleme und verarbeiten mehrere Sprachen. Insgesamt macht Llama 3 die AI anpassungsfähiger und zugänglicher als je zuvor. Mit Blick auf die Zukunft versprechen geplante Upgrades für Llama 3 noch mehr Funktionen, etwa die Verarbeitung mehrerer Modelle und das Verständnis größerer Kontexte.
Sieh dir unser GitHub-Repository an und tritt unserer Community bei, um mehr über AI zu erfahren. Besuche unsere Lösungsseiten, um zu sehen, wie AI in Bereichen wie Fertigung und Landwirtschaft eingesetzt wird.









