LiveCodeBench
LiveCodeBench ist ein Benchmark mit datierten Aufgaben für AI-Codierungsmodelle. Er testet Codegenerierung, Fehlerbehebung, Schlussfolgerungen zur Programmausführung und die Leistung bei neuen Problemen.
LiveCodeBench ist ein kontinuierlich aktualisierter Benchmark zur Bewertung, wie gut AI-Sprachmodelle Programmierprobleme lösen. Er prüft, ob ein Modell funktionierenden Code erzeugen, Fehler beheben und das Verhalten von Programmen nachvollziehen kann. Sein besonderes Merkmal ist der Zeitbezug: Die Probleme sind mit Veröffentlichungsdaten versehen. So können Bewertende Modelle anhand von Aufgaben testen, die nach dem Trainingsstichtag veröffentlicht wurden – dem spätesten Zeitpunkt, der durch das Trainingsmaterial abgedeckt ist. Dadurch lässt sich die tatsächliche Problemlösungsfähigkeit besser vom Abruf zuvor bekannter Lösungen unterscheiden.
Ursprung und Benchmark-Design#
LiveCodeBench wurde in der Studie von 2024 LiveCodeBench: Ganzheitliche und kontaminationsfreie Bewertung großer Sprachmodelle für Code vorgestellt. Forschende der UC Berkeley, des MIT und der Cornell University entwickelten den Benchmark unter der Leitung von Naman Jain. Er sammelt Wettbewerbsprogrammieraufgaben von LeetCode, AtCoder und Codeforces. Zu den frühen maßgeblichen Vergleichsmodellen gehörten GPT-4 Turbo und Claude 3 Opus, die bei den Bewertungsaufgaben starke Ergebnisse erzielten; DeepSeek-Instruct-33B und Phind-34B waren in den ersten Vergleichen führende frei zugängliche Vergleichsmodelle. Diese Modelle sind historische Bezugspunkte und keine dauerhaften Spitzenreiter der Rangliste.
Die erste Version, release_v1, umfasste 400 Probleme, die von Mai 2023 bis März 2024 veröffentlicht wurden. Spätere Veröffentlichungen auf Hugging Face erweiterten die Sammlung, sodass LiveCodeBench keine dauerhaft festgelegte Größe hat. Ein reproduzierbares Ergebnis muss die verwendete Version und den Bewertungszeitraum angeben.
Wie andere Benchmark-Datensätze stellt der Benchmark gemeinsame Aufgaben und Bewertungsverfahren für den Modellvergleich bereit. Sein datumsbezogenes Bewertungsdesign ermöglicht es Bewertenden zusätzlich, einen gemeinsamen Zeitraum neu veröffentlichter Probleme auszuwählen.
Was LiveCodeBench misst#
LiveCodeBench bewertet vier miteinander verbundene Fähigkeiten von großen Sprachmodellen, also Systemen, die Text einschließlich Quellcode erzeugen und interpretieren:
- Codegenerierung: Ein Programm anhand einer Aufgabenbeschreibung und beispielhafter Ein- und Ausgabepaare erstellen. Die Bewertungsinstanz führt die Lösung mit zusätzlichen Tests aus.
- Selbstkorrektur: Eine fehlerhafte Lösung überarbeiten, nachdem Rückmeldungen zur Ausführung eingegangen sind, etwa eine Ausnahme oder ein fehlgeschlagener Test.
- Codeausführung: Die Ausgabe eines vorgegebenen Programms für eine bestimmte Eingabe vorhersagen. „Ausführung“ bezeichnet hier die Schlussfolgerungsaufgabe des Modells; die Bewertungsinstanz vergleicht seine Vorhersage mit der tatsächlichen Ausführung.
- Vorhersage von Testausgaben: Die erwartete Ausgabe anhand der Aufgabenbeschreibung und einer vorgegebenen Eingabe ableiten, ohne die Implementierung zu erhalten.
Der Unterschied zwischen den letzten beiden Aufgaben ist wichtig. Bei der Codeausführung geht es darum, was ein bestehendes Programm tut; bei der Vorhersage von Testausgaben darum, was eine korrekte Implementierung tun sollte. Die Selbstkorrektur untersucht das Verhalten bei Rückmeldungen und Überarbeitungen, das auch beim agentischen Programmieren zum Einsatz kommt, bei dem AI-Systeme Code planen, schreiben, ausführen und überarbeiten.
Bei der Codegenerierung bedeutet funktionale Korrektheit, alle erforderlichen Tests zu bestehen. Ein Programm kann erfolgreich ausgeführt werden und dennoch falsche Antworten liefern, während ein Ausführungsfehler verhindern kann, dass es überhaupt eine Antwort ausgibt. Beide Fehlerarten beeinträchtigen die Benchmark-Leistung.
Ergebnisse lesen und Kontamination verstehen#
Pass@1 misst die Wahrscheinlichkeit, dass eine einzelne generierte Lösung alle erforderlichen Tests besteht, gemittelt über die Probleme hinweg. Ein angegebener Wert von 60 % bedeutet, dass unter dem festgelegten Bewertungsverfahren ungefähr sechs von zehn Problemen gelöst werden. Das bedeutet nicht, dass jedes Programm 60 % seiner Tests besteht.
Für faire Vergleiche müssen die verwendete Datensatzversion, der Zeitraum, die Aufgabe und die Generierungseinstellungen übereinstimmen. Prompt-Engineering, Abtasteinstellungen, Ausgabelimits und Möglichkeiten zur Fehlerbehebung können das Ergebnis verändern. Aufschlüsselungen nach einfachen, mittleren und schwierigen Aufgaben zeigen außerdem Unterschiede, die sich im Gesamtdurchschnitt verbergen.
Benchmark-Kontamination liegt vor, wenn Bewertungsaufgaben oder Lösungen in den Trainingsdaten eines Modells vorkommen. Diese Form der Datenleckage kann die Ergebnisse künstlich erhöhen, weil das Modell das Material bereits kennt. Die Auswahl von Problemen, die nach dem Trainingsstichtag des Modells veröffentlicht wurden, verringert dieses Risiko. Allerdings sind auch die Zuverlässigkeit des Stichtags und spätere Modellaktualisierungen relevant.
Die Behauptung, ein bestimmtes Modell „führe bei LiveCodeBench“, erfordert daher eine datierte Rangliste und übereinstimmende Bewertungseinstellungen. Ohne diesen Kontext ist eine Rangfolge schwer zu interpretieren.
Anwendungen und verwandte Benchmarks#
LiveCodeBench unterstützt den Vergleich von Codierungsmodellen und hilft dabei festzustellen, ob Schwächen bei der Lösungserstellung, beim Verständnis von Code oder bei der Fehlerbehebung liegen. Die wettbewerbsbasierten Aufgaben liefern Hinweise auf die Fähigkeiten im algorithmischen Programmieren; für eine umfassendere Bewertung der Softwareentwicklung sind außerdem Tests zur Navigation in Code-Repositorien, zum Abhängigkeitsmanagement und zum Integrationsverhalten erforderlich.
LiveBench ist ein eigenständiger, umfassenderer Benchmark, der Bereiche wie logisches Schlussfolgern, Mathematik, Sprache und Codierung abdeckt. Ähnliche Namen bedeuten nicht, dass die Ergebnisse austauschbar sind.
Für Entwicklerinnen und Entwickler, die mit Ultralytics YOLO arbeiten, bietet LiveCodeBench einen Anhaltspunkt bei der Bewertung eines Codierungsassistenten. Eine konkrete ergänzende Arbeitsweise ist der Einsatz von Ultralytics Agent Skills, die kompatiblen Codierungsagenten Anleitungen zur Datensatzaufbereitung, zum Training, zur Inferenz und zum Export bereitstellen.
Wenn der Assistent beim Erstellen einer YOLO26-Anwendung hilft, solltest du den generierten Code getrennt vom Bildverarbeitungsmodell bewerten: Der Validierungsmodus misst die Vorhersagequalität, während der Benchmark-Modus die Genauigkeit und Inferenzgeschwindigkeit verschiedener Bereitstellungsformate vergleicht.










