Die wichtigsten Höhepunkte von Ultralytics auf der YOLO Vision 2025 Shenzhen!
Erlebe die wichtigsten Momente der YOLO Vision 2025 Shenzhen, bei der Ultralytics Innovatoren, Partner und die KI-Community zu einem inspirierenden Tag zusammenbrachte.

Am 26. Oktober feierte YOLO Vision 2025 (YV25) im Gebäude B10 des OCT Creative Culture Park in Shenzhen seine China-Premiere. Das hybride Vision-KI-Event von Ultralytics brachte mehr als 200 Teilnehmende vor Ort zusammen, während viele weitere online über YouTube und Bilibili dabei waren.
Der Livestream von YV25 Shenzhen hat auf YouTube bereits mehr als 3.500 Aufrufe erzielt und erhält weiterhin Aufmerksamkeit, während die Event-Highlights in der Community geteilt werden. Es war ein Tag voller Ideen, Gespräche und praktischer Einblicke in die weitere Entwicklung von Vision-KI.
Der Tag begann mit einer herzlichen Begrüßung durch unsere Gastgeberin Huang Xueying, die alle dazu einlud, sich auszutauschen, zu lernen und sich an den Diskussionen während der gesamten Veranstaltung zu beteiligen. Sie erklärte, dass dies nach der Veranstaltung in London im September die zweite YOLO Vision des Jahres war, und teilte mit, wie spannend es sei, die Vision-KI-Community hier in Shenzhen erneut zusammenzubringen.
In diesem Artikel werfen wir einen Blick zurück auf die Highlights des Tages, darunter die Aktualisierungen der Modelle, die Vorträge, Live-Demos und die Momente in der Community, die alle zusammenbrachten. Legen wir los!
Die bisherige Entwicklung der Ultralytics YOLO-Modelle#
Die erste Keynote des Tages hielt der Gründer und CEO von Ultralytics, Glenn Jocher. Er berichtete, wie sich die Ultralytics YOLO-Modelle von einem Forschungsdurchbruch zu einigen der weltweit meistgenutzten Vision-KI-Modelle entwickelt haben. Glenn erklärte, dass seine frühe Arbeit darauf ausgerichtet war, die Nutzung von YOLO zu vereinfachen.
Er portierte die Modelle zu PyTorch, verbesserte die Dokumentation und stellte alles offen zur Verfügung, damit Entwickler überall darauf aufbauen konnten. Wie er sich erinnerte: „Ich bin 2018 kopfüber eingestiegen. Ich habe beschlossen, dass hier meine Zukunft liegt.“ Was als persönliches Projekt begann, entwickelte sich schnell zu einer globalen Open-Source-Bewegung.

Abb. 1. Glenn Jocher spricht bei der YOLO Vision 2025 Shenzhen auf der Bühne.
Heute ermöglichen die Ultralytics YOLO-Modelle täglich Milliarden von Inferenzvorgängen. Glenn betonte, dass dieses Ausmaß nur dank der Menschen möglich war, die am Aufbau beteiligt waren. Forschende, Ingenieure, Studierende, Hobbyentwickler und Open-Source-Mitwirkende aus aller Welt haben YOLO zu dem gemacht, was es heute ist.
Wie Glenn es ausdrückte: „Fast tausend [Mitwirkende] sind da draußen, und wir sind ihnen sehr dankbar. Ohne diese Menschen wären wir heute nicht dort, wo wir sind.“
Aktuelles zu Ultralytics YOLO26#
Einen ersten Blick auf Ultralytics YOLO26 gab es Anfang dieses Jahres bei der Veranstaltung YOLO Vision 2025 London, bei der es als nächster großer Schritt in der Modellfamilie von Ultralytics YOLO vorgestellt wurde. Bei YV25 Shenzhen informierte Glenn über die Fortschritte seit dieser Ankündigung und gab der KI-Community einen genaueren Einblick in die Entwicklung des Modells.
Ultralytics YOLO26 wurde so entwickelt, dass es kleiner, schneller und genauer ist und zugleich für den praktischen Einsatz in der realen Welt geeignet bleibt. Glenn erklärte, dass das Team im vergangenen Jahr die Architektur verfeinert, die Leistung auf verschiedenen Geräten getestet und Erkenntnisse aus der Forschung sowie Rückmeldungen aus der Community einbezogen hat. Ziel ist es, eine Leistung auf dem neuesten Stand der Technik zu liefern, ohne die Bereitstellung der Modelle zu erschweren.
Was du von Ultralytics YOLO26 erwarten kannst#
Eine der zentralen von Glenn hervorgehobenen Neuerungen ist, dass Ultralytics YOLO26 mit einer speziellen Kampagne zur Hyperparameter-Optimierung kombiniert wird. Dabei wird von einem vollständigen Training von Grund auf auf Feinabstimmung mit größeren Datensätzen umgestellt. Er erläuterte, dass dieser Ansatz deutlich besser an tatsächlichen Anwendungsfällen aus der Praxis ausgerichtet ist.
Hier sind einige der weiteren wichtigen Verbesserungen, die bei der Veranstaltung vorgestellt wurden:
- Vereinfachte Architektur: Die Schicht für Distribution Focal Loss (DFL) wurde entfernt. Dadurch lassen sich die Modelle einfacher und schneller ausführen, während die Genauigkeit auf demselben Niveau bleibt.
- Unterstützung für End-to-End-Inferenz: Ultralytics YOLO26 arbeitet nativ End-to-End, sodass es ohne eine separate NMS-Schicht ausgeführt werden kann. Dadurch wird das Exportieren in Formate wie ONNX und TensorRT sowie die Bereitstellung auf Edge-Hardware deutlich einfacher.
- Bessere Leistung bei kleinen Objekten: Aktualisierte Verlustfunktionen helfen dem Modell, sehr kleine Objekte zuverlässiger zu erkennen. Dies war in der Computer Vision schon lange eine Herausforderung.
- Ein neuer hybrider Optimierer: YOLO26 enthält einen neuen Optimierer, der von aktueller Forschung zum Training großer Sprachmodelle inspiriert ist. Er verbessert die Genauigkeit des Modells und ist nun direkt in das Ultralytics Python-Paket integriert.
Ultralytics YOLO26 ist der nächste Schritt für praxistaugliche Vision-KI#
Zusammen führen diese Aktualisierungen zu Modellen, die auf der CPU bis zu 43 % schneller und zugleich genauer als Ultralytics YOLO11 sind. Damit ist YOLO26 besonders für eingebettete Geräte, Robotik und Edge-Systeme relevant.
Ultralytics YOLO26 wird dieselben Aufgaben und Modellgrößen unterstützen, die derzeit in YOLO11 verfügbar sind. Dadurch entstehen 25 Modellvarianten innerhalb der Familie. Dazu gehören Modelle für Objekterkennung, Segmentierung, Posenschätzung, orientierte Begrenzungsrahmen und Klassifizierung – von Nano bis Extra Large.
Das Team arbeitet außerdem an fünf Varianten, die sich per Prompt steuern lassen. Diese Modelle können einen Text-Prompt entgegennehmen und direkt Begrenzungsrahmen zurückgeben, ohne dass ein Training erforderlich ist.
Dies ist ein früher Schritt hin zu flexibleren, anweisungsbasierten Workflows für Vision-KI, die sich leichter an unterschiedliche Anwendungsfälle anpassen lassen. Die Ultralytics YOLO26-Modelle befinden sich noch in aktiver Entwicklung, aber die ersten Leistungsergebnisse sind vielversprechend, und das Team arbeitet auf eine baldige Veröffentlichung hin.
Ein Blick auf die Ultralytics Platform#
Nach dem Update zu YOLO26 begrüßte Glenn Prateek Bhatnagar, unseren Leiter der Produktentwicklung, zu einer Live-Demo der Ultralytics Platform. Diese Plattform soll zentrale Teile des Computer-Vision-Workflows zusammenführen, darunter das Erkunden von Datensätzen, die Bildannotation, das Trainieren von Modellen und den Vergleich von Ergebnissen.

Abb. 2. Prateek Bhatnagar präsentiert die Ultralytics Platform.
Prateek wies darauf hin, dass die Plattform den Open-Source-Wurzeln von Ultralytics treu bleibt. Sie führt zwei Bereiche für die Community ein: eine Datensatz-Community und eine Projekt-Community, in denen Entwickler zu den Arbeiten anderer beitragen, sie wiederverwenden und verbessern können. Während der Demo zeigte er KI-gestützte Annotation, einfaches Training in der Cloud und die Möglichkeit, Modelle direkt aus der Community feinabzustimmen, ohne lokale GPU-Ressourcen zu benötigen.
Die Plattform befindet sich derzeit in der Entwicklung. Prateek empfahl dem Publikum, Ankündigungen im Auge zu behalten, und wies darauf hin, dass das Team in China wächst, um die Einführung zu unterstützen.
Stimmen hinter YOLO: Die Podiumsdiskussion mit den Autoren#
Als die Dynamik zunahm, ging die Veranstaltung in eine Podiumsdiskussion mit mehreren Forschenden über, die hinter verschiedenen YOLO-Modellen stehen. An der Diskussion nahmen Glenn Jocher sowie Jing Qiu, unsere leitende Machine-Learning-Ingenieurin, Chen Hui, Machine-Learning-Ingenieur bei Meta und einer der Autoren von YOLOv10, sowie Bo Zhang, Algorithmusstratege bei Meituan und einer der Autoren von YOLOv6, teil.

Abb. 3. Eine Podiumsdiskussion über die Entwicklung von YOLO-Modellen mit Huang Xueying, Chen Hui, Bo Zhang, Jing Qiu und Glenn Jocher.
Die Diskussion konzentrierte sich darauf, wie sich YOLO durch den Einsatz in der realen Welt weiterentwickelt. Die Redner gingen darauf ein, dass Fortschritte häufig durch praktische Herausforderungen bei der Bereitstellung vorangetrieben werden, etwa durch die effiziente Ausführung auf Edge-Geräten, die Verbesserung der Erkennung kleiner Objekte und die Vereinfachung des Modell-Exports.
Statt ausschließlich der Genauigkeit hinterherzujagen, betonte das Panel, wie wichtig es ist, Geschwindigkeit, Benutzerfreundlichkeit und Zuverlässigkeit in Produktionsumgebungen auszubalancieren. Eine weitere gemeinsame Erkenntnis war der Wert von Iteration und Rückmeldungen aus der Community.
Hier sind einige weitere interessante Erkenntnisse aus dem Gespräch:
- Erkennung mit offenem Vokabular gewinnt im YOLO-Ökosystem an Bedeutung: Neuere Modelle zeigen, wie die Abstimmung von Bild und Sprache sowie promptbasierte Workflows Objekte außerhalb festgelegter Kategorien erkennen können.
- Leichtgewichtige Aufmerksamkeit setzt sich zunehmend durch: Das Panel erörterte, wie effiziente Aufmerksamkeitsmechanismen anstelle vollständiger Aufmerksamkeit an jeder Stelle die Genauigkeit steigern können, während die Inferenz leicht genug für Edge-Geräte bleibt.
- Mit der Community früh und häufig iterieren: Die Diskussionsteilnehmenden bekräftigten eine Denkweise nach dem Muster „entwickeln – testen – verbessern“. Modelle früher zu veröffentlichen und aus den Erfahrungen der Nutzenden zu lernen, führt zu besseren Ergebnissen als lange Entwicklungszyklen hinter verschlossenen Türen.
Vordenker, die die Zukunft von KI und Vision prägen#
Als Nächstes werfen wir einen genaueren Blick auf einige Keynotes bei YV25 Shenzhen. Führungspersönlichkeiten aus der KI-Community zeigten, wie sich Vision-KI weiterentwickelt – von digitalen Menschen und Robotik bis hin zu multimodalem Schlussfolgern und effizienter Bereitstellung am Rand des Netzwerks.
KI beibringen, menschliche Erfahrungen zu verstehen#
In einer aufschlussreichen Session berichtete Dr. Peng Zhang vom Alibaba Qwen Lab, wie sein Team große Videomodelle entwickelt, die ausdrucksstarke digitale Menschen mit natürlicheren Bewegungen und besserer Steuerbarkeit erzeugen können. Er stellte Wan S2V und Wan Animate vor, die Audio- oder Bewegungsreferenzen nutzen, um realistische Sprache, Gesten und Animationen zu erzeugen und damit die Grenzen einer rein textgesteuerten Generierung zu überwinden.

Abb. 4. Peng Zhang erklärt, wie große Videomodelle digitale Menschen ermöglichen können.
Dr. Zhang sprach außerdem über Fortschritte bei interaktiven Avataren in Echtzeit. Dazu gehören das Zero-Shot-Klonen von Aussehen und Bewegungen sowie leichtgewichtige Modelle, die ein Gesicht direkt aus einem Live-Kamerastream animieren können. Dadurch rückt der reibungslose Betrieb lebensechter digitaler Menschen auf alltäglichen Geräten näher.
Von der Wahrnehmung zur Handlung: Das Zeitalter verkörperter Intelligenz#
Eines der zentralen Themen bei YV25 Shenzhen war der Wandel von Vision-Modellen, die die Welt lediglich sehen, hin zu Systemen, die in ihr handeln können. Anders gesagt: Die Wahrnehmung ist nicht länger das Ende der Verarbeitungskette, sondern wird zum Ausgangspunkt für Handlungen.
In seiner Keynote beschrieb Hu Chunxu von D-Robotics beispielsweise, wie die Entwicklungsbausätze und System-on-a-Chip-Lösungen (SoC) des Unternehmens Sensorik, Bewegungssteuerung in Echtzeit und Entscheidungsfindung auf einer einheitlichen Hard- und Softwareplattform integrieren. Indem Wahrnehmung und Handlung als kontinuierliche Rückkopplungsschleife statt als getrennte Phasen behandelt werden, unterstützt dieser Ansatz Roboter, die sich in realen Umgebungen zuverlässiger bewegen, anpassen und interagieren können.

Abb. 5. Demo von D-Robotics bei der YOLO Vision 2025 in Shenzhen, China.
Alex Zhang von Baidu Paddle griff diese Idee in seinem Vortrag auf. Er erklärte, wie YOLO und PaddleOCR zusammenarbeiten, um Objekte zu erkennen und anschließend den sie umgebenden Text und dessen Struktur zu interpretieren. Dadurch können Systeme Bilder und Dokumente in nutzbare, strukturierte Informationen für Aufgaben wie Logistik, Inspektionen und automatisierte Verarbeitung umwandeln.
Intelligenz am Rand des Netzwerks: Effiziente KI für jedes Gerät#
Ein weiteres interessantes Thema bei YV25 Shenzhen war die zunehmende Effizienz und Leistungsfähigkeit von Vision-KI auf Edge-Geräten.
Paul Jung von DEEPX sprach über die direkte Bereitstellung von YOLO-Modellen auf eingebetteter Hardware, wodurch die Abhängigkeit von der Cloud verringert wird. Durch den Fokus auf niedrigen Energieverbrauch, optimierte Inferenz und hardwarebewusste Modellabstimmung ermöglicht DEEPX die Wahrnehmung in Echtzeit für Drohnen, mobile Roboter und industrielle Systeme in dynamischen Umgebungen.
Liu Lingfei von Moore Threads zeigte ebenfalls, wie die Plattform Moore Threads E300 die Rechenleistung der Zentraleinheit (CPU), der Grafikprozessoreinheit (GPU) und der neuronalen Prozessoreinheit (NPU) integriert, um schnelle Vision-Inferenz auf kompakten Geräten bereitzustellen.
Die Plattform kann mehrere YOLO-Streams mit hohen Bildraten ausführen, und ihre Toolchain vereinfacht Schritte wie Quantisierung, statische Kompilierung und Leistungsoptimierung. Moore Threads hat außerdem eine große Auswahl an Computer-Vision-Modellen und Beispielen für die Bereitstellung als Open Source veröffentlicht, um Entwicklern den Einstieg zu erleichtern.
Vision und Sprache für intelligentere KI-Systeme verbinden#
Bis vor Kurzem erforderte die Entwicklung eines einzelnen Modells, das sowohl Bilder verstehen als auch Sprache interpretieren kann, große Transformer-Architekturen, deren Ausführung kostspielig war. Bei YV25 Shenzhen gab Yue Ziyin von Yuanshi Intelligence einen Überblick über RWKV, eine Architektur, die die Fähigkeiten von Transformern zum Schlussfolgern über lange Kontexte mit der Effizienz rekurrenter Modelle verbindet.
Er erklärte, wie Vision-RWKV dieses Konzept auf Computer Vision anwendet, indem Bilder so verarbeitet werden, dass der Rechenaufwand linear mit der Auflösung steigt. Dadurch eignet sich das Verfahren für Eingaben mit hoher Auflösung und für Edge-Geräte mit begrenzten Rechenressourcen.
Yue zeigte außerdem, wie RWKV in Vision-Sprach-Systemen eingesetzt wird. Dabei werden Bildmerkmale mit Sprachverständnis verbunden, um über die Objekterkennung hinaus auch Szenen, Dokumente und reale Zusammenhänge zu interpretieren.

Abb. 6. Yue Ziyin spricht über die Anwendungen von RWKV.
Stände und Live-Demos, die Vision-KI zum Leben erweckten#
Während die Vorträge auf der Bühne einen Ausblick auf die Zukunft der Vision-KI gaben, zeigten die Stände im Ausstellungsbereich, wie sie bereits heute eingesetzt wird. Die Teilnehmenden konnten live laufende Modelle sehen, Hardwareoptionen vergleichen und direkt mit den Teams sprechen, die diese Systeme entwickeln.
Hier ein Einblick in die präsentierte Technologie:
- Entwicklungs- und Prototyping-Plattformen: Seeed, M5Stack und Infermove präsentierten kompakte Entwicklungsplatinen und Starterkits, mit denen sich Anwendungen auf YOLO-Basis einfach ausprobieren und Ideen schnell in funktionierende Demos umsetzen lassen.
- Leistungsstarke Edge-Hardware: Hailo, DEEPX, Intel und Moore Threads demonstrierten Chips und Module, die für schnelle und effiziente Inferenz entwickelt wurden.
- Workflows für Vision und Sprache: Baidu Paddle und RWKV stellten Software-Stacks vor, die Objekte erkennen und außerdem lesen, interpretieren und Schlussfolgerungen darüber ziehen können, was in einem Bild oder Dokument zu sehen ist.
- Open-Source-Werkzeuge und Community-Tools: Ultralytics und Datawhale bezogen Entwickler mit Live-Modell-Demos, Trainingstipps und praktischer Anleitung ein und unterstrichen damit, wie gemeinsames Wissen Innovation beschleunigt.

Abb. 7. Ein Blick auf den Stand von M5Stack bei YV25 Shenzhen.
Vernetzung mit der Vision-KI-Community#
Neben der spannenden Technologie war es einer der schönsten Aspekte von YV25 Shenzhen, die Computer-Vision-Community und das Ultralytics-Team wieder persönlich zusammenzubringen. Den ganzen Tag über versammelten sich Menschen um die Demos, tauschten sich in den Kaffeepausen aus und führten ihre Gespräche noch lange nach dem Ende der Vorträge weiter.
Forschende, Ingenieure, Studierende und Entwickler verglichen ihre Erfahrungen, stellten Fragen und tauschten Erkenntnisse aus der Praxis aus – von der Bereitstellung bis zum Modelltraining. Dank Cinco Jotas von Grupo Osborne brachten wir mit frisch aufgeschnittenem Jamón sogar einen Hauch spanischer Kultur zur Veranstaltung und schufen damit einen herzlichen Moment der Verbundenheit. Ein schöner Veranstaltungsort, ein begeistertes Publikum und das gemeinsame Gefühl des Aufbruchs machten den Tag zu etwas ganz Besonderem.
Wichtige Erkenntnisse#
Von inspirierenden Keynotes bis hin zu praktischen Demos verkörperte YOLO Vision 2025 Shenzhen den Innovationsgeist, der die Ultralytics-Community auszeichnet. Den ganzen Tag über tauschten Redner und Teilnehmende Ideen aus, erkundeten neue Technologien und verbanden sich durch eine gemeinsame Vision für die Zukunft der KI. Gemeinsam gingen sie voller Energie und Vorfreude auf die nächsten Schritte mit Ultralytics YOLO nach Hause.
Denke neu darüber nach, was mit KI und Computer Vision möglich ist. Tritt unserer Community bei und besuche unser GitHub-Repository, um mehr zu erfahren. Erfahre mehr über Anwendungen wie Computer Vision in der Landwirtschaft und KI im Einzelhandel. Entdecke unsere Lizenzierungsoptionen und beginne noch heute mit Computer Vision!









