Ultralytics YOLO27:
Veranstaltungen

Generative KI verändert die Zukunft der Computer Vision

Entdecke spannende Einblicke aus einer Podiumsdiskussion bei YOLO Vision 2024. Erfahre, wie generative KI die Zukunft von Vision-AI-Modellen in Echtzeit gestaltet.

ABAbirami Vina7 Min. Lesezeit
Podiumsdiskussion zu generativer KI und Vision AI bei YOLO Vision 2024

Generative KI ist ein Teilgebiet der künstlichen Intelligenz (AI), das neue Inhalte wie Bilder, Texte oder Audio erzeugt, indem es Muster aus vorhandenen Daten lernt. Dank jüngster Fortschritte kann sie nun äußerst realistische Inhalte erstellen, die oft menschliche Kreativität nachahmen.

Der Einfluss generativer KI geht jedoch weit über die reine Erstellung von Inhalten hinaus. Während sich Echtzeit-Computer-Vision-Modelle wie die Ultralytics YOLO-Modelle ständig weiterentwickeln, verändert generative KI auch die Verarbeitung und Erweiterung visueller Daten und ebnet so den Weg für innovative Anwendungen in realen Einsatzszenarien.

Dieser neue technologische Wandel war ein interessantes Gesprächsthema bei [YOLO Vision 2024 (YV24),](https://ultralytics-translation-0.invalid] einer jährlich stattfindenden Hybridveranstaltung von Ultralytics. Bei YV24 kamen KI-Begeisterte und Branchenführende zusammen, um über die neuesten Durchbrüche in der Computer Vision zu sprechen. Im Mittelpunkt der Veranstaltung standen Innovation, Effizienz und die Zukunft von KI-Lösungen in Echtzeit.

Einer der Höhepunkte der Veranstaltung war eine Podiumsdiskussion über YOLO im Zeitalter der generativen KI. Mit dabei waren Glenn Jocher, Gründer und CEO von Ultralytics, Jing Qiu, Senior Machine-Learning-Ingenieur bei Ultralytics, und Ao Wang von der Tsinghua-Universität. Sie erörterten, wie generative KI die Computer Vision beeinflusst und welche Herausforderungen es bei der Entwicklung praxistauglicher KI-Modelle gibt.

In diesem Artikel greifen wir die wichtigsten Erkenntnisse aus dem Gespräch noch einmal auf und sehen uns genauer an, wie generative KI die visuelle KI verändert.

Entwicklung der Ultralytics YOLO-Modelle#

Neben Glenn Jocher haben viele talentierte Ingenieure eine entscheidende Rolle bei der Entwicklung der Ultralytics YOLO-Modelle gespielt. Einer von ihnen, Jing Qiu, berichtete von seinem unerwarteten Einstieg in die Arbeit mit YOLO. Er erklärte, dass seine Begeisterung für KI während des Studiums begann. Er verbrachte viel Zeit damit, das Gebiet zu erkunden und mehr darüber zu lernen. Jing Qiu erinnerte sich daran, wie er über GitHub mit Glenn Jocher in Kontakt kam und sich an verschiedenen KI-Projekten beteiligte.

Ergänzend zu Jing Qius Ausführungen bezeichnete Glenn Jocher GitHub als „eine großartige Möglichkeit, Wissen zu teilen – Menschen, die sich noch nie begegnet sind, kommen zusammen, um sich gegenseitig zu helfen und zur Arbeit der anderen beizutragen. Es ist eine tolle Community und ein wirklich guter Einstieg in die KI.“

Glenn Jocher und Jing Qiu sprechen bei YV24 auf der Bühne

Abb. 1: Glenn Jocher und Jing Qiu sprechen bei YV24 auf der Bühne.

Jing Qius Interesse an KI und seine Arbeit an Ultralytics YOLOv5 trugen dazu bei, das Modell weiterzuentwickeln. Später spielte er eine wichtige Rolle bei der Entwicklung von Ultralytics YOLOv8, das weitere Verbesserungen mit sich brachte. Er beschrieb es als eine unglaubliche Reise. Heute arbeitet Jing Qiu weiterhin an Modellen wie Ultralytics YOLO11 und verbessert sie.

YOLOv10: Für Leistung in der Praxis optimiert#

Ao Wang nahm aus China per Fernzugriff an der Podiumsdiskussion teil und stellte sich als Doktorand vor. Zunächst studierte er Softwaretechnik, doch seine Begeisterung für KI führte ihn zur Computer Vision und zum Deep Learning.

Zum ersten Mal begegnete er dem bekannten YOLO-Modell, als er mit verschiedenen KI-Techniken und -Modellen experimentierte. Seine Geschwindigkeit und Genauigkeit beeindruckten ihn und motivierten ihn, sich intensiver mit Computer-Vision-Aufgaben wie der Objekterkennung zu beschäftigen. Vor Kurzem wirkte Ao Wang an YOLOv10 mit, einer aktuellen Version des YOLO-Modells. Seine Forschung konzentrierte sich darauf, das Modell schneller und genauer zu machen.

Der entscheidende Unterschied zwischen generativer KI und visueller KI#

Anschließend diskutierte die Gesprächsrunde über generative KI. Jing Qiu wies darauf hin, dass generative KI und visuelle KI ganz unterschiedliche Aufgaben haben. Generative KI erstellt oder erzeugt Dinge wie Texte, Bilder und Videos, während visuelle KI analysiert, was bereits vorhanden ist – hauptsächlich Bilder.

Glenn Jocher hob hervor, dass auch die Größe einen großen Unterschied ausmacht. Generative KI-Modelle sind riesig und enthalten oft Milliarden von Parametern – interne Einstellungen, die dem Modell helfen, aus Daten zu lernen. Computer-Vision-Modelle sind deutlich kleiner. Er sagte: „Das kleinste YOLO-Modell, das wir haben, ist etwa tausendmal kleiner als das kleinste LLM [große Sprachmodell]. Es hat also 3 Millionen statt drei Milliarden Parameter.“

Die Podiumsdiskussion über generative KI und visuelle KI bei YV24

Abb. 2: Die Podiumsdiskussion über generative KI und visuelle KI bei YV24.

Jing Qiu ergänzte, dass sich auch die Abläufe beim Training und bei der Bereitstellung generativer KI und Computer Vision stark unterscheiden. Generative KI benötigt leistungsstarke Server, um ausgeführt zu werden. Modelle wie YOLO sind dagegen auf Effizienz ausgelegt und lassen sich mit Standardhardware trainieren und bereitstellen. Dadurch sind Ultralytics YOLO-Modelle für den praktischen Einsatz besser geeignet.

Obwohl sich die beiden Bereiche unterscheiden, beginnen sie sich zunehmend zu überschneiden. Glenn Jocher erklärte, dass generative KI neue Fortschritte in der visuellen KI ermöglicht und Modelle intelligenter und effizienter macht.

Der Einfluss generativer KI auf die Computer Vision#

Generative KI hat sich rasant weiterentwickelt, und ihre Durchbrüche beeinflussen viele andere Bereiche der künstlichen Intelligenz, darunter auch die Computer Vision. Sehen wir uns nun einige spannende Erkenntnisse der Podiumsdiskussion dazu an.

Fortschritte bei der Hardware ermöglichen KI-Innovationen#

Zu Beginn der Podiumsdiskussion erklärte Glenn Jocher, dass es Ideen zum maschinellen Lernen schon lange gibt, Computer damals aber nicht leistungsfähig genug waren, um sie umzusetzen. Für die Verwirklichung dieser KI-Ideen war leistungsfähigere Hardware nötig.

Der Aufstieg der GPUs (Grafikprozessoren) mit ihren Fähigkeiten zur parallelen Verarbeitung in den vergangenen 20 Jahren hat alles verändert. Dadurch wurde das Training von KI-Modellen wesentlich schneller und effizienter, sodass sich Deep Learning rasant weiterentwickeln konnte.

Heutzutage verbrauchen KI-Chips wie TPUs (Tensorprozessoren) und optimierte GPUs weniger Energie und können zugleich größere und komplexere Modelle verarbeiten. Dadurch ist KI zugänglicher und für Anwendungen in der Praxis nützlicher geworden.

Mit jeder Verbesserung der Hardware werden sowohl Anwendungen generativer KI als auch der Computer Vision leistungsfähiger. Diese Fortschritte machen KI in Echtzeit schneller und effizienter und ermöglichen ihren Einsatz in weiteren Branchen.

Wie generative KI Objekterkennungsmodelle prägt#

Auf die Frage, wie generative KI die Computer Vision beeinflusst, sagte Jing Qiu, dass Transformer – Modelle, die der KI helfen, sich auf die wichtigsten Bildbereiche zu konzentrieren – die Art und Weise verändert haben, wie KI Bilder versteht und verarbeitet. Ein wichtiger erster Schritt war DETR (Erkennungs-Transformer), der diesen neuen Ansatz für die Objekterkennung nutzte. Das Modell verbesserte die Genauigkeit, hatte aber Leistungsprobleme, die es in manchen Fällen langsamer machten.

Um dieses Problem zu lösen, entwickelten Forschende hybride Modelle wie RT-DETR. Diese Modelle kombinieren Convolutional Neural Networks (CNNs, Deep-Learning-Modelle, die Merkmale in Bildern automatisch lernen und extrahieren) mit Transformern und schaffen so einen Ausgleich zwischen Geschwindigkeit und Genauigkeit. Dieser Ansatz nutzt die Vorteile von Transformern und beschleunigt zugleich die Objekterkennung.

Interessanterweise verwendet YOLOv10 Transformer-basierte Aufmerksamkeitsmodule – Modellbestandteile, die wie ein Scheinwerfer die wichtigsten Bildbereiche hervorheben und weniger relevante Details ausblenden –, um die Leistung zu steigern.

Ao Wang erwähnte außerdem, wie generative KI die Art und Weise verändert, auf die Modelle trainiert werden. Techniken wie das Maskieren von Bildbereichen helfen der KI, effizienter aus Bildern zu lernen, und verringern den Bedarf an großen, manuell beschrifteten Datensätzen. Dadurch lässt sich Computer Vision schneller und mit geringerem Ressourcenaufwand trainieren.

Die Zukunft der generativen und visuellen KI#

Ein weiterer wichtiger Diskussionspunkt war, wie generative KI und visuelle KI zusammenwirken könnten, um leistungsfähigere Modelle zu entwickeln. Glenn Jocher erklärte, dass die beiden Ansätze zwar unterschiedliche Stärken haben, ihre Kombination aber neue Möglichkeiten eröffnen könnte.

Visuelle KI-Modelle wie YOLO unterteilen ein Bild beispielsweise häufig in ein Raster, um Objekte zu erkennen. Dieser rasterbasierte Ansatz könnte Sprachmodellen dabei helfen, Details genauer zu lokalisieren und zu beschreiben – eine Herausforderung, mit der viele Sprachmodelle heute zu kämpfen haben. Die Kombination dieser Techniken könnte also zu Systemen führen, die Gesehenes präzise erkennen und verständlich erklären können.

Die Zukunft der generativen und visuellen KI

Abb. 3: Die Zukunft der generativen und visuellen KI. Bild vom Autor.

Die wichtigsten Erkenntnisse#

Generative KI und Computer Vision entwickeln sich gemeinsam weiter. Generative KI erzeugt zwar Bilder und Videos, verbessert aber auch deren Analyse, indem sie neue innovative Ideen einbringt, die visuelle KI-Modelle genauer und effizienter machen könnten.

Bei dieser aufschlussreichen Podiumsdiskussion im Rahmen von YV24 teilten Glenn Jocher, Jing Qiu und Ao Wang ihre Gedanken dazu, wie diese Technologien die Zukunft prägen. Dank besserer KI-Hardware werden sich generative KI und visuelle KI weiterentwickeln und noch größere Innovationen hervorbringen. Die beiden Bereiche arbeiten zusammen, um intelligentere, schnellere und nützlichere KI für den Alltag zu schaffen.

Tritt unserer Community bei und sieh dir unser GitHub-Repository an, um mehr über visuelle KI zu erfahren. Informiere dich über unsere Lizenzoptionen, um deine Computer-Vision-Projekte zu starten. Interessierst du dich für Innovationen wie KI in der Fertigung oder Computer Vision im autonomen Fahren? Auf unseren Lösungsseiten erfährst du mehr.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze mit Ultralytics YOLO-Modellen Vision AI für die Überwachung aus der Luft ein. Nutze Computer-Vision-Lösungen für Drohnen, Arbeitsabläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision für Sicherheit

Computer Vision für Sicherheit

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Überwachung von Sicherheitsbereichen, die Gefahrenerkennung, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht Paketprüfung, Sortierung, Fahrzeugverfolgung und die Echtzeitüberwachung der Sicherheit in Lagerhallen.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision-KI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle mit Ultralytics YOLO-Modellen Lösungen für das Gesundheitswesen. Vision-KI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, präzisere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Bildbasierte KI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von PSA-Vorschriften und die Automatisierung von Fertigungslinien.
Mehr erfahren
Computer Vision im Automobilbereich

Computer Vision im Automobilbereich

Setze Computer Vision im Automobilbereich mit Ultralytics-YOLO-Modellen ein. Bildbasierte KI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung und macht Straßen intelligenter.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring bildbasierte KI mit Ultralytics-YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere, nachhaltigere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze mit Ultralytics YOLO-Modellen Vision AI für die Überwachung aus der Luft ein. Nutze Computer-Vision-Lösungen für Drohnen, Arbeitsabläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision für Sicherheit

Computer Vision für Sicherheit

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Überwachung von Sicherheitsbereichen, die Gefahrenerkennung, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht Paketprüfung, Sortierung, Fahrzeugverfolgung und die Echtzeitüberwachung der Sicherheit in Lagerhallen.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision-KI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle mit Ultralytics YOLO-Modellen Lösungen für das Gesundheitswesen. Vision-KI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, präzisere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Bildbasierte KI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von PSA-Vorschriften und die Automatisierung von Fertigungslinien.
Mehr erfahren
Computer Vision im Automobilbereich

Computer Vision im Automobilbereich

Setze Computer Vision im Automobilbereich mit Ultralytics-YOLO-Modellen ein. Bildbasierte KI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung und macht Straßen intelligenter.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring bildbasierte KI mit Ultralytics-YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere, nachhaltigere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze mit Ultralytics YOLO-Modellen Vision AI für die Überwachung aus der Luft ein. Nutze Computer-Vision-Lösungen für Drohnen, Arbeitsabläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision für Sicherheit

Computer Vision für Sicherheit

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Überwachung von Sicherheitsbereichen, die Gefahrenerkennung, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht Paketprüfung, Sortierung, Fahrzeugverfolgung und die Echtzeitüberwachung der Sicherheit in Lagerhallen.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision-KI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle mit Ultralytics YOLO-Modellen Lösungen für das Gesundheitswesen. Vision-KI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, präzisere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Bildbasierte KI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von PSA-Vorschriften und die Automatisierung von Fertigungslinien.
Mehr erfahren
Computer Vision im Automobilbereich

Computer Vision im Automobilbereich

Setze Computer Vision im Automobilbereich mit Ultralytics-YOLO-Modellen ein. Bildbasierte KI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung und macht Straßen intelligenter.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring bildbasierte KI mit Ultralytics-YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere, nachhaltigere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens