FastVLM: Apple stellt sein neues schnelles Vision-Language-Modell vor
Apple stellt FastVLM auf der CVPR 2025 vor. Dieses quelloffene Vision-Language-Modell verwendet den FastViTHD-Encoder und ermöglicht eine bis zu 85-mal schnellere Zeit bis zum ersten Token.

Auf der CVPR-2025-Konferenz stellte Apple ein neues quelloffenes KI-Modell namens FastVLM vor. Es wurde entwickelt, um sowohl Bilder als auch Sprache zu verstehen, und läuft auf Apple-Geräten wie iPhones, iPads und Macs. Dadurch kann es schnell intelligente Ergebnisse liefern, ohne deine Daten an die Cloud zu senden.
Besonders interessant an FastVLM ist seine hohe Geschwindigkeit und Effizienz. Apple hat einen neuen Bildencoder namens FastViTHD entwickelt, der dem Modell hilft, hochwertige Bilder mit weniger Speicher und Energie zu interpretieren. Die gesamte Verarbeitung findet lokal auf dem Gerät statt. Das führt zu schnelleren Antwortzeiten und schützt gleichzeitig die Privatsphäre der Nutzer.
In diesem Artikel sehen wir uns an, wie FastVLM funktioniert, wodurch es sich auszeichnet und warum diese Veröffentlichung von Apple ein wichtiger Schritt für alltägliche KI-Anwendungen auf deinen Geräten sein könnte.
Visions-Sprach-Modelle (VLMs) verstehen#
Bevor wir uns ansehen, was FastVLM besonders macht, klären wir, wofür das „VLM“ in seinem Namen steht. Es bezeichnet ein Visions-Sprach-Modell, das visuelle Inhalte und Sprache verstehen und miteinander verknüpfen kann.
VLMs verbinden visuelles Verständnis mit Sprache und können dadurch Aufgaben wie das Beschreiben eines Fotos, das Beantworten von Fragen zu einem Bildschirmfoto oder das Extrahieren von Text aus einem Dokument ausführen. Visions-Sprach-Modelle arbeiten typischerweise in zwei Teilen: Einer verarbeitet das Bild und wandelt es in Daten um, während der andere diese Daten interpretiert und eine Antwort erzeugt, die du lesen oder hören kannst.
Vielleicht hast du diese Art von KI-Innovation bereits genutzt, ohne es zu bemerken. Apps, die Belege scannen, Ausweiskarten lesen, Bildbeschreibungen erstellen oder Menschen mit eingeschränktem Sehvermögen bei der Interaktion mit ihren Bildschirmen unterstützen, setzen häufig auf Visions-Sprach-Modelle, die unauffällig im Hintergrund laufen.
Was ist FastVLM?#
Apple hat FastVLM entwickelt, um dieselben Aufgaben wie andere Visions-Sprach-Modelle auszuführen, jedoch mit höherer Geschwindigkeit, besserem Datenschutz und optimierter Leistung auf den eigenen Geräten. Das Modell kann den Inhalt eines Bildes verstehen und mit Text antworten. Anders als viele Modelle, die auf Cloud-Server angewiesen sind, kann FastVLM vollständig auf deinem iPhone, iPad oder Mac laufen.
VLMs erzielen mit hochauflösenden Bildern im Allgemeinen bessere Ergebnisse. Wie unten dargestellt, konnte FastVLM beispielsweise ein Straßenschild erst dann korrekt als „Einfahrt verboten“ erkennen, wenn eine hochauflösende Version des Bildes verwendet wurde. Hochauflösende Eingaben verlangsamen Modelle jedoch normalerweise. Hier kommt FastViTHD ins Spiel.

Abb. 1. Leistung von FastVLM bei Bildern mit niedriger und hoher Auflösung. (Quelle)
Der neue Bildencoder von Apple, FastViTHD, hilft FastVLM dabei, hochwertige Bilder effizienter zu verarbeiten und dabei weniger Speicher und Energie zu verbrauchen. FastViTHD ist so kompakt, dass er auch auf kleineren Geräten reibungslos läuft.
FastVLM ist außerdem öffentlich im FastVLM-GitHub-Repository verfügbar. Dort können Entwickler auf den Quellcode zugreifen, Änderungen vornehmen und ihn gemäß den Lizenzbedingungen von Apple in ihren eigenen Apps verwenden.
FastVLM im Vergleich zu anderen VLM-Modellen#
Im Vergleich zu anderen Visions-Sprach-Modellen ist FastVLM für den Betrieb auf alltäglichen Geräten wie Smartphones und Laptops optimiert. In Leistungstests erzeugte FastVLM sein erstes Wort oder seine erste Ausgabe bis zu 85-mal schneller als Modelle wie LLaVA-OneVision-0.5B.

Abb. 2. Vergleich der Leistung von FastVLM mit anderen Modellen. (Quelle)
Hier findest du einen Überblick über einige der gängigen Benchmarks, anhand derer FastVLM bewertet wurde:
- DocVQA (visuelle Beantwortung von Fragen zu Dokumenten): Dieser Benchmark bewertet, wie gut das Modell Textinformationen in Dokumenten wie gescannten Formularen oder Seiten lesen und verstehen kann.
- TextVQA (textbasierte visuelle Beantwortung von Fragen): Dieser Benchmark bewertet, wie gut das Modell Bilder mit eingebettetem Text interpretieren und zugehörige Fragen korrekt beantworten kann.
- GQA (Beantwortung von Fragen zu Graphen): Diese Aufgabe prüft die Schlussfolgerungsfähigkeiten des Modells, indem es Beziehungen zwischen Objekten und Szenen innerhalb eines Bildes verstehen muss.
- MMMU (umfangreiches multidisziplinäres multimodales Verständnis): Dieser Benchmark misst die Leistung des Modells in einer großen Bandbreite akademischer Fachgebiete und Formate und verbindet visuelles und textuelles Verständnis.
- SeedBench (standardisierte Bewertung verbesserter Daten für das Benchmarking): Dieser Benchmark untersucht die allgemeinen Fähigkeiten des Modells beim visuellen Verständnis und Schlussfolgern in mehreren Bereichen.
Über diese Benchmarks hinweg erzielte FastVLM konkurrenzfähige Ergebnisse und benötigte dabei weniger Ressourcen. Es bringt praxisnahe visuelle KI auf alltägliche Geräte wie Smartphones, Tablets und Laptops.
Der effiziente Bildencoder von FastVLM: FastViTHD#
Als Nächstes sehen wir uns FastViTHD genauer an, den Bildencoder, der eine entscheidende Rolle bei der Bildverarbeitungsleistung von FastVLM spielt.
Die meisten Visions-Sprach-Modelle teilen ein Bild in Tausende kleiner Bildbereiche, sogenannte Token, auf. Je mehr Token vorhanden sind, desto mehr Zeit und Energie benötigt das Modell, um das Bild zu verstehen. Das kann insbesondere auf Smartphones oder Laptops zu einer langsamen Verarbeitung führen.

Abb. 3. So verarbeitet ein Bildencoder ein Bild. (Quelle)
FastViTHD vermeidet die Verlangsamung durch die Verarbeitung zu vieler Token, indem es weniger davon verwendet und trotzdem das gesamte Bild versteht. Es kombiniert zwei Ansätze: Transformer, die sich gut zur Modellierung von Mustern und Beziehungen eignen, und Faltungsschichten, die visuelle Daten effizient verarbeiten. Das Ergebnis ist ein System, das schneller arbeitet und weniger Speicher benötigt.
Laut Apple ist FastViTHD bis zu 3,4-mal kleiner als einige herkömmliche Bildencoder und erreicht dabei weiterhin eine hohe Genauigkeit. Statt auf Modelloptimierungstechniken wie das Beschneiden von Token zu setzen, bei dem weniger wichtige Bildbereiche entfernt werden, um die Verarbeitung zu beschleunigen, erzielt FastViTHD seine Effizienz durch eine einfachere, schlankere Architektur.
Die Modellvarianten und Trainingspipeline von FastVLM#
Apple hat FastVLM in drei verschiedenen Größen veröffentlicht: mit 0,5B, 1,5B und 7B Parametern („B“ steht für Milliarde und bezeichnet die Anzahl der trainierbaren Gewichte im Modell). Jede Version ist für unterschiedliche Gerätetypen ausgelegt. Die kleineren Modelle können auf Smartphones und Tablets laufen, während sich das größere 7B-Modell besser für Desktop-Computer oder anspruchsvollere Aufgaben eignet.
Das gibt Entwicklern die Flexibilität, die beste Lösung für ihre Apps auszuwählen. Sie können eine schnelle, kompakte Anwendung für mobile Geräte oder eine komplexere Anwendung für größere Systeme entwickeln und dabei dieselbe zugrunde liegende Modellarchitektur verwenden.
Apple trainierte die FastVLM-Modellvarianten mit der LLaVA‑1.5-Pipeline, einem Framework zur Abstimmung von Bild- und Sprachmodellen. Für die Sprachkomponente testete Apple FastVLM mit bestehenden quelloffenen Modellen wie Qwen und Vicuna, die für die Erzeugung natürlicher und zusammenhängender Texte bekannt sind. Diese Konfiguration ermöglicht es FastVLM, sowohl einfache als auch komplexe Bilder zu verarbeiten und verständliche, relevante Antworten zu erzeugen.
Die Bedeutung von FastVLM: Apples effizienter Ansatz für KI#
Vielleicht fragst du dich, warum die effiziente Bildverarbeitung von FastVLM wichtig ist. Entscheidend ist, wie reibungslos Apps in Echtzeit arbeiten können, ohne auf die Cloud angewiesen zu sein. FastVLM kann hochauflösende Bilder mit bis zu 1152 × 1152 Pixeln verarbeiten und bleibt dabei schnell und kompakt genug, um direkt auf deinem Gerät zu laufen.
Dadurch können Apps beschreiben, was die Kamera sieht, Belege beim Aufnehmen scannen oder auf Änderungen des Bildschirminhalts reagieren, während alle Daten lokal bleiben. Das ist besonders hilfreich in Bereichen wie Bildung, Barrierefreiheit, Produktivität und Fotografie.
Da FastViTHD auch bei großen Bildern effizient arbeitet, trägt es dazu bei, dass Geräte reaktionsfähig bleiben und sich nicht stark erwärmen. Es funktioniert mit allen Modellgrößen, auch mit der kleinsten, die auf iPhones der Einstiegsklasse läuft. Dadurch können dieselben KI-Funktionen auf Smartphones, Tablets und Macs eingesetzt werden.
Anwendungen von FastVLM#
Dank zentraler Vorteile wie Geschwindigkeit, Effizienz und Datenschutz auf dem Gerät kann FastVLM eine große Bandbreite von Anwendungen unterstützen. Hier sind einige Einsatzmöglichkeiten:
-
Dokumente lesen: Das Modell kann Belege, Formulare oder Ausweiskarten scannen und nur die relevanten Informationen extrahieren. Es kann sich auf bestimmte Bereiche eines Bildes konzentrieren, was für Apps nützlich ist, die eine schnelle und genaue Textextraktion benötigen.
-
Bildbeschreibungen: Durch die Analyse eines Fotos kann das Modell eine klare Beschreibung des Bildinhalts erzeugen. Das unterstützt Funktionen in Kamera-Apps, Fotogalerien oder allen anderen Anwendungen, die von einem visuellen Verständnis in Echtzeit profitieren.
-
Unterstützung der Barrierefreiheit: FastVLM kann Bildschirminhalte für blinde Nutzer oder Nutzer mit eingeschränktem Sehvermögen beschreiben und dadurch die Navigation und Nutzung von Schaltflächen, Menüs und Layoutelementen erleichtern.
-
KI-Assistenten auf dem Gerät: FastVLM eignet sich gut für KI-Assistenten, die schnell verstehen müssen, was auf dem Bildschirm zu sehen ist. Da es direkt auf dem Gerät läuft und Daten vertraulich behandelt, kann es Aufgaben wie das Lesen von Text, das Erkennen von Schaltflächen oder Symbolen und die Anleitung von Nutzern in Echtzeit unterstützen, ohne Informationen an die Cloud senden zu müssen.

Abb. 4. FastVLM kann zur Texterkennung und zur visuellen Beantwortung von Fragen eingesetzt werden. (Quelle)
Wichtige Erkenntnisse#
FastVLM bringt visuelle KI mit Sprachverständnis auf Apple-Geräte und verbindet Geschwindigkeit, Datenschutz und Effizienz. Durch sein kompaktes Design und die Veröffentlichung als quelloffenes Modell ermöglicht es das Verständnis von Bildern in Echtzeit in mobilen und Desktop-Anwendungen.
Das macht KI praktischer und zugänglicher für den Alltag und gibt Entwicklern eine solide Grundlage für die Entwicklung nützlicher, datenschutzorientierter Anwendungen. Mit Blick auf die Zukunft ist es wahrscheinlich, dass Visions-Sprach-Modelle eine wichtige Rolle dabei spielen werden, wie wir mit Technologie interagieren, und KI in alltäglichen Situationen reaktionsfähiger, kontextbewusster und hilfreicher machen.
Erkunde unser GitHub-Repository, um mehr über KI zu erfahren. Werde Teil unserer aktiven Community und entdecke Innovationen in Bereichen wie KI in der Automobilindustrie und visuelle KI in der Fertigungsindustrie. Wenn du heute mit Computer Vision beginnen möchtest, informiere dich über unsere Lizenzoptionen.









