Prompt Caching
Entdecke, wie Prompt-Caching generative KI durch die Verringerung von Latenz und Kosten optimiert. Erfahre, welche Rolle es bei LLMs und der Echtzeit-Bildverarbeitung mit Ultralytics YOLO26 spielt.
Prompt-Caching ist eine fortschrittliche Optimierungsstrategie, die hauptsächlich in der generativen KI eingesetzt wird, um Kosten deutlich zu senken und Antwortzeiten während der Inferenz zu verbessern. Im Bereich der großen Sprachmodelle (LLMs) erfordert die Verarbeitung von Text die Umwandlung der Eingaben in numerische Sequenzen, die als Tokens bezeichnet werden. Häufig bleibt ein großer Teil der Eingabedaten – etwa eine detaillierte Systemanweisung, ein umfangreiches juristisches Dokument oder eine Codebasis – über viele verschiedene Benutzeranfragen hinweg unverändert. Statt diese unveränderten Abschnitte für jede neue Anfrage erneut zu verarbeiten, speichert Prompt-Caching die vorberechneten mathematischen Zustände (oft als Key-Value-Cache bezeichnet) im Speicher. Dadurch kann die Inferenz-Engine redundante Berechnungen überspringen und die Rechenleistung ausschließlich auf die neuen, dynamischen Teile des Prompts konzentrieren.
Mechanismen und Vorteile#
Die grundlegenden Mechanismen des Prompt-Cachings beruhen auf der Architektur von Transformern, die Daten sequenziell verarbeiten. Indem das System das sich wiederholende Präfix eines Prompts erkennt, kann es die zugehörigen Zustände des Aufmerksamkeitsmechanismus direkt aus dem Hochgeschwindigkeitsspeicher laden.
- Geringere Latenz: Caching senkt die Inferenzlatenz erheblich, insbesondere die Zeit bis zum ersten Token (TTFT). Dadurch wirken Echtzeitanwendungen wie interaktive Chatbots für den Benutzer unmittelbar reaktionsfähig.
- Kosteneffizienz: Da Anbieter von Cloud Computing häufig nach Rechenzeit oder Token-Verarbeitung abrechnen, führt das Überspringen der aufwendigen Verarbeitung des statischen Kontexts zu erheblichen Einsparungen.
- Höherer Durchsatz: Durch die Freigabe von GPU-Ressourcen können Server eine größere Anzahl gleichzeitiger Anfragen verarbeiten, wodurch die gesamte Bereitstellungsinfrastruktur für Modelle besser skalierbar wird.
Anwendungen in der Praxis#
Prompt-Caching verändert Branchen, die auf umfangreichen Datenkontext angewiesen sind.
-
Programmierassistenten: In der Softwareentwicklung nutzen Tools wie GitHub Copilot umfangreiche Kontextinformationen aus den geöffneten Dateien und der Repository-Struktur des Benutzers. Durch das Caching der Einbettungen der Codebasis kann das Modell in Echtzeit Vorschläge zur Codevervollständigung bereitstellen, ohne die gesamte Dateistruktur des Projekts bei jedem Tastendruck erneut analysieren zu müssen.
-
Juristische und medizinische Analysen: Fachleute stellen KI-Agenten häufig Anfragen zu umfangreichen statischen Dokumenten, etwa Archiven mit Gerichtsentscheidungen oder Aufzeichnungen zur Krankengeschichte von Patienten. Mithilfe der retrieval-augmentierten Generierung (RAG) ruft das System relevante Textabschnitte ab. Prompt-Caching stellt sicher, dass der grundlegende Kontext dieser abgerufenen Dokumente für Folgefragen nicht erneut berechnet werden muss, wodurch der Workflow zur Beantwortung von Fragen optimiert wird.
Bedeutung für Computer Vision#
Obwohl Caching traditionell mit Text in Verbindung gebracht wird, ist das Konzept auch für die multimodale Bildverarbeitung (CV) von entscheidender Bedeutung. Modelle wie YOLO-World ermöglichen es Benutzern, Objekte mithilfe von Text-Prompts mit offenem Vokabular zu erkennen. Wenn ein Benutzer eine Liste von Klassen definiert (z. B. „Person, Rucksack, Auto“), berechnet das Modell Texte Einbettungen für diese Klassen. Das Caching dieser Einbettungen verhindert, dass das Modell die Text-Prompts für jedes einzelne Videobild erneut codieren muss, und ermöglicht so eine schnelle Echtzeit-Inferenz.
Abgrenzung verwandter Begriffe#
- Im Vergleich zu Prompt Engineering: Prompt Engineering umfasst den menschlichen Aufwand, die optimale Texteingabe zu entwerfen, um das Modell zu steuern. Prompt-Caching ist eine rechnerische Optimierung im Backend, die die Verarbeitung dieses Textes durch die Maschine speichert.
- Im Vergleich zu Prompt Tuning: Prompt Tuning ist eine Transfer-Learning-Technik, bei der bestimmte Modellgewichte (Soft-Prompts) aktualisiert werden, um ein Modell an eine Aufgabe anzupassen. Caching verändert die Parameter des Modells nicht, sondern merkt sich lediglich Aktivierungszustände während der Laufzeit.
Codebeispiel: Caching von Texte Einbettungen in der Bildverarbeitung#
Das folgende Python-Snippet veranschaulicht das Konzept des „Cachings“ eines Prompts im Kontext der Bildverarbeitung mithilfe des Pakets ultralytics. Indem die Klassen einmalig in einem YOLO-World-Modell festgelegt werden, werden die Texte Einbettungen berechnet und gespeichert (persistent gespeichert). Dadurch kann das Modell effizient Vorhersagen für mehrere Bilder treffen, ohne die Textbeschreibung erneut zu verarbeiten.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLOWorld("yolov8s-world.pt")
# "Cache" the prompt: Define classes once.
# The model computes and stores text embeddings for these specific terms.
model.set_classes(["helmet", "reflective vest", "gloves"])
# Run inference repeatedly. The text prompt is not re-computed for each call.
# This mimics the efficiency gains of prompt caching in LLMs.
results_1 = model.predict("construction_site_1.jpg")
results_2 = model.predict("construction_site_2.jpg")Für die Verwaltung von Datensätzen und die Bereitstellung dieser optimierten Modelle bietet die Ultralytics Platform eine umfassende Umgebung zum Annotieren von Daten, zum Trainieren hochmoderner Modelle wie YOLO26 und zum Überwachen der Bereitstellungsleistung auf verschiedenen Edge-KI-Geräten.









