Prompt Tuning
Entdecke Prompt-Tuning, um Basismodelle effizient ohne vollständiges erneutes Training anzupassen. Erfahre, wie Soft-Prompts die Latenz und den Speicherbedarf für KI-Aufgaben wie YOLO26 reduzieren.
Prompt-Tuning ist eine ressourcenschonende Technik, mit der sich vortrainierte Grundlagenmodelle an bestimmte nachgelagerte Aufgaben anpassen lassen, ohne den gesamten Rechenaufwand für ein erneutes Training des kompletten Netzwerks zu verursachen. Anders als beim herkömmlichen Feinabstimmen, bei dem alle oder die meisten Parameter eines Modells aktualisiert werden, friert Prompt-Tuning die vortrainierten Modellgewichte ein und optimiert nur eine kleine Gruppe lernbarer Vektoren – sogenannte „Soft-Prompts“ –, die den Eingabedaten vorangestellt werden. Dieser Ansatz ermöglicht es, dass ein einziges, sehr großes Backbone gleichzeitig mehrere spezialisierte Anwendungen unterstützt, und reduziert dadurch den Speicherbedarf sowie die Kosten für den Wechsel zwischen verschiedenen Inferenzlatenzen erheblich.
Die Funktionsweise von Prompt-Tuning#
In standardmäßigen Workflows des maschinellen Lernens (ML) werden Eingaben wie Texte oder Bilder in numerische Darstellungen umgewandelt, die als Embeddings bezeichnet werden. Beim Prompt-Tuning werden zusätzliche, trainierbare Embedding-Vektoren in diese Eingabesequenz eingefügt. Während der Trainingsphase verwendet das System Backpropagation, um Gradienten zu berechnen. Der Optimierungsalgorithmus aktualisiert jedoch nur die Werte der Soft-Prompts, während die umfangreiche Modellstruktur unverändert bleibt.
Diese Methode ist eine Form des parametereffizienten Feinabstimmens (PEFT). Durch das Erlernen dieser kontinuierlichen Vektoren wird das Modell auf die gewünschte Ausgabe „ausgerichtet“. Obwohl dieses Konzept ursprünglich aus der Verarbeitung natürlicher Sprache (NLP) stammt, wurde es erfolgreich für Aufgaben der Computer Vision (CV) angepasst und wird dort häufig als Visual Prompt Tuning (VPT) bezeichnet.
Verwandte Konzepte unterscheiden#
Um den Nutzen von Prompt-Tuning zu verstehen, ist es wichtig, zwischen diesem Verfahren und ähnlichen Begriffen aus dem KI-Umfeld zu unterscheiden:
- Prompt Engineering: Dabei werden von Menschen lesbare Textanweisungen (Hard-Prompts) manuell formuliert, um ein Modell für generative KI zu steuern. Dafür sind weder Programmierung noch Training erforderlich. Prompt-Tuning verwendet dagegen überwachtes Lernen, um optimale numerische Embeddings zu finden, die möglicherweise keinen Wörtern der natürlichen Sprache entsprechen.
- Vollständiges Feinabstimmen: Bei herkömmlichen Methoden wird das gesamte neuronale Netzwerk aktualisiert, was häufig zum „katastrophalen Vergessen“ der ursprünglichen Trainingsinhalte führt. Prompt-Tuning bewahrt die ursprünglichen Fähigkeiten des Modells und erleichtert dadurch den Einsatz von Transfer Learning für voneinander unabhängige Aufgaben.
- Few-Shot Learning: Damit ist in der Regel gemeint, einem LLM einige wenige Beispiele im Kontextfenster bereitzustellen. Prompt-Tuning unterscheidet sich davon, weil es Parameter dauerhaft erlernt, speichert und wiederverwendet, anstatt lediglich einen vorübergehenden Kontext bereitzustellen.
Anwendungen in der Praxis#
Prompt-Tuning ermöglicht die skalierbare Bereitstellung von KI in Umgebungen mit begrenzten Ressourcen – eine zentrale Philosophie, die auch die Ultralytics Platform für die Modellverwaltung verfolgt.
-
Mehrsprachiger Kundensupport: Ein global tätiges Unternehmen kann ein zentrales, eingefrorenes Sprachmodell verwenden. Durch das Training leichter Soft-Prompts für Spanisch, Japanisch und Deutsch kann das System sofort zwischen den Sprachen wechseln. Dadurch entfallen die enormen Kosten für das Hosten von drei separaten, mehrere Gigabyte großen Modellen; stattdessen werden nur Prompt-Dateien im Kilobyte-Bereich benötigt.
-
KI im Gesundheitswesen: Die medizinische Bildgebung leidet häufig unter einer geringen Datenverfügbarkeit. Forschende können ein allgemeines Vision-Backbone, etwa einen Vision Transformer, verwenden und es per Prompt-Tuning für die Erkennung bestimmter Anomalien wie Netzhauterkrankungen oder Tumoren anpassen. Dadurch bleibt der Datenschutz von Patientendaten gewahrt, und eine schnelle Anpassung an neue medizinische Geräte ist ohne vollständiges erneutes Training des Modells möglich.
Implementierungsbeispiel#
Das folgende PyTorch-Beispiel veranschaulicht das grundlegende Funktionsprinzip: Die Hauptschichten eines Modells werden eingefroren, und ein separater, trainierbarer Parameter (der „Soft-Prompt“) wird erstellt und so optimiert, dass er die Ausgabe beeinflusst.
import torch
import torch.nn as nn
# 1. Define a dummy backbone (e.g., a pre-trained layer)
backbone = nn.Linear(10, 5)
# 2. Freeze the backbone weights (crucial for prompt tuning)
for param in backbone.parameters():
param.requires_grad = False
# 3. Create a 'soft prompt' vector that IS trainable
# This represents the learnable embeddings prepended to inputs
soft_prompt = nn.Parameter(torch.randn(1, 10), requires_grad=True)
# 4. Initialize an optimizer that targets ONLY the soft prompt
optimizer = torch.optim.SGD([soft_prompt], lr=0.1)
# Verify that only the prompt is being trained
trainable_params = sum(p.numel() for p in [soft_prompt] if p.requires_grad)
print(f"Optimizing {trainable_params} parameters (Soft Prompt only)")Bedeutung für moderne Edge-KI#
Je größer die Modelle werden, desto wichtiger wird die Möglichkeit, sie kostengünstig anzupassen. Obwohl Architekturen wie YOLO26 bereits stark auf Effizienz optimiert sind, bilden das Einfrieren von Backbones und die effiziente Anpassung grundlegende Prinzipien für die Zukunft der Edge-KI. Techniken ähnlich dem Prompt-Tuning ermöglichen es Geräten mit begrenztem Speicher, vielfältige Aufgaben – von der Objekterkennung bis zur Segmentierung – auszuführen, indem einfach kleine Konfigurationsdateien ausgetauscht werden, anstatt umfangreiche neuronale Netzwerke neu zu laden.
Für Entwickler, die effizient trainieren und bereitstellen möchten, stellt der Einsatz von Werkzeugen wie der Ultralytics Platform sicher, dass Modelle für ihre jeweilige Zielhardware optimiert sind und dabei die Best Practices des modernen MLOps nutzen.









