Agent Skills
Erfahre, wie Agent Skills wiederverwendbare Anweisungen, Tools und Skripte bündeln, um AI-Agenten spezialisiertes Fachwissen zu vermitteln, Workflows zu optimieren und Computer-Vision-Aufgaben zu unterstützen.
Agentenfähigkeiten sind wiederverwendbare Pakete aus Anweisungen, Metadaten, Referenzmaterialien und optionalen Skripten, die einem KI-Agenten spezialisiertes Wissen für eine bestimmte Aufgabe vermitteln. Anstatt jedes Verfahren in einem langen System-Prompt unterzubringen, können Entwickler eine gezielte Fähigkeit – etwa zur Produktprüfung, Tabellenanalyse oder Befolgung einer organisationsspezifischen Checkliste für die Bereitstellung – als Paket zusammenstellen und den Agenten sie nur laden lassen, wenn sie relevant ist.
Fähigkeiten helfen einem vielseitig einsetzbaren KI-Agenten, sich eher wie ein Fachexperte zu verhalten, während das Wissen modular, wartbar und portabel bleibt. „Claude Skills“ sind eine Produktimplementierung dieser übergeordneten Idee; der Begriff Agentenfähigkeiten kann sich auch auf das interoperable Format beziehen, das in der offenen Übersicht zu Agentenfähigkeiten beschrieben wird.
Funktionsweise von Agentenfähigkeiten#
Gemäß der Spezifikation für Agentenfähigkeiten ist eine Fähigkeit in der Regel ein Verzeichnis, das eine erforderliche Datei namens SKILL.md enthält. Diese Datei beginnt mit YAML-Metadaten, einschließlich eines Namens und einer Beschreibung, aus der hervorgeht, was die Fähigkeit tut und wann der Agent sie aktivieren sollte. Der Markdown-Text der Datei enthält Verfahren, Beispiele, Einschränkungen und Hinweise zu Sonderfällen. Optionale Verzeichnisse können ausführbare Skripte, Referenzdokumente, Schemata oder Vorlagen enthalten.
Fähigkeiten verwenden die schrittweise Offenlegung. Das bedeutet, dass Informationen stufenweise in das Kontextfenster des Agenten gelangen:
- Der Agent sieht zunächst kurze Namen und Beschreibungen der verfügbaren Fähigkeiten.
- Wenn eine Anfrage zu einer Beschreibung passt, lädt er die relevante
SKILL.md. - Er liest unterstützende Ressourcen oder führt gebündelte Skripte nur bei Bedarf aus.
Dadurch wird der unnötige Verbrauch von Token reduziert, und ein Agent kann auf viele spezialisierte Fähigkeiten zugreifen, ohne beim Start jede Anweisung zu laden. Die Dokumentationen zu Claude-Agentenfähigkeiten und Microsoft-Agentenfähigkeiten enthalten Beispiele für dieses Lademuster in Agentenplattformen.
Agentenfähigkeiten und verwandte Konzepte#
Agentenfähigkeiten organisieren Wissen und Verfahren, ersetzen jedoch weder den Agenten selbst noch seine Werkzeuge oder das System, das seine Aktionen koordiniert.
-
Werkzeuge und Funktionsaufrufe: Ein Werkzeug führt eine einzelne Operation aus, etwa die Abfrage einer API oder die Ausführung einer Inferenz. Eine Fähigkeit erklärt, wann und wie ein oder mehrere Werkzeuge gemeinsam verwendet werden, einschließlich Validierungsregeln und domänenspezifischem Kontext.
-
Agentengesteuerte Arbeitsabläufe: Eine Fähigkeit ermöglicht es dem Agenten, Anweisungen flexibel zu interpretieren. Ein Arbeitsablauf definiert einen expliziteren Ausführungspfad und eignet sich daher besser für lang laufende Prozesse, Prüfpunkte, Genehmigungen und Aktionen, die in einer festen Reihenfolge erfolgen müssen.
-
Model Context Protocol: MCP standardisiert, wie Agenten externe Ressourcen und Werkzeuge erkennen und aufrufen. Die offizielle Spezifikation für MCP-Werkzeuge definiert Werkzeug-Schnittstellen, während eine Fähigkeit prozedurales Fachwissen bündelt, das einen Agenten zur Verwendung dieser Schnittstellen anweisen kann.
Ein Prompt wird in der Regel für ein einzelnes Gespräch verfasst. Eine Fähigkeit ist hingegen für die Wiederverwendung, Versionsverwaltung, das Testen und die gemeinsame Nutzung in kompatiblen Umgebungen vorgesehen.
Anwendungen in der Computer Vision#
Agentenfähigkeiten sind besonders nützlich, wenn visuelle Wahrnehmung mit Geschäftsregeln und nachfolgenden Aktionen kombiniert werden muss.
Qualitätsprüfung in der Fertigung: Eine Fähigkeit für die Qualitätskontrolle kann einen Agenten anweisen, ein Bild aufzunehmen, eine Objekterkennung auszuführen, die Erkennungen mit Abnahmekriterien zu vergleichen, Belege zu speichern und bei geringer Konfidenz eine menschliche Prüfung anzufordern. Das Visionsmodell liefert Beobachtungen, während die Fähigkeit das werksspezifische Prüfverfahren bereitstellt. Dadurch werden wiederholbare Arbeitsabläufe zur Fehlererkennung ermöglicht, ohne jede Richtlinie im Basisprompt des Agenten zu hinterlegen.
Prüfung von Lagerbeständen im Einzelhandel: Eine Fähigkeit zur Regalprüfung kann einen Agenten dabei unterstützen, Ladenbilder zu verarbeiten, bestimmte Produkte zu zählen, die Ergebnisse mit Bestandsaufzeichnungen zu vergleichen und eine Empfehlung zur Nachbestückung zu erstellen. Teams können die Ultralytics Platform verwenden, um Regaldaten zu annotieren, ein benutzerdefiniertes Modell zu trainieren, es bereitzustellen und das von der Fähigkeit aufgerufene visuelle Werkzeug zu überwachen.
In beiden Fällen verbinden Fähigkeiten die Wahrnehmung mit operativem Wissen. Sie verbessern nicht von selbst die visuelle Genauigkeit des zugrunde liegenden Modells, sondern erleichtern die konsistente Nutzung seiner Ausgaben.
Beispiel für ein Vision-Skript einer Fähigkeit#
Eine Fähigkeit kann ein deterministisches Skript für die visuelle Prüfung enthalten. Der folgende dokumentierte Ultralytics-YOLO-Ablauf zur Vorhersage könnte im Verzeichnis scripts/ einer Fähigkeit gespeichert werden:
from pathlib import Path
from ultralytics import YOLO
image_url = "https://ultralytics.com/images/bus.jpg"
output_path = Path("inspection_result.jpg")
# Run the skill's visual perception step
model = YOLO("yolo26n.pt")
results = model(image_url)
result = results[0]
result.save(filename=str(output_path))
print(output_path)Hier stellt YOLO26 die visuelle Fähigkeit bereit, während SKILL.md erläutern würde, wann das Skript ausgeführt wird, wie seine Ausgabe zu interpretieren ist und welche Aktion anschließend erfolgen soll.
Überlegungen zu Design und Sicherheit#
Effektive Fähigkeiten sollten klar abgegrenzte Zuständigkeiten, eindeutige Aktivierungsbeschreibungen, präzise Anweisungen, realistische Beispiele und dokumentierte Abhängigkeiten aufweisen. Die offiziellen Best Practices für das Erstellen von Fähigkeiten empfehlen, den Detailgrad der Anweisungen an das Aufgabenrisiko anzupassen: Flexible Leitlinien können für offene Analysen geeignet sein, während fehleranfällige Vorgänge exakte Skripte und engere Einschränkungen erfordern.
Fähigkeiten von Drittanbietern sollten wie installierte Software behandelt werden. Prüfe jede Anweisung, jedes Skript, jede Abhängigkeit, jeden Netzwerkaufruf und jeden Dateivorgang, bevor du Zugriff gewährst. Setze Sandboxing, Berechtigungen nach dem Prinzip der geringsten Privilegien, Ressourcenbeschränkungen, Protokollierung und menschliche Genehmigungen für folgenreiche Aktionen ein. Diese Kontrollen helfen, die in den OWASP-Leitlinien zur Prompt-Injection und den OWASP-Leitlinien zu übermäßiger Autonomie beschriebenen Risiken zu bewältigen. Teams können außerdem das NIST AI Risk Management Framework Playbook verwenden, um die Bewertung, Überwachung und Governance von Fähigkeiten in ein umfassenderes Risikomanagement für KI zu integrieren.









