Agent Skills
Agent Skills が再利用可能な指示、ツール、スクリプトをパッケージ化し、AI エージェントに専門的な専門知識を与え、ワークフローを効率化し、コンピュータビジョンタスクを強化する方法を学びます。
Agent Skillsは、AIエージェントに特定のタスクに関する専門的なスキルを付与するための、手順、メタデータ、参考資料、オプションスクリプトの再利用可能なパッケージです。すべての手順を長いシステムプロンプトに詰め込むのではなく、製品の検査、スプレッドシートの分析、組織のデプロイチェックリストへの従属といった特化した機能をパッケージ化し、関連する場合にのみエージェントに読み込ませることができます。
スキルは、汎用的なAIエージェントがドメインスペシャリストのように振る舞うのを助けながら、知識をモジュール化、保守可能、かつポータブルに保ちます。「Claude Skills」はこの広範なアイデアの製品実装の一つであり、「Agent Skills」という用語は、オープンな Agent Skills の概要で説明されている相互運用可能なフォーマットを指す場合もあります。
Agent Skillsの仕組み#
Agent Skills仕様に基づき、スキルは通常、必須の SKILL.md ファイルを含むディレクトリです。このファイルは、スキルの内容とエージェントがアクティブ化すべきタイミングを説明する名前や説明を含むYAMLメタデータから始まります。そのMarkdown本文には、手順、例、制約、およびエッジケースのガイダンスが記載されています。オプションのディレクトリには、実行可能スクリプト、参考文書、スキーマ、またはテンプレートを含めることができます。
スキルは**プログレッシブ・ディスクロージャ(段階的開示)**を使用します。つまり、情報は段階的にエージェントのコンテキストウィンドウに入ります。
- エージェントは最初に、利用可能なスキルの短い名前と説明を確認します。
- リクエストが説明に一致すると、関連する
SKILL.mdが読み込まれます。 - 必要な場合にのみ、サポートリソースの読み込みやバンドルされたスクリプトの実行が行われます。
これにより、不要なトークンの使用が削減され、エージェントは起動時にすべての命令を読み込むことなく、多くの特化機能にアクセスできるようになります。Claude Agent Skills ドキュメントおよびMicrosoft Agent Skills ドキュメントは、エージェントプラットフォームにおけるこの読み込みパターンの例を提供しています。
Agent Skills と関連コンセプトの比較#
Agent Skillsは知識と手順を整理しますが、エージェント自体、そのツール、またはそのアクションを調整するシステムを置き換えるものではありません。
-
ツールと関数呼び出し: ツールは、APIのクエリや推論の実行など、個別の操作を実行します。スキルは、検証ルールやドメインコンテキストを含め、1つまたは複数のツールをいつ、どのように組み合わせて使用するかを説明します。
-
エージェントワークフロー: スキルはエージェントが適応的に指示を解釈することを可能にします。ワークフローはより明示的な実行パスを定義するため、長期間実行されるプロセス、チェックポイント、承認、および固定された順序で実行する必要があるアクションに適しています。
-
Model Context Protocol: MCPは、エージェントが外部リソースやツールを発見および呼び出す方法を標準化します。公式のMCPツール仕様はツールインターフェースを定義し、スキルはそれらのインターフェースを使用するようエージェントに指示する手続き型の専門知識をパッケージ化します。
プロンプトは通常、1つの会話用に作成されます。スキルは、互換性のある環境全体で再利用、バージョン管理、テスト、および共有されることを目的としています。
コンピュータビジョンにおける応用#
Agent Skillsは、視覚的知覚をビジネスルールや後続のアクションと組み合わせる必要がある場合に特に役立ちます。
製造業の検査: 品質管理スキルは、エージェントに画像のキャプチャ、物体検出の実行、検出結果と受け入れ基準の比較、証拠の保存、および信頼度が低い場合の人間によるレビューの要求を指示できます。ビジョンモデルが観察結果を提供し、スキルが工場固有の検査手順を提供します。これにより、エージェントの基本プロンプトにあらゆるポリシーを埋め込むことなく、反復可能な欠陥検出ワークフローをサポートできます。
小売在庫監査: 棚監査スキルは、エージェントが店舗の画像を処理し、指定された商品をカウントし、結果を在庫記録と比較し、補充の推奨事項を準備するのをガイドできます。チームはUltralytics Platformを使用して棚データをアノテーションし、カスタムモデルをトレーニングし、それをデプロイし、スキルが呼び出すビジュアルツールを監視できます。
どちらの場合も、スキルは知覚を運用知識に接続します。スキル自体が基盤となるモデルの視覚的精度を向上させるわけではありませんが、その出力を一貫して適用しやすくします。
スキル向けのビジョンスクリプト例#
スキルは、視覚検査用の決定論的スクリプトをバンドルできます。次の文書化されたUltralytics YOLO予測ワークフローは、スキルの scripts/ ディレクトリに保存できます。
from pathlib import Path
from ultralytics import YOLO
image_url = "https://ultralytics.com/images/bus.jpg"
output_path = Path("inspection_result.jpg")
# Run the skill's visual perception step
model = YOLO("yolo26n.pt")
results = model(image_url)
result = results[0]
result.save(filename=str(output_path))
print(output_path)ここでは、YOLO26が視覚機能を提供し、SKILL.md がスクリプトを実行するタイミング、その出力を解釈する方法、および次にどのアクションを実行すべきかを説明します。
設計とセキュリティに関する考慮事項#
効果的なスキルは、狭い責任範囲、明確な有効化説明、簡潔な指示、現実的な例、および文書化された依存関係を持つ必要があります。公式のスキルオーサリングのベストプラクティスでは、タスクのリスクに合わせて指示の詳細度を調整することを推奨しています。柔軟なガイダンスはオープンエンドの分析に適している一方、壊れやすい操作には正確なスクリプトとより厳格な制約が必要です。
サードパーティのスキルは、インストールされたソフトウェアのように扱う必要があります。アクセスを付与する前に、すべての指示、スクリプト、依存関係、ネットワーク呼び出し、およびファイル操作を確認してください。結果を伴うアクションに対しては、サンドボックス、最小権限のパーミッション、リソース制限、ロギング、および人間の承認を適用します。これらのコントロールは、OWASP プロンプトインジェクションガイダンスおよびOWASP 過剰なエージェンシーガイダンスで説明されているリスクへの対処に役立ちます。また、チームはNIST AI リスク管理フレームワークプレイブックを使用して、スキルの評価、監視、およびガバナンスを広範なAIリスク管理に統合することができます。






