Agent Harness
Découvre ce qu’est un harness d’agent IA, comment il gère les outils, la mémoire, la sécurité et les workflows, et comment YOLO26 prend en charge des agents de vision par ordinateur fiables.
Une infrastructure d’agent est la couche logicielle qui transforme un modèle de fondation en agent d’intelligence artificielle pratique. Elle entoure le modèle d’instructions, d’outils, de mémoire, de boucles d’exécution, d’autorisations, de validation et de supervision. Une formule concise tirée de l’anatomie d’une infrastructure d’agent de LangChain est que le modèle fournit l’intelligence, tandis que l’infrastructure la rend utilisable. Cette distinction est importante, car des workflows agentiques fiables dépendent de bien plus que de la seule qualité du modèle. (langchain.com)
Fonctionnement d’une infrastructure d’agent#
Une infrastructure fournit au modèle un contexte à plusieurs reprises, interprète sa réponse, exécute les actions approuvées et renvoie les résultats pour la décision suivante. Ses composants courants comprennent notamment :
- Instructions et contexte : définissent le rôle de l’agent, les informations disponibles, les contraintes et les critères de réussite.
- Exécution des outils : connecte le modèle à des API, des bases de données, des interpréteurs de code ou des modèles de vision au moyen d’interfaces telles que les outils du Model Context Protocol.
- État et mémoire : préservent les plans, les observations, les fichiers et les actions précédentes sur plusieurs étapes ou sessions.
- Flux de contrôle : gère les nouvelles tentatives, les embranchements, les sous-agents, les délais d’expiration, les budgets de tokens et les conditions d’arrêt.
- Traçage et évaluation : enregistre les décisions et les appels d’outils à l’aide de fonctionnalités telles que le traçage d’OpenAI Agents SDK.
- Contrôles de sécurité : appliquent les autorisations, les vérifications des entrées, la validation des sorties et l’approbation humaine au moyen de mécanismes tels que les garde-fous des agents d’OpenAI.
Contrairement à un SDK d’agent, qui fournit des composants réutilisables, une infrastructure correspond au comportement d’exécution configuré pour une application spécifique. Elle se distingue également de MCP, qui standardise les connexions aux outils, et du protocole Agent2Agent de Google, qui se concentre sur la communication entre agents. (modelcontextprotocol.io)
Pourquoi les infrastructures d’agents sont importantes#
Le guide d’OpenAI pour créer des agents et les recommandations d’Anthropic pour créer des agents efficaces conseillent de commencer par des modèles simples et composables. En pratique, une infrastructure bien conçue peut améliorer la fiabilité sans modifier les poids du modèle, en externalisant la gestion courante de l’état et en ajoutant une vérification. Des recherches récentes étudient les infrastructures en langage naturel modifiables, l’optimisation automatique avec Meta-Harness et la composition adaptative avec HarnessX. (arxiv.org)
Exemple de vision par ordinateur#
Dans un agent de vision, Ultralytics YOLO26 peut servir d’outil de perception, tandis que la logique déterministe de l’infrastructure décide de la suite :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
labels = {results[0].names[int(cls)] for cls in results[0].boxes.cls}
action = "Send alert" if "person" in labels else "Continue monitoring"
print(action)Cet exemple combine le mode predict de YOLO avec une règle de décision explicite, plutôt que de laisser au modèle un contrôle sans restriction.
Applications concrètes#
- Inspection visuelle industrielle : une infrastructure capture des images de caméra, exécute la détection des défauts, vérifie les seuils de confiance, ouvre des tickets de maintenance et demande une vérification humaine pour les cas incertains.
- Gestion des files d’attente : un agent de vision compte les personnes, suit le temps d’attente et alerte le personnel uniquement lorsque les limites configurables de capacité et de durée sont dépassées.
Les équipes peuvent utiliser Ultralytics Platform pour annoter des jeux de données, entraîner des modèles de vision spécialisés, déployer des endpoints et les superviser dans le cadre de ces workflows.
Bonnes pratiques#
Garde les outils dans un périmètre restreint, exige une approbation pour les actions irréversibles, rends les nouvelles tentatives idempotentes, valide les sorties structurées et teste les trajectoires complètes plutôt que les seules réponses finales. Suis les risques liés aux applications agentiques de l’OWASP et les normes émergentes du NIST pour les agents d’intelligence artificielle. Des implémentations ouvertes telles qu’OpenHarness illustrent également les autorisations modulaires, les hooks, la mémoire, les outils et la coordination multi-agents. (genai.owasp.org)









