Function Calling (Tool Use)
Explore comment l’appel de fonctions et l’utilisation d’outils permettent à l’IA d’interagir avec des API et des bases de données. Apprends à intégrer Ultralytics YOLO26 dans des workflows agentiques dès aujourd’hui.
L’appel de fonctions, souvent appelé utilisation d’outils, est un paradigme puissant de l’intelligence artificielle (IA) moderne qui permet aux modèles d’étendre leurs capacités au-delà de la simple génération de texte ou d’images. Au lieu de répondre uniquement à une invite en se basant sur ses données d’entraînement internes, le modèle peut produire des commandes structurées pour déclencher des fonctions de programmation externes, interroger des bases de données ou interagir avec des REST APIs. Cette approche donne concrètement à l’IA la capacité d’effectuer des actions tangibles dans des environnements numériques.
Lorsqu’un système d’IA utilise l’appel de fonctions, les développeurs fournissent au modèle une liste d’outils disponibles décrits à l’aide de JSON Schema. Si l’invite de l’utilisateur nécessite des données en temps réel ou une action spécifique, le modèle interrompt son processus de génération standard et produit une charge utile au format JSON hautement structurée, correspondant aux paramètres requis par l’outil sélectionné. Des frameworks comme l’API d’appel de fonctions d’OpenAI et le framework d’utilisation d’outils d’Anthropic ont popularisé cette technique, transformant les agents conversationnels en solveurs de problèmes performants.
Applications concrètes#
L’intégration de l’utilisation d’outils dans les workflows transforme le fonctionnement des logiciels. Évaluées par des benchmarks comme le Berkeley Function Calling Leaderboard, ces capacités favorisent une évolution vers des systèmes hautement autonomes.
- Commerce de détail et service client automatisés : Dans l’IA dans le commerce de détail, un assistant virtuel peut utiliser l’appel de fonctions pour consulter les stocks en temps réel. Si un client demande : « Où est ma commande ? », le modèle génère un appel de fonction vers l’API d’une base de données, récupère le statut de suivi et renvoie une réponse en langage naturel.
- Extraction de données assistée par la vision : Un modèle de vision et de langage (VLM) peut utiliser des détecteurs d’objets Ultralytics YOLO comme outils. S’il est chargé de vérifier la conformité aux règles de sécurité dans une image d’usine, l’IA conversationnelle principale peut appeler un script exécutant un modèle Ultralytics YOLO26 pour détecter les casques de protection, puis renvoyer de manière transparente les résultats de détection d’objets dans le dialogue de l’utilisateur.
Intégrer la vision par ordinateur comme outil#
Tu peux exposer un modèle de vision par ordinateur comme outil fonctionnel pour un agent d’IA de niveau supérieur. Dans cette architecture, tu définis une méthode Python qui effectue l’inférence et qu’un modèle de raisonnement peut déclencher lorsque des données visuelles sont nécessaires.
from ultralytics import YOLO
# Define a specific tool function for an AI agent to call
def count_objects_in_scene(image_url: str) -> str:
# Load the highly efficient YOLO26 model
model = YOLO("yolo26n.pt")
# Perform inference to analyze the visual data
results = model(image_url)
object_count = len(results[0].boxes)
# Return structured context back to the calling AI system
return f"Vision Analysis: Detected {object_count} objects in the scene."
# Simulated function call executed by an AI system
print(count_objects_in_scene("https://ultralytics.com/images/bus.jpg"))Différencier les termes associés#
Pour bien comprendre les architectures modernes d’IA, il est utile de comprendre comment l’appel de fonctions se rapporte à des concepts similaires et s’en distingue :
- Protocole de contexte des modèles (MCP) : Alors que l’appel de fonctions repose sur des définitions d’API spécifiques transmises dans l’invite du modèle, MCP est une architecture normalisée de niveau supérieur. MCP crée un protocole universel pour connecter les modèles d’IA aux sources de données, tandis que l’appel de fonctions est le mécanisme localisé que les modèles utilisent pour invoquer réellement ces connexions.
- Génération augmentée par récupération (RAG) : Le RAG est une méthodologie conçue spécifiquement pour récupérer des textes ou des documents pertinents afin d’enrichir l’invite d’un LLM. L’appel de fonctions est un mécanisme plus large : une IA peut utiliser un outil pour effectuer une opération de RAG, mais elle peut également s’en servir pour écrire des fichiers sur le disque ou envoyer un e-mail. Tu trouveras des implémentations complètes du RAG utilisant des outils dans la documentation PyTorch et les guides multimodaux Google Gemini.
- Agent d’IA : Un agent d’IA est un système autonome complet qui perçoit son environnement et entreprend des actions pour atteindre un objectif. L’appel de fonctions est la principale compétence qui donne à un agent la capacité d’exécuter ces actions. Lors du déploiement de systèmes agentiques à grande échelle, les équipes utilisent souvent la plateforme Ultralytics pour entraîner et servir de manière transparente les modèles visuels sous-jacents auxquels ces agents font appel pour voir le monde. Les organisations qui passent de modèles statiques à des workflows agentiques s’appuient souvent sur des bibliothèques de deep learning comme TensorFlow pour optimiser les endpoints avec lesquels ces fonctions communiquent.








