Explorer la détection des petits objets avec Ultralytics YOLO11
Découvre comment Ultralytics YOLO11 assure une détection rapide et précise des petits objets dans des applications concrètes comme la surveillance et la robotique.

Les drones intégrant une IA de vision peuvent voler à plusieurs centaines de mètres au-dessus du sol tout en devant détecter une personne qui n’apparaît que comme quelques pixels dans leur flux vidéo. En fait, il s’agit d’un défi courant dans des applications comme la robotique, la surveillance et la télédétection, où les systèmes doivent identifier des objets très petits dans une image.
Mais les modèles traditionnels de détection d’objets peuvent avoir du mal à y parvenir. Les petits objets dans les images et les vidéos contiennent très peu d’informations visuelles. En termes simples, lorsqu’un modèle les observe, il n’y a pas beaucoup de détails à apprendre ou à reconnaître.
Sous le capot, ces modèles reposent généralement sur une architecture fondée sur un réseau neuronal convolutif (CNN). Les images traversent les différentes couches du réseau et sont transformées en cartes de caractéristiques ou en représentations simplifiées qui mettent en évidence les motifs pertinents plutôt que les pixels bruts.
À mesure que l’image progresse dans le réseau, ces cartes de caractéristiques deviennent plus petites. Cela accélère les calculs, mais signifie également que les détails fins peuvent disparaître.
Pour les objets minuscules, ces détails sont essentiels. Une fois qu’ils ont disparu, un modèle de vision par ordinateur peut avoir du mal à détecter l’objet, ce qui peut entraîner des BBox moins précises ou incohérentes.
Les systèmes de vision par ordinateur temps réel de bout en bout rendent la tâche encore plus délicate. Les images haute résolution contribuent à préserver les détails, mais ralentissent l’inférence et nécessitent davantage de puissance GPU. Les résolutions plus faibles sont plus rapides, mais rendent les petits objets encore plus difficiles à détecter.
Il faut constamment trouver un équilibre entre vitesse, précision et limites matérielles. Grâce aux avancées technologiques récentes, les modèles de vision par ordinateur comme Ultralytics YOLO11 et le prochain Ultralytics YOLO26 sont conçus pour gérer plus efficacement ce compromis.

Fig. 1. Utiliser YOLO11 pour détecter de petits objets dans des images aériennes (Source)
Dans cet article, nous allons examiner pourquoi la détection des petits objets est difficile et comment Ultralytics YOLO11 peut la faciliter. Commençons !
Qu’est-ce que la détection des petits objets et pourquoi est-elle importante ?#
La détection des petits objets est une tâche de vision par ordinateur, une branche de l’IA, qui consiste à identifier et localiser des objets occupant une très petite partie d’une image. Ces objets sont souvent représentés dans l’image par un nombre limité de pixels, qui sont les plus petites unités d’une image numérique. Ils sont donc plus difficiles à détecter que des cibles plus grandes et plus nettes (qui contiennent souvent davantage de pixels).
Par exemple, des véhicules dans des images aériennes, des outils sur le sol d’une usine ou des personnes capturées par des caméras de surveillance grand angle peuvent tous apparaître comme de petits objets dans l’image. Il est important de les détecter, car ils contiennent souvent des informations essentielles et de nombreuses applications concrètes, comme la surveillance, dépendent de ces détections pour fonctionner correctement.
Lorsque de petits objets ne sont pas détectés, les performances du système et la prise de décision peuvent être affectées. La surveillance par véhicule aérien sans pilote (UAV) en est un bon exemple : ne pas détecter un petit objet en mouvement au sol peut nuire à la précision de la navigation ou du suivi.
Les défis liés à la détection des petits objets#
Les premiers systèmes utilisaient des caractéristiques conçues manuellement et des méthodes traditionnelles de vision par ordinateur, qui rencontraient des difficultés dans les scènes chargées ou variées. Même aujourd’hui, alors que les modèles d’apprentissage profond sont bien plus performants, la détection de petites cibles reste difficile lorsqu’elles n’occupent qu’une infime partie de l’image.
Examinons maintenant certains des défis courants qui apparaissent dans différents scénarios réels lors de la détection de petits objets.
Taille, pixels et perte d’informations#
Les petits objets contiennent très peu de pixels, ce qui limite la quantité de détails visuels qu’un modèle peut apprendre lors d’étapes comme l’extraction de caractéristiques. Par conséquent, les motifs tels que les contours, les formes et les textures sont plus difficiles à détecter, ce qui rend les petits objets plus susceptibles de se fondre dans l’arrière-plan.
À mesure que les images traversent les couches convolutives d’un réseau neuronal, les informations visuelles contenues dans les pixels sont progressivement compressées en cartes de caractéristiques. Cela aide le modèle à rester efficace, mais signifie également que les détails fins s’estompent.

Fig. 2. Les cartes de caractéristiques représentent les motifs visuels d’une image (Source)
Pour les petites cibles, des indices importants peuvent disparaître avant que le réseau de détection ait la possibilité d’agir. Dans ce cas, la localisation devient moins fiable et les BBox peuvent se déplacer, se chevaucher ou manquer complètement les objets ciblés.
Occlusion, variation d’échelle et contexte#
Les défis liés à la taille sont également souvent aggravés par l’occlusion. Une occlusion se produit lorsque des objets, en particulier les plus petits, sont partiellement masqués par d’autres objets de la scène.
Cela réduit la zone visible d’une cible et limite les informations disponibles pour le détecteur d’objets. Même une légère occlusion peut perturber les réseaux de détection, en particulier lorsqu’elle est combinée à une entrée basse résolution. On peut notamment l’observer dans des jeux de données UAV comme VisDrone, où des piétons, des vélos ou des véhicules peuvent être partiellement masqués par des bâtiments, des arbres ou d’autres objets en mouvement.

Fig. 3. Un exemple du jeu de données VisDrone montrant de petits objets (Source)
De même, la variation d’échelle ajoute une difficulté supplémentaire lorsque le même objet apparaît très petit ou relativement grand selon la distance et la position de la caméra. Malgré ces obstacles, les algorithmes de détection doivent reconnaître ces petits objets à différentes échelles sans perdre en précision.
Le contexte joue également un rôle important dans la détection. Par exemple, les grands objets apparaissent généralement dans un environnement bien visible qui fournit des indices visuels utiles. À l’inverse, les petites cibles manquent souvent de ces informations contextuelles, ce qui complique la reconnaissance des motifs.
Le problème de la métrique cachée dans la détection des petits objets#
Les métriques d’évaluation courantes, comme l’intersection sur union (IoU), mesurent le degré de chevauchement entre une BBox prédite et la BBox de référence. Si l’IoU fonctionne bien pour les objets plus grands, son comportement est très différent pour les petits objets.
Les petits objets n’occupent que quelques pixels. Ainsi, même un léger décalage de la BBox prédite peut créer une importante erreur proportionnelle et réduire fortement le score IoU. Cela signifie que les petits objets ne franchissent souvent pas le seuil IoU standard utilisé pour considérer une prédiction comme correcte, même lorsque l’objet est visible dans l’image.
Par conséquent, les erreurs de localisation sont plus susceptibles d’être classées comme des faux positifs ou des faux négatifs. Ces limites ont incité les chercheurs à repenser la manière dont les systèmes de détection d’objets évaluent et gèrent les petites cibles difficiles à détecter.
Caractéristiques multi-échelles : la clé de la détection d’objets de petite taille en temps réel#
À mesure que les chercheurs cherchaient à améliorer la détection des petits objets, il est devenu évident qu’il était essentiel de préserver et de représenter les informations visuelles à plusieurs échelles. Cette idée se retrouve dans des recherches récentes publiées sur arXiv ainsi que dans des articles présentés lors d’événements tels que les conférences internationales IEEE et la Conférence européenne sur la vision par ordinateur (ECCV).
À mesure que les images progressent dans un réseau neuronal, les petits objets peuvent perdre des détails ou disparaître complètement. C’est pourquoi les modèles modernes de vision par ordinateur comme Ultralytics YOLO11 accordent une grande importance à l’amélioration de l’extraction des caractéristiques. Examinons maintenant les concepts fondamentaux qui sous-tendent les cartes de caractéristiques et les réseaux pyramidaux de caractéristiques afin de mieux les comprendre.
Cartes de caractéristiques et représentation multi-échelle#
Lorsqu’une image d’entrée, comme une image de télédétection, entre dans un réseau neuronal, elle est progressivement transformée en cartes de caractéristiques. Il s’agit de représentations simplifiées de l’image qui mettent en évidence des motifs visuels tels que les contours, les formes et les textures.
À mesure que le réseau s’approfondit, ces cartes de caractéristiques deviennent plus petites sur le plan spatial. Cette réduction aide le modèle à fonctionner efficacement et à se concentrer sur les informations de haut niveau. Cependant, la réduction de la taille et l’approfondissement des cartes de caractéristiques diminuent également les détails spatiaux.

Fig. 4. L’extraction des caractéristiques est essentielle pour la détection des petits objets. (Source)
Alors que les grands objets conservent suffisamment d’informations visuelles pour être détectés avec précision, les petites cibles peuvent perdre des détails essentiels après seulement quelques couches du réseau. Dans ce cas, un modèle peut avoir du mal à reconnaître qu’un petit objet existe réellement. C’est l’une des principales raisons pour lesquelles les petits objets ne sont pas détectés par les modèles de détection d’objets fondés sur l’apprentissage profond.
Réseaux pyramidaux de caractéristiques et apprentissage multi-échelle#
Les réseaux pyramidaux de caractéristiques, souvent appelés FPN, ont été introduits pour remédier à la perte de détails spatiaux. Ils fonctionnent comme un module complémentaire qui combine les informations de plusieurs couches afin que les modèles puissent détecter plus efficacement les petits objets. Ce processus est également appelé agrégation et fusion des caractéristiques.
Les couches peu profondes fournissent des détails spatiaux fins, tandis que les couches plus profondes ajoutent un contexte sémantique, ce qui permet un apprentissage efficace des caractéristiques à plusieurs échelles. Contrairement au suréchantillonnage naïf, qui se contente d’agrandir les cartes de caractéristiques, FPN préserve les informations pertinentes et améliore la détection des petits objets.
Les approches modernes s’appuient sur cette idée en utilisant une fusion adaptative des caractéristiques et des architectures tenant compte du contexte afin d’améliorer davantage la détection des petites cibles. En d’autres termes, FPN aide les modèles à voir à la fois la vue d’ensemble et les détails minuscules. Cette optimisation est essentielle lorsque les objets sont petits.
L’évolution des modèles de détection d’objets pour gérer les petits objets#
Voici un aperçu de l’évolution et des progrès des modèles de détection d’objets au fil du temps pour mieux détecter des objets de différentes tailles, y compris les très petits objets :
- Premières méthodes de détection : Les premières approches de détection d’objets reposaient sur des caractéristiques conçues manuellement et des algorithmes fondés sur des règles, issus du traitement classique des images. Comme ces caractéristiques étaient fixes, les performances se dégradaient avec des images différentes.
- Introduction de l’apprentissage automatique et de l’apprentissage profond : L’adoption de l’apprentissage automatique et de l’apprentissage profond a marqué un tournant majeur dans la recherche sur la détection d’objets. Au lieu de reposer sur des règles prédéfinies, les réseaux neuronaux ont appris des représentations visuelles directement à partir des données d’entraînement, améliorant leur adaptabilité à différentes tailles d’objets et scènes.
- Réseaux convolutifs : Ces réseaux neuronaux apprennent à voir les motifs dans les images. Chaque couche identifie différents détails, en commençant par les contours et les couleurs simples, puis les formes et, enfin, les objets entiers, ce qui les rend essentiels à la vision par ordinateur moderne.
- Détecteurs d’objets en deux étapes : Les détecteurs en deux étapes, comme Faster R-CNN, introduit par Girshick et Ren, généraient d’abord des régions candidates, puis les classaient. Cette approche améliorait la précision pour les petits objets, mais augmentait le coût de calcul et réduisait les performances en temps réel.
- Détecteurs d’objets en une étape : Les détecteurs en une étape, comme SSD (détecteur à détection unique) et la famille YOLO (You Only Look Once), notamment YOLOv3, Ultralytics YOLOv5 et plus tard Ultralytics YOLOv8, effectuent la détection en un seul passage. Cette conception améliore considérablement la vitesse d’inférence tout en conservant une précision compétitive.
- Modèles de pointe les plus récents : Les nouveaux modèles de détection d’objets mettent davantage l’accent sur les performances en temps réel et le déploiement en périphérie. Les versions récentes des modèles Ultralytics YOLO, comme Ultralytics YOLO11 et le prochain Ultralytics YOLO26, sont conçues pour équilibrer une grande précision et une inférence à faible latence, ce qui les rend particulièrement adaptées à la détection d’objets de toutes tailles, y compris les petites cibles, sur des appareils aux capacités de calcul limitées.
Utiliser Ultralytics YOLO11 pour les cas d’usage de détection des petits objets#
Maintenant que nous comprenons mieux le fonctionnement de la détection des petits objets, examinons quelques applications concrètes dans lesquelles Ultralytics YOLO11 peut être utilisé.
Véhicules aériens sans pilote et imagerie aérienne#
Imagine un drone volant très haut au-dessus d’une rue animée. Depuis cette hauteur, les voitures, les vélos et même les personnes se réduisent à quelques pixels sur un écran.
Les modules de véhicules aériens sans pilote et d’imagerie aérienne capturent souvent ce type de scène, où les objets d’intérêt sont minuscules et entourés d’arrière-plans encombrés, ce qui les rend difficiles à détecter pour les modèles de vision par ordinateur.
Dans ce type de scénario, Ultralytics YOLO11 peut être un choix de modèle idéal. Par exemple, un drone équipé d’un modèle comme YOLO11 pourrait surveiller le trafic en temps réel et détecter les véhicules, les cyclistes et les piétons à mesure qu’ils se déplacent dans la scène, même lorsque chaque objet n’occupe qu’une petite partie de l’image. Cela permet de prendre des décisions plus rapidement et d’obtenir des informations plus précises dans des applications telles que la gestion du trafic, la sécurité publique ou l’urbanisme.
Robotique et automatisation#
Les robots sont souvent utilisés dans des environnements où la précision et le respect des délais sont essentiels. Dans des lieux comme les entrepôts, les usines et les exploitations agricoles, un robot peut devoir reconnaître de très petits objets, comme une pièce sur une chaîne d’assemblage, une étiquette sur un colis ou un jeune bourgeon dans un champ, puis réagir rapidement.
La détection d’objets de cette taille peut être complexe, surtout lorsqu’ils n’apparaissent que comme quelques pixels dans le flux de la caméra ou qu’ils sont partiellement masqués par d’autres objets. Ne pas détecter ces petits détails peut ralentir l’automatisation ou affecter la capacité du robot à accomplir une tâche.
Ultralytics YOLO11 peut faire la différence dans ces situations. Son extraction améliorée des caractéristiques et sa vitesse d’inférence permettent aux robots de détecter de petits objets en temps réel et d’agir immédiatement.
Ultralytics YOLO11 prend également en charge la segmentation d’instances, ce qui peut aider les robots à comprendre plus précisément les contours des objets et les points de préhension, plutôt que de simplement localiser des BBox générales. Par exemple, un bras robotique intégré à YOLO11 pourrait repérer de petits composants sur un tapis roulant, segmenter leur forme exacte et les saisir avant qu’ils ne deviennent hors de portée, aidant ainsi le système à rester efficace et fiable.
Ce qui rend Ultralytics YOLO11 efficace pour la détection des petits objets#
Avec les nombreux modèles de vision par ordinateur disponibles aujourd’hui, tu te demandes peut-être ce qui distingue Ultralytics YOLO11.
Voici quelques raisons pour lesquelles Ultralytics YOLO11 constitue une excellente option pour les applications nécessitant la détection de petits objets :
- Meilleure extraction des caractéristiques : YOLO11 utilise une architecture backbone et neck améliorée pour renforcer l’extraction des caractéristiques, ce qui permet une détection d’objets plus précise.
- Écosystème et simplicité d’utilisation : Le package Python Ultralytics est une bibliothèque qui fournit des fonctions intégrées pour charger, entraîner, valider et déployer des modèles comme YOLO11. Comme ces flux de travail ne nécessitent que quelques lignes de code, les équipes peuvent rapidement expérimenter et affiner des modèles pour la détection des petits objets.
- Optimisé pour le déploiement en périphérie : Ultralytics YOLO11 peut fonctionner efficacement sur des appareils edge comme NVIDIA Jetson, Raspberry Pi et les systèmes de caméras industrielles. En termes simples, il permet d’exécuter directement sur l’appareil des tâches d’IA de vision en temps réel.
Stratégies pratiques à utiliser pour détecter de petits objets avec Ultralytics YOLO11#
En plus d’utiliser un modèle comme Ultralytics YOLO11, la manière dont tu prépares tes annotations, l’ensemble de données et la procédure d’entraînement du modèle peut faire une grande différence sur les performances de détection.
Voici un bref aperçu des éléments à privilégier :
- Augmentation appropriée des données : Une augmentation légère des données, comme la mise à l’échelle ou le recadrage, peut aider le modèle à se généraliser à de nouvelles images. Cependant, une augmentation agressive à grande échelle peut déformer ou supprimer les petits objets, ce qui les rend plus difficiles à apprendre pour le modèle.
- Analyse des cas d’échec : L’analyse des situations dans lesquelles le modèle ne détecte pas correctement les objets ou les identifie mal aide à établir une base de référence et à déterminer si les problèmes proviennent du jeu de données, de pertes d’informations lors de l’extraction des caractéristiques ou de la nécessité d’ajuster les paramètres d’entraînement.
- Composition du jeu de données : Ton jeu de données doit contenir suffisamment d’exemples de petits objets pour que le modèle puisse apprendre des motifs pertinents, tout en restant équilibré afin que les objets plus grands ne prennent pas le dessus sur les plus petits pendant l’entraînement.
Points clés à retenir#
La détection des petits objets est difficile, car les petites cibles perdent des détails à mesure que les images traversent un modèle de vision par ordinateur. Ultralytics YOLO11 améliore la préservation de ces détails, rendant la détection des petits objets plus fiable sans sacrifier les performances en temps réel. Cet équilibre permet à YOLO11 d’assurer une détection précise et efficace dans des applications concrètes.
Rejoins notre communauté grandissante ! Explore notre dépôt GitHub pour en savoir plus sur l'IA. Découvre des innovations comme la vision par ordinateur dans le commerce de détail et l'IA dans le secteur automobile en consultant nos pages consacrées aux solutions. Pour commencer dès aujourd'hui à créer avec la vision par ordinateur, consulte nos options de licence.









