Frame Interpolation
Explore comment l’interpolation d’images utilise l’IA pour créer des vidéos fluides à haute fréquence d’images. Apprends à améliorer le suivi des objets avec Ultralytics YOLO26 et la plateforme Ultralytics.
L'interpolation d'images est une technique de vision par ordinateur et de traitement vidéo qui synthétise de nouvelles images intermédiaires entre les images existantes afin d'augmenter la fréquence d'images d'une vidéo et de créer des mouvements plus fluides. Alors qu'elle reposait traditionnellement sur un simple mélange d'images, l'interpolation d'images moderne utilise des modèles avancés d'apprentissage profond (DL) pour analyser le mouvement et le contenu des images adjacentes, prédire les déplacements complexes des pixels et générer des images continues de haute qualité. Cette approche fondée sur l'IA est largement adoptée pour convertir des séquences standard en contenus à fréquence de rafraîchissement élevée, créer des effets de ralenti et stabiliser des séquences rapides dans divers domaines multimédias et scientifiques.
Fonctionnement de l'interpolation d'images basée sur l'IA#
Les frameworks d'interpolation modernes s'éloignent de la simple moyenne d'images. Ils s'appuient plutôt sur des réseaux neuronaux (NNs) complexes et des stratégies sophistiquées d'estimation du mouvement pour combler les intervalles entre les entrées successives :
- Interpolation basée sur le flot optique : cette méthode calcule le mouvement apparent des pixels entre les images. Les modèles utilisent ce flot estimé pour déformer les images d'entrée et les fusionner. Bien qu'elle soit rapide, elle peut rencontrer des difficultés en cas de fortes occlusions ou de mouvements rapides.
- Architectures convolutionnelles et Transformer : les réseaux neuronaux convolutifs (CNNs) profonds et les modèles Transformer plus récents apprennent des relations spatiales et temporelles riches. Ils gèrent les occlusions et les mouvements rapides en prédisant des caractéristiques contextuelles sur un champ réceptif plus large.
- Approches génératives : des avancées récentes utilisent des modèles de diffusion pour générer des images intermédiaires. Ces modèles permettent une synthèse perceptuellement réaliste, même lorsque les images d'entrée présentent d'importants écarts de mouvement, en adaptant des techniques comme l'interpolation de trames vidéo basée sur les événements (EVFI) pour reconstruire des mouvements à haute vitesse à partir de données de capteurs clairsemées.
Distinction entre concepts connexes#
Pour déployer efficacement des pipelines d'amélioration vidéo, il est essentiel de différencier l'interpolation d'images des techniques d'intelligence artificielle (AI) qui lui sont associées :
- Interpolation d'images et flot optique : le flot optique est une métrique de bas niveau qui mesure la direction et la vitesse du déplacement des pixels. L'interpolation d'images est une tâche de plus haut niveau qui utilise souvent le flot optique comme outil sous-jacent pour déformer les pixels et générer des images entièrement nouvelles.
- Interpolation d'images et super-résolution : l'interpolation augmente la résolution temporelle en ajoutant davantage d'images par seconde (par exemple, un suréchantillonnage temporel de 30 FPS à 60 FPS). À l'inverse, la super-résolution augmente la résolution spatiale en agrandissant les dimensions en pixels des images individuelles (par exemple, de 1080p à 4K).
Principales applications concrètes#
L'interpolation d'images répond à des enjeux essentiels dans de nombreux secteurs en comblant les lacunes des données visuelles :
-
Diffusion de contenus et retransmission sportive : les créateurs utilisent des outils comme FILM (interpolation d'images pour grands mouvements) de Google pour générer des séquences de ralenti extrêmement fluides à partir de caméras standard. Cela améliore l'analyse sportive et les effets cinématographiques sans nécessiter de matériel haute vitesse coûteux.
-
Imagerie biologique et médicale : en microscopie en accéléré, l'interpolation générative d'images améliore le suivi d'objets biologiques, tels que des cellules en division ou des bactéries en mouvement. En synthétisant les états intermédiaires, les chercheurs peuvent réduire la fréquence des acquisitions d'images, ce qui limite la phototoxicité et préserve les échantillons fragiles.
Améliorer les workflows d'IA grâce à la vidéo interpolée#
En apprentissage automatique, l'utilisation de vidéos à fréquence d'images élevée améliore considérablement la précision du suivi d'objets en aval en fournissant des transitions temporelles plus fluides et en réduisant les sauts des cadres englobants. Une fois la vidéo lissée par interpolation, des modèles comme Ultralytics YOLO26 peuvent facilement suivre les objets à travers les images synthétisées.
L'extrait Python suivant montre comment suivre des objets dans une vidéo interpolée à FPS élevé à l'aide du package ultralytics :
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")
# Run persistent object tracking on the temporally up-sampled video
# The tracker uses the smooth motion to preserve object IDs more accurately
results = model.track(source="interpolated_high_fps_video.mp4", show=True, tracker="botsort.yaml")Pour le traitement vidéo à grande échelle, les équipes peuvent utiliser la plateforme Ultralytics afin d'automatiser l'annotation des données sur des jeux de données interpolés, ce qui permet un entraînement cloud fluide et un déploiement de modèles robuste pour des pipelines complexes de compréhension vidéo.






