Frame Interpolation
Explora cómo la interpolación de fotogramas utiliza la IA para crear vídeos fluidos con muchos FPS. Aprende a mejorar el seguimiento de objetos con Ultralytics YOLO26 y Ultralytics Platform.
La interpolación de fotogramas es una técnica de visión por ordenador y procesamiento de vídeo que sintetiza fotogramas nuevos e intermedios entre los existentes para aumentar la frecuencia de fotogramas de un vídeo y crear un movimiento más fluido. Mientras que tradicionalmente se basaba en una simple combinación de imágenes, la interpolación de fotogramas moderna utiliza modelos avanzados de aprendizaje profundo (DL) para analizar el movimiento y el contenido de los fotogramas adyacentes, predecir movimientos complejos de los píxeles y generar imágenes continuas de alta calidad. Este enfoque basado en IA se utiliza ampliamente para convertir grabaciones estándar en contenido con una alta frecuencia de actualización, sintetizar efectos de cámara lenta y estabilizar secuencias de ritmo rápido en diversos ámbitos multimedia y científicos.
Cómo funciona la interpolación de fotogramas basada en IA#
Los marcos de interpolación modernos se alejan del simple promediado de fotogramas. En su lugar, se basan en complejas redes neuronales (NNs) y sofisticadas estrategias de estimación del movimiento para rellenar los huecos entre entradas secuenciales:
- Interpolación basada en flujo óptico: Este método calcula el movimiento aparente de los píxeles entre fotogramas. Los modelos utilizan este flujo estimado para deformar y combinar las imágenes de entrada. Aunque es rápido, puede tener dificultades con oclusiones importantes o movimientos rápidos.
- Arquitecturas convolucionales y Transformer: Las redes neuronales convolucionales (CNNs) profundas y los modelos Transformer más recientes aprenden relaciones espaciales y temporales complejas. Gestionan las oclusiones y el movimiento rápido prediciendo características contextuales en un campo receptivo más amplio.
- Enfoques generativos: Los avances recientes emplean modelos de difusión para generar fotogramas intermedios. Estos modelos permiten una síntesis realista desde el punto de vista perceptual incluso cuando los fotogramas de entrada presentan grandes saltos de movimiento, adaptando técnicas como la interpolación de fotogramas de vídeo basada en eventos (EVFI) para reconstruir movimientos de alta velocidad utilizando datos dispersos de sensores.
Diferenciación de conceptos relacionados#
Para implementar eficazmente canalizaciones de mejora de vídeo, es fundamental diferenciar la interpolación de fotogramas de las técnicas relacionadas de inteligencia artificial (AI):
- Interpolación de fotogramas frente a flujo óptico: El flujo óptico es una métrica de bajo nivel que mide la dirección y la velocidad del movimiento de los píxeles. La interpolación de fotogramas es una tarea de nivel superior que a menudo utiliza el flujo óptico como herramienta subyacente para deformar los píxeles y generar fotogramas de imagen completamente nuevos.
- Interpolación de fotogramas frente a superresolución: La interpolación aumenta la resolución temporal al añadir más fotogramas por segundo (por ejemplo, sobremuestreo temporal de 30 FPS a 60 FPS). En cambio, la superresolución aumenta la resolución espacial ampliando las dimensiones de los píxeles de cada fotograma (por ejemplo, de 1080p a 4K).
Principales aplicaciones en el mundo real#
La interpolación de fotogramas resuelve desafíos fundamentales en múltiples sectores al cerrar las brechas en los datos visuales:
-
Emisión de medios y retransmisiones deportivas: Los creadores utilizan herramientas como FILM (Interpolación de fotogramas para movimientos amplios) de Google para generar secuencias de cámara lenta extremadamente fluidas a partir de cámaras estándar. Esto mejora el análisis deportivo y los efectos cinematográficos sin necesidad de costoso hardware de alta velocidad.
-
Imágenes biológicas y médicas: En la microscopía time-lapse, la interpolación generativa de fotogramas mejora el seguimiento de objetos biológicos, como células en división o bacterias en movimiento. Al sintetizar estados intermedios, los investigadores pueden reducir la frecuencia de las capturas físicas, lo que limita la fototoxicidad y preserva las muestras delicadas.
Mejora de los flujos de trabajo de IA con vídeo interpolado#
En el aprendizaje automático, utilizar vídeo con una alta frecuencia de fotogramas mejora notablemente la precisión del seguimiento de objetos posterior al proporcionar transiciones temporales más fluidas y reducir los saltos de los cuadros delimitadores. Una vez suavizado un vídeo mediante interpolación, modelos como Ultralytics YOLO26 pueden seguir fácilmente los objetos a través de los fotogramas sintetizados.
El siguiente fragmento de Python muestra cómo seguir objetos en un vídeo interpolado con una alta tasa de FPS utilizando el paquete ultralytics:
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")
# Run persistent object tracking on the temporally up-sampled video
# The tracker uses the smooth motion to preserve object IDs more accurately
results = model.track(source="interpolated_high_fps_video.mp4", show=True, tracker="botsort.yaml")Para el procesamiento de vídeo a gran escala, los equipos pueden utilizar Ultralytics Platform para automatizar la anotación de datos en conjuntos de datos interpolados, lo que permite entrenar en la nube sin interrupciones y realizar un despliegue de modelos sólido para canalizaciones complejas de comprensión de vídeo.






