Novedades de investigación en IA de Meta FAIR: SAM 2.1 y CoTracker3
Explora los últimos modelos de IA de Meta FAIR, SAM 2.1 y CoTracker3, que ofrecen capacidades avanzadas de segmentación y seguimiento para diversas aplicaciones del mundo real.

La inteligencia artificial (IA) es un campo de investigación que recientemente está despertando entusiasmo y energía, con nuevas innovaciones y avances que aparecen más rápido que nunca. En las últimas semanas, el equipo de Investigación Fundamental en IA (FAIR) de Meta ha presentado un conjunto de herramientas y modelos destinados a abordar retos en distintas áreas de la IA. Estos lanzamientos incluyen actualizaciones que podrían influir en campos tan diversos como la sanidad, la robótica y la realidad aumentada.
Por ejemplo, el modelo SAM 2.1 actualizado mejora la segmentación de objetos, lo que facilita identificar y separar objetos con precisión en imágenes y vídeos. Mientras tanto, CoTracker3 se centra en el seguimiento de puntos, ayudando a seguir la posición de los puntos en los fotogramas de vídeo incluso cuando los objetos se mueven o quedan parcialmente ocultos.
Meta también ha presentado versiones más ligeras y rápidas de su modelo de lenguaje Llama para un uso eficiente en el dispositivo, junto con una nueva tecnología de detección táctil para la robótica. En este artículo, desglosaremos estos lanzamientos más recientes de Meta FAIR y analizaremos qué ofrece cada herramienta. ¡Empecemos!
El Segment Anything Model mejorado de Meta: SAM 2.1#
La segmentación de objetos, una tarea clave de visión por ordenador, permite identificar y separar objetos distintos dentro de una imagen o un vídeo, lo que facilita analizar áreas de interés específicas. Desde su lanzamiento, el Modelo Segment Anything 2 (SAM 2) de Meta se ha utilizado para la segmentación de objetos en distintos campos, como la imagen médica y la meteorología. A partir de los comentarios de la comunidad, Meta ha presentado SAM 2.1, una versión mejorada diseñada para abordar algunos de los retos encontrados con el modelo original y ofrecer un rendimiento general superior.

Fig. 1. Evaluación comparativa del rendimiento del modelo SAM 2.1.
SAM 2.1 incluye actualizaciones para gestionar mejor los objetos visualmente similares y de menor tamaño gracias a nuevas técnicas de aumento de datos. También mejora la forma en que el modelo gestiona la oclusión (cuando partes de un objeto quedan ocultas) mediante el entrenamiento con secuencias de vídeo más largas, lo que le permite «recordar» y reconocer objetos a lo largo del tiempo, aunque queden bloqueados temporalmente. Por ejemplo, si alguien está grabando un vídeo de una persona caminando detrás de un árbol, SAM 2.1 puede seguir a la persona cuando reaparece al otro lado, utilizando su memoria de la posición del objeto y su movimiento para completar los huecos cuando la visión se interrumpe brevemente.
Junto con estas actualizaciones, Meta ha lanzado SAM 2 Developer Suite, que proporciona código de entrenamiento de código abierto y toda la infraestructura de demostración para que los desarrolladores puedan ajustar SAM 2.1 con sus propios datos e integrarlo en una amplia variedad de aplicaciones.
CoTracker3: el modelo de seguimiento de Meta, sus funciones y actualizaciones#
Otra tarea interesante de visión por ordenador es el seguimiento de puntos. Consiste en seguir puntos o características específicos a través de varios fotogramas de un vídeo. Piensa en un vídeo de un ciclista recorriendo una pista: el seguimiento de puntos permite al modelo mantener el seguimiento de puntos del ciclista, como el casco o las ruedas, aunque queden ocultos por obstáculos durante un instante.
El seguimiento de puntos es esencial para aplicaciones como la reconstrucción 3D, la robótica y la edición de vídeo. Los modelos tradicionales suelen depender de configuraciones complejas y grandes conjuntos de datos sintéticos, lo que limita su eficacia cuando se aplican a situaciones del mundo real.
El modelo de seguimiento CoTracker3 de Meta aborda estas limitaciones simplificando la arquitectura del modelo. También introduce una técnica de etiquetado pseudoque permite al modelo aprender de vídeos reales sin anotar, lo que hace que CoTracker3 sea más eficiente y escalable para su uso práctico.

Fig. 2. Comparación de CoTracker3 con otros modelos de seguimiento.
Una de las características que diferencia a CoTracker3 es su capacidad para gestionar bien las oclusiones. Mediante la atención entre seguimientos, una técnica que permite al modelo compartir información entre varios puntos seguidos, CoTracker3 puede inferir las posiciones de los puntos ocultos tomando como referencia los visibles. De este modo, CoTracker3 está diseñado para ser muy eficaz en entornos dinámicos, como seguir a una persona por una escena concurrida.
CoTracker3 también ofrece modos online y offline. El modo online proporciona seguimiento en tiempo real, mientras que el modo offline puede utilizarse para un seguimiento más exhaustivo a lo largo de secuencias de vídeo completas, algo ideal para tareas como la edición de vídeo o la animación.
Otras actualizaciones e investigaciones de Meta FAIR#
Aunque SAM 2.1 y CoTracker3 muestran los últimos avances de Meta en visión por ordenador, también hay actualizaciones interesantes en otras áreas de la IA, como el procesamiento del lenguaje natural (NLP) y la robótica. Veamos algunos de estos desarrollos recientes de Meta FAIR.
Spirit LM de Meta: innovaciones de IA en modelos lingüísticos y multimodales#
Spirit LM de Meta es un nuevo modelo de lenguaje multimodal que combina capacidades de texto y voz, haciendo que las interacciones con la IA resulten más naturales. A diferencia de los modelos tradicionales, que procesan solo texto o solo voz, Spirit LM puede alternar entre ambos sin interrupciones.
Spirit LM puede comprender y generar lenguaje de formas más parecidas a las humanas. Por ejemplo, puede mejorar asistentes virtuales capaces de escuchar y responder tanto en lenguaje hablado como escrito, o facilitar herramientas de accesibilidad que convierten voz en texto y texto en voz.

Fig. 3. Un ejemplo de conversión de texto a voz con Spirit LM de Meta.
Además, Meta ha desarrollado técnicas para hacer más eficientes los modelos de lenguaje grandes. Una de ellas, denominada Layer Skip, ayuda a reducir las necesidades computacionales y los costes energéticos activando únicamente las capas necesarias para una tarea determinada. Esto resulta especialmente útil para aplicaciones en dispositivos con memoria y potencia limitadas.
Para llevar un paso más allá la necesidad de desplegar aplicaciones de IA en este tipo de dispositivos, Meta también ha lanzado versiones cuantizadas de sus modelos Llama. Estos modelos están comprimidos para ejecutarse más rápido en dispositivos móviles sin sacrificar la precisión.
Una mirada al futuro de la optimización con Meta Lingua#
A medida que los modelos de IA aumentan de tamaño y complejidad, optimizar su proceso de entrenamiento se ha vuelto crucial. En lo que respecta a la optimización, Meta ha presentado Meta Lingua, una base de código flexible y eficiente que facilita el entrenamiento de modelos de lenguaje grandes. El diseño modular de Meta Lingua permite a los investigadores personalizar y ampliar rápidamente sus experimentos.
Los investigadores pueden dedicar menos tiempo a la configuración técnica y más tiempo a la investigación propiamente dicha. La base de código también es ligera y fácil de integrar, por lo que resulta adecuada tanto para experimentos pequeños como para proyectos a gran escala. Al eliminar estas barreras técnicas, Meta Lingua ayuda a los investigadores a avanzar más rápido y probar nuevas ideas con mayor facilidad.

Fig. 4. Una visión general de Meta Lingua.
Las mejoras de Meta en seguridad de la IA#
A medida que avanza la tecnología de computación cuántica, surgen nuevos retos para la seguridad de los datos. A diferencia de los ordenadores actuales, es probable que los ordenadores cuánticos puedan resolver cálculos complejos mucho más rápido. Esto significa que potencialmente podrían romper los métodos de cifrado utilizados actualmente para proteger información sensible. Por eso la investigación en este campo es cada vez más importante: desarrollar nuevas formas de proteger los datos es esencial mientras nos preparamos para el futuro de la computación cuántica.
Para abordar este problema, Meta ha desarrollado Salsa, una herramienta destinada a reforzar la seguridad criptográfica poscuántica. Salsa ayuda a los investigadores a probar ataques impulsados por IA e identificar posibles puntos débiles, lo que les permite comprender y abordar mejor las vulnerabilidades de los sistemas criptográficos. Mediante la simulación de escenarios de ataque avanzados, Salsa proporciona información valiosa que puede orientar el desarrollo de medidas de seguridad más sólidas y resilientes para la era cuántica.
La IA en Meta: últimas innovaciones en robótica#
El trabajo más reciente de Meta en robótica se centra en ayudar a la IA a interactuar de forma más natural con el mundo físico mediante la mejora de la percepción táctil, la destreza y la colaboración con las personas. En particular, Meta Digit 360 es un sensor táctil avanzado que proporciona a los robots un sentido del tacto más preciso. Los sensores ayudan a los robots a detectar detalles como la textura, la presión e incluso la forma de los objetos. A partir de esta información, los robots pueden manipular objetos con mayor precisión, algo crucial en ámbitos como la sanidad y la fabricación.
Estas son algunas de las principales características de Meta Digit 360:
- Está equipado con 18 funciones de detección distintas para capturar una amplia variedad de detalles táctiles.
- El sensor puede detectar cambios de presión de tan solo 1 milinewton, lo que permite a los robots responder a texturas finas y movimientos sutiles.
- Incluye más de 8 millones de taxels (pequeños puntos de detección) en la superficie de la yema del dedo, proporcionando un mapa de alta resolución de la información táctil.
Una ampliación de Meta Digit 360 es Meta Digit Plexus, una plataforma que integra varios sensores táctiles en una única mano robótica. Esta configuración permite a los robots procesar simultáneamente información táctil procedente de múltiples puntos, de forma similar a cómo las manos humanas recopilan datos sensoriales.

Fig. 5. Meta Digit Plexus.
Preparando el terreno para el próximo capítulo de la IA#
Las últimas actualizaciones de IA de Meta, desde los avances en visión por ordenador con SAM 2.1 y CoTracker3 hasta los nuevos desarrollos en modelos de lenguaje y robótica, muestran cómo la IA pasa progresivamente de la teoría a soluciones prácticas con un impacto real.
Estas herramientas están diseñadas para hacer que la IA sea más adaptable y útil en distintos campos, ayudando desde la segmentación de imágenes complejas hasta la comprensión del lenguaje humano e incluso la colaboración con nosotros en espacios físicos.
Al dar prioridad a la accesibilidad y a las aplicaciones en el mundo real, Meta FAIR nos acerca a un futuro en el que la IA pueda abordar retos reales y mejorar nuestra vida cotidiana de manera significativa.
¿Te interesa la IA? Únete a nuestra comunidad para estar al día de las últimas novedades y obtener información, y visita nuestro repositorio de GitHub. También puedes explorar cómo utilizar la visión por ordenador en sectores como los coches autónomos y la agricultura.









