Ultralytics YOLO27:
IA visual

Explorando SAM 3: el nuevo Segment Anything Model de Meta AI

Descubre cómo SAM 3, el nuevo Segment Anything Model de Meta AI, facilita la detección, segmentación y seguimiento de objetos en imágenes y vídeos del mundo real.

ABAbirami Vina12 min read
El Segment Anything Model SAM 3 de Meta AI

El 19 de noviembre de 2025, Meta AI lanzó Segment Anything Model 3, también conocido como SAM 3. Esta última versión del modelo Segment Anything introduce nuevas formas de detectar, segmentar y seguir objetos en imágenes y vídeos del mundo real mediante indicaciones de texto, indicaciones visuales y ejemplos de imágenes.

El modelo SAM 3 se basa en SAM y SAM 2, e incorpora nuevos avances y funciones, como la segmentación por conceptos, la detección con vocabulario abierto y el seguimiento de vídeo en tiempo real. Puede comprender frases nominales cortas, seguir objetos entre fotogramas e identificar conceptos detallados o poco frecuentes que los modelos anteriores no podían gestionar con la misma consistencia.

Como parte del lanzamiento de SAM 3, Meta también presentó SAM 3D. Esta suite de modelos de nueva generación reconstruye objetos, escenas y cuerpos humanos completos a partir de una sola imagen, y amplía el ecosistema de Segment Anything hacia la comprensión 3D. Estas incorporaciones abren nuevas aplicaciones en visión por ordenador, robótica, edición multimedia y flujos de trabajo creativos.

En este artículo exploraremos qué es SAM 3, qué lo diferencia de SAM 2, cómo funciona el modelo y cuáles son sus aplicaciones en el mundo real. ¡Empecemos!

¿Qué es SAM 3? Una mirada al Segment Anything Model 3 de Meta#

SAM 3 es un modelo de visión por ordenador de última generación capaz de identificar, separar y seguir objetos en imágenes y vídeos a partir de instrucciones sencillas. En lugar de depender de una lista fija de etiquetas, SAM 3 entiende el lenguaje natural y las señales visuales, por lo que resulta fácil indicarle al modelo qué quieres encontrar.

Por ejemplo, con SAM 3 puedes escribir una frase corta como «autobús escolar amarillo» o «un gato atigrado», hacer clic en un objeto o resaltar un ejemplo en una imagen. A continuación, el modelo detectará todos los objetos coincidentes y generará máscaras de segmentación limpias (un contorno visual que muestra exactamente qué píxeles pertenecen a un objeto). SAM 3 también puede seguir esos objetos entre los fotogramas del vídeo y mantener su coherencia mientras se desplazan.

SAM 3D permite la reconstrucción 3D a partir de una sola imagen#

Otra parte destacada del anuncio de Meta AI es SAM 3D, que amplía el proyecto Segment Anything hacia la comprensión 3D. SAM 3D puede tomar una única imagen 2D y reconstruir la forma, la postura o la estructura de un objeto o de un cuerpo humano en tres dimensiones. En otras palabras, el modelo puede estimar cómo ocupa algo el espacio aunque solo haya disponible un punto de vista.

SAM 3D se ha lanzado como dos modelos distintos: SAM 3D Objects, que reconstruye objetos cotidianos con su geometría y textura, y SAM 3D Body, que estima la forma y la postura del cuerpo humano a partir de una sola imagen. Ambos modelos utilizan la salida de segmentación de SAM 3 y, después, generan una representación 3D alineada con el aspecto y la posición del objeto en la fotografía original.

Un ejemplo del uso de SAM 3D

Fig. 1. Un ejemplo del uso de SAM 3D. (Fuente: creado con el playground de Segment Anything de Meta AI)

SAM 3: nuevas funciones para unificar la detección, la segmentación y el seguimiento#

Estas son algunas de las principales novedades que introduce SAM 3 para integrar la detección, la segmentación y el seguimiento en un único modelo unificado:

  • Tareas de segmentación por conceptos: En SAM y SAM 2, la segmentación de objetos dependía de indicaciones visuales, como clics o recuadros. SAM 3 añade la capacidad de segmentar objetos a partir de una frase de texto corta o de un recorte de ejemplo de la imagen. Esto significa que el modelo puede identificar todas las instancias coincidentes sin necesidad de hacer clic en cada una.
  • Indicaciones de texto con vocabulario abierto: A diferencia de las versiones anteriores, SAM 3 puede interpretar frases cortas en lenguaje natural. Esto elimina la necesidad de una lista fija de etiquetas y permite que el modelo trabaje con conceptos más específicos o menos comunes.
  • Un modelo para la detección, la segmentación y el seguimiento: SAM 3 unifica la detección, la segmentación y el seguimiento en un solo modelo, eliminando la necesidad de utilizar sistemas independientes para encontrar objetos, generar máscaras de segmentación y seguirlos entre los fotogramas del vídeo. Esto crea un flujo de trabajo más coherente y optimizado tanto para imágenes como para vídeo y, aunque SAM 2 también ofrecía algunas capacidades de seguimiento, SAM 3 proporciona un rendimiento considerablemente mayor y más fiable.
  • Resultados más estables en escenas complejas: Como SAM 3 puede combinar texto, imágenes de ejemplo e indicaciones visuales, gestiona las escenas abigarradas o repetitivas con mayor fiabilidad que las versiones anteriores, que dependían únicamente de los clics visuales.

Segmentación por conceptos de SAM 3 con texto o ejemplos de imágenes

Fig. 2. SAM 3 introduce la segmentación por conceptos con texto o ejemplos de imágenes. (Fuente)

Comparación entre SAM 3, SAM 2 y SAM 1#

Imagina que estás viendo un vídeo de un safari con muchos animales distintos y quieres detectar y segmentar únicamente los elefantes. ¿Cómo sería esta tarea en las distintas versiones de SAM?

Con SAM, tendrías que hacer clic manualmente en cada elefante de cada fotograma para generar una máscara de segmentación. No hay seguimiento, por lo que cada nuevo fotograma requiere nuevos clics.

Con SAM 2, podrías hacer clic una vez en un elefante, obtener su máscara y hacer que el modelo siguiera a ese mismo elefante durante todo el vídeo. Sin embargo, aún tendrías que proporcionar clics independientes si quisieras segmentar varios elefantes (objetos específicos), ya que SAM 2 no entiende por sí solo categorías como «elefante».

Con SAM 3, el flujo de trabajo resulta mucho más sencillo. Puedes escribir «elefante» o dibujar un recuadro delimitador alrededor de un solo elefante como ejemplo, y el modelo encontrará automáticamente todos los elefantes del vídeo, los segmentará y los seguirá de forma coherente entre los fotogramas. Sigue admitiendo las indicaciones mediante clics y recuadros utilizadas en las versiones anteriores, pero ahora también puede responder a indicaciones de texto e imágenes ejemplares, algo que SAM y SAM 2 no podían hacer.

Cómo funciona el modelo SAM 3#

A continuación, analizaremos con más detalle cómo funciona el modelo SAM 3 y cómo se ha entrenado.

Una visión general de la arquitectura del modelo SAM 3#

SAM 3 reúne varios componentes para admitir indicaciones basadas en conceptos e indicaciones visuales dentro de un único sistema. En su núcleo, el modelo utiliza Meta Perception Encoder, el codificador unificado de código abierto de imágenes y texto de Meta.

Este codificador puede procesar tanto imágenes como frases nominales cortas. Dicho de forma sencilla, permite a SAM 3 vincular las características lingüísticas y visuales de forma más eficaz que las versiones anteriores del modelo Segment Anything.

Además de este codificador, SAM 3 incluye un detector basado en la familia DETR de modelos Transformer. Este detector identifica los objetos de la imagen y ayuda al sistema a determinar qué objetos corresponden a la indicación del usuario.

En concreto, para la segmentación de vídeo, SAM 3 utiliza un componente de seguimiento que se basa en el banco de memoria y el codificador de memoria de SAM 2. Esto permite al modelo conservar información sobre los objetos entre fotogramas para volver a identificarlos y seguirlos a lo largo del tiempo.

Cómo funciona la segmentación de cualquier elemento mediante conceptos

Fig. 3. Cómo funciona la segmentación de cualquier elemento mediante conceptos (Fuente: scontent)

El motor de datos escalable tras Segment Anything Model 3#

Para entrenar SAM 3, Meta necesitaba muchos más datos anotados de los que existen actualmente en Internet. Las máscaras de segmentación y las etiquetas de texto de alta calidad son difíciles de crear a gran escala, y perfilar por completo cada instancia de un concepto en imágenes y vídeos es lento y caro.

Para solucionarlo, Meta creó un nuevo motor de datos que combina el propio SAM 3, modelos de IA adicionales y anotadores humanos que trabajan conjuntamente. El flujo de trabajo comienza con una canalización de sistemas de IA, incluido SAM 3 y un modelo de generación de descripciones basado en Llama.

Estos sistemas analizan grandes colecciones de imágenes y vídeos, generan descripciones, convierten esas descripciones en etiquetas de texto y producen candidatos iniciales para las máscaras de segmentación. A continuación, anotadores humanos y de IA revisan estos candidatos.

Los anotadores de IA, entrenados para igualar o incluso superar la precisión humana en tareas como comprobar la calidad de las máscaras y verificar la cobertura de los conceptos, filtran los casos sencillos. Los humanos solo intervienen en los ejemplos más difíciles, en los que el modelo todavía puede tener problemas.

Motor de datos de SAM 3

Fig. 4. Motor de datos de SAM 3 (Fuente)

Este enfoque proporciona a Meta un gran aumento de la velocidad de anotación. Al permitir que los anotadores de IA se encarguen de los casos sencillos, la canalización es aproximadamente cinco veces más rápida con indicaciones negativas y un 36 % más rápida con indicaciones positivas en dominios detallados.

Esta eficiencia hizo posible ampliar el conjunto de datos hasta superar los cuatro millones de conceptos únicos. El ciclo constante de propuestas de la IA, correcciones humanas y predicciones actualizadas del modelo también mejora la calidad de las etiquetas con el tiempo y ayuda a SAM 3 a aprender un conjunto mucho más amplio de conceptos visuales y textuales.

Mejoras de rendimiento de SAM 3#

En cuanto al rendimiento, SAM 3 ofrece una mejora clara respecto a los modelos anteriores. En el nuevo benchmark SA-Co de Meta, que evalúa la detección y segmentación de conceptos con vocabulario abierto, SAM 3 alcanza aproximadamente el doble de rendimiento que los sistemas anteriores, tanto en imágenes como en vídeo.

También iguala o supera a SAM 2 en tareas visuales interactivas, como point-to-mask y mask-to-masklet. Meta informa de mejoras adicionales en evaluaciones más difíciles, como LVIS zero-shot (en las que los modelos deben reconocer categorías poco frecuentes sin ejemplos de entrenamiento) y el recuento de objetos (que mide si se detectan todas las instancias de un objeto), lo que destaca una mayor capacidad de generalización entre dominios.

Además de estas mejoras de precisión, SAM 3 es eficiente: procesa una imagen con más de 100 objetos detectados en unos 30 milisegundos en una GPU H200 y mantiene velocidades casi en tiempo real al seguir varios objetos en vídeo.

Aplicaciones del Segment Anything Model 3#

Ahora que entendemos mejor SAM 3, repasemos cómo se está utilizando en aplicaciones reales, desde el razonamiento avanzado guiado por texto hasta la investigación científica y los propios productos de Meta.

Gestión de consultas de texto complejas mediante SAM 3 Agent#

SAM 3 también puede utilizarse como herramienta dentro de un modelo lingüístico multimodal más grande, al que Meta denomina SAM 3 Agent. En lugar de darle a SAM 3 una frase corta como «elefante», el agente puede dividir una pregunta más compleja en indicaciones más pequeñas que SAM 3 entiende.

Por ejemplo, si el usuario pregunta «¿Qué objeto de la imagen se utiliza para controlar y guiar a un caballo?», el agente prueba distintas frases nominales, se las envía a SAM 3 y comprueba qué máscaras tienen sentido. Sigue perfeccionando el proceso hasta encontrar el objeto correcto.

Aunque no se ha entrenado con conjuntos de datos especiales de razonamiento, SAM 3 Agent obtiene buenos resultados en benchmarks diseñados para consultas de texto complejas, como ReasonSeg y OmniLabel. Esto demuestra que SAM 3 puede servir de apoyo a sistemas que necesitan tanto comprensión lingüística como segmentación visual detallada.

Aplicaciones científicas y de conservación de SAM 3#

Curiosamente, SAM 3 ya se está utilizando en entornos de investigación en los que las etiquetas visuales detalladas son importantes. Meta colaboró con Conservation X Labs y Osa Conservation para crear SA-FARI, un conjunto de datos público de monitorización de fauna con más de 10 000 vídeos de cámaras trampa.

Cada animal de cada fotograma está etiquetado con recuadros y máscaras de segmentación, algo que llevaría muchísimo tiempo anotar manualmente. Del mismo modo, en la investigación oceánica, SAM 3 se está utilizando junto con FathomNet y MBARI para crear máscaras de segmentación de instancias para imágenes submarinas y contribuir a nuevos benchmarks de evaluación.

Estos conjuntos de datos ayudan a los científicos a analizar secuencias de vídeo de forma más eficiente y a estudiar animales y hábitats que normalmente son difíciles de seguir a gran escala. Los investigadores también pueden utilizar estos recursos para crear sus propios modelos de identificación de especies, análisis del comportamiento y monitorización ecológica automatizada.

Cómo está implementando Meta SAM 3 en sus productos#

Además de sus usos en investigación, SAM 3 también impulsa nuevas funciones y casos de uso en los productos de consumo de Meta. Estas son algunas de las formas en las que ya se está integrando:

  • Ediciones de Instagram: Los creadores pueden aplicar efectos a una persona u objeto concretos de un vídeo sin tener que trabajar manualmente fotograma a fotograma.
  • Aplicación Meta AI y meta.ai en la web: SAM 3 permite utilizar nuevas herramientas para modificar, mejorar y remezclar imágenes y vídeos.
  • «View in Room» de Facebook Marketplace: SAM 3 funciona con SAM 3D para permitir a las personas previsualizar muebles o elementos decorativos en sus hogares utilizando una sola fotografía.
  • Gafas de investigación Aria Gen 2: El modelo Segment Anything 3 ayuda a segmentar y seguir manos y objetos desde una perspectiva en primera persona, dando soporte a la realidad aumentada (AR), la robótica y la investigación de IA contextual.

Conclusiones clave#

SAM 3 supone un avance importante para la segmentación. Introduce la segmentación por conceptos, las indicaciones de texto con vocabulario abierto y un seguimiento mejorado. Con un rendimiento notablemente superior tanto en imágenes como en vídeo, además de la incorporación de SAM 3D, esta suite de modelos abre nuevas posibilidades para la IA de visión, las herramientas creativas, la investigación científica y los productos del mundo real.

Únete a nuestra comunidad y explora nuestro repositorio de GitHub para descubrir más sobre la IA. Si quieres crear tu propio proyecto de IA de visión, consulta nuestras opciones de licencia. Descubre más sobre aplicaciones como la IA en la sanidad y la IA de visión en el comercio minorista visitando nuestras páginas de soluciones.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático