Знакомство с SAM 3: новая модель Segment Anything от Meta AI
Узнай, как SAM 3 — новая модель Segment Anything от Meta AI — упрощает обнаружение, сегментацию и отслеживание объектов на реальных изображениях и видео.

19 ноября 2025 года Meta AI выпустила Segment Anything Model 3, также известную как SAM 3. Эта новая версия Segment Anything Model представляет новые способы обнаружения, сегментации и отслеживания объектов на реальных изображениях и видео с помощью текстовых и визуальных подсказок, а также примеров изображений.
Модель SAM 3 развивает возможности SAM и SAM 2, добавляя такие новые функции и улучшения, как сегментация концепций, обнаружение объектов с открытым словарём и отслеживание видео в реальном времени. Она понимает короткие именные фразы, отслеживает объекты между кадрами и распознаёт детализированные или редкие концепции, с которыми предыдущие модели справлялись менее стабильно.
В рамках выпуска SAM 3 Meta также представила SAM 3D. Этот набор моделей нового поколения реконструирует объекты, сцены и человеческое тело целиком по одному изображению, расширяя экосистему Segment Anything возможностями понимания 3D. Эти дополнения открывают новые приложения в компьютерном зрении, робототехнике, редактировании медиа и творческих рабочих процессах.
В этой статье мы разберёмся, что такое SAM 3, чем он отличается от SAM 2, как работает модель и где она применяется в реальных задачах. Давай начнём!
Что такое SAM 3? Обзор Segment Anything Model 3 от Meta#
SAM 3 — это современная модель компьютерного зрения, способная обнаруживать, разделять и отслеживать объекты на изображениях и видео по простым инструкциям. Вместо фиксированного списка меток SAM 3 понимает естественный язык и визуальные признаки, поэтому ты можешь легко указать модели, что именно нужно найти.
Например, с SAM 3 ты можешь ввести короткую фразу вроде «жёлтый школьный автобус» или «полосатая кошка», нажать на объект или выделить пример на изображении. Затем модель обнаружит все подходящие объекты и создаст точные маски сегментации — визуальные контуры, показывающие, какие именно пиксели принадлежат объекту. SAM 3 также может отслеживать эти объекты между кадрами видео, сохраняя их идентичность при движении.
SAM 3D обеспечивает 3D-реконструкцию по одному изображению#
Ещё одной интересной частью анонса Meta AI стала SAM 3D, расширяющая проект Segment Anything возможностями понимания 3D. SAM 3D может получить одно 2D-изображение и реконструировать форму, позу или структуру объекта либо человеческого тела в трёх измерениях. Иными словами, модель может оценить, как объект занимает пространство, даже если доступен только один ракурс.
SAM 3D выпущена в виде двух разных моделей: SAM 3D Objects, которая реконструирует повседневные предметы с учётом геометрии и текстуры, и SAM 3D Body, которая оценивает форму и позу человеческого тела по одному изображению. Обе модели используют результат сегментации SAM 3, а затем создают 3D-представление, соответствующее внешнему виду и положению объекта на исходной фотографии.

Рис. 1. Пример использования SAM 3D. (Источник: создано с помощью playground Segment Anything от Meta AI)
SAM 3: новые функции для объединения обнаружения, сегментации и отслеживания#
Ниже перечислены ключевые обновления SAM 3, объединяющие обнаружение, сегментацию и отслеживание в одной унифицированной модели:
- Задачи сегментации концепций: В SAM и SAM 2 сегментация объектов зависела от визуальных подсказок, например нажатий или рамок. SAM 3 добавляет возможность сегментировать объекты по короткой текстовой фразе или фрагменту-примеру из изображения. Благодаря этому модель может обнаруживать все подходящие экземпляры без необходимости нажимать на каждый из них.
- Текстовые подсказки с открытым словарём: В отличие от предыдущих версий, SAM 3 умеет интерпретировать короткие фразы на естественном языке. Это устраняет необходимость в фиксированном списке меток и позволяет модели работать с более специфичными или редкими концепциями.
- Одна модель для обнаружения, сегментации и отслеживания: SAM 3 объединяет обнаружение, сегментацию и отслеживание в одной модели, устраняя необходимость в отдельных системах для поиска объектов, создания масок сегментации и отслеживания объектов между кадрами видео. Это обеспечивает более согласованный и простой рабочий процесс как для изображений, так и для видео. Хотя SAM 2 также поддерживала некоторые возможности отслеживания, SAM 3 обеспечивает значительно более высокую и надёжную производительность.
- Более стабильные результаты в сложных сценах: Поскольку SAM 3 может объединять текст, изображения-примеры и визуальные подсказки, она надёжнее обрабатывает загромождённые или повторяющиеся сцены, чем предыдущие версии, которые полагались только на визуальные нажатия.

Рис. 2. SAM 3 представляет сегментацию концепций с помощью текстовых примеров или примеров изображений. (Источник)
Сравнение SAM 3, SAM 2 и SAM 1#
Представь, что ты смотришь видео с сафари, где много разных животных, и хочешь обнаружить и сегментировать только слонов. Как будет выглядеть эта задача в разных версиях SAM?
В SAM тебе пришлось бы вручную нажимать на каждого слона в каждом кадре, чтобы создать маску сегментации. Отслеживания нет, поэтому для каждого нового кадра нужны новые нажатия.
В SAM 2 ты мог бы один раз нажать на слона, получить его маску, и модель отслеживала бы этого же слона на протяжении всего видео. Однако для сегментации нескольких слонов — конкретных объектов — всё равно пришлось бы делать отдельные нажатия, поскольку SAM 2 сама по себе не понимает такие категории, как «слон».
С SAM 3 рабочий процесс становится намного проще. Ты можешь ввести «слон» или обвести одного слона ограничивающей рамкой в качестве примера, после чего модель автоматически найдёт всех слонов в видео, сегментирует их и будет стабильно отслеживать между кадрами. Она по-прежнему поддерживает подсказки в виде нажатий и рамок из предыдущих версий, но теперь также реагирует на текстовые подсказки и изображения-образцы — чего не умели SAM и SAM 2.
Как работает модель SAM 3#
Теперь подробнее рассмотрим, как работает модель SAM 3 и как она обучалась.
Обзор архитектуры модели SAM 3#
SAM 3 объединяет несколько компонентов, чтобы поддерживать концептуальные и визуальные подсказки в одной системе. В основе модели лежит Meta Perception Encoder — унифицированный энкодер изображений и текста с открытым исходным кодом от Meta.
Этот энкодер может обрабатывать как изображения, так и короткие именные фразы. Проще говоря, благодаря этому SAM 3 эффективнее связывает языковые и визуальные признаки, чем предыдущие версии Segment Anything Model.
Поверх этого энкодера SAM 3 использует детектор на базе семейства моделей Transformer DETR. Этот детектор обнаруживает объекты на изображении и помогает системе определить, какие из них соответствуют подсказке пользователя.
В частности, для сегментации видео SAM 3 использует компонент отслеживания, основанный на банке памяти и энкодере памяти из SAM 2. Благодаря этому модель сохраняет информацию об объектах между кадрами, чтобы повторно идентифицировать и отслеживать их с течением времени.

Рис. 3. Как работает сегментация чего угодно с помощью концепций (Источник: scontent)
Масштабируемый механизм работы с данными для Segment Anything Model 3#
Для обучения SAM 3 Meta требовалось гораздо больше размеченных данных, чем сейчас есть в интернете. Высококачественные маски сегментации и текстовые метки сложно создавать в больших масштабах, а полная обводка каждого экземпляра концепции на изображениях и видео требует много времени и средств.
Чтобы решить эту проблему, Meta создала новый механизм работы с данными, объединяющий саму SAM 3, дополнительные модели AI и работающих вместе людей-разметчиков. Рабочий процесс начинается с конвейера AI-систем, включая SAM 3 и модель создания описаний на базе Llama.
Эти системы сканируют большие коллекции изображений и видео, создают описания, преобразуют их в текстовые метки и формируют предварительные варианты масок сегментации. Затем люди и AI-разметчики проверяют эти варианты.
AI-разметчики, обученные соответствовать человеческой точности или превосходить её в таких задачах, как проверка качества масок и полноты охвата концепций, отфильтровывают простые случаи. Люди подключаются только к более сложным примерам, с которыми модель всё ещё может испытывать трудности.

Рис. 4. Механизм работы с данными SAM 3 (Источник)
Такой подход значительно повышает скорость разметки Meta. Благодаря тому, что AI-разметчики обрабатывают простые случаи, конвейер работает примерно в пять раз быстрее на негативных подсказках и на 36% быстрее на позитивных подсказках в задачах с высокой детализацией.
Такая эффективность позволила расширить набор данных до более чем четырёх миллионов уникальных концепций. Постоянный цикл предложений AI, исправлений людей и обновлённых предсказаний модели со временем повышает качество меток и помогает SAM 3 изучать гораздо более широкий набор визуальных и текстовых концепций.
Улучшения производительности SAM 3#
Что касается производительности, SAM 3 заметно превосходит предыдущие модели. На новом бенчмарке SA-Co от Meta, оценивающем обнаружение и сегментацию концепций с открытым словарём, SAM 3 показывает примерно вдвое более высокие результаты, чем предыдущие системы, как на изображениях, так и на видео.
Она также не уступает SAM 2 или превосходит её в интерактивных визуальных задачах, таких как point-to-mask и mask-to-masklet. Meta сообщает о дополнительных улучшениях на более сложных оценках, включая zero-shot LVIS, где модели должны распознавать редкие категории без обучающих примеров, и подсчёт объектов, измеряющий, обнаружены ли все экземпляры объекта. Это свидетельствует о более сильной способности к обобщению между различными предметными областями.
Помимо повышения точности, SAM 3 эффективна: она обрабатывает изображение более чем со 100 обнаруженными объектами примерно за 30 миллисекунд на GPU H200 и сохраняет скорость, близкую к реальному времени, при отслеживании нескольких объектов в видео.
Применение Segment Anything Model 3#
Теперь, когда мы лучше понимаем SAM 3, давай рассмотрим, как её используют в реальных приложениях — от продвинутого рассуждения по текстовым инструкциям до научных исследований и собственных продуктов Meta.
Обработка сложных текстовых запросов с помощью SAM 3 Agent#
SAM 3 также можно использовать как инструмент внутри более крупной мультимодальной языковой модели, которую Meta называет SAM 3 Agent. Вместо короткой фразы вроде «слон» агент может разбить более сложный вопрос на небольшие подсказки, понятные SAM 3.
Например, если пользователь спрашивает: «Какой объект на картинке используется для управления лошадью и направления её движения?», агент перебирает разные именные фразы, отправляет их в SAM 3 и проверяет, какие маски имеют смысл. Он продолжает уточнять запрос, пока не найдёт нужный объект.
Даже не обученный на специальных наборах данных для рассуждений, SAM 3 Agent хорошо показывает себя на бенчмарках для сложных текстовых запросов, таких как ReasonSeg и OmniLabel. Это демонстрирует, что SAM 3 может поддерживать системы, которым одновременно нужны понимание языка и детализированная визуальная сегментация.
Научные и природоохранные применения SAM 3#
Интересно, что SAM 3 уже используется в исследовательских задачах, где важны подробные визуальные метки. Meta совместно с Conservation X Labs и Osa Conservation создала SA-FARI — общедоступный набор данных для мониторинга дикой природы, содержащий более 10 000 видео с фотоловушек.
Каждое животное в каждом кадре размечено рамками и масками сегментации, а ручная разметка такой информации заняла бы огромное количество времени. Аналогичным образом, в океанографических исследованиях SAM 3 используется вместе с FathomNet и MBARI для создания масок сегментации экземпляров на подводных изображениях и поддержки новых оценочных бенчмарков.
Такие наборы данных помогают учёным эффективнее анализировать видеозаписи и изучать животных и среды обитания, за которыми обычно сложно наблюдать в больших масштабах. Исследователи также могут использовать эти ресурсы для создания собственных моделей идентификации видов, анализа поведения и автоматизированного экологического мониторинга.
Как Meta внедряет SAM 3 в свои продукты#
Помимо исследовательского применения, SAM 3 также обеспечивает новые функции и сценарии использования в потребительских продуктах Meta. Вот несколько примеров её интеграции:
- Редактирование в Instagram: Создатели контента могут применять эффекты к конкретному человеку или объекту в видео без ручной обработки каждого кадра.
- Приложение Meta AI и meta.ai в интернете: SAM 3 поддерживает новые инструменты для изменения, улучшения и создания ремиксов изображений и видео.
- Функция «View in Room» в Facebook Marketplace: SAM 3 работает вместе с SAM 3D и позволяет пользователям предварительно просматривать мебель или декор в своих домах по одной фотографии.
- Исследовательские очки Aria Gen 2: Segment Anything Model 3 помогает сегментировать и отслеживать руки и объекты с точки зрения первого лица, поддерживая AR (дополненную реальность), робототехнику и исследования контекстного AI.
Основные выводы#
SAM 3 — важный шаг вперёд в сегментации. Она представляет сегментацию концепций, текстовые подсказки с открытым словарём и улучшенное отслеживание. Благодаря заметно более высокой производительности как на изображениях, так и на видео, а также появлению SAM 3D этот набор моделей открывает новые возможности для AI в области компьютерного зрения, творческих инструментов, научных исследований и реальных продуктов.
Присоединяйся к нашему сообществу и изучай наш репозиторий GitHub, чтобы узнать больше об AI. Если ты хочешь создать собственный проект в области компьютерного зрения, ознакомься с нашими вариантами лицензирования. Узнай больше о таких приложениях, как AI в здравоохранении и Vision AI в розничной торговле, на наших страницах решений.









