Ultralytics YOLO27:
Компьютерное зрение на базе ИИ

Знакомство с SAM 3: новая модель Segment Anything от Meta AI

Узнай, как SAM 3 — новая модель Segment Anything от Meta AI — упрощает обнаружение, сегментацию и отслеживание объектов на реальных изображениях и видео.

ABAbirami Vina10 min read
Модель Segment Anything SAM 3 от Meta AI

19 ноября 2025 года Meta AI выпустила Segment Anything Model 3, также известную как SAM 3. Эта новая версия Segment Anything Model представляет новые способы обнаружения, сегментации и отслеживания объектов на реальных изображениях и видео с помощью текстовых и визуальных подсказок, а также примеров изображений.

Модель SAM 3 развивает возможности SAM и SAM 2, добавляя такие новые функции и улучшения, как сегментация концепций, обнаружение объектов с открытым словарём и отслеживание видео в реальном времени. Она понимает короткие именные фразы, отслеживает объекты между кадрами и распознаёт детализированные или редкие концепции, с которыми предыдущие модели справлялись менее стабильно.

В рамках выпуска SAM 3 Meta также представила SAM 3D. Этот набор моделей нового поколения реконструирует объекты, сцены и человеческое тело целиком по одному изображению, расширяя экосистему Segment Anything возможностями понимания 3D. Эти дополнения открывают новые приложения в компьютерном зрении, робототехнике, редактировании медиа и творческих рабочих процессах.

В этой статье мы разберёмся, что такое SAM 3, чем он отличается от SAM 2, как работает модель и где она применяется в реальных задачах. Давай начнём!

Что такое SAM 3? Обзор Segment Anything Model 3 от Meta#

SAM 3 — это современная модель компьютерного зрения, способная обнаруживать, разделять и отслеживать объекты на изображениях и видео по простым инструкциям. Вместо фиксированного списка меток SAM 3 понимает естественный язык и визуальные признаки, поэтому ты можешь легко указать модели, что именно нужно найти.

Например, с SAM 3 ты можешь ввести короткую фразу вроде «жёлтый школьный автобус» или «полосатая кошка», нажать на объект или выделить пример на изображении. Затем модель обнаружит все подходящие объекты и создаст точные маски сегментации — визуальные контуры, показывающие, какие именно пиксели принадлежат объекту. SAM 3 также может отслеживать эти объекты между кадрами видео, сохраняя их идентичность при движении.

SAM 3D обеспечивает 3D-реконструкцию по одному изображению#

Ещё одной интересной частью анонса Meta AI стала SAM 3D, расширяющая проект Segment Anything возможностями понимания 3D. SAM 3D может получить одно 2D-изображение и реконструировать форму, позу или структуру объекта либо человеческого тела в трёх измерениях. Иными словами, модель может оценить, как объект занимает пространство, даже если доступен только один ракурс.

SAM 3D выпущена в виде двух разных моделей: SAM 3D Objects, которая реконструирует повседневные предметы с учётом геометрии и текстуры, и SAM 3D Body, которая оценивает форму и позу человеческого тела по одному изображению. Обе модели используют результат сегментации SAM 3, а затем создают 3D-представление, соответствующее внешнему виду и положению объекта на исходной фотографии.

Пример использования SAM 3D

Рис. 1. Пример использования SAM 3D. (Источник: создано с помощью playground Segment Anything от Meta AI)

SAM 3: новые функции для объединения обнаружения, сегментации и отслеживания#

Ниже перечислены ключевые обновления SAM 3, объединяющие обнаружение, сегментацию и отслеживание в одной унифицированной модели:

  • Задачи сегментации концепций: В SAM и SAM 2 сегментация объектов зависела от визуальных подсказок, например нажатий или рамок. SAM 3 добавляет возможность сегментировать объекты по короткой текстовой фразе или фрагменту-примеру из изображения. Благодаря этому модель может обнаруживать все подходящие экземпляры без необходимости нажимать на каждый из них.
  • Текстовые подсказки с открытым словарём: В отличие от предыдущих версий, SAM 3 умеет интерпретировать короткие фразы на естественном языке. Это устраняет необходимость в фиксированном списке меток и позволяет модели работать с более специфичными или редкими концепциями.
  • Одна модель для обнаружения, сегментации и отслеживания: SAM 3 объединяет обнаружение, сегментацию и отслеживание в одной модели, устраняя необходимость в отдельных системах для поиска объектов, создания масок сегментации и отслеживания объектов между кадрами видео. Это обеспечивает более согласованный и простой рабочий процесс как для изображений, так и для видео. Хотя SAM 2 также поддерживала некоторые возможности отслеживания, SAM 3 обеспечивает значительно более высокую и надёжную производительность.
  • Более стабильные результаты в сложных сценах: Поскольку SAM 3 может объединять текст, изображения-примеры и визуальные подсказки, она надёжнее обрабатывает загромождённые или повторяющиеся сцены, чем предыдущие версии, которые полагались только на визуальные нажатия.

Сегментация концепций в SAM 3 с текстовыми примерами или примерами изображений

Рис. 2. SAM 3 представляет сегментацию концепций с помощью текстовых примеров или примеров изображений. (Источник)

Сравнение SAM 3, SAM 2 и SAM 1#

Представь, что ты смотришь видео с сафари, где много разных животных, и хочешь обнаружить и сегментировать только слонов. Как будет выглядеть эта задача в разных версиях SAM?

В SAM тебе пришлось бы вручную нажимать на каждого слона в каждом кадре, чтобы создать маску сегментации. Отслеживания нет, поэтому для каждого нового кадра нужны новые нажатия.

В SAM 2 ты мог бы один раз нажать на слона, получить его маску, и модель отслеживала бы этого же слона на протяжении всего видео. Однако для сегментации нескольких слонов — конкретных объектов — всё равно пришлось бы делать отдельные нажатия, поскольку SAM 2 сама по себе не понимает такие категории, как «слон».

С SAM 3 рабочий процесс становится намного проще. Ты можешь ввести «слон» или обвести одного слона ограничивающей рамкой в качестве примера, после чего модель автоматически найдёт всех слонов в видео, сегментирует их и будет стабильно отслеживать между кадрами. Она по-прежнему поддерживает подсказки в виде нажатий и рамок из предыдущих версий, но теперь также реагирует на текстовые подсказки и изображения-образцы — чего не умели SAM и SAM 2.

Как работает модель SAM 3#

Теперь подробнее рассмотрим, как работает модель SAM 3 и как она обучалась.

Обзор архитектуры модели SAM 3#

SAM 3 объединяет несколько компонентов, чтобы поддерживать концептуальные и визуальные подсказки в одной системе. В основе модели лежит Meta Perception Encoder — унифицированный энкодер изображений и текста с открытым исходным кодом от Meta.

Этот энкодер может обрабатывать как изображения, так и короткие именные фразы. Проще говоря, благодаря этому SAM 3 эффективнее связывает языковые и визуальные признаки, чем предыдущие версии Segment Anything Model.

Поверх этого энкодера SAM 3 использует детектор на базе семейства моделей Transformer DETR. Этот детектор обнаруживает объекты на изображении и помогает системе определить, какие из них соответствуют подсказке пользователя.

В частности, для сегментации видео SAM 3 использует компонент отслеживания, основанный на банке памяти и энкодере памяти из SAM 2. Благодаря этому модель сохраняет информацию об объектах между кадрами, чтобы повторно идентифицировать и отслеживать их с течением времени.

Как работает сегментация чего угодно с помощью концепций

Рис. 3. Как работает сегментация чего угодно с помощью концепций (Источник: scontent)

Масштабируемый механизм работы с данными для Segment Anything Model 3#

Для обучения SAM 3 Meta требовалось гораздо больше размеченных данных, чем сейчас есть в интернете. Высококачественные маски сегментации и текстовые метки сложно создавать в больших масштабах, а полная обводка каждого экземпляра концепции на изображениях и видео требует много времени и средств.

Чтобы решить эту проблему, Meta создала новый механизм работы с данными, объединяющий саму SAM 3, дополнительные модели AI и работающих вместе людей-разметчиков. Рабочий процесс начинается с конвейера AI-систем, включая SAM 3 и модель создания описаний на базе Llama.

Эти системы сканируют большие коллекции изображений и видео, создают описания, преобразуют их в текстовые метки и формируют предварительные варианты масок сегментации. Затем люди и AI-разметчики проверяют эти варианты.

AI-разметчики, обученные соответствовать человеческой точности или превосходить её в таких задачах, как проверка качества масок и полноты охвата концепций, отфильтровывают простые случаи. Люди подключаются только к более сложным примерам, с которыми модель всё ещё может испытывать трудности.

Механизм работы с данными SAM 3

Рис. 4. Механизм работы с данными SAM 3 (Источник)

Такой подход значительно повышает скорость разметки Meta. Благодаря тому, что AI-разметчики обрабатывают простые случаи, конвейер работает примерно в пять раз быстрее на негативных подсказках и на 36% быстрее на позитивных подсказках в задачах с высокой детализацией.

Такая эффективность позволила расширить набор данных до более чем четырёх миллионов уникальных концепций. Постоянный цикл предложений AI, исправлений людей и обновлённых предсказаний модели со временем повышает качество меток и помогает SAM 3 изучать гораздо более широкий набор визуальных и текстовых концепций.

Улучшения производительности SAM 3#

Что касается производительности, SAM 3 заметно превосходит предыдущие модели. На новом бенчмарке SA-Co от Meta, оценивающем обнаружение и сегментацию концепций с открытым словарём, SAM 3 показывает примерно вдвое более высокие результаты, чем предыдущие системы, как на изображениях, так и на видео.

Она также не уступает SAM 2 или превосходит её в интерактивных визуальных задачах, таких как point-to-mask и mask-to-masklet. Meta сообщает о дополнительных улучшениях на более сложных оценках, включая zero-shot LVIS, где модели должны распознавать редкие категории без обучающих примеров, и подсчёт объектов, измеряющий, обнаружены ли все экземпляры объекта. Это свидетельствует о более сильной способности к обобщению между различными предметными областями.

Помимо повышения точности, SAM 3 эффективна: она обрабатывает изображение более чем со 100 обнаруженными объектами примерно за 30 миллисекунд на GPU H200 и сохраняет скорость, близкую к реальному времени, при отслеживании нескольких объектов в видео.

Применение Segment Anything Model 3#

Теперь, когда мы лучше понимаем SAM 3, давай рассмотрим, как её используют в реальных приложениях — от продвинутого рассуждения по текстовым инструкциям до научных исследований и собственных продуктов Meta.

Обработка сложных текстовых запросов с помощью SAM 3 Agent#

SAM 3 также можно использовать как инструмент внутри более крупной мультимодальной языковой модели, которую Meta называет SAM 3 Agent. Вместо короткой фразы вроде «слон» агент может разбить более сложный вопрос на небольшие подсказки, понятные SAM 3.

Например, если пользователь спрашивает: «Какой объект на картинке используется для управления лошадью и направления её движения?», агент перебирает разные именные фразы, отправляет их в SAM 3 и проверяет, какие маски имеют смысл. Он продолжает уточнять запрос, пока не найдёт нужный объект.

Даже не обученный на специальных наборах данных для рассуждений, SAM 3 Agent хорошо показывает себя на бенчмарках для сложных текстовых запросов, таких как ReasonSeg и OmniLabel. Это демонстрирует, что SAM 3 может поддерживать системы, которым одновременно нужны понимание языка и детализированная визуальная сегментация.

Научные и природоохранные применения SAM 3#

Интересно, что SAM 3 уже используется в исследовательских задачах, где важны подробные визуальные метки. Meta совместно с Conservation X Labs и Osa Conservation создала SA-FARI — общедоступный набор данных для мониторинга дикой природы, содержащий более 10 000 видео с фотоловушек.

Каждое животное в каждом кадре размечено рамками и масками сегментации, а ручная разметка такой информации заняла бы огромное количество времени. Аналогичным образом, в океанографических исследованиях SAM 3 используется вместе с FathomNet и MBARI для создания масок сегментации экземпляров на подводных изображениях и поддержки новых оценочных бенчмарков.

Такие наборы данных помогают учёным эффективнее анализировать видеозаписи и изучать животных и среды обитания, за которыми обычно сложно наблюдать в больших масштабах. Исследователи также могут использовать эти ресурсы для создания собственных моделей идентификации видов, анализа поведения и автоматизированного экологического мониторинга.

Как Meta внедряет SAM 3 в свои продукты#

Помимо исследовательского применения, SAM 3 также обеспечивает новые функции и сценарии использования в потребительских продуктах Meta. Вот несколько примеров её интеграции:

  • Редактирование в Instagram: Создатели контента могут применять эффекты к конкретному человеку или объекту в видео без ручной обработки каждого кадра.
  • Приложение Meta AI и meta.ai в интернете: SAM 3 поддерживает новые инструменты для изменения, улучшения и создания ремиксов изображений и видео.
  • Функция «View in Room» в Facebook Marketplace: SAM 3 работает вместе с SAM 3D и позволяет пользователям предварительно просматривать мебель или декор в своих домах по одной фотографии.
  • Исследовательские очки Aria Gen 2: Segment Anything Model 3 помогает сегментировать и отслеживать руки и объекты с точки зрения первого лица, поддерживая AR (дополненную реальность), робототехнику и исследования контекстного AI.

Основные выводы#

SAM 3 — важный шаг вперёд в сегментации. Она представляет сегментацию концепций, текстовые подсказки с открытым словарём и улучшенное отслеживание. Благодаря заметно более высокой производительности как на изображениях, так и на видео, а также появлению SAM 3D этот набор моделей открывает новые возможности для AI в области компьютерного зрения, творческих инструментов, научных исследований и реальных продуктов.

Присоединяйся к нашему сообществу и изучай наш репозиторий GitHub, чтобы узнать больше об AI. Если ты хочешь создать собственный проект в области компьютерного зрения, ознакомься с нашими вариантами лицензирования. Узнай больше о таких приложениях, как AI в здравоохранении и Vision AI в розничной торговле, на наших страницах решений.

Explore solutions

Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше

Давай вместе создавать будущее AI!

Начни свой путь в будущее машинного обучения