Image Captioning
Автоматическое описание изображений создаёт текстовое описание изображения на естественном языке с помощью визуально-языковых моделей. Рассматриваются области применения, ограничения и привязка описаний к данным YOLO.
Создание подписей к изображениям — это задача ИИ, которая автоматически генерирует текстовое описание изображения на естественном языке. Например, получив фотографию улицы, система может выдать: «Городской автобус проезжает мимо пешеходов на перекрёстке». Эта задача объединяет визуальное восприятие с генерацией языка, поэтому модель должна выявлять важное содержимое, понимать отношения между объектами и ясно описывать эту информацию.
Подписи обычно генерирует визуально-языковая модель, которая работает с визуальными и текстовыми данными. В отличие от подписи к фотографии, написанной человеком, подпись, созданная ИИ, — это предсказание на основе закономерностей, усвоенных из пар изображение—текст.
Как работает создание подписей к изображениям#
Система создания подписей к изображениям обычно состоит из двух связанных этапов:
- Визуальный энкодер преобразует пиксели в признаковые представления объектов, текстур, расположения и общей информации о сцене.
- Языковой декодер преобразует эти визуальные признаки в последовательность слов.
Во многих системах используется декодер Transformer. Он начинает с начального токена, предсказывает следующий токен, добавляет его в последовательность и повторяет этот процесс, пока не сгенерирует конечный токен или не достигнет ограничения длины. Этот процесс генерации по одному токену называется авторегрессионной генерацией.
Полный цикл работы энкодера-декодера выглядит так:
Механизм внимания помогает декодеру сосредоточиться на нужных областях изображения при выборе каждого слова. Генерируя слово «автобус», модель может уделить больше внимания транспортному средству, а при генерации слова «улица» — окружающей дороге. Полноценная модель для создания подписей к изображениям объединяет признаки изображения, токенизацию, перекрёстное внимание и текстовый декодер.
Для обучения обычно нужны изображения, сопоставленные с одной или несколькими подписями, написанными людьми. Несколько подписей полезны, поскольку одно и то же изображение можно правильно описать разными способами, например: «Ребёнок играет с собакой» и «Юный человек бросает мяч питомцу».
Отличия от связанных задач компьютерного зрения#
Создание подписей к изображениям пересекается с несколькими задачами ИИ, но даёт отдельный тип результата:
- Классификация изображений присваивает всему изображению одну или несколько меток, например «пляж». При создании подписей генерируется предложение, которое может описывать объекты, действия, атрибуты и контекст.
- Обнаружение объектов выявляет заданные объекты и определяет их расположение с помощью ограничивающих рамок. В подписи можно упомянуть эти объекты, а также описать их взаимное расположение, например: «Два велосипедиста едут рядом с автомобилем».
- Оптическое распознавание символов извлекает видимый текст с вывесок, документов или упаковок. Подпись описывает сцену в целом, а не переписывает весь текст.
- Ответы на вопросы о визуальном содержимом дают ответ на конкретный вопрос об изображении. Создание подписи формирует общее описание без вопроса.
- Альтернативный текст передаёт назначение изображения в определённом контексте. Автоматически созданная подпись может служить черновиком, но не всегда подходит в качестве альтернативного текста: декоративные, функциональные и сложные изображения требуют разного подхода согласно руководству W3C по изображениям.
Примеры применения в реальных условиях#
-
Веб-контент с поддержкой доступности: платформа для публикаций может создавать черновые описания недавно загруженных фотографий. Для новостного изображения подпись может назвать основных людей, место действия и происходящее, после чего редактор проверит точность и уместность текста. Для сложных диаграмм всё равно требуется структурированное подробное описание, а не общее визуальное резюме.
-
Медиатеки с поиском: продавец или медиакомпания может создавать подписи к большим коллекциям изображений и индексировать сгенерированный текст. Тогда пользователи смогут искать фразы вроде «красный рюкзак рядом с палаткой», даже если файлы никогда не помечали вручную. Подписи дополняют визуальные эмбеддинги и метаданные, упрощая поиск в больших каталогах.
Практическая привязка к визуальным данным с помощью Ultralytics YOLO#
Генераторы подписей могут выдумывать неподтверждённые детали, особенно в переполненных или незнакомых сценах. Один из практических подходов — опираться при генерации на структурированные наблюдения от Ultralytics YOLO26. В следующем документированном процессе предсказания YOLO извлекаются названия обнаруженных объектов, которые последующий языковой компонент может использовать как визуальный контекст:
from ultralytics import YOLO
# Обнаружение объектов, помогающих обосновать подпись, создаваемую последующей системой
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Преобразование результатов обнаружения в краткий текстовый контекст
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Этот процесс не создаёт итоговую подпись. Вместо этого он предоставляет проверяемые метки объектов, которые могут ограничить вывод языковой модели. Для специализированных предметных областей Ultralytics Platform поддерживает облачное аннотирование наборов данных, обучение, развёртывание и мониторинг компонента восприятия в конвейере создания подписей.
Ограничения и оценка#
В подписях могут отсутствовать важные объекты, неверно описываться отношения между объектами, воспроизводиться смещение в наборе данных или галлюцинироваться невидимые детали. Оценки уверенности, например возвращаемые API описания изображений, помогают ранжировать варианты описаний, но беглое предложение не обязательно соответствует действительности.
Поэтому при оценке нужно проверять охват объектов, соответствие фактам, читабельность, смещения и полезность для предполагаемой аудитории. Поскольку несколько подписей могут быть одинаково правильными, командам следует сочетать автоматические измерения с проверкой человеком, придерживаясь таких практик, как оценка генеративного ИИ, и более широкой системы управления рисками ИИ NIST. Проверка человеком особенно важна для контента, связанного с доступностью, медициной, безопасностью или предназначенного широкой аудитории.










