Image Captioning
Узнай, как создание подписей к изображениям использует зрительно-языковые модели для генерации описаний картинок, изучи реальные сценарии применения и связывай подписи с помощью Ultralytics YOLO26.
Создание подписей к изображениям — это задача ИИ, которая автоматически генерирует текстовое описание изображения на естественном языке. Например, для фотографии улицы система может выдать: «Городской автобус проезжает мимо пешеходов на перекрестке». Эта задача объединяет визуальное восприятие с генерацией текста, поэтому модель должна определять важный контент, понимать взаимосвязи между объектами и четко выражать эту информацию.
Создание подписей обычно выполняется с помощью модели «зрение-язык», которая работает как с визуальными, так и с текстовыми данными. В отличие от написанной вручную подписи к фотографии, подпись, сгенерированная ИИ, является предсказанием на основе закономерностей, изученных из пар «изображение-текст».
Как работает создание подписей к изображениям#
Система создания подписей к изображениям обычно имеет два связанных этапа:
- Визуальный энкодер преобразует пиксели в представления признаков, описывающие объекты, текстуры, локации и общую информацию о сцене.
- Языковой декодер превращает эти визуальные признаки в последовательность слов.
Многие системы используют декодер transformer. Он начинается со стартового токена, предсказывает следующий токен, добавляет его в последовательность и повторяет процесс до тех пор, пока не сгенерирует конечный токен или не достигнет ограничения по длине. В Google Machine Learning Glossary этот процесс пошагового создания описывается как авторегрессионная генерация.
Механизм внимания помогает декодеру фокусироваться на релевантных областях изображения при выборе каждого слова. При генерации слова «автобус» он может делать акцент на транспортном средстве; при генерации слова «улица» он может обращать внимание на окружающую дорогу. В руководстве по созданию подписей к изображениям TensorFlow продемонстрировано, как визуальные признаки, токенизация, перекрестное внимание и текстовый декодер сочетаются друг с другом.
Для обучения обычно требуются изображения в паре с одной или несколькими подписями, написанными человеком. Несколько подписей полезны, потому что одно и то же изображение можно описать правильно разными способами, например «Ребенок играет с собакой» и «Молодой человек бросает мяч для питомца».
Отличия от связанных задач компьютерного зрения#
Создание подписей к изображениям пересекается с несколькими задачами ИИ, но выдает особый результат:
- Классификация изображений присваивает всему изображению одну или несколько меток, таких как «пляж». Создание подписей генерирует предложение, которое может описывать объекты, действия, атрибуты и контекст.
- Обнаружение объектов идентифицирует и локализует предопределенные объекты с помощью ограничивающих рамок. Создание подписей может упоминать эти объекты, а также описывать их взаимосвязи, например «Два велосипедиста едут рядом с автомобилем».
- Распознавание текста на изображениях извлекает видимый текст с вывесок, документов или упаковок. Подпись обобщает сцену, а не расшифровывает весь текст.
- Визуальные ответы на вопросы отвечают на конкретный вопрос об изображении. Создание подписей формирует общее описание без необходимости задавать вопрос.
- Альтернативный текст передает назначение изображения в определенном контексте. Автоматическая подпись может служить черновиком, но она не всегда подходит в качестве альтернативного текста автоматически, поскольку декоративные, функциональные и сложные изображения требуют особого подхода согласно руководству по изображениям W3C.
Реальные приложения#
-
Доступный веб-контент: Платформа публикации может генерировать черновики описаний для недавно загруженных фотографий. Для новостного изображения подпись может определять основных людей, обстановку и действие, прежде чем редактор проверит их на точность и актуальность. Сложным диаграммам по-прежнему требуется структурированное длинное описание, а не обобщенная визуальная сводка.
-
Доступные для поиска медиабиблиотеки: Ритейлер или медиакомпания может добавлять подписи к большим коллекциям изображений и индексировать сгенерированный текст. Пользователи смогут искать такие фразы, как «красный рюкзак рядом с палаткой», даже если файлы никогда не тегировались вручную. Подписи могут дополнять визуальные эмбеддинги и метаданные, улучшая поиск по большим каталогам.
Практическое обоснование с Ultralytics YOLO#
Генераторы подписей могут придумывать неподтвержденные детали, особенно в переполненных или незнакомых сценах. Одним из практических подходов является обоснование генерации с помощью структурированных наблюдений от Ultralytics YOLO26. Следующий задокументированный рабочий процесс предсказания YOLO извлекает обнаруженные имена объектов, которые последующий языковой компонент может использовать в качестве визуального контекста:
from ultralytics import YOLO
# Detect objects that can ground a downstream caption generator
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact textual context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Этот рабочий процесс не создает финальную подпись. Вместо этого он предоставляет проверяемые метки объектов, которые могут ограничивать языковую модель. Для кастомных доменов платформа Ultralytics поддерживает разметку датасетов в облаке, обучение, развертывание и мониторинг для компонента восприятия в конвейере создания подписей.
Ограничения и оценка#
Подписи могут пропускать важные объекты, путать взаимосвязи, воспроизводить предвзятость датасета или галлюцинировать детали, которые не видны. Оценки уверенности могут помочь ранжировать варианты описаний, как показано в API описания изображений Azure, но беглое предложение не обязательно является достоверным.
Поэтому оценка должна проверять охват объектов, фактическое обоснование, читаемость, предвзятость и полезность для целевой аудитории. Поскольку несколько подписей могут быть одинаково правильными, команды должны сочетать автоматизированные измерения с проверкой человеком, следуя таким практикам, как оценка генеративного ИИ и более широкий фреймворк управления рисками ИИ NIST. Одобрение человека остается особенно важным для контента, связанного с доступностью, медициной, критической безопасностью или публичным использованием.






