Image Captioning
A legendagem de imagens cria uma descrição em linguagem natural de uma imagem usando modelos de visão e linguagem. Abrange usos, limitações e fundamentação de legendas com YOLO.
A legendagem de imagens é uma tarefa de IA que gera automaticamente uma descrição em linguagem natural de uma imagem. Por exemplo, a partir de uma fotografia de uma rua, um sistema poderia produzir: «Um autocarro urbano passa por peões num cruzamento.» A tarefa combina perceção visual e geração de linguagem, pelo que o modelo tem de identificar conteúdos importantes, compreender as relações entre objetos e expressar essa informação com clareza.
A legendagem é normalmente realizada por um modelo de visão e linguagem, que trabalha com dados visuais e textuais. Ao contrário de uma legenda escrita manualmente, uma legenda gerada por IA é uma previsão baseada em padrões aprendidos a partir de pares de imagens e texto.
Como funciona a legendagem de imagens#
Um sistema de legendagem de imagens costuma ter duas etapas ligadas entre si:
- Um codificador visual converte os píxeis em representações de características que descrevem objetos, texturas, localizações e informações mais gerais sobre a cena.
- Um descodificador de linguagem transforma essas características visuais numa sequência de palavras.
Muitos sistemas usam um decodificador transformer. Este começa com um token inicial, prevê o token seguinte, adiciona-o à sequência e repete o processo até gerar um token final ou atingir um limite de comprimento. Este processo token a token chama-se geração autorregressiva.
O ciclo completo de codificador-decodificador é assim:
Um mecanismo de atenção ajuda o decodificador a concentrar-se nas regiões relevantes da imagem ao escolher cada palavra. Ao gerar «autocarro», pode dar ênfase ao veículo; ao gerar «rua», pode prestar atenção à estrada ao redor. Um modelo completo de legendagem de imagens combina atributos de imagem, tokenização, atenção cruzada e um decodificador de texto.
O treino requer, em geral, imagens emparelhadas com uma ou mais legendas escritas por pessoas. É útil ter várias legendas, porque a mesma imagem pode ser descrita corretamente de diferentes formas, como «Uma criança a brincar com um cão» e «Uma pessoa jovem atira uma bola a um animal de estimação».
Diferenças em relação a tarefas de visão relacionadas#
A legendagem de imagens sobrepõe-se a várias tarefas de IA, mas produz um resultado distinto:
- A classificação de imagens atribui um ou mais rótulos à imagem inteira, como «praia». A legendagem gera uma frase que pode descrever objetos, ações, atributos e contexto.
- A deteção de objetos identifica e localiza objetos predefinidos com caixas delimitadoras. A legendagem pode mencionar esses objetos, mas também descreve as relações entre eles, como «Dois ciclistas passam ao lado de um carro».
- O reconhecimento ótico de caracteres extrai texto visível de sinais, documentos ou embalagens. Uma legenda resume a cena, em vez de transcrever todo o texto.
- A resposta a perguntas visuais responde a uma pergunta específica sobre uma imagem. A legendagem cria uma descrição geral sem exigir uma pergunta.
- Texto alternativo comunica a finalidade de uma imagem num contexto específico. Uma legenda automática pode servir de rascunho, mas não é automaticamente adequada como texto alternativo, porque imagens decorativas, funcionais e complexas exigem tratamentos diferentes, de acordo com o Tutorial da W3C sobre imagens.
Aplicações no mundo real#
-
Conteúdo Web acessível: Uma plataforma de publicação pode gerar descrições preliminares para fotografias carregadas recentemente. Para uma imagem noticiosa, a legenda pode identificar as principais pessoas, o local e a ação, antes de um editor verificar a precisão e a relevância. Os diagramas complexos continuam a precisar de uma descrição longa e estruturada, em vez de um resumo visual genérico.
-
Bibliotecas de multimédia pesquisáveis: Um retalhista ou uma empresa de comunicação pode criar legendas para grandes coleções de imagens e indexar o texto gerado. Assim, os utilizadores podem pesquisar expressões como «mochila vermelha ao lado de uma tenda», mesmo que os ficheiros nunca tenham sido etiquetados manualmente. As legendas podem complementar os embeddings visuais e os metadados, melhorando a pesquisa em catálogos de grandes dimensões.
Ancoragem prática com Ultralytics YOLO#
Os geradores de legendas podem inventar detalhes sem suporte, sobretudo em cenas cheias ou desconhecidas. Uma abordagem prática consiste em ancorar a geração com observações estruturadas do Ultralytics YOLO26. O fluxo de trabalho documentado de previsão do YOLO apresentado a seguir extrai os nomes dos objetos detetados, que um componente de linguagem posterior pode usar como contexto visual:
from ultralytics import YOLO
# Detetar objetos que possam servir de referência para um gerador de legendas posterior
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Converter as deteções em contexto textual compacto
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Este fluxo de trabalho não produz a legenda final. Em vez disso, fornece etiquetas de objetos verificáveis que podem restringir um modelo de linguagem. Para domínios personalizados, a Ultralytics Platform permite anotar conjuntos de dados na cloud, treinar, implementar e monitorizar o componente de perceção de um fluxo de legendagem.
Limitações e avaliação#
As legendas podem omitir objetos importantes, confundir relações, reproduzir o viés do conjunto de dados ou alucinar detalhes que não estão visíveis. As pontuações de confiança, como as devolvidas por uma API de descrição de imagens, podem ajudar a ordenar descrições candidatas, mas uma frase fluente não é necessariamente factual.
A avaliação deve, por isso, analisar a cobertura de objetos, a fundamentação factual, a legibilidade, o enviesamento e a utilidade para o público pretendido. Como várias legendas podem estar igualmente corretas, as equipas devem combinar medições automáticas com revisão humana, seguindo práticas como a avaliação de IA generativa e o mais abrangente Estrutura de Gestão de Riscos de IA do NIST. A aprovação humana continua a ser especialmente importante para conteúdos relacionados com acessibilidade, medicina, segurança crítica ou destinados ao público.










