Ultralytics YOLO27:
IA para visão

Ligando o processamento de linguagem natural e a visão computacional

Saiba como o processamento de linguagem natural (NLP) e a visão computacional (CV) podem trabalhar em conjunto para transformar setores com sistemas de IA multimodais mais inteligentes.

ABAbirami Vina9 min read
Ligando o processamento de linguagem natural e a visão computacional

O processamento de linguagem natural (NLP) e a visão computacional (CV) são dois ramos distintos da inteligência artificial (AI) que ganharam muita popularidade nos últimos anos. Graças aos avanços na AI, estes dois ramos estão agora mais interligados do que nunca.

Um ótimo exemplo disso é a legendagem automática de imagens. A visão computacional pode ser utilizada para analisar e compreender o conteúdo de uma imagem, enquanto o processamento de linguagem natural pode ser utilizado para [gerar](https://ultralytics-translation-2.invalid uma legenda que a descreva. A legendagem automática de imagens é normalmente utilizada em plataformas de redes sociais para melhorar a acessibilidade e em sistemas de gestão de conteúdos para ajudar a organizar e etiquetar imagens de forma eficiente.

As inovações em NLP e IA de visão deram origem a muitos casos de utilização deste tipo numa grande variedade de setores. Neste artigo, vamos analisar mais detalhadamente o NLP e a visão computacional e explicar como ambos funcionam. Também vamos explorar aplicações interessantes que utilizam estas duas tecnologias em conjunto. Vamos começar!

Compreender o NLP e a IA de visão#

O NLP centra-se na interação entre computadores e a linguagem humana. Permite que as máquinas compreendam, interpretem e gerem texto ou discurso de uma forma significativa. Pode ser utilizado para realizar tarefas como tradução, análise de sentimentos ou sumarização.

Entretanto, a visão computacional ajuda as máquinas a analisar e trabalhar com imagens e vídeos. Pode ser utilizada para tarefas como detetar objetos numa fotografia, reconhecimento facial, rastreamento de objetos ou classificação de imagens. A tecnologia de IA de visão permite que as máquinas compreendam e interajam melhor com o mundo visual.

Um exemplo de classificação de imagens

Fig. 1. Um exemplo de classificação de imagens.

Quando integrado com a visão computacional, o NLP pode atribuir significado aos dados visuais, combinando texto e imagens para permitir uma compreensão mais profunda. Como diz o provérbio, «uma imagem vale mais do que mil palavras» e, quando acompanhada de texto, torna-se ainda mais poderosa, proporcionando conhecimentos mais ricos.

Exemplos de NLP e visão computacional a trabalhar em conjunto#

Provavelmente já viste o NLP e a visão computacional a trabalharem em conjunto em ferramentas do dia a dia sem sequer notares, por exemplo quando o teu telemóvel traduz texto a partir de uma imagem.

Na verdade, o Google Translate utiliza tanto o processamento de linguagem natural como a visão computacional para traduzir texto de imagens. Quando tiras uma fotografia de um sinal de trânsito noutra língua, a visão computacional identifica e extrai o texto, enquanto o NLP o traduz para o teu idioma preferido.

O NLP e o CV trabalham em conjunto para tornar o processo simples e eficiente, permitindo que os utilizadores compreendam e interajam com informações entre idiomas em tempo real. Esta integração harmoniosa de tecnologias elimina barreiras de comunicação.

Funcionalidade do Google Translate a traduzir texto de uma imagem

Fig. 2. Funcionalidade Translate da Google.

Eis algumas outras aplicações em que o NLP e a visão computacional trabalham em conjunto:

  • Carros autónomos: o CV pode ser utilizado para detetar sinais de trânsito, faixas de rodagem e obstáculos, enquanto o NLP pode processar comandos de voz ou o texto presente nos sinais rodoviários.
  • Leitores de documentos: a IA de visão pode reconhecer texto de documentos digitalizados ou manuscritos, e o processamento de linguagem natural pode interpretar e resumir as informações.
  • Pesquisa visual em aplicações de compras: a visão computacional pode identificar produtos em fotografias, enquanto o NLP processa os termos de pesquisa para melhorar as recomendações.
  • Ferramentas educativas: o CV pode reconhecer notas manuscritas ou dados visuais, e o NLP pode fornecer explicações ou feedback com base no conteúdo.

Conceitos fundamentais que ligam a visão computacional e o NLP#

Agora que vimos como a visão computacional e o processamento de linguagem natural são utilizados, vamos explorar como se combinam para permitir a AI multimodal.

A AI multimodal combina a compreensão visual da visão computacional com a compreensão da linguagem pelo NLP para processar e ligar informações em texto e imagens. Por exemplo, na área da saúde, a AI multimodal pode ajudar a analisar um raio X e gerar um resumo escrito claro de possíveis problemas, ajudando os médicos a tomar decisões mais rápidas e precisas.

Compreensão da linguagem natural (NLU)#

A compreensão da linguagem natural é um subconjunto especializado do NLP que se centra na interpretação e extração de significado do texto através da análise da sua intenção, contexto, semântica, tom e estrutura. Enquanto o NLP processa texto bruto, a NLU permite que as máquinas compreendam a linguagem humana de forma mais eficaz. Por exemplo, a análise sintática é uma técnica de NLU que converte texto escrito num formato estruturado que as máquinas conseguem compreender.

Diagrama da relação entre NLP e NLU

Fig. 3. A relação entre NLP e NLU.

A NLU trabalha com a visão computacional quando os dados visuais contêm texto que precisa de ser compreendido. A visão computacional, utilizando tecnologias como o reconhecimento ótico de carateres (OCR), extrai texto de imagens, documentos ou vídeos. Isto pode incluir tarefas como digitalizar um recibo, ler texto num sinal ou digitalizar notas manuscritas.

A NLU processa então o texto extraído para compreender o seu significado, contexto e intenção. Esta combinação permite que os sistemas façam mais do que simplesmente reconhecer texto. Podem categorizar despesas a partir de recibos ou analisar o tom e os sentimentos. Em conjunto, a visão computacional e a NLU transformam texto visual em informações significativas e acionáveis.

Engenharia de prompts#

A engenharia de prompts é o processo de conceber prompts de entrada claros, precisos e detalhados para orientar sistemas de AI generativa, como modelos de linguagem de grande escala (LLMs) e modelos de visão-linguagem (VLMs), na produção dos resultados pretendidos. Estes prompts funcionam como instruções que ajudam o modelo de AI a compreender a intenção do utilizador.

Uma engenharia de prompts eficaz exige compreender as capacidades do modelo e criar entradas que maximizem a sua capacidade de gerar respostas precisas, criativas ou esclarecedoras. Isto é especialmente importante no caso de modelos de AI que trabalham tanto com texto como com imagens.

Tomemos como exemplo o modelo DALL·E da OpenAI. Se lhe pedires para criar «uma imagem fotorrealista de um astronauta a montar um cavalo», ele consegue gerar exatamente isso com base na tua descrição. Esta capacidade é extremamente útil em áreas como o design gráfico, onde os profissionais podem transformar rapidamente ideias textuais em maquetes visuais, poupando tempo e aumentando a produtividade.

Uma imagem criada com o DALL-E da OpenAI

Fig. 4. Uma imagem criada com o DALL-E da OpenAI.

Podes estar a perguntar-te como isto se relaciona com a visão computacional — não se trata apenas de AI generativa? Na verdade, as duas estão estreitamente relacionadas. A AI generativa baseia-se nos fundamentos da visão computacional para criar resultados visuais totalmente novos.

Os modelos de AI generativa que criam imagens a partir de prompts de texto são treinados com grandes conjuntos de dados de imagens emparelhadas com descrições textuais. Isto permite-lhes aprender as relações entre a linguagem e conceitos visuais como objetos, texturas e relações espaciais.

Estes modelos não interpretam os dados visuais da mesma forma que os sistemas tradicionais de visão computacional, como ao reconhecer objetos em imagens do mundo real. Em vez disso, utilizam a compreensão adquirida destes conceitos para gerar novos elementos visuais com base nos prompts. Ao combinar este conhecimento com prompts bem elaborados, a AI generativa pode produzir imagens realistas e detalhadas que correspondem à entrada do utilizador.

Resposta a perguntas (QA)#

Os sistemas de resposta a perguntas foram concebidos para compreender perguntas em linguagem natural e fornecer respostas precisas e relevantes. Utilizam técnicas como recuperação de informações, compreensão semântica e aprendizagem profunda para interpretar e responder a consultas.

Modelos avançados como o GPT-4o da OpenAI conseguem lidar com respostas a perguntas visuais (VQA), o que significa que podem analisar e responder a perguntas sobre imagens. No entanto, o GPT-4o não executa diretamente tarefas de visão computacional. Em vez disso, utiliza um codificador de imagens especializado para processar imagens, extrair caraterísticas e combiná-las com a sua compreensão da linguagem para fornecer respostas.

Capacidade do ChatGPT de responder a perguntas visuais

Fig. 5. Capacidade do ChatGPT de responder a perguntas visuais. Imagem do autor.

Outros sistemas podem ir mais longe, integrando totalmente capacidades de visão computacional. Estes sistemas podem analisar diretamente imagens ou vídeos para identificar objetos, cenas ou texto. Quando combinados com o processamento de linguagem natural, conseguem lidar com perguntas mais complexas sobre conteúdos visuais. Por exemplo, podem responder a «Que objetos estão nesta imagem?» ou «Quem aparece nesta gravação?» detetando e interpretando os elementos visuais.

Aprendizagem sem exemplos (ZSL)#

A aprendizagem sem exemplos (ZSL) é um método de aprendizagem automática que permite aos modelos de AI lidar com tarefas novas e desconhecidas sem terem sido especificamente treinados para tal. Isto é feito através da utilização de informações adicionais, como descrições ou relações semânticas, para ligar aquilo que o modelo já conhece (classes observadas) a categorias novas e desconhecidas.

No processamento de linguagem natural, o ZSL ajuda os modelos a compreender e trabalhar com temas nos quais não foram treinados, baseando-se nas relações entre palavras e conceitos. Do mesmo modo, na visão computacional, o ZSL permite aos modelos reconhecer objetos ou cenas que nunca encontraram antes, ligando caraterísticas visuais, como asas ou penas, a conceitos conhecidos, como aves.

O ZSL liga o NLP e o CV ao combinar a compreensão da linguagem com o reconhecimento visual, sendo especialmente útil para tarefas que envolvem ambos. Por exemplo, na resposta a perguntas visuais, um modelo pode analisar uma imagem enquanto compreende uma pergunta relacionada para fornecer uma resposta precisa. Também é útil para tarefas como a legendagem de imagens.

Principais conclusões#

A união do processamento de linguagem natural e da visão computacional deu origem a sistemas de AI capazes de compreender tanto texto como imagens. Esta combinação é utilizada em muitos setores, desde ajudar carros autónomos a ler sinais rodoviários até melhorar diagnósticos médicos e tornar as redes sociais mais seguras. À medida que estas tecnologias melhoram, continuarão a facilitar a vida e a abrir novas oportunidades numa grande variedade de áreas. Para saberes mais, visita o nosso repositório do GitHub e participa na nossa comunidade. Explora aplicações de AI em carros autónomos e agricultura nas nossas páginas de soluções. 🚀

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática