A visão computacional orienta a forma como os agentes de IA de visão tomam decisões
Aprende como os agentes de IA estão a utilizar a visão computacional para reinventar setores. Explora as suas aplicações em áreas como a segurança, os veículos autónomos e muito mais.

Todas as indústrias, desde a manufatura até ao retalho, enfrentam os seus próprios desafios de processos, e encontrar formas inovadoras de resolver estes problemas sempre foi essencial para gerir empresas de sucesso. Recentemente, os agentes de IA tornaram-se uma solução popular em muitos setores. Estes sistemas vão além da análise de dados. Também podem agir.
Por exemplo, os agentes de IA na manufatura podem detetar defeitos em tempo real e iniciar automaticamente medidas de controlo de qualidade para manter a produção a funcionar sem problemas. Da mesma forma, na logística e no retalho, podem monitorizar vários locais utilizando vigilância inteligente e alertar imediatamente as equipas para atividades invulgares.
À medida que esta tendência cresce, os agentes de IA estão a transformar ativamente as indústrias em todo o mundo. O mercado global de agentes de IA atingiu 5,1 mil milhões de dólares em 2024 e prevê-se que cresça para 47,1 mil milhões de dólares até 2030.

Fig. 1. Uma visão geral da dimensão do mercado global de agentes de IA.
Uma das principais tecnologias que impulsionam estes avanços é a visão computacional. Ao permitir que as máquinas processem e interpretem dados visuais, a IA visual torna possível que os agentes de IA executem tarefas de visão computacional, como deteção de objetos em tempo real, segmentação de instâncias e rastreamento de objetos, com uma precisão extraordinária. Faz a ponte entre aquilo que as máquinas veem e a forma como tomam decisões, sendo uma parte essencial de muitas soluções baseadas em IA.
Neste artigo, vamos explorar os agentes de IA e a sua relação com a visão computacional. Também vamos abordar os diferentes tipos de agentes de IA e a forma como são utilizados em aplicações baseadas em visão. Vamos começar!
O que são agentes de IA?#
Antes de nos aprofundarmos nos agentes de IA visual, vamos dedicar um momento a compreender os agentes de IA em geral, para perceber até que ponto estes sistemas podem ser versáteis.
Um agente de IA é um sistema inteligente que consegue compreender e responder a tarefas ou perguntas sem precisar da ajuda de uma pessoa. Muitos agentes de IA utilizam aprendizagem automática e processamento de linguagem natural (NLP) para executar uma grande variedade de tarefas, desde responder a perguntas básicas até gerir processos complexos.
Alguns agentes de IA conseguem até aprender e melhorar ao longo do tempo, ao contrário dos sistemas de IA tradicionais, que dependem da intervenção humana para cada atualização. É por isso que os agentes de IA estão rapidamente a tornar-se uma parte essencial da IA. Podem automatizar tarefas, tomar decisões e interagir com o ambiente sem precisarem de supervisão constante. São especialmente úteis para gerir tarefas repetitivas e demoradas.
Por exemplo, podemos encontrar agentes de IA em setores como o atendimento ao cliente e a hotelaria. No atendimento ao cliente, os agentes de IA são utilizados para processar reembolsos e oferecer recomendações personalizadas de produtos. Entretanto, na hotelaria, podem ajudar os funcionários dos hotéis a gerir pedidos dos hóspedes, otimizar o serviço de quartos e sugerir atrações próximas aos hóspedes. Estes exemplos mostram como os agentes de IA estão a tornar os processos quotidianos mais rápidos e eficientes.
Compreender como funcionam os agentes de IA visual#
Agora, vamos analisar rapidamente como funcionam os agentes de IA. Embora cada agente de IA seja único e concebido para tarefas específicas, todos partilham os mesmos três passos principais: perceção, tomada de decisões e ação.
Primeiro, na etapa de perceção, os agentes de IA recolhem informações de diferentes fontes para compreender o que está a acontecer. Segue-se a tomada de decisões. Com base nas informações recolhidas, utilizam os seus algoritmos para analisar a situação e decidir qual é a melhor ação. Por fim, temos a ação. Depois de tomarem uma decisão, executam-na — seja responder a uma pergunta, concluir uma tarefa ou sinalizar um problema para ser tratado por uma pessoa.
Pode parecer simples, mas, dependendo do tipo de agente de IA, muitas vezes há bastante atividade nos bastidores para que estes passos funcionem. Desde analisar dados complexos até utilizar modelos avançados de aprendizagem automática, cada agente de IA é desenvolvido para executar tarefas específicas à sua maneira.
Por exemplo, enquanto muitos agentes de IA se concentram no processamento de linguagem através de NLP, outros — conhecidos como agentes de IA visual — integram visão computacional para lidar com dados visuais. Utilizando modelos avançados de visão computacional, como o Ultralytics YOLO11, os agentes de IA visual podem realizar análises de imagens mais precisas.

Fig. 2. Um exemplo de contagem de maçãs numa imagem utilizando YOLO11.
Agentes de IA visual em carros autónomos#
Vamos utilizar os carros autónomos como exemplo para perceber como os agentes de IA visual funcionam através dos três passos principais descritos acima:
- Perceção: os agentes de IA visual em carros autónomos recolhem dados visuais de câmaras e sensores instalados no veículo. Estes dados incluem imagens e vídeos do ambiente circundante, como outros veículos, peões, semáforos e sinais de trânsito.
- Tomada de decisões: o agente de IA processa estes dados visuais utilizando modelos como Ultralytics YOLO11. Identifica objetos como carros e peões, deteta obstáculos ou mudanças súbitas de faixa e reconhece padrões, como o fluxo de trânsito e o estado dos semáforos. Isto ajuda o carro a compreender as condições da estrada em tempo real.
- Ação: com base na sua análise, o agente de IA age, por exemplo, virando o volante para evitar um obstáculo, ajustando a velocidade ou parando num semáforo vermelho. Estas decisões são tomadas rapidamente para garantir uma condução segura e eficiente.
Os carros autónomos da Waymo são um excelente exemplo desta tecnologia. Utilizam agentes de IA visual para compreender o ambiente circundante, tomar decisões em tempo real e navegar pelas estradas de forma segura e eficiente, sem intervenção humana.

Fig. 3. Táxi autónomo da Waymo baseado num agente de IA.
Tipos de agentes de IA visual#
Agora que vimos como funcionam os agentes de IA e como utilizam a visão computacional, vamos analisar os diferentes tipos de agentes de IA. Cada tipo é concebido para tarefas específicas, desde ações simples até à tomada de decisões e aprendizagem mais complexas.
Agentes de reflexo simples#
Os agentes de reflexo simples são o tipo mais básico de agente de IA. Respondem a entradas específicas com ações predefinidas, baseando-se exclusivamente na situação atual, sem considerar qualquer histórico ou resultados futuros. Estes agentes utilizam normalmente regras simples de "se-então" para orientar o seu comportamento.
No que diz respeito à análise de imagens, um agente de reflexo simples pode ser programado para detetar uma determinada cor, como o vermelho, e desencadear uma ação imediata, como destacar ou contar objetos vermelhos. Embora isto possa funcionar em tarefas diretas, o desempenho é insuficiente em ambientes mais complexos, uma vez que o agente não aprende nem se adapta com base em experiências anteriores.
Agentes de reflexo baseados em modelos#
Os agentes de reflexo baseados em modelos são mais avançados do que os agentes de reflexo simples, porque utilizam um modelo interno do ambiente para compreender melhor a situação. Este modelo permite-lhes lidar com informações ausentes ou incompletas e tomar decisões mais fundamentadas.
Consideremos, por exemplo, os sistemas de câmaras de segurança com IA. Os agentes de IA visual integrados nesses sistemas podem utilizar visão computacional para analisar o que está a acontecer em tempo real. Podem comparar movimentos e ações com um modelo de comportamento normal, ajudando a identificar atividades invulgares, como furtos em lojas, e a sinalizar potenciais ameaças à segurança com maior precisão.

Fig. 4. Um exemplo da utilização de visão computacional para detetar furtos.
Agentes baseados em utilidade#
Pense num drone baseado em utilidade utilizado para monitorizar culturas agrícolas. Ajusta a sua trajetória de voo para cobrir uma área maior, evitando obstáculos, e seleciona a melhor rota para a tarefa. Isto significa que o drone avalia várias ações possíveis, como a área a priorizar ou a forma mais eficiente de navegar, e escolhe a que maximiza a sua eficácia.
Da mesma forma, os agentes baseados em utilidade são concebidos para escolher a melhor ação entre várias opções, de modo a alcançar o maior benefício ou resultado possível. Os agentes de IA visual concebidos para este fim podem processar e analisar diferentes entradas visuais, como imagens ou dados de sensores, e selecionar o resultado mais útil com base em critérios predefinidos.

Fig. 5. Os drones baseados em utilidade podem ser utilizados para monitorizar culturas agrícolas.
Agentes baseados em objetivos#
Os agentes baseados em objetivos são semelhantes aos agentes baseados em utilidade, pois ambos procuram alcançar objetivos específicos. No entanto, os agentes baseados em objetivos concentram-se exclusivamente em ações que os aproximam do objetivo definido. Avaliam cada ação com base na forma como contribui para alcançar o objetivo, sem ponderar outros fatores, como o valor global ou os compromissos envolvidos.
Por exemplo, um carro autónomo funciona como um agente baseado em objetivos quando tem como objetivo chegar a um destino. Processa dados de câmaras com IA e sensores para tomar decisões, como evitar obstáculos, respeitar os sinais de trânsito e escolher as curvas certas para se manter no percurso. Estas decisões são orientadas exclusivamente pelo grau de alinhamento com o objetivo de chegar ao destino de forma segura e eficiente. Ao contrário dos agentes baseados em utilidade, os agentes baseados em objetivos concentram-se apenas na concretização do objetivo, sem considerar critérios adicionais, como eficiência ou otimização.

Fig. 6. Um carro autónomo que utiliza visão computacional para identificar objetos no ambiente circundante.
Agentes de aprendizagem#
Se estás familiarizado com visão computacional, talvez já tenhas ouvido falar de ajuste fino — um processo através do qual os modelos melhoram ao aprender com novos dados. Os agentes de aprendizagem funcionam de forma semelhante, adaptando-se e melhorando ao longo do tempo à medida que ganham experiência. Em aplicações como o controlo de qualidade baseado em visão, estes agentes tornam-se melhores a detetar defeitos a cada inspeção. Esta capacidade de aperfeiçoar o seu desempenho é particularmente importante em áreas como a aviação, onde a segurança e a precisão são essenciais.
Agentes hierárquicos#
Os agentes hierárquicos simplificam tarefas complexas, dividindo-as em etapas menores e mais fáceis de gerir. Um agente de nível superior supervisiona o processo global e toma decisões estratégicas, enquanto os agentes de nível inferior tratam de tarefas específicas. Esta abordagem é mais eficiente em operações que envolvem várias etapas e uma execução pormenorizada.
Por exemplo, num armazém automatizado, um robô de nível superior pode planear o processo de triagem, decidindo que artigos devem ser encaminhados para cada área. Ao mesmo tempo, os robôs de nível inferior concentram-se em identificar artigos utilizando visão computacional, analisar características como tamanho, forma ou etiquetas e organizá-los nos contentores corretos. Uma divisão clara das responsabilidades ajuda o sistema a funcionar sem problemas.

Fig. 7. Um exemplo de um agente de IA robótico a separar encomendas.
Como começar a criar um agente de IA visual#
O núcleo de um agente de IA com capacidades de visão é um modelo de visão computacional. Um dos modelos de visão computacional mais recentes e fiáveis disponíveis atualmente é o Ultralytics YOLO11. O YOLO11 é conhecido pela sua eficiência e precisão em tempo real, sendo ideal para tarefas de visão computacional.
Eis os diferentes processos envolvidos na criação do teu próprio agente de IA com as capacidades do Ultralytics YOLO11:
-
Preparar um conjunto de dados: recolhe e pré-processa imagens etiquetadas relevantes para a tarefa que o teu agente de IA irá executar.
-
Treinar de forma personalizada o modelo: treina o Ultralytics YOLO11 especificamente com o teu conjunto de dados para melhorar a sua precisão e desempenho na tua aplicação específica.
-
Integrar numa estrutura de tomada de decisões: liga o modelo treinado a um sistema que permita ao agente de IA tomar decisões com base em entradas visuais.
-
Testar e aperfeiçoar: implementa o agente de IA, testa o seu desempenho, recolhe feedback e ajusta o modelo para melhorar a precisão e a fiabilidade.
Principais conclusões#
Os agentes de IA integrados com visão computacional — os agentes de IA visual — estão a transformar as indústrias ao automatizar tarefas, tornar os processos mais rápidos e melhorar a tomada de decisões. Desde cidades inteligentes que controlam o trânsito até sistemas de segurança que utilizam reconhecimento facial, estes agentes estão a trazer novas soluções para problemas comuns.
Também podem continuar a aprender e a melhorar ao longo do tempo, o que os torna úteis em ambientes em mudança. Com ferramentas como o Ultralytics YOLO11, é mais fácil criar e utilizar estes agentes de IA, conduzindo a soluções mais inteligentes e eficientes.
Junta-te à nossa comunidade e consulta o nosso repositório no GitHub para aprenderes sobre IA. Explora várias aplicações da visão computacional na área da saúde e da IA na agricultura nas nossas páginas de soluções. Consulta as opções de licenciamento disponíveis para começar!









