Ultralytics YOLO27:
Guias

O que é a estimativa de profundidade monocular? Uma visão geral

Saiba como funciona a estimativa de profundidade monocular, como se compara com métodos de profundidade baseados em sensores e como permite uma perceção 3D escalável em sistemas de visão.

ABAbirami Vina20 min read
Um mapa de profundidade previsto criado através da estimativa de profundidade monocular

Os carros autónomos são concebidos para compreender o que acontece à sua volta, de modo a poderem conduzir com segurança. Isto significa ir além do simples reconhecimento de objetos, como peões ou outros veículos.

Também precisam de saber a que distância esses objetos estão para responder corretamente. No entanto, dar às máquinas esta noção de distância não é simples. Ao contrário dos humanos, elas não percecionam naturalmente a profundidade a partir de imagens e têm de ser ensinadas explicitamente a fazê-lo.

Uma das razões é que a maioria das câmaras capta o mundo como imagens planas e bidimensionais. Transformar essas imagens em algo que reflita a profundidade e a estrutura 3D do mundo real é complexo, especialmente quando os sistemas precisam de funcionar de forma fiável em condições quotidianas.

Curiosamente, a visão computacional, um ramo da IA que se concentra na interpretação e compreensão de dados visuais, permite que as máquinas compreendam melhor o mundo a partir de imagens. Por exemplo, a estimativa de profundidade monocular é uma técnica de visão computacional que estima a distância dos objetos utilizando apenas uma imagem captada por uma única câmara.

Ao aprender pistas visuais como o tamanho dos objetos, a perspetiva, a textura e o sombreamento, estes modelos conseguem prever a profundidade sem depender de sensores adicionais, como LiDAR (deteção e telemetria por luz) ou câmaras estéreo. Neste artigo, vamos explorar o que é a estimativa monocular de profundidade, como funciona e algumas das suas aplicações no mundo real. Vamos começar!

Uma breve introdução à estimativa monocular de profundidade#

A estimativa monocular de profundidade permite que uma máquina compreenda a que distância os objetos estão utilizando apenas uma imagem. Como depende de apenas uma câmara, esta abordagem tem várias vantagens, incluindo um custo mais baixo e requisitos de hardware mais simples.

Por exemplo, pode ser utilizada em robôs domésticos económicos que funcionam com uma única câmara. Mesmo a partir de uma única imagem, o sistema robótico consegue identificar quais as paredes que estão mais próximas e quais as portas que estão mais afastadas, além de inferir a profundidade geral do espaço.

Muitas vezes, uma única imagem não contém informação à escala correta, pelo que a estimativa monocular de profundidade se concentra geralmente na profundidade relativa. Por outras palavras, consegue determinar quais os objetos que estão mais próximos e quais estão mais afastados, mesmo quando as distâncias exatas não são conhecidas.

Quando um modelo é treinado com dados que contêm distâncias reais ou profundidade absoluta, como medições de profundidade obtidas por sensores como LiDAR, pode aprender a prever distâncias em unidades do mundo real, como metros. Sem este tipo de dados de referência, o modelo ainda consegue inferir a profundidade relativa, mas não pode estimar de forma fiável as distâncias absolutas.

O resultado da estimativa monocular de profundidade é normalmente um mapa de profundidade, ou seja, uma imagem em que cada píxel representa quão próxima ou distante está essa parte da cena. Um mapa de profundidade fornece aos sistemas de visão uma compreensão básica da estrutura 3D do ambiente.

Um exemplo de um mapa de profundidade previsto criado com estimativa monocular de profundidade

Fig. 1. Um exemplo de um mapa de profundidade previsto criado com estimativa monocular de profundidade (Fonte)

Dos sensores às imagens: estimar a profundidade#

A estimativa de profundidade pode ser abordada de várias formas, dependendo dos sensores disponíveis, das limitações de hardware e dos requisitos de precisão. Os métodos tradicionais dependem frequentemente de vários pontos de vista ou de sensores especializados para medir diretamente a distância.

Uma abordagem comum é a visão estéreo, que estima a profundidade comparando duas imagens sincronizadas captadas a partir de pontos de vista ligeiramente diferentes. Ao medir a diferença entre pontos correspondentes nas duas imagens, o sistema consegue inferir a que distância os objetos estão da câmara.

Outra abordagem consiste nos sistemas RGB-D (vermelho, verde, azul e profundidade), que utilizam sensores de profundidade ativos para medir diretamente a distância em cada píxel. Estes sistemas podem fornecer informações de profundidade precisas em ambientes controlados, mas requerem hardware adicional.

Entretanto, os métodos baseados em LiDAR utilizam impulsos laser para gerar representações tridimensionais precisas de uma cena. Embora sejam altamente precisos, os sensores LiDAR são frequentemente caros e acrescentam uma complexidade significativa ao hardware.

Em contrapartida, a estimativa monocular de profundidade infere a profundidade utilizando apenas uma imagem RGB. Como não depende de várias câmaras ou sensores especializados, é mais fácil de implementar em grande escala e é uma boa opção quando o custo e os recursos de hardware são limitados.

Aprender a profundidade a partir de uma única imagem#

Ao estimar a profundidade a partir de uma única imagem, os modelos monoculares de profundidade aprendem a reconhecer pistas visuais que os humanos utilizam instintivamente para avaliar a distância. Estas pistas incluem linhas de perspetiva, o tamanho dos objetos, a densidade da textura, a sobreposição de objetos e o sombreamento, que fornecem indicações sobre a distância dos objetos em relação à câmara.

Estas pistas funcionam em conjunto para criar uma noção de profundidade. Os objetos que parecem mais pequenos ou estão parcialmente ocluídos estão frequentemente mais afastados, enquanto detalhes mais nítidos e aparências visuais maiores costumam indicar que algo está mais próximo.

Para aprender estes padrões, os modelos monoculares de profundidade são treinados com grandes conjuntos de dados de imagens, frequentemente associados a informações de profundidade obtidas de outras fontes, como LiDAR ou sistemas estéreo. Durante o treino, os modelos aprendem a relação entre as pistas visuais e a profundidade, o que lhes permite inferir a distância a partir de uma única imagem no momento da inferência.

Com dados de treino diversificados, os modelos de visão modernos conseguem generalizar esta compreensão aprendida para uma grande variedade de ambientes, incluindo cenas interiores e exteriores, e lidar com pontos de vista desconhecidos.

Uma análise de várias técnicas de estimativa monocular de profundidade#

De seguida, vamos explorar as principais abordagens utilizadas para estimar a profundidade a partir de uma única imagem e a forma como estes métodos evoluíram ao longo do tempo.

Abordagens clássicas e baseadas em geometria#

Os primeiros métodos de estimativa de profundidade dependiam de regras visuais simples associadas à geometria da câmara. Pistas como a perspetiva, o tamanho dos objetos e o facto de um objeto bloquear outro eram utilizadas para estimar a distância.

Por exemplo, quando dois objetos semelhantes apareciam com tamanhos diferentes, assumia-se que o mais pequeno estava mais afastado. Estas abordagens funcionavam razoavelmente bem em ambientes controlados, onde fatores como a iluminação, a posição da câmara e a disposição da cena permaneciam consistentes.

No entanto, em cenas do mundo real, estas suposições falham frequentemente. Variações na iluminação, alterações do ponto de vista e uma maior complexidade da cena podem conduzir a estimativas de profundidade pouco fiáveis, limitando a eficácia dos métodos clássicos em ambientes não controlados.

Primeiras abordagens de aprendizagem automática#

Os primeiros métodos de aprendizagem automática trouxeram mais flexibilidade à estimativa de profundidade ao aprenderem padrões diretamente a partir dos dados. Em vez de dependerem apenas de regras geométricas fixas, estes modelos tentavam aprender a relação entre a informação visual e a distância, tratando a previsão de profundidade como um problema de regressão baseado em pistas como contornos, texturas e alterações de cor.

A seleção destas características era uma parte essencial do processo. Os engenheiros tinham de decidir quais os sinais visuais a extrair e como representá-los, e o desempenho do modelo dependia fortemente dessas escolhas.

Embora esta abordagem funcionasse melhor do que os métodos anteriores, continuava a ter limitações. Se as características selecionadas não contivessem contexto importante, as previsões de profundidade seriam menos precisas. À medida que as cenas se tornavam mais complexas e variadas, estes modelos tinham frequentemente dificuldades em produzir resultados fiáveis.

Algoritmos de aprendizagem profunda#

A maioria dos sistemas modernos de estimativa monocular de profundidade utiliza aprendizagem profunda, que consiste em redes neuronais com muitas camadas capazes de aprender padrões complexos a partir dos dados. Estes modelos aprendem a prever diretamente a profundidade a partir de imagens e produzem mapas de profundidade.

Muitas abordagens são desenvolvidas com redes neuronais convolucionais (CNNs), um tipo de rede neuronal concebido para processar imagens através da deteção de padrões como contornos e formas. Estes modelos utilizam frequentemente uma arquitetura de codificador–descodificador: o codificador extrai características visuais da imagem e o descodificador converte essas características num mapa de profundidade. Processar a imagem a várias escalas ajuda o modelo a captar a disposição geral da cena, mantendo simultaneamente limites claros dos objetos.

Os modelos mais recentes concentram-se na compreensão das relações entre diferentes partes de uma imagem. Os modelos baseados em Transformer e os modelos Vision Transformer (ViT) utilizam mecanismos de atenção, que permitem ao modelo identificar quais as regiões de uma imagem mais relevantes e relacionar áreas distantes entre si. Isto ajuda o modelo a construir uma compreensão mais consistente da profundidade em toda a cena.

Alguns sistemas combinam ambas as ideias. Os modelos híbridos CNN–Transformer utilizam CNNs para captar detalhes locais finos e Transformers para modelar o contexto global da cena. Embora isto melhore frequentemente a precisão, normalmente requer mais recursos computacionais, como memória e capacidade de processamento adicionais.

Porque é importante compreender a profundidade para os sistemas de IA de visão#

À medida que aprende sobre a estimativa monocular de profundidade, pode perguntar-se porque é que a compreensão da profundidade é uma parte tão importante dos sistemas de IA baseados em visão.

Quando um sistema consegue estimar a que distância estão os objetos e as superfícies, obtém uma melhor compreensão da disposição da cena e da forma como os diferentes elementos se relacionam. Este tipo de perceção espacial é essencial para tomar decisões fiáveis, especialmente em aplicações do mundo real, como a condução autónoma.

As informações de profundidade também acrescentam contexto valioso a outras tarefas de visão computacional. Por exemplo, a deteção de objetos, suportada por modelos como o Ultralytics YOLO26, pode dizer a um sistema o que está presente numa cena, mas a profundidade ajuda a responder onde esses objetos estão localizados em relação à câmara e entre si.

Em conjunto, estas capacidades permitem uma grande variedade de aplicações de IA de visão, como a criação de mapas 3D, a navegação em ambientes complexos e a compreensão de uma cena como um todo.

Os robôs e os veículos autónomos dependem destas informações para se deslocarem com segurança, evitarem obstáculos e reagirem a alterações em tempo real. Por exemplo, a abordagem de condução baseada apenas em visão da Tesla depende de imagens de câmaras combinadas com estimativa de profundidade, em vez de LiDAR, para compreender a que distância estão os objetos e como estão posicionados na estrada.

Como funcionam os modelos de estimativa monocular de profundidade#

Embora as arquiteturas dos modelos variem, a maioria dos modelos de estimativa monocular de profundidade segue um processo semelhante para converter uma única imagem num mapa de profundidade. Eis uma breve visão geral das principais etapas envolvidas:

  • Entrada e pré-processamento: O fluxo de trabalho começa com uma imagem de entrada. Antes de ser introduzida no modelo, a imagem original é normalmente redimensionada, normalizada e convertida num tensor, um formato que as redes neuronais utilizam para processar dados de imagem de forma eficiente.
  • Extração de características: Uma rede codificadora analisa a imagem para extrair características visuais relevantes. Estas características captam informações como texturas, limites dos objetos e a disposição geral da cena. A maioria dos modelos opera a várias escalas para compreender tanto os detalhes finos como a estrutura global.
  • Raciocínio sobre a profundidade: Utilizando as características extraídas, o modelo combina detalhes locais com o contexto global para raciocinar sobre as relações espaciais na cena. Nesta fase, aprende quais as regiões da imagem que estão mais próximas da câmara e quais estão mais afastadas.
  • Geração do mapa de profundidade: Em seguida, um descodificador converte estas informações num mapa de profundidade denso. A cada píxel da imagem é atribuído um valor de profundidade, frequentemente através da combinação de previsões de diferentes escalas para melhorar a precisão e a consistência.

Como são treinados os modelos de estimativa monocular de profundidade#

O processo que acabámos de discutir pressupõe que já temos um modelo treinado ou pré-treinado. Mas como funciona, na prática, o treino de um modelo de estimativa monocular de profundidade?

O treino começa com a preparação dos dados de imagem para que possam ser processados eficientemente pela rede. As imagens de entrada são redimensionadas e normalizadas para uma escala consistente e, em seguida, passam pelo modelo para gerar um mapa de profundidade previsto que estima a distância em cada píxel.

O mapa de profundidade previsto é então comparado com dados de profundidade de referência utilizando uma função de perda, que mede o quanto a previsão do modelo se afasta da profundidade real. Este valor de perda representa o erro atual do modelo e fornece um sinal para melhoria.

Um otimizador utiliza este sinal para atualizar o modelo, ajustando os seus pesos internos. Para isso, o otimizador calcula o gradiente, que descreve como a perda varia em relação a cada parâmetro do modelo, e aplica estas atualizações repetidamente ao longo de várias épocas, ou passagens completas pelo conjunto de dados de treino.

Este processo iterativo de treino supervisionado é orientado por hiperparâmetros como a taxa de aprendizagem, que controla o tamanho de cada passo de atualização, e o tamanho do lote, que determina quantas imagens são processadas de cada vez. Como o treino envolve um grande número de operações matemáticas, é normalmente acelerado utilizando uma unidade de processamento gráfico (GPU), adequada para computação paralela.

Quando o treino termina, o modelo é avaliado utilizando métricas de avaliação padrão num conjunto de validação, constituído por imagens que não foram utilizadas durante o treino. Esta avaliação ajuda a medir até que ponto o modelo generaliza para novos dados.

O modelo treinado pode então ser reutilizado ou ajustado para novos cenários. De forma geral, este processo de treino permite que os modelos de estimativa monocular de profundidade produzam estimativas de profundidade consistentes, essenciais para tarefas posteriores como a reconstrução 3D e a implementação no mundo real.

Explorar modelos de última geração e tendências de investigação#

A estimativa monocular de profundidade melhorou rapidamente à medida que os modelos se tornaram mais capazes de compreender cenas inteiras, em vez de apenas pequenos detalhes visuais. As abordagens anteriores produziam frequentemente mapas de profundidade irregulares, sobretudo em ambientes complexos.

Os modelos mais recentes, como se observa em investigações recentes publicadas no arXiv, dão maior ênfase ao contexto global, o que conduz a previsões de profundidade mais estáveis e realistas. Modelos conhecidos como MiDaS e DPT ajudaram a impulsionar esta mudança ao aprenderem a profundidade a partir de conjuntos de dados diversificados e de alta resolução, generalizando bem para muitas cenas.

Os modelos mais recentes, incluindo ZoeDepth e Depth Anything V2, desenvolvem este trabalho ao melhorar a consistência da escala, mantendo um desempenho sólido numa grande variedade de ambientes. Este tipo de progresso é frequentemente medido utilizando conjuntos de dados de referência comuns, como o KITTI e o NYU, que abrangem cenas exteriores e interiores.

Outra tendência clara é equilibrar a precisão com a praticidade. Os modelos mais pequenos são otimizados para a velocidade e podem funcionar em tempo real em dispositivos edge ou móveis, enquanto os modelos maiores privilegiam uma resolução superior e a precisão da profundidade a longa distância.

Aplicações da estimativa monocular de profundidade#

De seguida, vamos analisar alguns exemplos do mundo real que mostram como a estimativa monocular de profundidade é utilizada para compreender a estrutura 3D de uma cena a partir de uma única imagem.

Em todos estes casos, é importante ter em mente que as informações de profundidade são uma estimativa inferida a partir de pistas visuais, e não uma medição precisa. Isto torna a estimativa monocular de profundidade útil para compreender a disposição relativa e as relações espaciais, mas não um substituto para sensores concebidos para medir a distância com precisão, como LiDAR ou sistemas estéreo.

Mapeamento e navegação de terrenos com drones#

Os drones operam frequentemente em ambientes onde os sinais de GPS não são fiáveis, como florestas, estaleiros de construção, zonas afetadas por catástrofes ou áreas urbanas densas. Para voarem com segurança nestas condições, precisam de compreender o terreno circundante e saber a que distância estão os obstáculos. No passado, isto exigia normalmente a adição de sensores como LiDAR ou câmaras estéreo, que aumentam o peso, o consumo de energia e o custo total.

A estimativa monocular de profundidade é uma alternativa mais simples. Utilizando apenas uma câmara RGB, os drones podem estimar a profundidade a partir de imagens e construir uma compreensão 3D básica do seu ambiente. Isto permite-lhes detetar obstáculos como edifícios, árvores ou alterações súbitas do terreno e ajustar a sua trajetória de voo em tempo real.

Estas estimativas de profundidade suportam tarefas essenciais de navegação, incluindo a deteção de obstáculos, o controlo da altitude e a aterragem segura. Como resultado, os drones leves podem realizar tarefas de mapeamento, inspeção e navegação sem depender de sensores de profundidade especializados.

Estimativa monocular de profundidade utilizada para analisar imagens captadas por drones

Fig. 2. A estimativa monocular de profundidade pode ser utilizada para analisar imagens captadas por drones (Fonte)

Preencher pontos cegos em veículos de competição autónomos#

Os veículos autónomos dependem normalmente bastante de sensores LiDAR, que utilizam impulsos laser para medir a distância e construir uma representação 3D da estrada. Embora seja altamente preciso, o LiDAR pode ter dificuldades com lombas acentuadas, declives íngremes, oclusões ou inclinações súbitas do veículo, devolvendo por vezes dados de profundidade esparsos ou inexistentes.

A estimativa monocular de profundidade pode ajudar a preencher estas lacunas ao fornecer informações de profundidade densas a partir de uma única imagem RGB, mesmo quando os dados LiDAR estão incompletos. Considere um cenário em que um carro autónomo se aproxima rapidamente do topo de uma subida. Os feixes LiDAR podem ultrapassar a estrada para além do topo, deixando incerteza sobre o que se encontra à frente.

No entanto, a estimativa de profundidade baseada em câmaras ainda consegue inferir a forma da estrada a partir de pistas visuais como a perspetiva e a textura, ajudando o veículo a manter uma perceção fiável até os dados LiDAR estabilizarem. Em conjunto, o LiDAR e a estimativa monocular de profundidade permitem uma perceção mais estável e um controlo mais seguro em condições de condução difíceis.

Uma visualização da utilização da estimativa monocular de profundidade em competições autónomas

Fig. 3. Uma visualização da utilização da estimativa monocular de profundidade em competições autónomas (Fonte)

Os robôs são frequentemente utilizados em locais onde não existem mapas detalhados e as condições mudam constantemente. Para se deslocarem com segurança, precisam de uma noção fiável do espaço disponível à sua volta e da localização dos obstáculos.

A estimativa monocular de profundidade pode fornecer esta perceção espacial utilizando uma única câmara RGB, sem depender de hardware pesado ou caro. Ao aprender pistas visuais como a escala e a perspetiva, os modelos de estimativa de profundidade conseguem gerar mapas de profundidade densos do ambiente circundante. Isto proporciona aos robôs uma visão clara da distância até às superfícies e aos objetos.

Em particular, quando as informações de profundidade são combinadas com tarefas de visão computacional, como a deteção de objetos e a segmentação semântica, os robôs conseguem obter uma visão mais completa do ambiente. Podem identificar objetos, compreender a sua distância e decidir por onde é seguro deslocarem-se. Isto suporta a prevenção de obstáculos, a deteção de espaço livre e o planeamento de trajetórias em tempo real.

Deteção de objetos utilizando estimativa monocular de profundidade e deteção de objetos

Fig. 4. Deteção de objetos utilizando estimativa monocular de profundidade e deteção de objetos (Fonte)

Vantagens e desvantagens da estimativa monocular de profundidade#

Eis algumas das principais vantagens da utilização da estimativa monocular de profundidade:

  • Leve e eficiente em termos energéticos: A utilização de uma única câmara reduz o peso do sistema e o consumo de energia, o que é especialmente importante para robôs móveis, drones e sistemas incorporados.
  • Compatível com fusão de sensores: A profundidade monocular pode complementar outros sensores, como LiDAR ou radar, preenchendo lacunas ou fornecendo redundância.
  • Funciona em muitos ambientes: A mesma abordagem baseada em câmara pode ser utilizada em interiores, exteriores e em diferentes plataformas sem exigir alterações de hardware.

Embora a estimativa monocular de profundidade ofereça benefícios claros, há algumas limitações a considerar:

  • Menor precisão do que os sensores ativos: Embora esteja a melhorar rapidamente, a estimativa monocular de profundidade geralmente não consegue igualar a precisão absoluta do LiDAR ou dos sensores de luz estruturada em condições controladas.
  • Sensibilidade às condições de iluminação: O desempenho pode degradar-se em ambientes com pouca luz, sombras fortes, brilho intenso ou cenas com textura insuficiente.
  • Desafios de generalização: Um modelo treinado num ambiente pode não ser transferido de forma fiável para domínios desconhecidos sem adaptação ou ajuste fino.

Quando não depender da estimativa monocular de profundidade#

Embora a estimativa monocular de profundidade seja uma área de investigação interessante, é importante compreender onde pode ser utilizada na prática e onde não pode. As distâncias que produz são estimativas baseadas no que o modelo vê numa imagem, e não medições exatas obtidas do mundo real.

Por isso, a qualidade dos resultados pode variar consoante fatores como a iluminação, a complexidade da cena e o grau de semelhança entre a cena e os dados utilizados para treinar o modelo. A estimativa monocular de profundidade é geralmente eficaz para indicar o que está mais próximo e o que está mais afastado, mas não é fiável quando são necessárias distâncias exatas.

Em situações em que a precisão é realmente importante, como sistemas críticos para a segurança, inspeção industrial ou robôs que precisam de interagir com objetos com elevada precisão, a profundidade tem de ser medida diretamente. Sensores como LiDAR, radar, câmaras estéreo ou sistemas de luz estruturada foram concebidos para isso e fornecem informações de distância muito mais fiáveis.

A estimativa monocular de profundidade também pode ter dificuldades em condições visualmente complexas. Iluminação deficiente, sombras fortes, superfícies refletoras ou transparentes, nevoeiro, fumo ou cenas com muito pouca textura visual podem tornar as estimativas de profundidade menos fiáveis. A estimativa de profundidade a longas distâncias é outro caso em que os sensores dedicados costumam funcionar melhor.

Quando se trata de soluções para o mundo real, a estimativa de profundidade monocular funciona melhor como ferramenta de apoio do que como solução autónoma. Pode adicionar contexto espacial útil, ajudar a colmatar lacunas quando outros sensores são limitados e melhorar a compreensão geral da cena. No entanto, não deve ser a única fonte de informação de profundidade quando a precisão, a segurança ou requisitos rigorosos de fiabilidade são importantes.

Principais conclusões#

A estimativa de profundidade monocular é uma técnica de visão computacional que permite às máquinas estimar a que distância estão os objetos utilizando apenas uma imagem de uma única câmara. Ao aprender pistas visuais como a perspetiva, o tamanho dos objetos, a textura e o sombreamento, estes modelos de IA conseguem inferir a estrutura 3D de uma cena sem depender de sensores como LiDAR ou câmaras estéreo. Isto torna a estimativa de profundidade monocular numa abordagem económica e escalável para aplicações como condução autónoma, robótica e compreensão de cenas 3D.

Para explorares mais sobre IA de visão, visita o nosso repositório no GitHub e junta-te à nossa comunidade. Consulta as nossas páginas de soluções para saberes mais sobre IA na robótica e visão computacional na indústria. Descobre as nossas opções de licenciamento para começares hoje a trabalhar com visão computacional!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática