Ultralytics YOLO27:
IA para visão

Uma história dos modelos de visão

Explora a história, as conquistas, os desafios e as direções futuras dos modelos de visão.

MOMostafa Ibrahim9 min read
Uma história dos modelos de visão

O que é visão computacional#

Imagina entrares numa loja onde uma câmara identifica o teu rosto, analisa o teu estado de espírito e sugere produtos adaptados às tuas preferências — tudo em tempo real. Isto não é ficção científica, mas sim uma realidade possibilitada pelos modelos de visão modernos. De acordo com um relatório da Fortune Business Insight, o tamanho do mercado global de visão computacional foi avaliado em 20,31 mil milhões de USD em 2023 e prevê-se que cresça de 25,41 mil milhões de USD em 2024 para 175,72 mil milhões de USD até 2032, refletindo os rápidos avanços e a crescente adoção desta tecnologia em vários setores.

O campo da visão computacional permite aos computadores detetar, identificar e analisar objetos em imagens. Tal como acontece noutras áreas da IA, a visão computacional evoluiu rapidamente nas últimas décadas, alcançando avanços notáveis.

A história da visão computacional é extensa. Nos seus primeiros anos, os modelos de visão computacional eram capazes de detetar formas e contornos simples, estando muitas vezes limitados a tarefas básicas, como reconhecer padrões geométricos ou distinguir entre áreas claras e escuras. No entanto, os modelos atuais conseguem realizar tarefas complexas, como a deteção de objetos em tempo real, o reconhecimento facial e até a interpretação de emoções a partir de expressões faciais, com uma precisão e eficiência excecionais. Esta progressão dramática destaca os avanços extraordinários no poder computacional, na sofisticação algorítmica e na disponibilidade de enormes quantidades de dados para treino.

Neste artigo, vamos explorar os principais marcos da evolução da visão computacional. Vamos percorrer os seus primórdios, analisar o impacto transformador das Redes Neuronais Convolucionais (CNNs) e examinar os avanços significativos que se seguiram.

Os primórdios da visão computacional#

Tal como noutras áreas da IA, o desenvolvimento inicial da visão computacional começou com investigação fundamental e trabalho teórico. Um marco importante foi o trabalho pioneiro de Lawrence G. Roberts no reconhecimento de objetos 3D, documentado na sua tese "Machine Perception of Three-Dimensional Solids" no início da década de 1960. As suas contribuições lançaram as bases para futuros avanços no campo.

Os primeiros algoritmos — deteção de contornos#

A investigação inicial em visão computacional centrou-se em técnicas de processamento de imagem, como a deteção de contornos e a extração de características. Algoritmos como o operador de Sobel, desenvolvido no final da década de 1960, estiveram entre os primeiros a detetar contornos através do cálculo do gradiente da intensidade da imagem.

Uma imagem que demonstra a deteção de contornos

Fig. 1. Uma imagem que demonstra a deteção de contornos, em que o lado esquerdo mostra o objeto original e o lado direito apresenta a versão com os contornos detetados.

Técnicas como os detetores de contornos de Sobel e Canny desempenharam um papel crucial na identificação de limites em imagens, essenciais para reconhecer objetos e compreender cenas.

Aprendizagem automática e visão computacional#

Reconhecimento de padrões#

Na década de 1970, o reconhecimento de padrões surgiu como uma área fundamental da visão computacional. Os investigadores desenvolveram métodos para reconhecer formas, texturas e objetos em imagens, abrindo caminho para tarefas de visão mais complexas.

Reconhecimento de padrões

Fig. 2. Reconhecimento de padrões.

Um dos primeiros métodos de reconhecimento de padrões envolvia a correspondência de modelos, em que uma imagem é comparada com um conjunto de modelos para encontrar a melhor correspondência. Esta abordagem era limitada pela sua sensibilidade a variações de escala, rotação e ruído.

Correspondência de modelos numa imagem

Fig. 3. Um modelo no lado esquerdo encontrado na imagem do lado direito.

Os primeiros sistemas de visão computacional estavam limitados pelo reduzido poder computacional da época. Os computadores das décadas de 1960 e 1970 eram volumosos, dispendiosos e tinham capacidades de processamento limitadas.

A revolução da aprendizagem profunda#

Aprendizagem profunda e Redes Neuronais Convolucionais#

A aprendizagem profunda e as Redes Neuronais Convolucionais (CNNs) marcaram um momento decisivo no campo da visão computacional. Estes avanços transformaram radicalmente a forma como os computadores interpretam e analisam dados visuais, permitindo uma vasta gama de aplicações que antes eram consideradas impossíveis.

Como funcionam as CNNs?#

Arquitetura de uma Rede Neuronal Convolucional (CNN)

Fig. 4. Arquitetura de uma Rede Neuronal Convolucional (CNN).

  1. Camadas convolucionais: as CNNs utilizam camadas convolucionais, que são um tipo de modelo de aprendizagem profunda concebido para processar dados estruturados em grelha, como imagens ou sequências, aprendendo automaticamente padrões hierárquicos, para percorrer uma imagem com filtros ou kernels. Estes filtros detetam várias características, como contornos, texturas e cores, ao deslizarem pela imagem e calcularem produtos escalares. Cada filtro é ativado por padrões específicos na imagem, permitindo ao modelo aprender características hierárquicas.
  2. Funções de ativação: após a convolução, funções de ativação como a ReLU (Unidade Linear Retificada), uma função de ativação popular na aprendizagem profunda que produz diretamente a entrada se esta for positiva e zero caso contrário, ajudam as redes neuronais a aprender eficazmente relações não lineares nos dados. Isto ajuda a rede a aprender padrões e representações complexos.
  3. Camadas de pooling: as camadas de pooling fornecem uma operação de subamostragem que reduz a dimensionalidade do mapa de características, ajudando a extrair as características mais relevantes e a reduzir o custo computacional e o sobreajuste.
  4. Camadas totalmente ligadas: as camadas finais de uma CNN são camadas totalmente ligadas que interpretam as características extraídas pelas camadas convolucionais e de pooling para fazer previsões. Estas camadas são semelhantes às das redes neuronais tradicionais.

Evolução dos modelos de visão CNN#

A evolução dos modelos de visão foi extensa e inclui alguns dos mais notáveis:

  • LeNet (1989): a LeNet foi uma das primeiras arquiteturas CNN, utilizada principalmente para o reconhecimento de algarismos em cheques manuscritos. O seu sucesso lançou as bases para CNNs mais complexas, demonstrando o potencial da aprendizagem profunda no processamento de imagens.

  • AlexNet (2012): a AlexNet superou significativamente os modelos existentes na competição ImageNet, demonstrando o poder da aprendizagem profunda. Este modelo utilizou ativações ReLU, dropout e aumento de dados, estabelecendo novos padrões na classificação de imagens e despertando um interesse generalizado pelas CNNs.

  • VGGNet (2014): através da utilização de filtros convolucionais mais pequenos (3x3), a VGGNet alcançou resultados impressionantes em tarefas de classificação de imagens, reforçando a importância da profundidade da rede para obter maior precisão.

  • ResNet (2015): a ResNet resolveu o problema de degradação nas redes profundas ao introduzir a aprendizagem residual. Esta inovação permitiu treinar redes muito mais profundas, alcançando um desempenho de vanguarda em várias tarefas de visão computacional.

  • YOLO (Só Olhas Uma Vez): a YOLO revolucionou a deteção de objetos ao formulá-la como um único problema de regressão, prevendo diretamente caixas delimitadoras e probabilidades de classe a partir de imagens completas numa única avaliação. Esta abordagem permitiu a deteção de objetos em tempo real com uma velocidade e precisão sem precedentes, tornando-a adequada para aplicações que exigem processamento instantâneo, como a condução autónoma e a vigilância.

Aplicações da visão computacional#

Saúde#

As utilizações da visão computacional são numerosas. Por exemplo, modelos de visão como o Ultralytics YOLOv8 são utilizados em imagiologia médica para detetar doenças como o cancro e a retinopatia diabética. Analisam radiografias, ressonâncias magnéticas e tomografias computorizadas com elevada precisão, identificando anomalias numa fase inicial. Esta capacidade de deteção precoce permite intervenções atempadas e melhores resultados para os doentes.

Deteção de tumores cerebrais utilizando o Ultralytics YOLOv8

Fig. 5. Deteção de tumores cerebrais utilizando o Ultralytics YOLOv8.

Preservação ambiental#

Os modelos de visão computacional ajudam a monitorizar e proteger espécies ameaçadas através da análise de imagens e vídeos de habitats selvagens. Identificam e acompanham o comportamento dos animais, fornecendo dados sobre a sua população e os seus movimentos. Esta tecnologia orienta estratégias de conservação e decisões políticas para proteger espécies como tigres e elefantes.

Com a ajuda da IA de visão, outras ameaças ambientais, como incêndios florestais e a desflorestação, podem ser monitorizadas, garantindo tempos de resposta rápidos por parte das autoridades locais.

Uma imagem de satélite de um incêndio florestal

Fig. 6. Uma imagem de satélite de um incêndio florestal.

Desafios e direções futuras#

Embora já tenham alcançado resultados significativos, devido à sua extrema complexidade e à natureza exigente do seu desenvolvimento, os modelos de visão enfrentam inúmeros desafios que exigem investigação contínua e avanços futuros.

Interpretabilidade e explicabilidade#

Os modelos de visão, especialmente os de aprendizagem profunda, são frequentemente vistos como "caixas negras", com transparência limitada. Isto deve-se ao facto de estes modelos serem extremamente complexos. A falta de interpretabilidade dificulta a confiança e a responsabilização, especialmente em aplicações críticas, como, por exemplo, os cuidados de saúde.

Requisitos computacionais#

Treinar e implementar modelos de IA de vanguarda exige recursos computacionais significativos. Isto é particularmente verdade no caso dos modelos de visão, que muitas vezes necessitam de processar grandes quantidades de dados de imagem e vídeo. As imagens e os vídeos de alta definição, estando entre os dados de entrada de treino mais exigentes, aumentam a carga computacional. Por exemplo, uma única imagem HD pode ocupar vários megabytes de armazenamento, tornando o processo de treino intensivo em recursos e demorado.

Isto exige hardware potente e algoritmos de visão computacional otimizados para processar os vastos volumes de dados e os cálculos complexos envolvidos no desenvolvimento de modelos de visão eficazes. A investigação de arquiteturas mais eficientes, compressão de modelos e aceleradores de hardware, como GPUs e TPUs, são áreas fundamentais para fazer avançar o futuro dos modelos de visão.

Estas melhorias visam reduzir as exigências computacionais e aumentar a eficiência do processamento. Além disso, tirar partido de modelos pré-treinados avançados, como o Ultralytics YOLOv8, pode reduzir significativamente a necessidade de treino extensivo, simplificando o processo de desenvolvimento e melhorando a eficiência.

Um cenário em constante evolução#

Atualmente, as aplicações dos modelos de visão são generalizadas, abrangendo desde os cuidados de saúde, como a deteção de tumores, até utilizações quotidianas, como a monitorização do trânsito. Estes modelos avançados trouxeram inovação a inúmeros setores ao proporcionarem maior precisão, eficiência e capacidades que antes eram inimagináveis.

À medida que a tecnologia continua a avançar, o potencial dos modelos de visão para inovar e melhorar vários aspetos da vida e da indústria continua ilimitado. Esta evolução contínua reforça a importância da investigação e do desenvolvimento contínuos no campo da visão computacional.

Curioso sobre o futuro da IA de visão? Para obteres mais informações sobre os avanços mais recentes, consulta a documentação da Ultralytics e explora os seus projetos no GitHub da Ultralytics e no GitHub da YOLOv8. Além disso, para obteres informações sobre aplicações de IA em vários setores, as páginas de soluções sobre carros autónomos e fabrico oferecem informações particularmente úteis.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática