A evolução da deteção de objetos e dos modelos YOLO da Ultralytics
Junta-te a nós para recuarmos na evolução da deteção de objetos. Vamos concentrar-nos em como os modelos YOLO (You Only Look Once) evoluíram nos últimos anos.

A visão computacional é um subcampo da inteligência artificial (AI) que se concentra em ensinar as máquinas a ver e compreender imagens e vídeos, de forma semelhante à maneira como os seres humanos percecionam o mundo real. Embora reconhecer objetos ou identificar ações seja algo natural para os seres humanos, estas tarefas exigem técnicas específicas e especializadas de visão computacional quando se trata de máquinas. Por exemplo, uma tarefa fundamental da visão computacional é a deteção de objetos, que envolve identificar e localizar objetos em imagens ou vídeos.
Desde a década de 1960, os investigadores têm trabalhado para melhorar a forma como os computadores podem detetar objetos. Os primeiros métodos, como a correspondência de modelos, envolviam deslizar um modelo predefinido sobre uma imagem para encontrar correspondências. Embora inovadoras, estas abordagens tinham dificuldades com alterações no tamanho e na orientação dos objetos, bem como nas condições de iluminação. Atualmente, temos modelos avançados, como o Ultralytics YOLO11, que conseguem detetar até objetos pequenos e parcialmente ocultos, conhecidos como objetos ocludidos, com uma precisão impressionante.
À medida que a visão computacional continua a evoluir, é importante recordar como estas tecnologias se desenvolveram. Neste artigo, vamos explorar a evolução da deteção de objetos e destacar a transformação dos modelos YOLO (Só Olhas Uma Vez). Vamos começar!
As origens da visão computacional#
Antes de abordar a deteção de objetos, vejamos como a visão computacional começou. As origens da visão computacional remontam ao final da década de 1950 e ao início da década de 1960, quando os cientistas começaram a explorar a forma como o cérebro processa informação visual. Em experiências com gatos, os investigadores David Hubel e Torsten Wiesel descobriram que o cérebro reage a padrões simples, como contornos e linhas. Isto lançou as bases da ideia por detrás da extração de características — o conceito de que os sistemas visuais detetam e reconhecem características básicas nas imagens, como contornos, antes de avançarem para padrões mais complexos.

Fig. 1. Aprender como o cérebro de um gato reage a barras luminosas ajudou a desenvolver a extração de características na visão computacional.
Por volta da mesma altura, surgiu uma nova tecnologia capaz de transformar imagens físicas em formatos digitais, despertando o interesse pela forma como as máquinas poderiam processar informação visual. Em 1966, o Projeto de Visão de Verão do Instituto de Tecnologia de Massachusetts (MIT) levou este trabalho mais longe. Embora o projeto não tenha sido totalmente bem-sucedido, tinha como objetivo criar um sistema capaz de separar o primeiro plano do fundo em imagens. Para muitos membros da comunidade de IA de visão, este projeto assinala o início oficial da visão computacional como área científica.
Compreender a história da deteção de objetos#
À medida que a visão computacional avançou no final da década de 1990 e no início dos anos 2000, os métodos de deteção de objetos passaram de técnicas básicas, como a correspondência de modelos, para abordagens mais avançadas. Um método popular foi o Haar Cascade, que passou a ser amplamente utilizado em tarefas como a deteção de rostos. Funcionava através da análise de imagens com uma janela deslizante, procurando características específicas, como contornos ou texturas, em cada secção da imagem e, em seguida, combinando essas características para detetar objetos como rostos. O Haar Cascade era muito mais rápido do que os métodos anteriores.

Fig. 2. Utilização do Haar Cascade para deteção de rostos.
Além destes, também foram introduzidos métodos como o Histograma de Gradientes Orientados (HOG) e as Máquinas de Vetores de Suporte (SVMs). O HOG utilizava a técnica da janela deslizante para analisar como a luz e as sombras variavam em pequenas secções de uma imagem, ajudando a identificar objetos com base nas suas formas. De seguida, as SVMs classificavam estas características para determinar a identidade do objeto. Estes métodos melhoraram a precisão, mas continuavam a ter dificuldades em ambientes reais e eram mais lentos em comparação com as técnicas atuais.
A necessidade de deteção de objetos em tempo real#
Na década de 2010, o crescimento da aprendizagem profunda e das Redes Neuronais Convolucionais (CNNs) provocou uma grande mudança na deteção de objetos. As CNNs permitiram que os computadores aprendessem automaticamente características importantes a partir de grandes quantidades de dados, tornando a deteção muito mais precisa.
Os primeiros modelos, como as Redes Neuronais Convolucionais baseadas em regiões (R-CNN), representaram uma grande melhoria na precisão, ajudando a identificar objetos com maior precisão do que os métodos anteriores.
No entanto, estes modelos eram lentos porque processavam as imagens em várias etapas, o que os tornava impraticáveis para aplicações em tempo real, como carros autónomos ou videovigilância.
Com o objetivo de acelerar o processo, foram desenvolvidos modelos mais eficientes. Modelos como o Fast R-CNN e o Faster R-CNN ajudaram ao aperfeiçoar a forma como as regiões de interesse eram selecionadas e ao reduzir o número de etapas necessárias para a deteção. Embora isto tenha tornado a deteção de objetos mais rápida, continuava a não ser suficientemente rápida para muitas aplicações do mundo real que precisavam de resultados instantâneos. A crescente procura por deteção em tempo real impulsionou o desenvolvimento de soluções ainda mais rápidas e eficientes, capazes de equilibrar velocidade e precisão.

Fig. 3. Comparação das velocidades do R-CNN, Fast R-CNN e Faster R-CNN.
Modelos YOLO (Só Olhas Uma Vez): um marco importante#
O YOLO é um modelo de deteção de objetos que redefiniu a visão computacional ao permitir a deteção em tempo real de múltiplos objetos em imagens e vídeos, tornando-se bastante diferente dos métodos de deteção anteriores. Em vez de analisar cada objeto detetado individualmente, a arquitetura do YOLO trata a deteção de objetos como uma única tarefa, prevendo simultaneamente a localização e a classe dos objetos através de CNNs.
O modelo funciona dividindo uma imagem numa grelha, ficando cada parte responsável por detetar objetos na respetiva área. Faz várias previsões para cada secção e filtra os resultados menos confiantes, mantendo apenas os mais precisos.

Fig. 4. Uma visão geral do funcionamento do YOLO.
A introdução do YOLO nas aplicações de visão computacional tornou a deteção de objetos muito mais rápida e eficiente do que nos modelos anteriores. Graças à sua velocidade e precisão, o YOLO tornou-se rapidamente uma escolha popular para soluções em tempo real em setores como a indústria transformadora, a saúde e a robótica.
Outro ponto importante é que, por ser de código aberto, o YOLO permitiu que programadores e investigadores o melhorassem continuamente, dando origem a versões ainda mais avançadas.
O caminho do YOLO ao Ultralytics YOLO11#
Os modelos YOLO têm melhorado continuamente ao longo do tempo, baseando-se nos avanços de cada versão. Para além de um melhor desempenho, estas melhorias tornaram os modelos mais fáceis de utilizar por pessoas com diferentes níveis de experiência técnica.
Por exemplo, quando o Ultralytics YOLOv5 foi lançado, a implementação de modelos tornou-se mais simples com o PyTorch, permitindo que um leque mais vasto de utilizadores trabalhasse com IA avançada. Reuniu precisão e facilidade de utilização, dando a mais pessoas a capacidade de implementar a deteção de objetos sem precisarem de ser especialistas em programação.

Fig. 5. A evolução dos modelos YOLO.
O Ultralytics YOLOv8 deu continuidade a este progresso ao adicionar suporte para tarefas como a segmentação de instâncias e ao tornar os modelos mais flexíveis. Tornou-se mais fácil utilizar o YOLO tanto em aplicações básicas como em aplicações mais complexas, tornando-o útil numa grande variedade de cenários.
Com o modelo mais recente, o Ultralytics YOLO11, foram efetuadas otimizações adicionais. Ao reduzir o número de parâmetros e melhorar simultaneamente a precisão, tornou-se mais eficiente para tarefas em tempo real. Quer sejas um programador experiente ou alguém novo na área da IA, o YOLO11 oferece uma abordagem avançada à deteção de objetos que é facilmente acessível.
Conhecer o Ultralytics YOLO11: novas funcionalidades e melhorias#
O YOLO11, lançado no evento híbrido anual da Ultralytics, o YOLO Vision 2024 (YV24), suporta as mesmas tarefas de visão computacional que o YOLOv8, como deteção de objetos, segmentação de instâncias, classificação de imagens e estimativa de pose. Assim, os utilizadores podem mudar facilmente para este novo modelo sem precisarem de ajustar os seus fluxos de trabalho. Além disso, a arquitetura atualizada do YOLO11 torna as previsões ainda mais precisas. Na verdade, o YOLO11m alcança uma precisão média (mAP) superior no conjunto de dados COCO, com menos 22% de parâmetros do que o YOLOv8m.
O YOLO11 também foi concebido para funcionar de forma eficiente numa vasta gama de plataformas, desde smartphones e outros dispositivos edge até sistemas de nuvem mais potentes. Esta flexibilidade garante um desempenho consistente em diferentes configurações de hardware para aplicações em tempo real. Além disso, o YOLO11 é mais rápido e eficiente, reduzindo os custos computacionais e acelerando os tempos de inferência. Quer estejas a utilizar o pacote Python da Ultralytics ou o Ultralytics HUB sem código, é fácil integrar o YOLO11 nos teus fluxos de trabalho existentes.
O futuro dos modelos YOLO e da deteção de objetos#
O impacto da deteção avançada de objetos nas aplicações em tempo real e na IA edge já se faz sentir em vários setores. À medida que setores como o petróleo e gás, a saúde e o retalho dependem cada vez mais da IA, a procura por uma deteção de objetos rápida e precisa continua a aumentar. O Ultralytics YOLO11 procura responder a esta procura ao permitir uma deteção de alto desempenho mesmo em dispositivos com capacidade computacional limitada.
À medida que a IA edge cresce, é provável que modelos de deteção de objetos como o Ultralytics YOLO11 se tornem ainda mais essenciais para a tomada de decisões em tempo real em ambientes onde a velocidade e a precisão são críticas. Com melhorias contínuas no design e na adaptabilidade, o futuro da deteção de objetos promete trazer ainda mais inovações para uma grande variedade de aplicações.
Principais conclusões#
A deteção de objetos percorreu um longo caminho, evoluindo de métodos simples para as técnicas avançadas de aprendizagem profunda que vemos atualmente. Os modelos YOLO estiveram no centro deste progresso, proporcionando uma deteção em tempo real mais rápida e precisa em diferentes setores. O Ultralytics YOLO11 baseia-se neste legado, melhorando a eficiência, reduzindo os custos computacionais e aumentando a precisão, o que o torna uma escolha fiável para uma variedade de aplicações em tempo real. Com os avanços contínuos na IA e na visão computacional, o futuro da deteção de objetos parece promissor, com margem para ainda mais melhorias em velocidade, precisão e adaptabilidade.
Tens curiosidade sobre IA? Mantém-te ligado à nossa comunidade para continuares a aprender! Consulta o nosso repositório do GitHub para descobrires como estamos a utilizar a IA para criar soluções inovadoras em setores como a indústria transformadora e a saúde. 🚀









