Precisão média (mAP) na deteção de objetos
Compreenda a Precisão Média (mAP) na deteção de objetos. Saiba o que significa, como é calculada e por que razão a mAP é essencial para avaliar o desempenho dos modelos.

A adoção da IA está a crescer rapidamente, e a inteligência artificial está a ser integrada em várias inovações, desde carros autónomos a sistemas de retalho capazes de identificar produtos numa prateleira. Estas tecnologias dependem da visão computacional, um ramo da inteligência artificial (AI) que permite às máquinas analisar dados visuais.
Uma métrica de avaliação essencial usada para medir a precisão de sistemas e algoritmos de visão computacional é a precisão média média (mAP). A métrica mAP indica até que ponto a previsão de um modelo de IA para visão corresponde aos resultados do mundo real.
Uma tarefa comum de visão computacional é a deteção de objetos, na qual um modelo identifica vários objetos numa imagem e desenha caixas delimitadoras à volta deles. A mAP é a métrica padrão usada para avaliar o desempenho de modelos de deteção de objetos e é amplamente utilizada para aferir modelos de aprendizagem profunda, como o Ultralytics YOLO11.
Neste artigo, veremos como a precisão média média é calculada e por que é essencial para qualquer pessoa que esteja a treinar ou avaliar modelos de deteção de objetos. Vamos começar!
O que é a precisão média média (mAP)?#
A precisão média média é uma pontuação que mostra quão preciso é um modelo de aprendizagem profunda em tarefas relacionadas com a recuperação de informação visual, como detetar e identificar diferentes objetos numa imagem. Por exemplo, considera um modelo de deteção de objetos a analisar uma fotografia que contém um cão, um gato e um carro. Um modelo fiável consegue realizar a deteção de objetos reconhecendo cada objeto e desenhando caixas delimitadoras e etiquetas à sua volta, destacando onde está e o que é.
A mAP indica quão bem o modelo executa esta tarefa em muitas imagens e com diferentes tipos de objetos. Verifica se o modelo identifica corretamente cada objeto e a sua localização na imagem. A pontuação varia de 0 a 1, em que um significa que o modelo encontrou tudo na perfeição e zero significa que não conseguiu detetar nenhum objeto.
Conceitos essenciais da precisão média média (mAP)#
Antes de explorarmos os conceitos por trás da precisão média média na aprendizagem automática, vamos compreender melhor dois termos básicos: verdade fundamental e previsões.
A verdade fundamental refere-se aos dados de referência corretos, nos quais os objetos e as suas localizações na imagem são cuidadosamente etiquetados por pessoas através de um processo conhecido como anotação. Já as previsões são os resultados fornecidos pelos modelos de IA após analisarem uma imagem. Ao comparar as previsões do modelo de IA com a verdade fundamental, podemos medir quão perto o modelo esteve de obter os resultados corretos.

Fig. 1. As caixas delimitadoras da previsão do modelo e da verdade fundamental. Imagem do autor.
Matriz de confusão#
Uma matriz de confusão é frequentemente utilizada para compreender quão preciso é um modelo de deteção de objetos. É uma tabela que mostra como as previsões do modelo correspondem às respostas corretas reais (verdade fundamental). A partir desta tabela, podemos obter uma divisão de quatro componentes ou resultados essenciais: verdadeiros positivos, falsos positivos, falsos negativos e verdadeiros negativos.
Eis o que estes componentes representam na matriz de confusão:
- Verdadeiro positivo (TP): Um objeto e a sua localização são detetados corretamente pelo modelo.
- Falso positivo (FP): O modelo fez uma deteção, mas esta estava incorreta.
- Falso negativo (FN): Um objeto que estava realmente presente na imagem, mas que o modelo não conseguiu detetar.
- Verdadeiro negativo (TN): Os verdadeiros negativos ocorrem quando o modelo identifica corretamente a ausência de um objeto.
Os verdadeiros negativos não são normalmente utilizados na deteção de objetos, pois geralmente ignoramos as muitas regiões vazias de uma imagem. No entanto, são essenciais noutras tarefas de visão computacional, como a classificação de imagens, na qual o modelo atribui uma etiqueta à imagem. Por exemplo, se a tarefa for detetar se uma imagem contém ou não um gato e o modelo identificar corretamente “sem gato” quando a imagem não contém nenhum, isso é um verdadeiro negativo.

Fig. 2. Resultados da classificação numa matriz de confusão. Imagem do autor.
Interseção sobre União (IoU)#
Outra métrica essencial na avaliação de modelos de deteção de objetos é a Interseção sobre União (IoU). Para estes modelos de IA para visão, detetar simplesmente a presença de um objeto numa imagem não é suficiente; também é necessário localizar onde ele se encontra na imagem para desenhar caixas delimitadoras.
A métrica IoU mede até que ponto a caixa prevista pelo modelo corresponde à caixa real correta (verdade fundamental). A pontuação situa-se entre 0 e 1, em que 1 significa uma correspondência perfeita e 0 significa ausência total de sobreposição.
Por exemplo, uma IoU mais elevada (como 0,80 ou 0,85) significa que a caixa prevista corresponde de perto à caixa da verdade fundamental, indicando uma localização precisa. Uma IoU mais baixa (como 0,30 ou 0,25) significa que o modelo não localizou o objeto com precisão.
Para determinar se uma deteção é bem-sucedida, utilizamos diferentes limiares. Um limiar de IoU comum é 0,5, o que significa que uma caixa prevista tem de se sobrepor à caixa da verdade fundamental em pelo menos 50% para ser contabilizada como um verdadeiro positivo. Qualquer sobreposição abaixo deste limiar é considerada um falso positivo.

Fig. 3. Compreender a Interseção sobre União. Imagem do autor.
Precisão e revocação#
Até agora, explorámos algumas métricas de avaliação básicas para compreender o desempenho dos modelos de deteção de objetos. Com base nisso, duas das métricas mais importantes são a precisão e a revocação. Estas fornecem uma visão clara da precisão das deteções do modelo. Vejamos o que são.
Os valores de precisão indicam quantas das previsões do modelo estavam efetivamente corretas. Respondem à pergunta: de todos os objetos que o modelo afirmou detetar, quantos estavam realmente presentes?
Por outro lado, os valores de revocação medem quão bem o modelo encontra todos os objetos reais presentes na imagem. Respondem à pergunta: de todos os objetos reais presentes, quantos foram detetados corretamente pelo modelo?
Em conjunto, a precisão e a revocação proporcionam uma visão mais clara do desempenho de um modelo. Por exemplo, se um modelo prever 10 carros numa imagem e 9 forem de facto carros, terá uma precisão de 90% (uma previsão positiva).
Estas duas métricas de avaliação envolvem frequentemente um compromisso: um modelo pode alcançar um valor de precisão elevado fazendo apenas previsões nas quais tem plena confiança, mas isso pode fazer com que não detete muitos objetos, reduzindo o nível de revocação. Entretanto, também pode alcançar uma revocação muito elevada ao prever uma caixa delimitadora praticamente em todo o lado, mas isso reduziria a precisão.

Fig. 4. Precisão e revocação. Imagem do autor.
Precisão média#
Embora a precisão e a revocação nos ajudem a compreender o desempenho de um modelo em previsões individuais, a precisão média (AP) pode proporcionar uma visão mais abrangente. Ilustra como a precisão do modelo se altera à medida que tenta detetar mais objetos e resume o seu desempenho num único número.
Para calcular a pontuação de precisão média, podemos primeiro criar, para cada tipo de objeto, uma métrica combinada semelhante a um gráfico, chamada curva de precisão-revocação (ou curva PR). Esta curva mostra o que acontece à medida que o modelo faz mais previsões.
Considera um cenário em que o modelo começa por detetar apenas os objetos mais fáceis ou óbvios. Nesta fase, a precisão é elevada porque a maioria das previsões está correta, mas a revocação é baixa, uma vez que muitos objetos continuam por detetar. À medida que o modelo tenta detetar mais objetos, incluindo os mais difíceis ou raros, geralmente introduz mais erros. Isto faz com que a precisão diminua enquanto a revocação aumenta.
A precisão média é a área sob a curva (AUC da curva PR). Uma área maior significa que o modelo é melhor a manter as suas previsões precisas, mesmo enquanto deteta mais objetos. A AP é calculada separadamente para cada etiqueta de classe.
Por exemplo, num modelo capaz de detetar carros, bicicletas e peões, podemos calcular individualmente os valores de AP para cada uma dessas três categorias. Isto ajuda-nos a perceber quais os objetos que o modelo deteta bem e onde ainda pode precisar de melhorias.

Fig. 5. Uma curva PR para cinco classes diferentes. (Fonte)
Precisão média média#
Depois de calcular a precisão média para cada classe de objeto, ainda precisamos de uma única pontuação que reflita o desempenho geral do modelo em todas as classes. Isto pode ser obtido através da fórmula da precisão média média. Esta calcula a média das pontuações AP de todas as categorias.
Por exemplo, suponhamos que um modelo de visão computacional como o Ultralytics YOLO11 alcança uma AP de 0,827 para carros, 0,679 para motociclos, 0,355 para camiões, 0,863 para autocarros e 0,982 para bicicletas. Utilizando a fórmula da mAP, podemos somar estes números e dividi-los pelo número total de classes da seguinte forma:
mAP = (0,827 + 0,679 + 0,355 + 0,863 + 0,982) ÷ 5 = 0,7432 ≈ 0,743
A pontuação mAP de 0,743 proporciona uma forma simples de avaliar o desempenho do modelo em todas as classes de objetos. Um valor próximo de 1 significa que o modelo é preciso para a maioria das categorias, enquanto um valor mais baixo sugere que tem dificuldades com algumas.
Importância da AP e da mAP na visão computacional#
Agora que compreendemos melhor como a AP e a mAP são calculadas e quais são os seus componentes, eis uma visão geral da sua importância na visão computacional:
-
AP baixa para uma classe específica: Uma AP baixa para uma única classe geralmente significa que o modelo tem dificuldades com essa classe de objeto específica. Isto pode dever-se a dados de treino insuficientes ou a desafios visuais nas imagens, como a oclusão.
-
Erros de localização: Um valor de mAP mais elevado com um limiar de IoU mais baixo (como mAP@0.50), combinado com uma queda significativa com um limiar de IoU mais elevado (como mAP@0.75), indica que o modelo consegue detetar objetos, mas tem dificuldades em localizá-los com precisão.
-
Sobreajuste: Um valor de mAP mais elevado no conjunto de dados de treino, mas um valor de mAP mais baixo no conjunto de dados de validação, é um sinal de sobreajuste, tornando o modelo pouco fiável para imagens novas.
Aplicações reais da precisão média média#
Em seguida, vamos explorar como métricas essenciais como a mAP podem ajudar na criação de casos de utilização reais de visão computacional.
Veículos autónomos: por que um valor de mAP mais elevado significa estradas mais seguras#
No caso dos carros autónomos, a deteção de objetos é crucial para identificar peões, sinais rodoviários, ciclistas e marcações de faixa. Por exemplo, se uma criança atravessar repentinamente a rua, o carro dispõe de segundos para detetar o objeto (a criança), localizar onde está, acompanhar o seu movimento e tomar as medidas necessárias (aplicar os travões).
Modelos como o Ultralytics YOLO11 foram concebidos para a deteção de objetos em tempo real nestes cenários de alto risco. Nestes casos, a mAP torna-se uma medida de segurança crítica.
Uma pontuação mAP elevada garante que o sistema deteta rapidamente a criança, a localiza com precisão e aciona a travagem com um atraso mínimo. Uma mAP baixa pode significar deteções falhadas ou classificações incorretas perigosas, como confundir a criança com outro objeto pequeno.

Fig. 6. Um exemplo da utilização do YOLO11 para detetar peões na estrada. (Fonte)
Utilizar a mAP para uma deteção precisa de produtos#
De forma semelhante, no retalho, os modelos de deteção de objetos podem ser utilizados para automatizar tarefas como a monitorização de stock e os processos de pagamento. Quando um cliente lê o código de um produto numa caixa de pagamento automático, um erro de deteção pode causar frustração.
Uma pontuação mAP elevada garante que o modelo distingue corretamente entre produtos semelhantes e desenha caixas delimitadoras precisas, mesmo quando os artigos estão muito juntos. Uma pontuação mAP baixa pode causar trocas. Por exemplo, se o modelo confundir uma garrafa de sumo de laranja com uma garrafa de sumo de maçã visualmente semelhante, isso poderá resultar numa faturação incorreta e em relatórios de inventário imprecisos.
Os sistemas de retalho integrados com modelos como o Ultralytics YOLO11 podem detetar produtos em tempo real, compará-los com o inventário e atualizar instantaneamente os sistemas de backend. Em ambientes de retalho acelerados, a mAP desempenha um papel crucial para manter as operações precisas e fiáveis.
Melhorar a precisão do diagnóstico na saúde com uma mAP elevada#
Melhorar a precisão do diagnóstico na área da saúde começa com uma deteção precisa em imagiologia médica. Modelos como o YOLO11 podem ajudar os radiologistas a identificar tumores, fraturas ou outras anomalias nessas imagens médicas. Aqui, a precisão média média é uma métrica essencial para avaliar a fiabilidade clínica de um modelo.
Uma mAP elevada indica que o modelo alcança tanto uma revocação elevada (identificando a maioria dos problemas reais) como uma precisão elevada (evitando falsos alarmes), o que é crucial na tomada de decisões clínicas. Além disso, o limiar de IoU na área da saúde é frequentemente definido como muito elevado (0,85 ou 0,90) para garantir uma deteção extremamente precisa.
No entanto, uma pontuação mAP baixa pode suscitar preocupações. Suponhamos que um modelo não deteta um tumor; isso poderia atrasar o diagnóstico ou conduzir a um tratamento incorreto.
Vantagens e desvantagens da utilização da mAP#
Eis as principais vantagens da utilização da precisão média média para avaliar modelos de deteção de objetos:
-
Métrica padronizada: A mAP é o padrão da indústria para avaliar modelos de deteção de objetos. Um valor de mAP permite comparações justas e consistentes entre diferentes modelos.
-
Reflete o desempenho no mundo real: Uma mAP elevada indica que o modelo é excelente a detetar várias classes de objetos e mantém um desempenho sólido em cenários complexos do mundo real.
-
Diagnóstico por classe: Uma pontuação mAP avalia individualmente o desempenho da deteção para cada classe. Isto facilita a identificação de categorias com desempenho insuficiente (como bicicletas ou sinais de trânsito) e o ajuste do modelo em conformidade.
Embora existam vários benefícios na utilização da métrica mAP, há algumas limitações a considerar. Eis alguns fatores a ter em conta:
-
Difícil para intervenientes não técnicos: As equipas empresariais ou clínicas podem considerar os valores de mAP abstratos, ao contrário de métricas mais intuitivas e fáceis de compreender.
-
Não reflete as restrições de tempo real: A mAP não tem em conta a velocidade de inferência ou a latência, que são cruciais para a implementação em aplicações sensíveis ao tempo.
Principais conclusões#
Vimos que a precisão média média não é apenas uma pontuação técnica, mas também um reflexo do potencial desempenho de um modelo no mundo real. Quer seja num sistema de veículos autónomos ou num pagamento de retalho, uma pontuação mAP elevada serve como um indicador fiável do desempenho e da preparação prática de um modelo.
Embora a mAP seja uma métrica essencial e relevante, deve ser considerada como parte de uma estratégia de avaliação abrangente. Para aplicações críticas, como a área da saúde e a condução autónoma, não é suficiente depender apenas da mAP.
Também é necessário considerar fatores adicionais, como a velocidade de inferência (a rapidez com que o modelo faz previsões), o tamanho do modelo (que afeta a implementação em dispositivos periféricos) e a análise qualitativa de erros (a compreensão dos tipos de erros cometidos pelo modelo), para garantir que o sistema é seguro, eficiente e verdadeiramente adequado à finalidade pretendida.
Junta-te à nossa comunidade em crescimento e ao nosso repositório do GitHub para saberes mais sobre visão computacional. Explora as nossas páginas de soluções para conhecer aplicações de visão computacional na agricultura e de IA na logística. Consulta as nossas opções de licenciamento para começares hoje mesmo a criar o teu próprio modelo de visão computacional!









