Como melhorar o mAP do modelo em objetos pequenos: um guia rápido
Saiba como melhorar o mAP do modelo em objetos pequenos com dicas práticas sobre qualidade dos dados, aumento de dados, estratégias de treinamento, avaliação e implantação.

À medida que a adoção da inteligência artificial (IA), da aprendizagem automática e da visão computacional continua a crescer, os sistemas de deteção de objetos são utilizados em todo o lado, desde câmaras de trânsito inteligentes a drones e ferramentas de análise no retalho. Muitas vezes, espera-se que estes sistemas detetem objetos de todos os tamanhos, quer se trate de um camião grande perto da câmara ou de um peão minúsculo ao longe.
Normalmente, é mais simples detetar objetos grandes e bem visíveis. Em contrapartida, a deteção de objetos pequenos é mais difícil.
Quando um objeto ocupa apenas uma parte minúscula da imagem, há muito pouca informação visual disponível. Um pedestre distante numa transmissão de trânsito ou um veículo pequeno capturado numa vista aérea pode conter apenas alguns pixels, mas esses pixels podem transmitir informações críticas.
Os modelos de visão computacional, como os modelos Ultralytics YOLO, dependem de padrões visuais para reconhecer objetos. Quando esses padrões são limitados ou pouco nítidos, o desempenho sofre. Detalhes importantes podem se perder durante o processamento, tornando as previsões mais sensíveis a erros de localização. Até um pequeno deslocamento de uma caixa delimitadora pode transformar uma detecção correta numa detecção perdida.
Essa lacuna fica evidente quando analisamos o desempenho dos modelos. A maioria dos modelos de detecção e segmentação lida bem com objetos médios e grandes, mas objetos pequenos costumam reduzir a precisão geral.
O desempenho do deep learning costuma ser medido usando a precisão média, ou mAP. Essa métrica reflete tanto a precisão das detecções quanto o alinhamento das caixas previstas com os objetos reais.
Ela combina precisão, que indica quantos objetos previstos estão corretos, e revocação, que indica quantos objetos reais são detectados com sucesso, considerando diferentes níveis de confiança e limiares de interseção sobre união, ou IoU (uma métrica que mede quanto a caixa delimitadora prevista se sobrepõe à caixa de referência).
Anteriormente, exploramos a detecção de objetos pequenos e por que ela é um problema tão difícil para os modelos de visão computacional. Neste artigo, vamos desenvolver essa base e nos concentrar em como melhorar o mAP quando há objetos pequenos. Vamos começar!
Por que é mais difícil detectar objetos pequenos?#
Em aplicações que envolvem detectores de objetos, um objeto pequeno é definido pelo espaço que ocupa na imagem, não necessariamente por quão pequeno parece ao olho humano. Se ocupar apenas uma parte minúscula da imagem, conterá muito pouca informação visual, o que dificulta sua detecção precisa por um algoritmo de visão computacional.

Fig. 1. Imagens de exemplo que mostram objetos pequenos ocupando áreas limitadas de pixels (Fonte)
Com menos pixels disponíveis, detalhes importantes como bordas, formas e texturas podem ficar pouco nítidos ou se perder facilmente. Durante o processamento pelo modelo, a imagem é redimensionada e simplificada para destacar padrões úteis.
Embora isso ajude o modelo a entender a cena como um todo, também pode reduzir ainda mais os detalhes finos. No caso de objetos pequenos, esses detalhes costumam ser essenciais para uma detecção correta.
Esses desafios ficam ainda mais evidentes ao analisar as métricas de avaliação. Objetos pequenos são especialmente sensíveis a erros de localização. Até uma caixa delimitadora ligeiramente desalinhada pode ficar abaixo do limiar exigido de interseção sobre união, ou IoU.
Quando isso acontece, uma previsão que parece razoável pode ser contabilizada como incorreta. Isso reduz tanto a precisão quanto a revocação, diminuindo, em última análise, a precisão média, ou mAP.
Como esses fatores estão estreitamente relacionados, melhorar o desempenho muitas vezes exige pensar no sistema inteiro. Isso significa equilibrar cuidadosamente a resolução da imagem, a extração de características, o design do modelo e as configurações de avaliação para preservar e interpretar melhor os pequenos detalhes visuais.
A importância da qualidade do conjunto de dados e das anotações#
Na detecção de objetos pequenos, a qualidade do conjunto de dados costuma ser o fator que mais influencia o desempenho. Objetos pequenos ocupam apenas uma parte minúscula da imagem, o que significa que há muito pouca informação visual disponível para o modelo aprender. Por isso, os dados de treinamento são especialmente importantes. Se o conjunto de dados não incluir exemplos claros e representativos em quantidade suficiente, o modelo de detecção de objetos terá dificuldade para reconhecer padrões consistentes.
Os conjuntos de dados adequados à detecção de objetos pequenos geralmente contêm imagens de alta resolução, aparições frequentes de alvos pequenos e condições visuais consistentes. Embora conjuntos de dados genéricos, como o conjunto de dados COCO, sejam pontos de partida úteis, muitas vezes não correspondem à escala, à densidade ou ao contexto de casos de uso específicos do mundo real. Nesses casos, é necessário coletar dados de treinamento específicos do domínio para melhorar o desempenho do modelo.
A qualidade das anotações também tem um papel fundamental. As anotações estabelecem a referência correta ao especificar os rótulos dos objetos e as posições das caixas delimitadoras que o modelo aprende a prever.
No caso de objetos pequenos, as caixas delimitadoras devem ser desenhadas com cuidado e consistência. Até pequenas diferenças no posicionamento das caixas podem afetar significativamente a precisão da localização, porque objetos pequenos são muito sensíveis a deslocamentos ao nível do pixel.
Anotações imprecisas ou inconsistentes podem reduzir significativamente o mAP. Se os objetos forem rotulados incorretamente, o modelo aprenderá padrões errados, o que pode aumentar os falsos positivos.
Se houver objetos na imagem que não estejam incluídos na referência, as detecções corretas poderão ser contabilizadas como falsos positivos durante a avaliação. Ambas as situações reduzem o desempenho geral.
Curiosamente, pesquisas recentes indicam que a precisão média para objetos pequenos costuma ficar entre 20% e 40% nos benchmarks padrão, um valor significativamente inferior ao obtido para objetos maiores. Essa diferença destaca a importância do design do conjunto de dados e da consistência das anotações para a precisão geral da detecção.
O aumento de dados pode ter um papel fundamental na melhoria da precisão#
Agora que entendemos a importância da qualidade do conjunto de dados e da consistência das anotações, vamos ver como um modelo de detecção de objetos pode aprender melhor com os dados existentes. Mesmo quando é difícil ou caro coletar mais imagens, ainda há maneiras de melhorar o desempenho aproveitando melhor os dados disponíveis.
Uma das abordagens mais práticas é o aumento de dados. Ele é especialmente importante na detecção de objetos pequenos, pois esses objetos oferecem menos pistas visuais para o modelo aprender. Ao introduzir variações controladas durante o treinamento, o aumento de dados ajuda o modelo a generalizar melhor sem exigir a coleta de novos dados.
Um aumento de dados eficaz busca manter os objetos pequenos claramente visíveis. Técnicas como redimensionamento controlado, recortes leves e divisão da imagem em blocos podem destacar os objetos pequenos, preservando sua forma e aparência. O objetivo é ajudar o modelo a ver objetos pequenos com mais frequência e em condições ligeiramente diferentes, sem alterar a aparência deles em situações reais.
No entanto, é preciso aplicar o aumento de dados com cuidado. Algumas transformações podem reduzir a visibilidade dos objetos pequenos ou alterar sua aparência de formas improváveis nos dados reais. Quando isso acontece, o modelo pode ter dificuldade para aprender os limites precisos dos objetos.
Aumento de dados mais inteligente com IA generativa#
Outro tipo interessante de aumento de dados, cada vez mais popular, é usar IA generativa para criar dados sintéticos de treinamento. Em vez de depender de imagens coletadas e rotuladas manualmente, as equipes podem agora gerar cenas realistas que simulam ambientes específicos, tamanhos de objetos, condições de iluminação e variações de fundo.

Fig. 2. Uma análise de imagens aéreas sintéticas usadas para aumento de dados (Fonte)
Essa abordagem é especialmente útil na detecção de objetos pequenos, quando pode ser difícil capturar exemplos do mundo real de maneira consistente. Ao controlar a aparência dos objetos pequenos nas imagens sintéticas, ajustando, por exemplo, a escala, a densidade e o posicionamento, é possível apresentar aos modelos uma variedade maior de cenários de treinamento.
Quando combinada cuidadosamente com dados reais, a geração de dados sintéticos pode aumentar a robustez do modelo, reduzir os custos de coleta de dados e permitir melhorias de desempenho mais direcionadas.
Escolhas de treinamento do modelo que podem afetar o mAP de objetos pequenos#
Além da qualidade do conjunto de dados e da consistência das anotações, as escolhas de treinamento do modelo também afetam bastante o desempenho na detecção de objetos pequenos.
Veja algumas das principais estratégias de treinamento a considerar:
- Comece com modelos pré-treinados: Um modelo pré-treinado, como o Ultralytics YOLO26, já aprendeu padrões visuais gerais a partir de grandes conjuntos de dados de imagens. Isso oferece uma base sólida, em vez de começar o treinamento do zero, o que é especialmente útil para detectar objetos pequenos com poucos dados.
- Use o aprendizado por transferência de forma estratégica: O aprendizado por transferência consiste em adaptar um modelo pré-treinado ao seu conjunto de dados específico. Isso ajuda o modelo a se concentrar nos seus objetos pequenos e reduz o sobreajuste (memorizar os dados de treinamento em vez de aprender padrões gerais).
- Lide com o desequilíbrio entre classes: Se os objetos pequenos aparecerem com menos frequência do que os maiores, o modelo poderá priorizar o aprendizado dos objetos grandes. Técnicas como ponderação de classes ou estratégias de amostragem ajudam a garantir que os objetos pequenos não sejam ignorados.
- Ajuste os limiares de confiança e IoU: Os objetos pequenos são sensíveis a pequenos erros de localização. Ajustar esses limiares ajuda a avaliar e interpretar melhor o desempenho na detecção de objetos pequenos durante a validação e a inferência.
Considerações sobre a arquitetura do modelo para detecção de objetos pequenos#
Embora possas usar um modelo geral de detecção de objetos para tarefas com objetos pequenos, também existem arquiteturas de modelos desenvolvidas especificamente para melhorar a detecção desses objetos. Por exemplo, há variantes do modelo Ultralytics YOLOv8 com P2, otimizadas para preservar detalhes espaciais finos.
O Ultralytics YOLOv8 processa imagens em várias escalas, reduzindo-as gradualmente à medida que avançam pela rede. Isso ajuda o modelo a entender a cena como um todo, mas também reduz os detalhes finos.
Quando um objeto já é muito pequeno, informações visuais importantes podem desaparecer durante esse processo. A variante P2 do Ultralytics YOLOv8 resolve esse problema usando um stride de 2 na pirâmide de características.
Uma pirâmide de características é a parte do modelo que analisa a imagem em várias resoluções internas para detectar objetos de diferentes tamanhos. Com um stride de 2, a imagem é reduzida mais gradualmente nessa etapa, permitindo preservar mais detalhes dos pixels originais.
Como mais detalhes espaciais são preservados, os objetos pequenos mantêm uma estrutura mais visível dentro da rede. Isso facilita a localização e a detecção de objetos que ocupam apenas alguns pixels, o que pode ajudar a melhorar o mAP de objetos pequenos.
Avaliação sensível ao tamanho para a detecção de objetos pequenos#
Embora a precisão média resuma o desempenho geral do modelo, ela nem sempre mostra o quanto o modelo consegue lidar com objetos de diferentes tamanhos. No caso de objetos pequenos, o desempenho costuma ser limitado pela precisão da localização, e não apenas pela classificação. Isso significa que pequenos deslocamentos das caixas delimitadoras podem afetar significativamente os resultados.
Em outras palavras, o modelo pode identificar corretamente a classe do objeto, mas, se a caixa delimitadora prevista estiver ligeiramente desalinhada, a detecção ainda poderá ser considerada incorreta. Como os objetos pequenos cobrem poucos pixels, até um pequeno deslocamento da caixa pode reduzir significativamente a sobreposição entre a caixa prevista e a referência. Consequentemente, as pontuações da avaliação podem cair mesmo quando o objeto foi identificado corretamente.

Fig. 3. Avaliar a detecção de objetos pequenos pode ser complicado (Fonte)
Uma abordagem mais informativa é avaliar o desempenho de acordo com o tamanho dos objetos. A maioria dos benchmarks amplamente usados apresenta a precisão média separadamente para objetos pequenos, médios e grandes.
Essa análise detalhada por tamanho mostra com mais clareza onde o modelo tem bom desempenho e onde encontra dificuldades. Na prática, a AP para objetos pequenos costuma ficar abaixo do mAP geral, destacando desafios de localização que podem não ser evidentes nas métricas agregadas.
Considere as restrições de implantação e as concessões no mundo real#
O desempenho do modelo costuma mudar quando passamos de ambientes de teste controlados para a implantação no mundo real. Fatores como resolução da imagem, velocidade de processamento e hardware disponível exigem concessões que afetam diretamente a detecção de objetos pequenos.
Por exemplo, aumentar a resolução de entrada pode melhorar o mAP de objetos pequenos, pois os alvos pequenos ocupam mais pixels e preservam mais detalhes. No entanto, uma resolução maior também aumenta o uso de memória e o tempo de processamento. Isso pode tornar a inferência mais lenta e elevar os custos operacionais.

Fig. 4. Desafios da implantação da detecção de objetos pequenos. Imagem do autor.
As escolhas de hardware têm um papel fundamental na gestão dessas concessões. GPUs mais potentes permitem usar modelos maiores e processar dados mais rapidamente, mas os ambientes de implantação, especialmente os dispositivos de borda, costumam ter recursos limitados de computação e memória.
As aplicações em tempo real acrescentam outra restrição: manter a latência baixa pode exigir reduzir o tamanho do modelo ou a resolução de entrada, o que pode prejudicar a revocação de objetos pequenos. Em última análise, as decisões de implantação exigem equilibrar o desempenho da detecção com as limitações do hardware, os requisitos de velocidade e o custo geral.
Juntando tudo: como melhorar o mAP do modelo para objetos pequenos#
Melhorar a detecção de objetos pequenos exige uma abordagem prática e estruturada, especialmente em ambientes do mundo real. Veja um resumo das principais etapas a ter em mente:
- Audite a qualidade do conjunto de dados: Certifique-se de que o conjunto de dados inclui exemplos suficientes de objetos pequenos, usa imagens de alta resolução sempre que possível e reflete as condições em que o modelo será implantado.
- Verifique a consistência das anotações: Garanta que as caixas delimitadoras sejam precisas, completas e rotuladas de maneira consistente. Anotações inconsistentes podem limitar diretamente o desempenho da localização.
- Ajuste as configurações de treinamento de forma deliberada: Ajuste cuidadosamente o tamanho do lote, o número de épocas e as configurações de otimização para que os objetos pequenos sejam representados adequadamente durante o treinamento.
- Avance passo a passo: Faça ajustes controlados, meça o impacto deles e refine sua abordagem. Iterações constantes e orientadas por dados levam a melhorias consistentes ao longo do tempo.
Principais conclusões#
Melhorar o mAP para objetos pequenos exige uma abordagem estruturada e orientada por dados, em vez de ajustes aleatórios. As melhorias reais vêm da combinação de bons dados, anotações consistentes, treinamento cuidadoso e métodos de avaliação adequados. Em projetos do mundo real, testes contínuos e pequenas mudanças mensuráveis levam, com o tempo, a uma detecção de objetos pequenos melhor e mais confiável.
Junta-te à nossa crescente comunidade e explora o nosso repositório do GitHub para acederes a recursos práticos de IA. Para começares hoje a desenvolver com IA de visão, explora as nossas opções de licenciamento. Descobre como a IA na agricultura está a transformar a atividade agrícola e como a IA de visão na robótica está a moldar o futuro, visitando as nossas páginas de soluções.









