Gestão inteligente de conjuntos de dados em visão computacional com a Ultralytics Platform
Explore como pode utilizar a Ultralytics Platform para melhorar a gestão de conjuntos de dados nos seus projetos de visão computacional. Acompanhe, compare e melhore os seus conjuntos de dados com facilidade.

A IA de visão, ou visão computacional, evoluiu muito desde os seus primórdios, passando de uma área de investigação experimental a uma tecnologia essencial que impulsiona aplicações do mundo real. Hoje, os entusiastas de IA podem criar modelos poderosos para tarefas como deteção de objetos e segmentação de instâncias utilizando ferramentas e frameworks acessíveis.
No entanto, à medida que estas aplicações passam da experimentação para a produção, a gestão de datasets continua a ser um desafio crítico e frequentemente negligenciado. À medida que os datasets de visão computacional aumentam em dimensão e complexidade, as equipas têm frequentemente dificuldades em manter anotações consistentes, acompanhar alterações entre versões e garantir a qualidade geral dos dados.
Mesmo os modelos mais avançados podem ter um desempenho inferior em ambientes do mundo real se os dados nos quais foram treinados estiverem incompletos, desequilibrados ou forem mal geridos. Esta diferença crescente entre o desempenho no desenvolvimento e a fiabilidade no mundo real explica por que é necessária uma abordagem mais estruturada à gestão de datasets.
Outra limitação comum é o facto de a recolha, anotação e formação de dados serem frequentemente realizadas com ferramentas separadas. Um fluxo de trabalho fragmentado dificulta a gestão eficiente dos datasets, aumenta o risco de inconsistências e abranda a iteração.
Para resolver obstáculos da IA de visão, como a gestão de datasets e os fluxos de trabalho fragmentados, lançámos recentemente a Ultralytics Platform. Trata-se de um espaço de trabalho completo que reúne a gestão de datasets, anotação, formação, implementação e monitorização num único fluxo de trabalho unificado.
Ao ligar cada etapa do ciclo de vida da visão computacional, torna-se mais fácil acompanhar as alterações dos datasets, comparar o desempenho entre versões e aperfeiçoar continuamente os teus dados para obter melhores resultados.

Fig. 1. Exemplo da visualização de imagens do teu dataset na Ultralytics Platform (Fonte)
Neste artigo, vamos explorar como a Ultralytics Platform te ajuda a acompanhar, comparar e melhorar os teus datasets para criar modelos de visão computacional mais fiáveis. Vamos começar!
A importância da gestão de datasets na visão computacional#
O desempenho de um modelo de visão computacional está estreitamente ligado aos dados com que é treinado. A precisão do modelo, ou seja, a frequência com que as previsões estão corretas, depende não só do algoritmo, mas também de quão bem o dataset representa as condições do mundo real.
Dito de forma simples, um modelo aprende padrões diretamente a partir dos dados, pelo que quaisquer lacunas, enviesamentos ou inconsistências no dataset podem influenciar a forma como faz previsões. Por outras palavras, dados de baixa qualidade, anotações incorretas ou uma cobertura limitada das variações do mundo real nas imagens, como diferentes condições de iluminação, ângulos dos objetos, fundos ou níveis de oclusão, podem reduzir significativamente a precisão, mesmo que a arquitetura do modelo seja sólida.
Isto também se aplica ao ajuste fino de um modelo, em que um modelo pré-treinado é treinado adicionalmente com dados novos ou atualizados para se adaptar melhor a um caso de utilização ou ambiente específico. Como a precisão do modelo depende tanto dos dados, gerir esses dados corretamente torna-se essencial.
A gestão de datasets inclui organizar, etiquetar e atualizar continuamente os dados para que se mantenham precisos e relevantes. Isto facilita a melhoria do desempenho ao longo do tempo, especialmente ao voltar a treinar ou ajustar modelos com novos dados.
Como a qualidade dos datasets afeta a fiabilidade no mundo real#
Os casos de utilização de visão computacional, como sistemas de monitorização de segurança, são um excelente exemplo de por que a gestão adequada dos dados é essencial. Estes sistemas têm de funcionar de forma fiável numa série de condições do mundo real, incluindo diferentes ambientes de iluminação, ângulos de câmara, níveis de aglomeração e oclusões parciais.
Se os dados de treino não abrangerem estas variações ou não tiverem diversidade na forma como os objetos aparecem em diferentes cenas e condições, o modelo poderá ter dificuldades em detetar objetos com precisão. Por exemplo, um modelo treinado sobretudo com cenas bem iluminadas e sem elementos perturbadores pode ter um desempenho fraco em ambientes com pouca luz ou em locais cheios. Em sistemas de segurança, isto pode resultar em eventos não detetados ou alertas falsos.
Para evitar isto, é importante manter datasets que não sejam apenas limpos e anotados com precisão, mas também equilibrados e continuamente atualizados. Isto significa identificar lacunas nos dados, adicionar novos exemplos à medida que as condições mudam e garantir que as diferentes classes e ambientes estão representados de forma equilibrada.
Com um dataset mais completo e estruturado, os modelos estão mais bem preparados para lidar com a variabilidade do mundo real e produzir previsões mais fiáveis.
Principais aspetos da gestão de datasets#
Então, como é que é realmente a gestão de datasets? Envolve organizar, etiquetar e manter os dados para que possam ser utilizados eficazmente ao longo do processo de desenvolvimento do modelo.
Organizar dados, por exemplo, inclui estruturar o dataset e dividi-lo em conjuntos de treino, validação e teste. O conjunto de treino é utilizado para ensinar o modelo, o conjunto de validação é utilizado para monitorizar o desempenho e orientar ajustes durante o desenvolvimento, e o conjunto de teste é utilizado para avaliar o desempenho do modelo final com dados completamente desconhecidos.
Por sua vez, a etiquetagem envolve anotar imagens com detalhes como etiquetas de classe, caixas delimitadoras ou máscaras de segmentação. Como o modelo aprende a partir destas anotações, a precisão e a consistência são cruciais para o ajudar a aprender padrões relevantes e fazer previsões fiáveis.
Além disso, manter o dataset envolve rever e atualizar os dados ao longo do tempo. Isto pode incluir corrigir erros de anotação, remover dados de baixa qualidade ou duplicados e adicionar novos exemplos para abranger casos em falta ou condições em mudança.
De forma mais abrangente, a gestão de datasets é um processo contínuo. À medida que os modelos são avaliados e novos dados são recolhidos, os datasets têm de ser atualizados para refletir as condições do mundo real e os casos extremos. Acompanhar estas atualizações e comparar diferentes versões ajuda as equipas a compreender o que está a melhorar o desempenho e onde são necessárias alterações adicionais.
Gerir datasets com a Ultralytics Platform#
A Ultralytics Platform fornece um fluxo de trabalho estruturado para gerir datasets num único ambiente, abrangendo tudo, desde a preparação dos dados até à exportação. Foi concebida para apoiar tanto programadores individuais como equipas, facilitando a gestão consistente de datasets, quer trabalhes de forma independente quer colabores em vários projetos.
Cada etapa foi concebida para simplificar a forma como os datasets são organizados, processados e utilizados ao longo do ciclo de vida do desenvolvimento do modelo. Ao reunir estes passos num só local, a plataforma reduz a fragmentação e torna mais simples manter a consistência entre fluxos de trabalho.
De seguida, vamos percorrer os principais passos envolvidos e ver como a plataforma apoia cada um deles.
Carregar datasets para a Ultralytics Platform#
Começar a trabalhar com datasets na plataforma é flexível, com várias formas de importar ou reutilizar dados. Podes carregar os teus próprios dados ou começar mais rapidamente utilizando datasets públicos disponíveis através da plataforma. Também podes clonar datasets existentes partilhados pela comunidade e desenvolver o teu trabalho a partir deles.
As funcionalidades da comunidade da plataforma facilitam a exploração e reutilização de trabalhos existentes. Com acesso a datasets criados por outros utilizadores, incluindo milhões de imagens e anotações, podes começar rapidamente sem teres de recolher e etiquetar tudo por conta própria. Clonar um dataset cria uma cópia no teu espaço de trabalho, permitindo modificá-lo e expandi-lo enquanto preserva o original.
Para carregamentos, a plataforma suporta imagens individuais, vídeos e arquivos de datasets, como ficheiros ZIP, TAR ou GZ. Também suporta formatos de datasets amplamente utilizados, como YOLO e COCO, facilitando a importação de datasets e anotações existentes sem conversão adicional. Além disso, podes carregar um dataset utilizando um ficheiro NDJSON exportado da plataforma, tornando simples recriar ou reutilizar datasets em vários projetos.
Depois de carregados, os dados são processados pela plataforma através de um pipeline estruturado. Isto inclui validar formatos e tamanhos de ficheiros, redimensionar imagens quando necessário, analisar anotações e gerar estatísticas do dataset.
Por exemplo, os vídeos são convertidos em fotogramas para poderem ser utilizados no treino, enquanto as imagens são otimizadas e preparadas para facilitar a navegação e a análise. Após o processamento, os datasets estão prontos para anotação, análise e treino de modelos na plataforma.
Anotação de dados na Ultralytics Platform#
Depois de carregados, os datasets podem ser revistos e anotados diretamente na plataforma. A plataforma inclui ferramentas integradas de anotação de imagens para uma série de tarefas de visão computacional, como deteção de objetos, segmentação de instâncias, estimativa de pose, deteção de caixas delimitadoras orientadas (OBB) e classificação de imagens.

Fig. 2. Utilizar a Ultralytics Platform para etiquetagem de dados (Fonte)
As anotações podem ser criadas manualmente com estas ferramentas ou aceleradas com funcionalidades assistidas por IA, como a anotação inteligente baseada em SAM. Com o SAM, podes gerar máscaras, caixas delimitadoras ou caixas orientadas interagindo com a imagem, ajudando a acelerar o processo de etiquetagem sem comprometer a precisão.
Analisar a qualidade dos datasets através da Ultralytics Platform#
Além de preparar e anotar dados, compreender a qualidade do dataset é essencial para criar modelos de visão computacional fiáveis. Sem visibilidade clara sobre fatores como a distribuição das classes, a qualidade das anotações, as divisões do dataset e a forma como os dados são representados em diferentes condições, pode ser difícil detetar problemas que afetam o desempenho do modelo.
A Ultralytics Platform inclui funcionalidades integradas para ajudar a analisar datasets de forma mais eficaz. Estas informações estão disponíveis diretamente na interface do dataset, em separadores como Images, Classes e Charts.
No separador Charts, podes consultar estatísticas ao nível do dataset, como a distribuição das divisões (treino, validação e teste), a frequência das classes e mapas de calor das anotações que mostram onde os objetos aparecem nas imagens.
O separador Classes fornece uma discriminação da quantidade de anotações por classe, facilitando a deteção de desequilíbrios entre classes. Entretanto, o separador Images mostra detalhes ao nível da imagem, como dimensões, quantidade de anotações e a forma como as etiquetas estão distribuídas em cada imagem.
Estas informações facilitam a identificação de problemas como desequilíbrio entre classes, cenários em falta ou distribuição desigual dos dados. Por exemplo, podes notar que determinadas classes têm muito poucos exemplos ou que a maioria das anotações está concentrada em áreas específicas de uma imagem.
Para além da análise de dados, a plataforma suporta a curadoria e o aumento de datasets, ou seja, o aperfeiçoamento dos datasets através da correção ou remoção de dados problemáticos e da criação de variações de dados existentes para melhorar o desempenho do modelo. Estas melhorias podem ser feitas diretamente na plataforma, atualizando anotações, adicionando novos dados ou reorganizando as divisões do dataset com base nas informações obtidas na análise.
Exportar datasets da Ultralytics Platform#
Depois de preparado e validado, um dataset pode ser exportado para utilização em diferentes ambientes. Isto dá-te a flexibilidade de utilizar os teus dados de visão computacional onde preferires, seja para treinar modelos localmente, na cloud ou noutras ferramentas e fluxos de trabalho.
A Ultralytics Platform suporta vários formatos de exportação, incluindo YOLO, COCO e NDJSON, facilitando a integração de datasets em diferentes fluxos de trabalho e ferramentas de treino.

Fig. 3. Exportar um dataset da Ultralytics Platform (Fonte)
Exportar um dataset cria um instantâneo fixo dos dados num determinado momento, incluindo as suas imagens, anotações e estrutura. Isto é útil porque os datasets mudam frequentemente à medida que são adicionados novos dados, atualizadas anotações ou ajustadas divisões. Ao exportar um instantâneo, podes preservar a versão exata do dataset utilizada numa determinada execução de treino.
Isto simplifica a reprodução posterior dos resultados, uma vez que podes voltar a treinar um modelo com a mesma configuração de dados e comparar o desempenho entre diferentes versões do dataset. Por exemplo, podes avaliar se adicionar novas imagens ou corrigir anotações melhora efetivamente a precisão do modelo, em vez de tentares adivinhar o que mudou.
As exportações são processadas de forma assíncrona e, quando estiverem prontas, os datasets podem ser descarregados e utilizados em ambientes de treino locais, na cloud ou offline.
Melhorar a qualidade dos datasets através de iterações na Ultralytics Platform#
Nos fluxos de trabalho de machine learning e deep learning, a gestão de datasets continua mesmo após a implementação, porque os dados do mundo real diferem frequentemente dos dados utilizados durante o treino.
À medida que os modelos encontram novas entradas, as lacunas no dataset, como condições em falta — ambientes com pouca luz, diferentes ângulos de câmara, oclusões ou cenas cheias —, bem como os erros de anotação, tornam-se mais evidentes, tornando necessário aperfeiçoar os dados ao longo do tempo.
Existem várias formas de melhorar um dataset. Podes adicionar novas imagens ou vídeos para abranger condições em falta, como ambientes com pouca luz, diferentes ângulos de câmara, oclusões ou cenas cheias, ajudando a reduzir os pontos cegos dos dados.
Ao mesmo tempo, garantir que as anotações são precisas e consistentes, como objetos corretamente etiquetados e caixas delimitadoras ou máscaras precisas, ajuda o modelo a aprender padrões mais fiáveis.
Isto segue normalmente um ciclo simples: treinar o modelo, avaliar os resultados, identificar erros, melhorar o dataset e voltar a treinar. Cada passo ajuda a destacar problemas como anotações incorretas, dados em falta ou casos sub-representados.
Imagina que estás a trabalhar num sistema de monitorização em tempo real de prateleiras de lojas, utilizado para detetar produtos em estabelecimentos. As primeiras versões do dataset podem não incluir determinados tipos de produtos, condições de iluminação ou disposições de prateleiras muito cheias. Durante a avaliação, podes notar que o modelo tem dificuldades em detetar artigos nestas situações.
Para melhorar o desempenho, podes recolher novas imagens que abranjam estes cenários em falta e atualizar as anotações quando necessário. Ao longo do tempo, repetir este processo ajuda o modelo a tornar-se mais preciso e fiável em condições do mundo real.
A Ultralytics Platform suporta este fluxo de trabalho ao ligar as atualizações dos datasets ao treino e à avaliação. Com o acompanhamento integrado de experiências e as métricas de desempenho, torna-se mais fácil monitorizar o progresso e melhorar continuamente os datasets ao longo do tempo.
Acompanhar as alterações dos datasets utilizando a Ultralytics Platform#
Já abordámos brevemente como os datasets evoluem ao longo do tempo como parte do processo de desenvolvimento do modelo. À medida que são adicionados novos dados, as anotações são aperfeiçoadas e as classes são atualizadas, acompanhar estas alterações torna-se essencial para manter a qualidade dos dados e garantir um desempenho consistente do modelo.
Eis algumas das principais funcionalidades da Ultralytics Platform que suportam o acompanhamento de datasets e o controlo de versões:
- Versionamento de datasets: Podes criar versões fixas de datasets como instantâneos NDJSON. Cada versão regista detalhes essenciais, como o número de imagens, o número de classes, o número de anotações e o tamanho do dataset num determinado momento. Estas versões são armazenadas e podem ser descarregadas posteriormente, facilitando a reprodução de experiências e a comparação de resultados entre diferentes estados do dataset.
- Separador Versions: Todas as versões dos datasets estão organizadas no separador Versions, onde podes consultar o histórico de versões, adicionar descrições às alterações e acompanhar a evolução do dataset ao longo do tempo.
- Ligação a modelos: O separador Models mostra todos os modelos treinados com um dataset, incluindo métricas como mAP e detalhes do treino. As versões dos datasets estão associadas às execuções de treino, ajudando-te a compreender como as alterações nos dados afetam o desempenho do modelo.
- Separador Errors: O separador Errors destaca os ficheiros que falharam durante o processamento, juntamente com os detalhes dos erros e sugestões. Isto permite identificar e corrigir problemas como ficheiros corrompidos ou formatos não suportados antes do treino.
- Interface do dataset (separadores Images e Classes): Estas vistas permitem navegar pelas imagens, rever anotações, gerir etiquetas de classes e analisar a distribuição das classes. Funcionalidades como filtragem, ordenação e identificação de imagens não anotadas simplificam a monitorização da qualidade do dataset ao longo do tempo.
- Estatísticas e gráficos: As visualizações de dados integradas, como a distribuição das divisões, a frequência das classes e os mapas de calor das anotações, ajudam a acompanhar as alterações na distribuição dos dados e a identificar desequilíbrios à medida que o dataset evolui.

Fig. 4. Um exemplo da análise da distribuição de classes de um dataset na Ultralytics Platform (Fonte)
Ligar datasets ao treino e à implementação na Ultralytics Platform#
A Ultralytics Platform liga diferentes etapas do desenvolvimento de modelos de IA num único pipeline. Isto simplifica o processo de passar de dados brutos a aplicações de IA de visão prontas para produção.
Depois de preparados e anotados, os datasets podem ser utilizados para treinar modelos de visão computacional, como o Ultralytics YOLO26, diretamente na plataforma. Durante o treino, podes monitorizar métricas de desempenho, acompanhar experiências e avaliar o progresso da aprendizagem do modelo utilizando dashboards integrados.

Fig. 5. Um vislumbre da visualização das métricas de treino de modelos na Ultralytics Platform (Fonte)
Após o treino, os modelos podem ser testados em novas imagens diretamente no browser para avaliar as previsões e identificar áreas a melhorar antes da implementação. Quando o modelo apresenta um bom desempenho, pode ser implementado em produção.
A plataforma suporta a exportação de modelos para vários formatos ou a sua implementação através de serviços de inferência e endpoints dedicados, permitindo que funcionem em diferentes ambientes.
Depois de implementados, as ferramentas de monitorização integradas ajudam a acompanhar o desempenho do sistema ao longo do tempo, incluindo métricas relacionadas com a utilização e o comportamento do modelo. Isto torna mais simples manter e melhorar sistemas de IA de visão em aplicações do mundo real.
Boas práticas para a gestão de datasets com a Ultralytics Platform#
Eis alguns fatores importantes a ter em conta ao gerir os teus datasets com a Ultralytics Platform:
- Utiliza filtros para encontrar lacunas: Identifica dados não etiquetados ou sub-representados utilizando ferramentas de filtragem, tornando mais simples concluir as anotações e melhorar a cobertura.
- Corrige os erros cedo: Utiliza o separador Errors para o controlo de qualidade e deteta carregamentos falhados, ficheiros corrompidos ou formatos não suportados antes do treino.
- Atualiza continuamente os datasets: Adiciona novos dados, corrige anotações e inclui casos extremos à medida que surgem. Isto ajuda a melhorar a cobertura e garante que os modelos funcionam de forma fiável em cenários do mundo real.
- Gere cuidadosamente as divisões do dataset: Garante um bom equilíbrio entre os conjuntos de treino, validação e teste. Podes reorganizar as divisões manualmente ou utilizar a redistribuição automática quando necessário.
Para saberes mais sobre a Ultralytics Platform, consulta a documentação oficial da Ultralytics.
Principais conclusões#
À medida que os projetos de visão computacional crescem, gerir datasets de forma eficaz torna-se tão importante como desenvolver modelos. Uma abordagem estruturada à gestão de datasets ajuda a melhorar a qualidade dos dados, simplificar os fluxos de trabalho e promover um melhor desempenho dos modelos ao longo do tempo.
A Ultralytics Platform simplifica este processo ao reunir a gestão de datasets, o treino e a implementação num único fluxo de trabalho. Ao adotarem uma abordagem estruturada à gestão de datasets, as equipas podem reduzir a complexidade, melhorar a eficiência e criar sistemas de visão computacional mais escaláveis e fiáveis.
Junta-te à nossa crescente comunidade e explora o nosso repositório do GitHub para encontrares recursos de IA. Para começares hoje a desenvolver com IA de visão, consulta as nossas opções de licenciamento. Descobre como a IA na agricultura está a transformar a atividade agrícola e como a IA de visão na área da saúde está a moldar o futuro, visitando as nossas páginas de soluções.









