Ultralytics YOLO27:
Guias

Explorar os melhores conjuntos de dados de visão computacional em 2025

Acompanha-nos para analisarmos mais de perto os melhores conjuntos de dados de visão computacional de 2025. Aprende como conjuntos de dados diversificados e de alta qualidade impulsionam soluções de IA de visão mais inteligentes.

ABAbirami Vina13 min read
Conjuntos de dados de visão computacional para treinar modelos

Sabias que os dados desempenham um papel em quase tudo o que fazes diariamente? Ver um vídeo, tirar uma fotografia ou consultar o Google Maps contribui para o fluxo constante de informações captadas por mais de 75 mil milhões de dispositivos ligados. Estes dados formam a base da inteligência artificial (IA). Na verdade, modelos avançados de visão computacional como o Ultralytics YOLO11 dependem de dados visuais para identificar padrões, interpretar imagens e compreender o mundo à nossa volta.

Curiosamente, o valor dos dados não depende apenas da quantidade. É mais importante a forma como estão organizados e preparados. Se um conjunto de dados estiver desorganizado ou incompleto, pode originar erros. No entanto, quando os conjuntos de dados são limpos e diversificados, ajudam os modelos de visão computacional a ter um melhor desempenho, quer estejam a reconhecer objetos numa multidão, quer a analisar elementos visuais complexos. Conjuntos de dados de alta qualidade fazem toda a diferença.

Neste artigo, vamos explorar os melhores conjuntos de dados de visão computacional de 2025 e ver como contribuem para criar modelos de visão computacional mais precisos e eficientes. Vamos começar!

O que são conjuntos de dados de visão computacional?#

Um conjunto de dados de visão computacional é uma coleção de imagens ou vídeos que ajuda os sistemas de visão computacional a aprender a compreender e reconhecer informações visuais. Estes conjuntos de dados incluem rótulos ou anotações que ajudam os modelos a reconhecer objetos, pessoas, cenas e padrões nos dados.

Podem ser utilizados para treinar modelos de visão computacional, ajudando-os a melhorar em tarefas como identificar rostos, detetar objetos ou analisar cenas. Quanto melhor for o conjunto de dados — bem organizado, diversificado e preciso — melhor será o desempenho do modelo de IA de visão, resultando numa tecnologia mais inteligente e útil no dia a dia.

Como criar um conjunto de dados de visão computacional#

Criar um conjunto de dados de visão computacional é como preparar apontamentos de estudo para ensinar alguém a ver e compreender o mundo. Tudo começa pela recolha de imagens e vídeos que correspondam à aplicação específica que estás a desenvolver.

Um conjunto de dados ideal inclui exemplos diversificados dos objetos de interesse, captados de diferentes ângulos, sob várias condições de iluminação e em múltiplos fundos e ambientes. Esta variedade garante que o modelo de visão computacional aprende a reconhecer padrões com precisão e funciona de forma fiável em cenários do mundo real.

Diagrama da criação do conjunto de dados de visão ideal

Fig. 1. Criação do conjunto de dados de visão ideal. Imagem do autor.

Depois de recolher imagens e vídeos relevantes, o passo seguinte é a rotulagem de dados. Este processo envolve adicionar etiquetas, anotações ou descrições aos dados para que a IA possa compreender o que cada imagem ou vídeo contém.

Os rótulos podem incluir nomes de objetos, localizações, limites ou outros detalhes relevantes que ajudam a treinar o modelo para reconhecer e interpretar informações visuais com precisão. A rotulagem de dados transforma uma simples coleção de imagens num conjunto de dados estruturado que pode ser utilizado para treinar um modelo de visão computacional.

O treino do modelo requer dados de alta qualidade#

Podes estar a perguntar-te o que torna um conjunto de dados de alta qualidade. Há muitos fatores envolvidos, como a precisão da rotulagem, a diversidade e a consistência. Por exemplo, se vários anotadores estiverem a rotular um conjunto de dados de deteção de objetos para identificar orelhas de gato, um pode classificá-las como parte da cabeça, enquanto outro pode classificá-las separadamente como orelhas. Esta inconsistência pode confundir o modelo e afetar a sua capacidade de aprender corretamente.

Eis uma breve descrição das qualidades de um conjunto de dados de visão computacional ideal:

  • Rótulos claros: Cada imagem é anotada com precisão, utilizando rótulos consistentes e exatos.
  • Dados diversificados: O conjunto de dados inclui diferentes objetos, fundos, condições de iluminação e ângulos para ajudar o modelo a funcionar bem em várias situações.
  • Imagens de alta resolução: Imagens nítidas e detalhadas facilitam a aprendizagem e o reconhecimento de características pelo modelo.

A Ultralytics suporta vários conjuntos de dados#

Os modelos Ultralytics YOLO, como o YOLO11, foram concebidos para trabalhar com conjuntos de dados num formato de ficheiro YOLO específico. Embora seja fácil converter os teus próprios dados para este formato, também disponibilizamos uma opção simples para quem quer começar a experimentar imediatamente.

O pacote Ultralytics Python suporta uma vasta gama de conjuntos de dados de visão computacional, permitindo-te iniciar projetos com tarefas como deteção de objetos, segmentação de instâncias ou estimativa de pose sem qualquer configuração adicional.

Os utilizadores podem aceder facilmente a conjuntos de dados prontos a utilizar, como COCO, DOTA-v2.0, Open Images V7 e ImageNet, especificando o nome do conjunto de dados como um dos parâmetros na função de treino. Quando o fazes, o conjunto de dados é transferido e pré-configurado automaticamente, para que te possas concentrar na criação e no aperfeiçoamento dos teus modelos.

Os 5 melhores conjuntos de dados de visão computacional em 2025#

Os avanços na IA de visão dependem de conjuntos de dados diversificados e de grande escala que impulsionam a inovação e permitem avanços significativos. Vejamos alguns dos conjuntos de dados mais importantes, suportados pela Ultralytics, que estão a influenciar os modelos de visão computacional.

Conjunto de dados ImageNet#

O ImageNet, criado por Fei-Fei Li e pela sua equipa na Universidade de Princeton em 2007 e apresentado em 2009, é um grande conjunto de dados com mais de 14 milhões de imagens rotuladas. É amplamente utilizado para treinar sistemas a reconhecer e categorizar diferentes objetos. O seu design estruturado torna-o particularmente útil para ensinar os modelos a classificar imagens com precisão. Embora esteja bem documentado, centra-se principalmente na classificação de imagens e não possui anotações detalhadas para tarefas como a deteção de objetos.

Eis alguns dos principais pontos fortes do ImageNet:

  • Diversidade: Com imagens que abrangem mais de 20 000 categorias, o ImageNet oferece um conjunto de dados vasto e variado que melhora o treino e a generalização dos modelos.
  • Organização estruturada: As imagens são meticulosamente categorizadas utilizando a hierarquia WordNet, facilitando a recuperação eficiente de dados e o treino sistemático dos modelos.
  • Documentação abrangente: A investigação extensa e os anos de estudo tornam o ImageNet acessível tanto a principiantes como a especialistas, fornecendo informações e orientações valiosas para projetos de visão computacional.

No entanto, tal como qualquer conjunto de dados, tem as suas limitações. Eis alguns dos desafios a considerar:

  • Exigências computacionais: O seu enorme tamanho pode representar desafios para equipas pequenas com recursos computacionais limitados.
  • Ausência de dados temporais: Como contém apenas imagens estáticas, pode não satisfazer as necessidades de aplicações que requerem dados de vídeo ou baseados no tempo.
  • Imagens desatualizadas: Algumas imagens do conjunto de dados são antigas e podem não refletir objetos, estilos ou ambientes atuais, reduzindo potencialmente a sua relevância para aplicações modernas.

Conjunto de dados DOTA-v2.0#

O conjunto de dados DOTA-v2.0, em que DOTA significa conjunto de dados para deteção de objetos em imagens aéreas, é uma extensa coleção de imagens aéreas criada especialmente para a deteção de objetos com caixas delimitadoras orientadas (OBB). Na deteção OBB, são utilizadas caixas delimitadoras rodadas para se alinharem com maior precisão com a orientação real dos objetos na imagem. Este método funciona especialmente bem com imagens aéreas, nas quais os objetos aparecem frequentemente em vários ângulos, resultando numa localização mais precisa e numa deteção geral melhor.

Este conjunto de dados é composto por mais de 11 000 imagens e mais de 1,7 milhões de caixas delimitadoras orientadas, distribuídas por 18 categorias de objetos. As imagens variam entre 800×800 e 20 000×20 000 píxeis e incluem objetos como aviões, navios e edifícios.

Imagens de exemplo e anotações do conjunto de dados DOTA-v2.0

Fig. 2. Exemplos de imagens e anotações do conjunto de dados DOTA-v2.0. Imagem do autor.

Devido às suas anotações detalhadas, o DOTA-v2.0 tornou-se uma escolha popular para projetos de deteção remota e vigilância aérea. Eis algumas das principais características do DOTA-v2.0:

  • Categorias de objetos diversificadas: Abrange muitos tipos diferentes de objetos, como veículos, portos e tanques de armazenamento, expondo os modelos a vários objetos do mundo real.
  • Anotações de alta qualidade: Anotadores especialistas forneceram caixas delimitadoras orientadas com precisão, que mostram claramente as formas e direções dos objetos.
  • Imagens multiescala: O conjunto de dados inclui imagens de diferentes tamanhos, ajudando os modelos a aprender a detetar objetos em escalas pequenas e grandes.

Embora o DOTA-v2 tenha muitos pontos fortes, eis algumas limitações que os utilizadores devem ter em conta:

  • Passos adicionais para a transferência: Devido à forma como o conjunto de dados DOTA é mantido, o DOTA-v2.0 requer um passo de configuração adicional. Primeiro, tens de transferir as imagens DOTA-v1.0 e, em seguida, adicionar as imagens extra e as anotações atualizadas do DOTA-v2.0 para completares o conjunto de dados.
  • Anotações complexas: As caixas delimitadoras orientadas podem exigir esforço adicional durante o treino do modelo.
  • Âmbito limitado: O DOTA-v2 foi concebido para imagens aéreas, o que o torna menos útil para tarefas gerais de deteção de objetos fora deste domínio.

Conjunto de dados Roboflow 100#

O conjunto de dados Roboflow 100 (RF100) foi criado pela Roboflow com o apoio da Intel. Pode ser utilizado para testar e avaliar o desempenho dos modelos de deteção de objetos. Este conjunto de dados de referência inclui 100 conjuntos de dados diferentes, selecionados entre mais de 90 000 conjuntos de dados públicos. Contém mais de 224 000 imagens e 800 classes de objetos de áreas como a saúde, imagens aéreas e jogos.

Eis algumas das principais vantagens da utilização do RF100:

  • Ampla cobertura de domínios: Inclui conjuntos de dados de sete áreas, como imagiologia médica, imagens aéreas e exploração subaquática.
  • Incentiva a melhoria dos modelos: A variabilidade e os desafios específicos dos domínios no RF100 revelam lacunas nos modelos atuais, orientando a investigação para soluções de deteção de objetos mais adaptáveis e robustas.
  • Formato de imagem consistente: Todas as imagens são redimensionadas para 640x640 píxeis. Isto ajuda os utilizadores a treinar modelos sem precisarem de ajustar os tamanhos das imagens.

Apesar dos seus pontos fortes, o RF100 também apresenta algumas desvantagens a ter em conta:

  • Limitado em termos de tarefas: O RF100 foi concebido para a deteção de objetos, pelo que não pode acomodar tarefas como segmentação ou classificação.
  • Foco centrado na avaliação comparativa: O RF100 foi concebido principalmente como uma ferramenta de avaliação comparativa, e não para treinar modelos destinados a aplicações do mundo real, pelo que os seus resultados podem não se traduzir totalmente em cenários práticos de implementação.
  • Variabilidade das anotações: Como o RF100 agrega conjuntos de dados obtidos através de contributos coletivos, podem existir inconsistências na qualidade das anotações e nas práticas de rotulagem, o que pode afetar a avaliação e o ajuste fino dos modelos.

Conjunto de dados COCO (Objetos Comuns em Contexto)#

O conjunto de dados COCO é um dos conjuntos de dados de visão computacional mais utilizados, oferecendo mais de 330 000 imagens com anotações detalhadas. Foi concebido para deteção de objetos, segmentação e legendagem de imagens, tornando-se um recurso valioso para muitos projetos. Os seus rótulos detalhados, incluindo caixas delimitadoras e máscaras de segmentação, ajudam os sistemas a aprender a analisar imagens com precisão.

Este conjunto de dados é conhecido pela sua flexibilidade e é útil para várias tarefas, desde projetos simples a complexos. Tornou-se um padrão na área da IA de visão, sendo frequentemente utilizado em desafios e competições para avaliar o desempenho dos modelos.

Alguns dos seus pontos fortes incluem:

  • Dados diversificados e realistas: O conjunto de dados inclui imagens de cenários do mundo real com vários objetos, oclusões e condições de iluminação variadas.
  • Forte adoção pela comunidade e pela investigação: Utilizado em importantes competições de aprendizagem automática e projetos de investigação, o conjunto de dados COCO dispõe de documentação extensa, modelos pré-treinados e apoio ativo da comunidade.
  • Anotações ricas e detalhadas: O conjunto de dados COCO fornece anotações muito detalhadas, incluindo segmentação de objetos, pontos-chave e legendas, sendo ideal para projetos que exigem uma compreensão visual precisa.

Eis também alguns fatores limitantes a ter em conta:

  • Requisitos computacionais elevados: Devido ao seu tamanho e complexidade, o treino de modelos com COCO pode exigir recursos computacionais significativos, o que representa um desafio para equipas com hardware limitado.
  • Desequilíbrio dos dados: Algumas categorias de objetos têm significativamente mais imagens do que outras, o que pode originar enviesamentos no treino dos modelos.
  • Estrutura de anotações complexa: As anotações detalhadas do conjunto de dados, embora valiosas, podem ser difíceis de gerir para principiantes ou equipas pequenas sem experiência no trabalho com conjuntos de dados estruturados de IA de visão.

Conjunto de dados Open Images V7#

O Open Images V7 é um enorme conjunto de dados de código aberto selecionado pela Google, com mais de 9 milhões de imagens e anotações para 600 categorias de objetos. Inclui vários tipos de anotações e é ideal para abordar tarefas complexas de visão computacional. A sua escala e profundidade proporcionam um recurso abrangente para treinar e testar modelos de visão computacional.

Imagens de exemplo do conjunto de dados Open Images V7

Fig. 3. Um vislumbre do conjunto de dados Open Images V7. Imagem do autor.

Além disso, a popularidade do conjunto de dados Open Images V7 na investigação proporciona muitos recursos e exemplos com os quais os utilizadores podem aprender. No entanto, o seu enorme tamanho pode tornar a transferência e o processamento demorados, especialmente para equipas pequenas. Outro problema é que algumas anotações podem ser inconsistentes, exigindo esforço adicional para limpar os dados, e a integração nem sempre é simples, o que significa que pode ser necessária preparação adicional.

Escolher o conjunto de dados certo#

Escolher o conjunto de dados certo é uma parte importante para preparar o teu projeto de visão computacional para o sucesso. A melhor escolha depende da tua tarefa específica — encontrar uma boa correspondência ajuda o modelo a aprender as competências certas. O conjunto de dados também deve integrar-se facilmente com as tuas ferramentas, para que te possas concentrar mais na criação do modelo e menos na resolução de problemas.

Diagrama dos fatores para escolher o conjunto de dados certo

Fig. 4. Fatores para escolher o conjunto de dados certo. Imagem do autor.

Principais conclusões#

Os conjuntos de dados de alta qualidade são a base de qualquer modelo de visão computacional, ajudando os sistemas a aprender a interpretar imagens com precisão. Os conjuntos de dados diversificados e bem anotados são especialmente importantes, pois permitem que os modelos funcionem de forma fiável em cenários do mundo real e reduzem os erros causados por dados limitados ou de baixa qualidade.

A Ultralytics simplifica o processo de acesso e trabalho com conjuntos de dados de visão computacional, facilitando a descoberta dos dados certos para o teu projeto. Escolher o conjunto de dados certo é um passo crucial para criar um modelo de elevado desempenho, conduzindo a resultados mais precisos e impactantes.

Junta-te à nossa comunidade e explora o nosso repositório no GitHub para saberes mais sobre IA. Descobre avanços como a visão computacional na área da saúde e a IA em carros autónomos nas nossas páginas de soluções. Consulta as nossas opções de licenciamento e dá hoje o primeiro passo para começares a trabalhar com visão computacional!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática