Data Labeling
Aprende os fundamentos da rotulagem de dados para machine learning. Descobre tipos essenciais, como a deteção de objetos, e como acelerar os fluxos de trabalho utilizando o Ultralytics YOLO26.
A rotulagem de dados é o processo fundamental de identificar dados em bruto — como imagens, fotogramas de vídeo, texto ou áudio — e adicionar etiquetas ou metadados informativos para fornecer contexto. No domínio da aprendizagem automática (ML), os algoritmos não conseguem compreender inerentemente o mundo físico; precisam de um "professor" para os orientar. Esta orientação assume a forma de conjuntos de dados rotulados utilizados durante a aprendizagem supervisionada. As etiquetas funcionam como a verdade fundamental, representando as respostas corretas que o modelo procura prever. Quer esteja a treinar um classificador simples ou uma arquitetura complexa como o Ultralytics YOLO26, a precisão, a consistência e a qualidade destas etiquetas são os principais fatores determinantes do sucesso de um modelo.
Rotulagem de dados vs. anotação de dados#
Embora os termos sejam frequentemente utilizados indistintamente em conversas informais, há uma distinção subtil que vale a pena mencionar. A "rotulagem de dados" refere-se geralmente ao ato abrangente de atribuir uma categoria ou etiqueta a um elemento de dados (por exemplo, marcar um e-mail como "spam"). Em contrapartida, a anotação de dados é frequentemente mais específica da visão computacional (CV), envolvendo a delimitação precisa de objetos através de caixas delimitadoras, polígonos ou pontos-chave. No entanto, na maioria dos fluxos de trabalho de operações de ML (MLOps), ambos os termos descrevem a criação de dados de treino de alta qualidade.
Principais tipos em visão computacional#
O método de rotulagem varia consoante a tarefa que o modelo tem de executar. Os tipos comuns incluem:
- Classificação de imagens: Atribuir uma única etiqueta a uma imagem inteira, como identificar uma condição meteorológica como "nublado" ou "ensolarado".
- Deteção de objetos: Desenhar caixas delimitadoras 2D em torno de objetos distintos para ensinar ao modelo o que é o objeto e onde está localizado.
- Segmentação de instâncias: Criar máscaras ou polígonos ao nível exato dos píxeis em torno dos objetos, algo essencial para determinar formas e limites precisos.
- Estimativa de pose: Marcar pontos-chave específicos num sujeito, como articulações do esqueleto, para analisar o movimento ou a postura.
Aplicações no mundo real#
A utilidade da rotulagem de dados estende-se a praticamente todos os setores que utilizam IA.
-
Veículos autónomos: Os carros autónomos dependem de enormes conjuntos de dados nos quais cada veículo, peão, sinal de trânsito e marca de faixa é meticulosamente rotulado. Estes dados rotulados permitem que o sistema de perceção navegue em ambientes complexos em segurança. As empresas de veículos autónomos investem fortemente na rotulagem ao nível dos píxeis para garantir a conformidade com os requisitos de segurança.
-
Agricultura de precisão: Na agricultura moderna, a IA na agricultura é utilizada para detetar doenças nas culturas ou monitorizar fases de crescimento. Os agricultores utilizam modelos treinados com imagens rotuladas de folhas "saudáveis" e "doentes" para automatizar o tratamento, reduzindo o uso de produtos químicos e aumentando o rendimento.
O fluxo de trabalho de rotulagem#
A criação de um conjunto de dados rotulado é frequentemente a parte mais demorada de um projeto de IA. O processo envolve normalmente uma abordagem de "Humano no circuito" (HITL), na qual anotadores humanos verificam as etiquetas para garantir uma elevada precisão. Os fluxos de trabalho modernos utilizam ferramentas como a Ultralytics Platform, que simplifica a gestão de conjuntos de dados e permite que as equipas colaborem nas anotações. Também podem ser utilizadas técnicas avançadas como a aprendizagem ativa, nas quais um modelo pré-rotula os dados e os humanos apenas corrigem as previsões de baixa confiança, acelerando significativamente o processo.
O exemplo seguinte demonstra como utilizar um modelo Ultralytics YOLO26 pré-treinado para gerar automaticamente etiquetas (rotulagem automática) para uma nova imagem, que pode depois ser corrigida por humanos:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")








