Data Labeling
Изучи основы разметки данных для машинного обучения. Узнай об основных типах, таких как обнаружение объектов, и о том, как ускорить рабочие процессы с помощью Ultralytics YOLO26.
Разметка данных — это фундаментальный процесс идентификации исходных данных, таких как изображения, видеокадры, текст или аудио, и добавления информативных тегов или метаданных для предоставления контекста. В сфере машинного обучения (ML) алгоритмы не могут самостоятельно понимать физический мир; им требуется «учитель», который будет ими руководить. Это руководство обеспечивается размеченными наборами данных, используемыми в процессе обучения с учителем. Метки служат эталонными значениями, то есть правильными ответами, которые модель стремится предсказывать. Независимо от того, обучаешь ли ты простой классификатор или сложную архитектуру, например Ultralytics YOLO26, именно точность, согласованность и качество этих меток в первую очередь определяют успешность модели.
Разметка данных и аннотирование данных#
Хотя в повседневной речи эти термины часто используются как взаимозаменяемые, между ними есть небольшое, но важное различие. «Разметка данных» обычно означает широкое действие по присвоению категории или тега отдельному фрагменту данных, например пометку электронного письма как «спам». В отличие от этого, аннотирование данных чаще относится к более специфической задаче в области компьютерного зрения (CV), которая включает точное обозначение объектов с помощью ограничивающих рамок, полигонов или ключевых точек. Однако в большинстве рабочих процессов операций машинного обучения (MLOps) оба термина описывают создание качественных обучающих данных.
Основные типы разметки в компьютерном зрении#
Метод разметки зависит от задачи, которую должна выполнять модель. К распространённым типам относятся:
- Классификация изображений: присвоение одного обозначения всему изображению, например определение погодного условия как «пасмурно» или «солнечно».
- Детекция объектов: нанесение двумерных ограничивающих рамок вокруг отдельных объектов, чтобы научить модель распознавать объект и определять его местоположение.
- Сегментация экземпляров: создание попиксельно точных масок или полигонов вокруг объектов, что необходимо для определения их точных форм и границ.
- Оценка позы: обозначение определённых ключевых точек на объекте, например суставов скелета, для анализа движений или положения тела.
Практические применения#
Разметка данных находит применение практически во всех отраслях, использующих ИИ.
-
Автономные транспортные средства: беспилотные автомобили используют огромные наборы данных, в которых тщательно размечены все транспортные средства, пешеходы, дорожные знаки и линии разметки. Эти размеченные данные позволяют системе восприятия безопасно ориентироваться в сложных условиях. Компании, занимающиеся автономными транспортными средствами, активно инвестируют в попиксельную разметку, чтобы обеспечить соответствие требованиям безопасности.
-
Точное земледелие: в современном сельском хозяйстве ИИ в сельском хозяйстве используется для обнаружения болезней растений и отслеживания стадий их роста. Фермеры применяют модели, обученные на размеченных изображениях «здоровых» и «больных» листьев, чтобы автоматизировать обработку, сократить использование химикатов и повысить урожайность.
Рабочий процесс разметки#
Создание размеченного набора данных часто оказывается самой трудоёмкой частью проекта в области ИИ. Обычно процесс предполагает подход «человек в контуре» (HITL), при котором специалисты по аннотированию проверяют метки, чтобы обеспечить высокую точность. В современных рабочих процессах используются такие инструменты, как Ultralytics Platform, которые упрощают управление наборами данных и позволяют командам совместно работать над аннотациями. Также можно применять передовые методы, например активное обучение: модель предварительно размечает данные, а люди исправляют только предсказания с низкой уверенностью, что значительно ускоряет процесс.
В следующем примере показано, как использовать предварительно обученную модель Ultralytics YOLO26 для автоматической генерации меток (автоматической разметки) нового изображения, после чего эти метки могут быть исправлены людьми:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")








