Data Labeling
Изучи основы разметки данных для машинного обучения. Узнай ключевые типы, такие как детекция объектов, и способы ускорения рабочих процессов с помощью Ultralytics YOLO26.
Разметка данных — это фундаментальный процесс идентификации сырых данных, таких как изображения, видеокадры, текст или аудио, и добавления информативных тегов или метаданных для предоставления контекста. В сфере машинного обучения (ML) алгоритмы не могут сами по себе понимать физический мир; им нужен «учитель», который будет их направлять. Это руководство поступает в виде размеченных наборов данных, используемых во время обучения с учителем. Метки служат эталонными данными (ground truth), представляя собой правильные ответы, которые модель стремится предсказать. Независимо от того, обучаешь ли ты простой классификатор или сложную архитектуру вроде Ultralytics YOLO26, точность, согласованность и качество этих меток являются главными определяющими факторами успеха модели.
Разметка данных против аннотирования данных#
Хотя эти термины часто используются взаимозаменяемо в непринужденной беседе, между ними есть тонкое различие, о котором стоит упомянуть. «Разметка данных» обычно относится к широкому действию по присвоению категории или тега фрагменту данных (например, тегирование электронной почты как «спам»). В отличие от этого, аннотирование данных часто более специфично для компьютерного зрения (CV) и включает точное выделение объектов с помощью ограничивающих прямоугольников, полигонов или ключевых точек. Тем не менее, в большинстве рабочих процессов операций ML (MLOps) оба термина описывают создание высококачественных обучающих данных.
Ключевые типы в computer vision#
Метод разметки меняется в зависимости от задачи, которую должна выполнять модель. Распространенные типы включают:
- Классификация изображений: Присвоение одной метки целому изображению, например определение погодных условий как «облачно» или «солнечно».
- Обнаружение объектов: Создание двумерных ограничивающих прямоугольников (bounding boxes) вокруг отдельных объектов, чтобы научить модель тому, что это за объект и где он находится.
- Сегментация экземпляров: Создание идеальных на уровне пикселей масок или полигонов вокруг объектов, что необходимо для определения точных форм и границ.
- Оценка позы: Отметка определенных ключевых точек на субъекте, таких как суставы скелета, для анализа движения или осанки.
Реальные приложения#
Польза разметки данных распространяется практически на каждую отрасль, использующую AI.
-
Автономный транспорт: Беспилотные автомобили полагаются на огромные наборы данных, где каждое транспортное средство, пешеход, дорожный знак и дорожная разметка тщательно размечены. Эти размеченные данные позволяют системе восприятия безопасно ориентироваться в сложных средах. Компании, занимающиеся автономным транспортом, вкладывают значительные средства в разметку на уровне пикселей для обеспечения соответствия требованиям безопасности.
-
Точное земледелие: В современном сельском хозяйстве ИИ в сельском хозяйстве используется для обнаружения болезней сельскохозяйственных культур или мониторинга стадий роста. Фермеры используют модели, обученные на размеченных изображениях «здоровых» и «больных» листьев, чтобы автоматизировать обработку, снижая использование химикатов и повышая урожайность.
Рабочий процесс разметки#
Создание размеченного набора данных часто является наиболее трудоемкой частью проекта ИИ. Процесс обычно включает подход «человек в контуре» (HITL), при котором аннотаторы-люди проверяют метки для обеспечения высокой точности. Современные рабочие процессы используют такие инструменты, как Ultralytics Platform, которая упрощает управление наборами данных и позволяет командам сотрудничать при создании аннотаций. Также могут применяться передовые методы, такие как активное обучение, при котором модель предварительно размечает данные, а люди исправляют только предсказания с низкой уверенностью, что значительно ускоряет процесс.
В следующем примере показано, как использовать предобученную модель Ultralytics YOLO26 для автоматической генерации разметки (авторазметки) для нового изображения, которую затем могут исправить люди:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")





