Golden Dataset
Эталонный набор данных — это тщательно размеченный репрезентативный набор, который служит надёжной базой для оценки ИИ. Объясняется, как создать и поддерживать такой набор.
Эталонный набор данных — это тщательно отобранная, точно размеченная и репрезентативная коллекция примеров, которая служит доверенной основой для оценки системы ИИ. Вместо максимального увеличения размера набора в приоритет ставятся точность, охват и соответствие предполагаемому применению. Команды используют его как стабильный «ключ с ответами» для сравнения моделей, проверки регрессий, анализа сбоев и принятия решения о готовности системы к развёртыванию.
В машинном обучении термин «эталонный набор данных» — это неофициальное инженерное понятие, а не общепринятый стандартизированный тип набора данных. Его точный состав зависит от задачи: изображения с проверенными ограничивающими рамками для обнаружения объектов, запросы с утверждёнными ответами для языковой модели или транзакции с подтверждёнными исходами для обнаружения мошенничества.
Что делает набор данных эталонным#
Эталонный набор данных содержит входные данные и доверенные ожидаемые результаты, которые часто называют эталонной разметкой. В компьютерном зрении такими результатами могут быть метки классов, ограничивающие рамки, маски сегментации или ключевые точки, полученные в ходе тщательной разметки данных.
Основные качества:
- Точность меток: Аннотации проверяют эксперты в предметной области или обученные проверяющие, используя понятные правила. Неоднозначные примеры разрешаются единообразно, а не оставляются на усмотрение отдельных специалистов.
- Репрезентативный охват: набор данных отражает важные условия эксплуатации, включая типичные случаи, сложные примеры, редкие события, а также соответствующие группы пользователей и условия среды.
- Соответствие задаче: каждый пример помогает измерить определённое требование, например обнаружение повреждённых посылок при освещении склада.
- Независимость: примеры отделены от обучающих данных, чтобы предотвратить утечку данных, из-за которой заявленные показатели могут выглядеть обманчиво высокими.
- Отслеживаемость: команды фиксируют источники данных, условия сбора, правила аннотирования, рецензентов и изменения. Отслеживание наборов данных в MLflow показывает, как хеши, схемы, источники и происхождение набора данных помогают обеспечить воспроизводимость.
- Контролируемые изменения: обновления версионируются и проходят проверку. Оценка модели имеет смысл, только если известны точная версия набора данных и настройки оценки.
Эталонный набор не обязательно безупречен или верен навсегда. Условия и определения реального мира могут меняться, поэтому эталонный набор нужно проверять и обновлять, не переписывая незаметно исторические результаты.
Эталонный набор данных и связанные понятия#
Эталонный набор данных пересекается с несколькими знакомыми понятиями, но в нём особое внимание уделяется доверию и управлению данными:
- Метка эталонной разметки — это принятый ответ для одного примера; эталонный набор данных представляет собой коллекцию проверенных примеров и принятых ответов для них.
- Набор данных для бенчмарка обычно публикуют, чтобы сравнивать системы на общей задаче. Эталонный набор данных часто остаётся закрытым и создаётся для конкретной организации, продукта или среды развёртывания.
- Валидационные данные помогают выбирать и настраивать модель во время разработки. Многократные решения на их основе могут постепенно привести к переобучению процесса разработки.
- Тестовые данные откладывают для итоговой оценки. Эталонный набор данных часто служит высококачественным тестовым набором или набором для регрессионного тестирования, хотя он также может включать отдельные части для разработки и финального тестирования.
- Обучающие данные используются для настройки параметров модели и обычно значительно объёмнее. Эталонный набор данных не должен попадать в обучение, если только его версию намеренно не выводят из оценки.
В рекомендациях Google по разделению наборов данных советуют разделять примеры для обучения, валидации и тестирования. Если данных мало, методы кросс-валидации могут улучшить оценку, но защищённый итоговый эталонный набор всё равно будет полезен.
Примеры применения в реальных условиях#
Проверка дефектов на производстве: фабрика может создать эталонный набор данных из проверенных изображений, показывающих годные изделия и подтверждённые дефекты, например трещины, отсутствующие детали или неправильную сборку. В него входят примеры с разных производственных линий, положений камеры, материалов и условий освещения. Перед выпуском каждую кандидатную модель проверяют на одном и том же наборе. Если полнота при обнаружении мелких трещин снижается, команда может заблокировать развёртывание, даже когда общий показатель выглядит приемлемо.
Мониторинг полок в розничной торговле: продавец может поддерживать набор проверенных снимков магазинов с переполненными полками, пустыми местами, частично скрытыми товарами, сезонной упаковкой и отражениями. Этот набор данных позволяет оценить, насколько надёжно система компьютерного зрения обнаруживает товары и пустоты на полках в разных магазинах. Анализ результатов по сценариям или категориям товаров соответствует более широкой практике выявления групп с высоким уровнем ошибок, описанной в рекомендациях Microsoft по ответственному ИИ.
Эти примеры показывают, почему одной общей точности недостаточно. Эталонный набор данных должен поддерживать оценку по срезам для редких классов, местоположений, устройств или условий, где ошибки имеют разные последствия. В основном документе NIST по системе управления рисками ИИ также подчёркивается важность документированных тестовых наборов, подходящих метрик и оценки в условиях, приближённых к развёртыванию.
Создание и поддержка эталонного набора данных#
Начни с определения предполагаемого поведения модели и важных сценариев отказа. Собери репрезентативные примеры, составь точные инструкции по аннотированию, откалибруй работу рецензентов и разреши разногласия с помощью экспертов предметной области. Оставляй почти дублирующиеся изображения и связанные кадры видео в одной части набора, чтобы визуально похожий контент не пересекал границу между обучением и оценкой.
Для проектов в области компьютерного зрения Ultralytics Platform поддерживает облачное управление наборами данных, аннотирование, обучение и развёртывание. Её процесс аннотирования позволяет командам создавать и уточнять метки, а представления наборов данных помогают проверять распределение классов, неаннотированные изображения, разбиения, дубликаты и выбросы.
Версионируй каждый утверждённый выпуск и документируй добавления, удаления, исправления меток и изменения политик. Рекомендации NIST по тестированию, оценке, валидации и верификации ИИ дают более широкую основу для содержательной оценки. После развёртывания сравнивай входящие данные с эталонными и отслеживай изменения условий; в рекомендациях Azure по мониторингу моделей объясняется, как сигналы дрейфа и качества данных помогают определить, когда эталонный набор нужно пересмотреть.
Оценка модели компьютерного зрения#
Ultralytics YOLO может оценивать предсказания по проверенным меткам с помощью режима валидации:
from ultralytics import YOLO
# Load a pretrained object detection model
model = YOLO("yolo26n.pt")
# Evaluate predictions against a labeled reference split
metrics = model.val(data="coco8.yaml", split="val")
# Report the primary detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Этот процесс показывает роль эталонного набора данных на стороне модели: запусти фиксированную модель на фиксированном размеченном разбиении и зафиксируй воспроизводимую метрику. В производственных проектах перед утверждением выпуска командам также следует проверять результаты по классам, матрицы ошибок, сложные примеры и пороговые значения приёмки, специфичные для приложения.










