Dataset Bias
Изучи причины смещения наборов данных в AI и узнай, как уменьшить перекос. Узнай, как использовать Ultralytics Platform и Ultralytics YOLO26 для повышения справедливости.
Смещение в наборе данных возникает, когда информация, используемая для обучения моделей машинного обучения (ML), содержит систематические ошибки или искажённые распределения, из-за чего получившаяся система ИИ отдаёт предпочтение одним результатам перед другими. Поскольку модели работают как механизмы распознавания закономерностей, они полностью зависят от входных данных: если обучающие данные неточно отражают разнообразие реальной среды, модель унаследует эти слепые зоны. Это явление часто приводит к плохой обобщающей способности: ИИ может показывать высокие результаты во время тестирования, но значительно хуже работать при развёртывании для вывода в реальном времени в разнообразных или непредсказуемых сценариях.
Распространённые источники искажения данных#
Смещение может проникнуть в набор данных на нескольких этапах жизненного цикла разработки и часто возникает из-за решений, принимаемых людьми при сборе или разметке данных.
- Смещение отбора: Оно возникает, когда собранные данные не представляют целевую совокупность случайным образом. Например, создание набора данных для распознавания лиц преимущественно на основе изображений знаменитостей может сместить модель в сторону лиц с насыщенным макияжем и профессиональным освещением, из-за чего она будет плохо работать с обычными изображениями с веб-камеры.
- Ошибки разметки: Субъективность при разметке данных может привнести человеческие предубеждения. Если разметчики постоянно неправильно классифицируют неоднозначные объекты из-за отсутствия чётких инструкций, модель воспринимает эти ошибки как эталонную истину.
- Смещение представления: Даже при случайном отборе группы меньшинств могут статистически теряться на фоне класса большинства. В обнаружении объектов набор данных с 10 000 изображений автомобилей и всего 100 изображениями велосипедов приведёт к созданию модели, смещённой в сторону обнаружения автомобилей.
Применение и последствия в реальном мире#
Влияние смещения в наборе данных значительно в различных отраслях, особенно там, где автоматизированные системы принимают решения с высокими последствиями или взаимодействуют с физическим миром.
В автомобильной отрасли ИИ в автомобилестроении использует камеры для обнаружения пешеходов и препятствий. Если беспилотный автомобиль обучался преимущественно на данных, собранных в солнечном сухом климате, его производительность может снизиться при работе в снегопад или сильный дождь. Это классический пример несоответствия распределения обучающих данных распределению эксплуатационных данных, что создаёт риски для безопасности.
Аналогично, в анализе медицинских изображений диагностические модели часто обучаются на исторических данных пациентов. Если модель, предназначенная для обнаружения кожных заболеваний, обучалась на наборе данных, в котором преобладали светлые тона кожи, её точность при диагностике пациентов с тёмной кожей может быть значительно ниже. Для решения этой проблемы необходимы согласованные усилия по формированию разнообразных наборов данных, обеспечивающих справедливость ИИ для всех демографических групп.
Стратегии снижения смещения#
Разработчики могут уменьшить смещение в наборе данных, применяя тщательный аудит и передовые стратегии обучения. Такие методы, как аугментация данных, помогают сбалансировать наборы данных за счёт искусственного создания вариаций недостаточно представленных примеров (например, отражения, поворота или изменения яркости). Кроме того, генерация синтетических данных может восполнить пробелы там, где реальные данные редки или их сложно собрать.
Эффективное управление такими наборами данных крайне важно. Ultralytics Platform позволяет командам визуализировать распределение классов и выявлять дисбаланс до начала обучения. Кроме того, соблюдение таких рекомендаций, как Рамка управления рисками ИИ NIST, помогает организациям системно выстраивать подход к выявлению и снижению этих рисков.
Смещение в наборе данных и связанные понятия#
Чтобы понять, где возникает ошибка, полезно отличать смещение в наборе данных от схожих терминов:
- против алгоритмического смещения: Смещение в наборе данных сосредоточено на данных и означает, что «ингредиенты» некорректны. Алгоритмическое смещение сосредоточено на модели и возникает из-за самой конструкции алгоритма или алгоритма оптимизации, который может отдавать приоритет классам большинства для максимизации общих метрик за счёт групп меньшинств.
- против дрейфа модели: Смещение в наборе данных — это статическая проблема, существующая на момент обучения. Дрейф модели (или дрейф данных) возникает, когда реальные данные со временем изменяются после развёртывания модели, что требует постоянного мониторинга модели.
Пример кода: аугментация для уменьшения смещения#
В следующем примере показано, как применять аугментацию данных во время обучения с помощью YOLO26. Увеличивая количество геометрических аугментаций, модель учится лучше обобщать данные, что потенциально уменьшает смещение в сторону определённых ориентаций или положений объектов, встречающихся в обучающем наборе.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








