CutMix
Узнай, как метод аугментации данных CutMix предотвращает переобучение. Научись легко применять его для обучения устойчивых моделей Ultralytics YOLO26.
CutMix — это продвинутая техника аугментации данных, используемая для обучения устойчивых моделей компьютерного зрения: прямоугольный фрагмент вырезается из одного изображения и вставляется в целевое изображение. В отличие от более простых методов аугментации, изменяющих яркость или поворот, CutMix меняет основную композицию обучающего примера. При замене пикселей соответствующие эталонные метки также смешиваются пропорционально площади фрагмента. Это помогает искусственным нейронным сетям учиться распознавать объекты по частичным изображениям, заставляя модель опираться на множество признаков, а не только на наиболее различимые части объекта. Впервые предложенный в научной работе 2019 года, этот метод стал стандартной операцией во фреймворках глубокого обучения, помогающей предотвращать переобучение и улучшать обобщающую способность на больших наборах данных.
Как работает эта техника#
Во время обучения модели алгоритм случайным образом выбирает координаты центра и размер прямоугольника, чтобы извлечь область из вторичного изображения. Затем этот фрагмент напрямую накладывается на основное изображение внутри текущего батча. Если на основном изображении была собака, а на вторичном — кошка, на итоговом изображении фрагмент с кошкой заменит часть изображения с собакой. Метки классификации обновляются с помощью линейной интерполяции на основе точной площади фрагмента — например, итоговая метка может составлять 0.7 для собаки и 0.3 для кошки. В задачах обнаружения объектов ограничивающие рамки, сохраняющие в вставленной области не менее определённой доли (часто 10%) своей исходной площади, сохраняются. Эта техника изначально поддерживается как гиперпараметр обучения cutmix в Ultralytics YOLO, позволяя специалистам легко задавать вероятность такого преобразования.
Различия между MixUp и Cutout#
CutMix тесно связан с двумя другими известными техниками аугментации данных, но устраняет их конкретные ограничения:
- Аугментация MixUp: MixUp объединяет два изображения целиком, вычисляя взвешенное среднее значений их пикселей. Хотя этот метод эффективен, он часто создаёт неестественные полупрозрачные фантомные изображения, которые могут сбивать модели с толку, нарушая локальную пространственную корреляцию. В отличие от него, CutMix сохраняет исходную интенсивность пикселей внутри вырезанных областей; этот подход исследователи дополнительно оптимизировали в таких методах, как Attentive CutMix.
- Аугментация Cutout: Cutout удаляет информацию, маскируя случайную прямоугольную область чёрными пикселями или средним значением набора данных. Хотя это побуждает модель анализировать объект целиком, ценные обучающие тензоры используются неэффективно. CutMix заполняет это пустое пространство информативными фрагментами для классификации изображений из других изображений, повышая общую эффективность обучения.
Практические применения#
Обучая модели распознавать объекты с сильными перекрытиями, CutMix значительно повышает эффективность машинного обучения в различных отраслях.
- ИИ для автомобилей и автономного вождения: В беспилотных автомобилях этот метод учит систему распознавать пешеходов или транспортные средства, даже когда их частично закрывают дорожные знаки, повышая безопасность в людных местах.
- Медицинская диагностика и сегментация органов: В здравоохранении этот метод широко используется для сегментации органов и опухолей, позволяя моделям распознавать сложные границы тканей даже при перекрытии анатомических структур.
- Дистанционное зондирование спутниковых изображений: Эта стратегия сохраняет плотные перекрывающиеся классы, такие как здания и растительность, на аэрофотоснимках. Передовые варианты метода активно исследуются для улучшения распознавания классов с длинным хвостом на сильно несбалансированных данных.
Практическая реализация#
Интеграция этой аугментации в конвейер ИИ не вызывает сложностей. Большинство высокоуровневых библиотек поддерживают её изначально, включая PyTorch Transforms и Keras Preprocessing Layers.
При обучении модели вроде YOLO26 для настройки этой аугментации достаточно изменить всего один параметр. При этом автоматически обрабатываются как нарезка изображений на фрагменты, так и сложная логика обрезки ограничивающих рамок.
from ultralytics import YOLO
# Initialize the recommended Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model with CutMix enabled at a 50% probability
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, cutmix=0.5)Для команд, управляющих крупномасштабными рабочими процессами компьютерного зрения, Ultralytics Platform упрощает эту задачу, позволяя настраивать передовые методы аугментации данных непосредственно через облачный интерфейс и сокращая путь от аннотирования до развёртывания модели.









