Важность качественных наборов данных для компьютерного зрения
Присоединяйся к нам, чтобы узнать, почему для создания моделей компьютерного зрения необходимы качественные данные. Разберись, как качество данных влияет на эффективность модели.

По состоянию на 2019 год внедрение искусственного интеллекта (ИИ) в корпоративную среду выросло на 270% по сравнению с предыдущими четырьмя годами. Этот рост подстегнул стремительную интеграцию приложений компьютерного зрения (CV) — систем ИИ, которые позволяют машинам интерпретировать и анализировать визуальные данные из окружающего мира. Эти приложения питают широкий спектр технологий: от обнаружения заболеваний в медицинских изображениях и поддержки автономных транспортных средств до оптимизации транспортных потоков и усиления наблюдения в системах безопасности.
Замечательная точность и непревзойденная производительность передовых моделей компьютерного зрения, таких как Ultralytics YOLO11, во многом обусловили этот экспоненциальный рост. Тем не менее производительность этих моделей сильно зависит от качества и количества данных, используемых для их обучения, валидации и тестирования.
Без достаточного количества высококачественных данных модели компьютерного зрения бывает сложно эффективно обучить и настроить в соответствии с отраслевыми стандартами. В этой статье мы исследуем жизненно важную роль данных в создании моделей компьютерного зрения и объясним, почему качество данных так важно. Мы также поделимся несколькими советами, которые помогут тебе создавать высококачественные наборы данных при обучении пользовательских моделей. Давай начнем!
Роль данных в создании моделей компьютерного зрения#
Модели компьютерного зрения можно обучать на больших наборах данных из изображений и видео, чтобы распознавать закономерности и делать точные предсказания. Например, модель обнаружения объектов можно обучить на сотнях или даже тысячах размеченных изображений и видео для точной идентификации объектов.
Качество и количество этих обучающих данных влияют на производительность модели.
Поскольку модели компьютерного зрения могут обучаться только на тех данных, которые они «видели», предоставление высококачественных данных и разнообразных примеров критически важно для их успеха. Без достаточных и разнообразных наборов данных такие модели могут неверно анализировать сценарии из реальной жизни, что приведет к предвзятым или неточным результатам.
Именно поэтому важно четко понимать роль данных в обучении моделей. Прежде чем мы разберем характеристики высококачественных данных, давай разберем типы наборов данных, с которыми ты можешь столкнуться при обучении моделей компьютерного зрения.
Типы наборов данных для компьютерного зрения#
В компьютерном зрении данные, используемые в процессе обучения, делятся на три типа, каждый из которых служит определенной цели. Вот краткий обзор каждого типа:
- Обучающие данные: это основной набор данных, используемый для обучения модели с нуля. Он состоит из изображений и видео с предопределенными метками, что позволяет модели изучать закономерности и распознавать объекты.
- Валидационные данные: это набор данных, используемый для проверки того, насколько хорошо модель работает в процессе обучения. Это помогает убедиться, что модель корректно работает с новыми, ранее не виденными данными.
- Тестовые данные: отдельный набор данных, используемый для оценки конечной производительности обученной модели. Он проверяет, насколько хорошо модель может делать предсказания на совершенно новых, ранее не виденных данных.

Рис. 1. Как данные классифицируются в компьютерном зрении.
Топ-5 черт высококачественных наборов данных для компьютерного зрения#
Независимо от типа набора данных, высокое качество данных необходимо для создания успешных моделей компьютерного зрения. Вот некоторые из ключевых характеристик, которые делают набор данных качественным:
- Точность: в идеале данные должны точно отражать реальные ситуации и содержать правильные метки. Например, когда речь идет об искусственном интеллекте для здравоохранения, изображения рентгенограмм или сканирования должны быть точно размечены, чтобы помочь модели правильно учиться.
- Разнообразие: Хороший набор данных включает в себя множество примеров, помогающих модели хорошо работать в разных ситуациях. Например, если модель обучается обнаруживать автомобили, набор данных должен включать автомобили разных форм, размеров и цветов в различных условиях (день, ночь, дождь и т.д.).
- Консистентность: высококачественные наборы данных соответствуют единому формату и стандартам качества. Например, изображения должны иметь схожее разрешение (а не быть одни размытыми, а другие резкими) и проходить одинаковые этапы предобработки, такие как изменение размера или коррекция цвета, чтобы модель училась на согласованной информации.
- Актуальность: регулярно обновляемые наборы данных позволяют идти в ногу с реальными изменениями. Допустим, ты обучаешь модель для обнаружения всех типов транспортных средств. Если появляются новые, например электросамокаты, их нужно добавить в набор данных, чтобы гарантировать точность и актуальность модели.
- Конфиденциальность: если набор данных содержит конфиденциальную информацию, например фотографии людей, он должен соответствовать правилам конфиденциальности. Такие методы, как анонимизация (удаление идентифицирующих деталей) и маскирование данных (скрытие конфиденциальных частей), могут защитить конфиденциальность, позволяя при этом безопасно использовать данные.
Проблемы, вызванные низкокачественными данными#
Важно не только понимать черты высококачественных данных, но и осознавать, как низкое качество данных может повлиять на твои модели компьютерного зрения.
Такие проблемы, как переобучение и недообучение, могут серьезно повлиять на производительность модели. Переобучение происходит, когда модель хорошо работает на обучающих данных, но испытывает трудности с новыми или невидимыми данными, часто из-за нехватки разнообразия в наборе данных. Недообучение, с другой стороны, возникает, когда набор данных не предоставляет достаточно примеров или качества для того, чтобы модель могла выучить значимые закономерности. Чтобы избежать этих проблем, крайне важно поддерживать разнообразные, непредвзятые и высококачественные наборы данных, обеспечивая надежную работу как при обучении, так и в реальных приложениях.

Рис. 2. Недообучение против переобучения.
Данные низкого качества также могут затруднить извлечение и изучение моделью полезных признаков из сырых данных — процесс, известный как извлечение признаков. Если набор данных неполный, нерелевантный или в нем отсутствует разнообразие, модель может испытывать трудности с эффективной работой.
Иногда данные низкого качества являются результатом их упрощения. Упрощение данных может помочь сэкономить место для хранения и снизить затраты на обработку, но излишнее упрощение может удалить важные детали, необходимые модели для хорошей работы. Именно поэтому так важно поддерживать высокое качество данных на протяжении всего процесса компьютерного зрения, от сбора до развертывания. Как правило, наборы данных должны включать в себя важные признаки, оставаясь при этом разнообразными и точными, чтобы гарантировать надежность предсказаний модели.

Рис. 3. Понимание извлечения признаков.
Советы по поддержанию качества набора данных для компьютерного зрения#
Теперь, когда мы поняли важность высококачественных данных и влияние низкого качества, давай разберемся, как гарантировать соответствие твоего набора данных высоким стандартам.
Все начинается с надежного сбора данных. Использование разнообразных источников, таких как краудсорсинг, данные из разных географических регионов и генерация синтетических данных, снижает предвзятость и помогает моделям справляться с реальными сценариями. После сбора данных критически важна предварительная обработка. Такие методы, как нормализация, которая масштабирует значения пикселей в согласованный диапазон, и аугментация, которая применяет такие трансформации, как поворот, отражение и масштабирование, улучшают набор данных. Эти шаги помогают твоей модели лучше обобщать и становиться более устойчивой, снижая риск переобучения.
Правильное разделение наборов данных — еще один ключевой шаг. Общий подход заключается в выделении 70% данных на обучение, 15% на валидацию и 15% на тестирование. Проверка отсутствия пересечений между этими множествами предотвращает «утечку данных» и обеспечивает точную оценку модели.

Рис. 4. Распространенное разделение данных на обучение, валидацию и тестирование.
Ты также можешь использовать предобученные модели, такие как YOLO11, чтобы сэкономить время и вычислительные ресурсы. YOLO11, обученная на больших наборах данных и разработанная для различных задач компьютерного зрения, может быть дообучена на твоем конкретном наборе данных в соответствии с твоими потребностями. Настроив модель под свои данные, ты сможешь избежать переобучения и сохранить высокую производительность.
Будущее наборов данных для компьютерного зрения#
ИИ-сообщество традиционно фокусировалось на улучшении производительности путем создания более глубоких моделей с большим количеством слоев. Однако по мере дальнейшего развития ИИ фокус смещается с оптимизации моделей на улучшение качества наборов данных. Эндрю Нг, которого часто называют «отцом ИИ», считает, что «самым важным сдвигом, через который миру ИИ предстоит пройти в этом десятилетии, станет переход к ИИ, ориентированному на данные».
Этот подход делает упор на доработку наборов данных путем повышения точности разметки, удаления шумных примеров и обеспечения разнообразия. Для компьютерного зрения эти принципы критически важны для решения проблем предвзятости и низкого качества данных, позволяя моделям надежно работать в реальных условиях.
Заглядывая в будущее, прогресс компьютерного зрения будет опираться на создание меньших по размеру высококачественных наборов данных, а не на сбор огромных объемов данных. По словам Эндрю Нг, «улучшение данных — это не разовый шаг предобработки; это ключевая часть итеративного процесса разработки моделей шинного обучения / машинного обучения» [Примечание: machine learning переведено стандартно]. Сфокусировавшись на принципах, ориентированных на данные, компьютерное зрение продолжит становиться более доступным, эффективным и влиятельным в различных отраслях.
Основные выводы#
Данные играют важнейшую роль на протяжении всего жизненного цикла модели зрения. От сбора данных до предобработки, обучения, валидации и тестирования — качество данных напрямую влияет на производительность и надежность модели. Отдавая приоритет качеству данных и точной разметке, мы можем создавать надежные модели компьютерного зрения, которые обеспечивают точные и стабильные результаты.
Двигаясь к будущему, управляемому данными, важно учитывать этические аспекты, чтобы снизить риски, связанные с предвзятостью и правилами конфиденциальности. В конечном итоге обеспечение целостности и справедливости данных — это ключ к раскрытию полного потенциала технологий компьютерного зрения.
Присоединяйся к нашему сообществу и загляни в наш репозиторий на GitHub, чтобы узнать больше об ИИ. Посмотри страницы наших решений, чтобы изучить другие варианты применения ИИ в таких секторах, как сельское хозяйство и производство.






