Улучшение прогнозирования столкновений с помощью моделей Ultralytics YOLO
Узнай, как идеи, полученные с помощью моделей Ultralytics YOLO, помогают системам прогнозирования столкновений принимать более безопасные и быстрые решения в динамичных средах.

Даже если ты осторожен на дороге, аварии все равно случаются. Машина меняет полосу, пешеход переходит дорогу в неположенном месте или велосипедист ускоряется без предупреждения. Такие повседневные моменты — это ситуации, когда системы прогнозирования столкновений могут действительно помочь и обеспечить безопасность для всех.
Ранее мы рассматривали ball trajectory prediction и видели, как прогнозирование траектории быстро движущегося мяча помогает спортивной аналитике понимать движение и предвидеть следующие события. Прогнозирование столкновений работает аналогичным образом.
Эти системы прогнозирования по сути заглядывают в будущее. Наблюдая за движением транспортных средств и пешеходов, они могут своевременно выявлять риски и корректировать путь или поведение (что также называют планированием движения или планированием пути) до того, как ситуация примет опасный оборот.
Ключевыми технологиями компьютерных наук, лежащими в основе систем прогнозирования столкновений, являются искусственный интеллект и его подразделы, такие как computer vision и методы прогнозирования, которые помогают предсказывать перемещение объектов. Например, модели компьютерного зрения, такие как Ultralytics YOLO11 и грядущая Ultralytics YOLO26, могут использоваться для обнаружения и отслеживания в реальном времени таких объектов, как транспортные средства и пешеходы, а модели прогнозирования используют эти данные для оценки их дальнейших перемещений.

Рис. 1. Пример использования YOLO11 для обнаружения объектов на дороге (Source).
Результатом является система ИИ, которая понимает происходящее вокруг и помогает принимать более разумные решения в динамичных средах. В этой статье мы разберем, как работает прогнозирование столкновений, какие методы лежат в его основе, а также какую роль в этом процессе играют компьютерное зрение и модели Ultralytics YOLO. Давай приступим!
Что такое прогнозирование столкновений?#
Прогнозирование столкновений — это способность системы ИИ понимать, как движутся объекты, и предвидеть, когда они могут опасно сблизиться или столкнуться. Различные системы могут использовать эту информацию по-разному, включая поддержку функций безопасности, оптимизацию движения или координацию действий в общих пространствах.
Везде, где объекты перемещаются в общем пространстве — будь то машины на шоссе, forklifts in a warehouse проходы на складе или пешеходы, переходящие улицу, — прогнозирование столкновений помогает системам понимать, как могут развиваться эти взаимодействия. В приложениях, ориентированных на безопасность, это предвидение можно использовать для снижения рисков, в то время как в других сценариях оно может поддерживать такие задачи, как планирование маршрута, расчет времени или координированное движение.
Например, во многих новых автомобилях, оснащенных усовершенствованными системами помощи водителю (ADAS), камеры и датчики следят за дорогой и оценивают скорость приближения автомобиля к близлежащим объектам. Если система обнаруживает, что ситуация становится небезопасной, она предупреждает водителя, а в некоторых случаях автоматическое торможение может помочь уменьшить последствия удара.
Изучаем четыре этапа прогнозирования столкновений#
Прогнозирование столкновений включает в себя скоординированный процесс, в котором различные компоненты ИИ работают вместе для идентификации объектов, отслеживания их движения и оценки того, что может произойти дальше. Эти системы обычно работают через четыре связанных этапа: обнаружение объектов, отслеживание объектов, прогнозирование траектории и, наконец, прогнозирование столкновений, где каждый этап опирается на точность предыдущего.
Давай подробнее рассмотрим, как работает каждый этап.
Взгляд на обнаружение объектов#
Object detection — это базовая задача компьютерного зрения, в которой модели ИИ для работы с визуальными данными идентифицируют и локализуют объекты на изображении или видеокадре. Анализируя данные пикселей, модель обнаружения объектов может выдавать три основных результата: ограничивающие рамки, классы объектов и оценки уверенности. Ограничивающие рамки показывают, где находится объект, классы объектов указывают, что это такое (например, автомобиль, пешеход или велосипедист), а оценки уверенности отражают степень уверенности модели в прогнозе.
Модели компьютерного зрения, такие как YOLO11 и YOLO26, опираются на этот фундамент и поддерживают несколько связанных задач, включая обнаружение объектов, их отслеживание и обнаружение с помощью ориентированных ограничивающих рамок (OBB). Обнаружение объектов сообщает системе, что находится в каждом кадре, отслеживание сопровождает эти объекты по мере их перемещения, а ориентированные ограничивающие рамки обеспечивают более точные контуры для объектов, расположенных под разными углами.
На данном этапе система прогнозирования столкновений сфокусирована исключительно на понимании того, что присутствует в визуальных данных. Это формирует базовый уровень информации, от которого зависят все последующие шаги, но здесь еще не учитывается, как объекты будут двигаться или взаимодействовать.
Обзор отслеживания объектов#
После обнаружения объектов следующим шагом является их отслеживание по кадрам, чтобы система понимала, как они перемещаются с течением времени. В то время как обнаружение предоставляет новые ограничивающие рамки для каждого кадра, object tracking обеспечивает непрерывность, связывая эти обнаружения во времени.
Алгоритмы отслеживания, поддерживаемые Ultralytics Python package, такие как ByteTrack или BoT-SORT, работают в паре с такими моделями, как YOLO11, используя данные обнаружения из каждого кадра для сопровождения движущихся объектов. Эти алгоритмы присваивают каждому объекту уникальный идентификатор и используют его для сохранения этой идентичности даже тогда, когда объект движется быстро или частично скрывается из виду. Это создает плавную историю отслеживания, которая фиксирует траекторию движения объекта.

Рис. 2. Пример присвоения уникальных идентификаторов для различных обнаружений с помощью YOLO (Source)
Вот краткий обзор того, как работают эти два метода отслеживания:
- ByteTrack: Использует как обнаружения с высокой, так и с низкой степенью уверенности для поддержания постоянных ID объектов, а прогнозы движения из фильтра Калмана помогают трекеру оставаться стабильным, когда объекты движутся быстро или их трудно обнаружить в течение короткого времени.
- BoT-SORT: Этот алгоритм расширяет SORT, объединяя прогнозы движения фильтра Калмана с визуальными признаками, что позволяет трекеру более надежно сопровождать объекты в людных сценах или при частичном перекрытии.
Чтобы измерить эффективность этих методов отслеживания, исследователи оценивают их на стандартных наборах данных и бенчмарках для многоцелевого отслеживания (MOT). Также широко используются метрики: точность многоцелевого отслеживания (MOTA), которая отражает общее качество трекинга; идентификационный F1-балл (IDF1), измеряющий постоянство идентификации объектов; и точность отслеживания высшего порядка (HOTA), которая предлагает сбалансированный взгляд как на качество обнаружения, так и на точность ассоциации.
Понимание прогнозирования траектории#
После отслеживания объекта по нескольким кадрам следующим шагом является прогноз того, куда он направится дальше. Это называется прогнозированием траектории. Пока обнаружение находит объекты, а отслеживание фиксирует их перемещение, прогнозирование заглядывает вперед и оценивает их будущие позиции.
Информация от обнаружения и отслеживания, такая как ограничивающая рамка объекта, положение между кадрами и присвоенный ID, может быть использована для расчета характеристик движения: скорости, направления и паттернов перемещения. Эти производные данные дают модели прогнозирования информацию, необходимую для оценки того, где объект, скорее всего, окажется в ближайшие несколько секунд.
В случаях, когда данные отслеживания содержат пропуски или резкие скачки, методы интерполяции помогают восстановить более плавные и последовательные траектории. Это гарантирует, что модель прогнозирования получит качественные входные данные о движении вместо зашумленных или неполных данных о положении.

Рис. 3. Визуализация прогнозирования траектории движения автомобиля. (Source)
Для выполнения этих прогнозов многие системы полагаются на модели глубокого обучения, предназначенные для понимания того, как меняется движение объекта с течением времени. Анализируя последовательности прошлых позиций и производные от них признаки движения, эти модели изучают общие паттерны перемещения и используют эти знания для прогнозирования будущих путей.
Вот некоторые часто используемые подходы глубокого и машинного обучения для прогнозирования траектории:
-
Рекуррентные нейронные сети (RNN): RNN — это модели глубокого обучения, предназначенные для работы с последовательностями, например, с рядом видеокадров. Они могут сохранять память о прошлых позициях и использовать эту информацию для понимания того, как перемещался объект. Это помогает системе распознавать простые паттерны движения, такие как ускорение, замедление или движение по прямой линии.
-
Long Short-Term Memory Networks (LSTMs): LSTM — это более продвинутый тип рекуррентных нейросетей, способный запоминать информацию в течение более длительных периодов времени. Это позволяет им улавливать более сложные движения, такие как подготовка автомобиля к повороту или изменение направления движения пешехода. Поскольку они могут отслеживать более долгосрочные тенденции, они часто выдают более надежные прогнозы в условиях интенсивного движения.
-
Transformers: Трансформеры обрабатывают полные последовательности движений и используют механизм внимания, чтобы сосредоточиться на наиболее важных деталях этих последовательностей. Это делает их особенно эффективными в ситуациях, когда взаимодействуют несколько объектов, например при слиянии потоков машин или пересечении путей пешеходов.
Эти модели могут предсказывать как краткосрочные, так и долгосрочные пути. Краткосрочные прогнозы (обычно до двух секунд) как правило наиболее точны, в то время как прогнозы на более длинные окна (от двух до шести секунд) обеспечивают большее предвидение, но сопровождаются большей неопределенностью.
Подводим итоги: Алгоритмы обнаружения столкновений#
На финальном этапе, прогнозировании столкновений, система использует всё, что узнала ранее: что представляет собой каждый объект (обнаружение), как он двигался (отслеживание) и где он, вероятно, окажется (прогнозирование). Этот этап проверяет, могут ли какие-либо из прогнозируемых путей пересечься таким образом, что это приведет к столкновению.

Рис. 4. Как работает система прогнозирования столкновений (Source)
В случае автономных транспортных средств система проверки столкновений сравнивает будущие траектории близлежащих объектов, таких как автомобили, пешеходы и велосипедисты. Если два прогнозируемых пути перекрываются или опасно сближаются, она отмечает ситуацию как потенциальное столкновение транспортных средств. Чтобы понять, насколько срочным может быть риск столкновения, система также вычисляет значение, известное как время до столкновения (TTC).
Время до столкновения (TTC) — это ключевой показатель в быстро меняющихся средах. Он оценивает, сколько времени осталось до момента, когда два объекта столкнутся, если продолжат двигаться с текущими скоростями и направлениями. Когда TTC опускается ниже определенного порога, система может отреагировать, выдав предупреждения, применив торможение или скорректировав запланированный путь.
Практическое применение прогнозирования столкновений#
Прогнозирование столкновений становится критически важным во многих отраслях, включая управление движением, инфраструктуру «умного города», промышленную автоматизацию и мобильную робототехнику. По мере того как современные модели компьютерного зрения и прогнозирования продолжают развиваться, эти системы становятся все более способными к предвидению движения.
Теперь, когда у нас есть лучшее понимание того, как работают прогнозирование столкновений и траектории, давай взглянем на некоторые интересные исследования, демонстрирующие, как эти методы могут применяться в различных реальных условиях.
Прогнозирование столкновений на базе YOLO для автономных машин экстренных служб#
Навигация в людных, непредсказуемых условиях — одна из самых сложных задач для автономных систем, особенно когда пешеходы двигаются способами, которые не поддаются четким закономерностям. Машины экстренных служб сталкиваются с этой проблемой еще чаще, так как им нужно быстро перемещаться на высокой скорости через плотные общественные пространства, не полагаясь на структурированные дороги, разметку полос или предсказуемое поведение пешеходов.
В таких сценариях понимание того, где находятся люди и как они могут двигаться в ближайшие несколько секунд, становится критически важным для предотвращения аварий. Например, в недавнем исследовании эта задача решалась путем создания полноценного конвейера collision prediction pipeline для автономного автомобиля экстренных служб (EAV), работающего в условиях большого скопления пешеходов.
Как работает конвейер прогнозирования столкновений на базе YOLO#
Вот краткий обзор того, как работает эта методология:
- Обнаружение пешеходов с помощью YOLO: Детектор на основе YOLO идентифицирует пешеходов в каждом кадре камеры и выводит ограничивающие рамки для каждого видимого человека.
- Отслеживание движения с помощью ByteTrack: Алгоритм ByteTrack связывает эти обнаружения между кадрами, давая каждому пешеходу постоянный ID и создавая историю движения, которая показывает, как они перемещаются во времени.
- Оценка положения в реальном мире: Обратное перспективное отображение (IPM) преобразует 2D-координаты пикселей в примерные положения на наземной плоскости, помогая системе понять, где находятся пешеходы в реальном пространстве относительно автомобиля.
- Генерация вида сверху с использованием cGAN: Условная GAN, модель ИИ, которая переводит один формат изображения в другой, создает представление сцены с высоты птичьего полета. Такая компоновка сверху облегчает интерпретацию положений пешеходов и их окружения.
- Прогноз траектории с помощью модели LSTM: Используя прошлые позиции и паттерны движения каждого пешехода, модель LSTM предсказывает, куда они, скорее всего, направятся в ближайшие несколько секунд.
- Эффективное обнаружение столкновений с использованием конусов столкновений: Прогнозируемые траектории сравниваются с использованием метода конусов столкновений, который определяет, пересекаются ли пути автомобиля и пешеходов.
- Предотвращение столкновений через сигналы: Если система прогнозирует столкновение, она активирует звуковой сигнал (например, гудок или звонок) в оптимальный момент. Время выбирается так, чтобы повлиять на поведение пешехода и дать ему шанс ускориться или замедлиться, чтобы оказаться в безопасности.
Обеспечение безопасности пешеходов в городах с помощью периферийного зрения и YOLO#
Аналогично, другой подход к предотвращению столкновений выходит за рамки транспортных средств и фокусируется на самой инфраструктуре. Вместо того чтобы полагаться на датчики внутри автомобиля, этот метод использует умные камеры, установленные на переходах и перекрестках, для мониторинга движения пешеходов и автомобилей в режиме реального времени. Эти локации часто непредсказуемы: люди могут внезапно выйти на дорогу, велосипедисты могут маневрировать в потоке, а водители не всегда притормаживают, поэтому раннее обнаружение рисков критически важно.
В одном интересном исследовании эта идея была реализована с помощью системы под названием NAVIBox — устройства периферийного компьютерного зрения, предназначенного для прогнозирования рисков столкновения автомобилей с пешеходами непосредственно на перекрестке. В системе используется модель Ultralytics YOLOv8 для обнаружения пешеходов и транспортных средств, а также легковесный центроидный трекер для их сопровождения по кадрам. Это позволяет получать короткую и надежную историю движения, которая затем уточняется с помощью проективного преобразования, переводящего угловой вид с камеры видеонаблюдения в более наглядную схему дороги с высоты птичьего полета.
Имея эти уточненные траектории, NAVIBox может оценить, как участники дорожного движения, вероятно, будут двигаться в ближайшие секунды, и проверить, могут ли их пути пересечься (также называемое тестом пересечения). Когда система обнаруживает рискованное взаимодействие, она немедленно отправляет предупреждения через дисплеи для водителей и динамики для пешеходов — без использования удаленного сервера или сетевого соединения. Тестирование в реальных городских условиях показало, что NAVIBox работает достаточно быстро для ответа в истинном режиме реального времени и может точно идентифицировать потенциальные сценарии столкновений, что делает его практичным инструментом безопасности для оживленных городских перекрестков.

Рис. 5. Прогнозирование риска столкновения между транспортными средствами и пешеходами. (Source)
Плюсы и минусы обнаружения и прогнозирования столкновений#
Вот некоторые преимущества использования систем прогнозирования столкновений на базе ИИ:
-
Улучшает ситуационную осведомленность: Системы ИИ непрерывно картируют, как объекты перемещаются в среде, обеспечивая более глубокое понимание крупномасштабных потоков толпы, поведения трафика или путей движения машин.
-
Данные для долгосрочного планирования: Логируя обнаружения, опасные ситуации и паттерны перемещения, системы ИИ предоставляют аналитику, которую городские планировщики, команды безопасности и операторы автопарков могут использовать для перепроектирования перекрестков, улучшения разметки или уточнения операционных политик.
-
Экономически эффективная профилактика рисков: Обнаруживая риски до того, как они обострятся, эти системы позволяют избежать дорогостоящих аварий, страховых выплат или ремонтов оборудования.
Несмотря на преимущества, системы предотвращения столкновений также сталкиваются с определенными ограничениями. Вот несколько проблем, которые стоит учитывать:
- Ограничения размещения датчиков и камер: Неправильно расположенные или установленные под неудобным углом камеры могут искажать размер объектов или расстояние до них, делая оценку глубины и прогнозирование траектории менее надежными.
- Перекрытие (окклюзия): Объекты могут быть частично или полностью скрыты другими. Это затрудняет отслеживание объектов, так как модель теряет визуальную непрерывность.
- Условия окружающей среды: Низкое освещение, яркое солнце, дождь, туман или плохое качество камеры могут снизить способность модели четко видеть сцену, влияя на точность.
Основные выводы#
Прогнозирование столкновений объединяет две мощные возможности: компьютерное зрение, которое позволяет системам понимать, что происходит в окружающей среде прямо сейчас, и прогнозирование траектории, которое помогает им предугадывать, что, скорее всего, произойдет дальше.
Объединив эти сильные стороны, машины могут обнаруживать движущиеся объекты в реальном времени и предсказывать, как эти объекты могут взаимодействовать в ближайшие секунды. По мере дальнейшего развития методов компьютерного зрения и прогнозирования, прогнозирование столкновений, вероятно, станет ключевым элементом для создания более безопасных, надежных и масштабируемых автономных систем.
Загляни в наше community и GitHub repository, чтобы узнать больше об искусственном интеллекте. Изучай такие приложения, как AI in healthcare и computer vision in manufacturing на наших страницах решений. Открой для себя наши licensing options и наччи создавать уже сегодня!






