Pose Estimation
Узнай, как оценка позы (pose estimation) использует ключевые точки для отслеживания движения. Исследуй реальные приложения и начни работу с Ultralytics YOLO26 для быстрых и точных результатов.
Оценка позы — это специализированный метод компьютерного зрения, который выходит за рамки простого обнаружения присутствия объектов и направлен на понимание их геометрической структуры и физической ориентации. В то время как стандартное object detection рисует простой прямоугольный бокс вокруг объекта, оценка позы определяет специфические семантические точки, известные как keypoints, такие как суставы человеческого тела (локти, колени, плечи) или структурные углы транспортного средства. Сопоставляя эти ориентиры, модели machine learning могут реконструировать скелетное представление объекта, позволяя системам интерпретировать язык тела, динамику движений и точное положение в двумерном или трехмерном пространстве.
Основные механизмы: сверху вниз и снизу вверх#
Современная оценка позы во многом опирается на сложные архитектуры deep learning, часто используя Convolutional Neural Networks (CNNs) для обработки визуальных данных. Алгоритмы обычно следуют одной из двух основных стратегий для определения ключевых точек:
- Нисходящие подходы: Этот метод сначала использует модель обнаружения объектов для определения отдельных экземпляров внутри bounding boxes. После того как человек или объект вырезается из общего изображения, средство оценки позы прогнозирует ключевые точки в этой конкретной области. Этот подход часто обладает высокой точностью, но может страдать от большей inference latency по мере увеличения числа объектов в кадре.
- Восходящие подходы: И наоборот, эта стратегия одновременно обнаруживает все потенциальные ключевые точки на всем изображении (например, находя каждое «левое колено» в толпе), а затем использует алгоритмы ассоциации для их группировки в отдельные скелеты. Этот метод обычно предпочтителен для real-time inference в многолюдных сценариях, поскольку вычислительные затраты остаются относительно постоянными независимо от количества присутствующих людей.
Современные модели, такие как YOLO26, используют передовые сквозные архитектуры, которые балансируют эти потребности, обеспечивая высокоскоростную оценку позы, подходящую для развертывания на устройствах edge AI и мобильных платформах.
Разграничение связанных терминов компьютерного зрения#
Полезно отличать оценку позы от других задач визуального распознавания, чтобы понять ее уникальную ценность в рабочих процессах computer vision:
- Object Detection: Фокусируется на определении того, что представляет собой объект и где он находится, выдавая прямоугольный бокс. Он рассматривает объект как жесткое целое без понимания его внутренней артикуляции.
- Instance Segmentation: Генерирует идеальную маску по пикселям, обводящую точную форму объекта. Хотя сегментация предоставляет границы, она явно не определяет суставы или скелетные соединения, необходимые для kinematic analysis.
- Pose Estimation: Нацелена конкретно на внутреннюю структуру, сопоставляя связи между предопределенными ориентирами (например, от бедра до колена) для анализа осанки и действий.
Реальные приложения#
Способность оцифровывать движения людей и объектов привела к революционным применениям в различных отраслях, часто при обучении с использованием таких инструментов, как Ultralytics Platform для управления крупными наборами данных с аннотированными ключевыми точками.
Здравоохранение и реабилитация#
В медицинской сфере AI in healthcare использует оценку позы для удаленного мониторинга реабилитации пациентов. Отслеживая углы в суставах и амплитуду движений, автоматизированные системы могут гарантировать, что пациенты правильно выполняют physical therapy exercises дома. Это снижает риск повторной травмы и позволяет клиницистам количественно оценивать прогресс восстановления без необходимости использования дорогостоящего лабораторного оборудования.
Спортивная аналитика#
Тренеры и спортсмены используют sports analytics для оптимизации результатов. Модели оценки позы могут анализировать плоскость удара гольфиста, длину шага бегуна или биомеханику питчера без необходимости использования навязчивых костюмов с маркерами, применяемых в традиционном motion capture. Это обеспечивает немедленную обратную связь на основе данных для улучшения техники и предотвращения травм от перенапряжения.
Розничная торговля и поведенческий анализ#
В коммерческой среде системы AI in retail используют обнаружение позы для понимания поведения клиентов, такого как тянуться за товарами на верхних полках или задерживаться в определенных проходах. Эти данные помогают оптимизировать планировку магазинов и улучшить inventory management за счет сопоставления физических действий с решениями о покупке.
Пример кода: Оценка позы с помощью Ultralytics YOLO26#
Внедрение оценки позы не представляет сложности при использовании современных фреймворков Python. Следующий пример демонстрирует, как использовать пакет ultralytics для загрузки предобученной модели YOLO26 (преемника YOLO11) и обнаружения ключевых точек человека на изображении.
from ultralytics import YOLO
# Load the YOLO26 pose model (nano version for speed)
model = YOLO("yolo26n-pose.pt")
# Perform inference on an image source
# The model identifies bounding boxes and specific keypoints (joints)
results = model("https://ultralytics.com/images/bus.jpg")
# Print the xy coordinates of detected keypoints
print(results[0].keypoints.xy)
# Visualize the skeletal results directly
results[0].show()





