Action Recognition
Узнай, как распознавание действий выявляет поведение на видео. Научись использовать Ultralytics YOLO26 для оценки позы и создания интеллектуальных систем ИИ для задач HAR.
Распознавание действий, также часто называемое распознаванием активности человека (HAR), — это динамично развивающееся направление в области компьютерного зрения (CV), связанное с выявлением и классификацией определённых действий или движений, выполняемых людьми на видеоданных. Если традиционное обнаружение объектов отвечает на вопрос «что находится на изображении?», то распознавание действий рассматривает более сложный вопрос: «что происходит с течением времени?». Анализируя последовательности кадров, а не статичные изображения, модели машинного обучения (ML) могут различать сложные действия, такие как «ходьба», «езда на велосипеде», «падение» или «рукопожатие», что делает распознавание действий важнейшим компонентом интеллектуальных систем, способных понимать намерения и контекст поведения человека.
Основные концепции и методы#
Для распознавания действий модель должна обрабатывать как пространственную информацию (как выглядят объекты или люди), так и временную информацию (как они перемещаются во времени). Для этого современные системы искусственного интеллекта (AI) часто используют специализированные архитектуры, выходящие за рамки стандартных свёрточных нейронных сетей (CNNs).
- Оценка позы: мощный метод, при котором модель отслеживает определённые ключевые точки на теле человека, например локти, колени и плечи. Геометрические изменения этих ключевых точек во времени дают сильный сигнал для классификации действий независимо от фоновых помех.
- Временное моделирование: алгоритмы используют такие структуры, как рекуррентные нейронные сети (RNNs) или сети с долговременной краткосрочной памятью (LSTM), чтобы запоминать предыдущие кадры и предсказывать будущие действия. В последнее время видеотрансформеры стали популярны благодаря способности обрабатывать зависимости на больших временных интервалах в видеопотоках.
- Двухпотоковые сети: этот подход обрабатывает пространственные признаки (кадры RGB) и временные признаки (часто с использованием оптического потока) в параллельных потоках, объединяя данные для итоговой классификации.
Практические применения#
Способность автоматически интерпретировать движения человека обладает преобразующим потенциалом в различных отраслях, повышая безопасность, эффективность и удобство для пользователей.
- AI в здравоохранении: распознавание действий имеет большое значение для систем мониторинга пациентов. Например, оно обеспечивает автоматическое обнаружение падений в домах престарелых и немедленно предупреждает персонал, если пациент падает. Эта технология также используется в дистанционной физической реабилитации, где AI-тренеры анализируют технику выполнения упражнений пациентом, чтобы убедиться, что он выполняет движения правильно и безопасно.
- Интеллектуальное видеонаблюдение и безопасность: помимо простого обнаружения движения, современные системы безопасности используют распознавание действий для выявления подозрительного поведения, например драк, краж в магазинах или несанкционированного проникновения, игнорируя при этом безобидные действия. Это сокращает число ложных тревог и улучшает мониторинг безопасности в реальном времени.
Реализация анализа действий с помощью Ultralytics#
Распространённый рабочий процесс включает сначала обнаружение людей и их скелетных поз, а затем анализ движений соответствующих суставов. Модель Ultralytics YOLO26 обеспечивает передовые скорость и точность на начальном этапе оценки позы, который служит основой для многих конвейеров распознавания действий.
В следующем примере показано, как извлечь скелетные ключевые точки из кадра видео с помощью Python:
from ultralytics import YOLO
# Load the YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect person keypoints
results = model("https://ultralytics.com/images/bus.jpg")
# Process results
for result in results:
# Access the keypoints (x, y, visibility)
if result.keypoints is not None:
print(f"Detected keypoints shape: {result.keypoints.data.shape}")Различия между связанными терминами#
Важно отличать распознавание действий от схожих задач компьютерного зрения, чтобы применять правильные методы.
- Распознавание действий и отслеживание объектов: отслеживание объектов направлено на сохранение идентичности конкретного объекта или человека при их перемещении между кадрами (например, «человек A находится в координате X»). Распознавание действий интерпретирует поведение отслеживаемого объекта (например, «человек A бежит»).
- Распознавание действий и понимание видео: если распознавание действий выявляет конкретные физические действия, то понимание видео — это более широкое понятие, включающее осмысление всего повествования, контекста и причинно-следственных связей в видеосцене.
Проблемы и будущие тенденции#
Разработка надёжных моделей распознавания действий сопряжена с трудностями, особенно из-за необходимости использовать большие размеченные наборы видеоданных, такие как Kinetics-400 или UCF101. Разметка видеоданных занимает значительно больше времени, чем разметка статичных изображений. Для решения этой задачи такие инструменты, как Ultralytics Platform, помогают оптимизировать рабочий процесс разметки и обучения.
Кроме того, критически важна вычислительная эффективность. Обработка видео высокого разрешения в реальном времени требует значительных аппаратных ресурсов. Отрасль всё активнее переходит к периферийному AI, оптимизируя модели для непосредственного запуска на камерах и мобильных устройствах, чтобы снизить задержку и расход пропускной способности. Будущие достижения направлены на улучшение обобщающей способности моделей, позволяя системам распознавать действия даже с точек обзора, на которых они явно не обучались.









