Embodied AI
探索具身 AI,了解智能系统如何与物理世界交互。了解如何利用 Ultralytics YOLO26 赋能机器人感知。
具身 AI 代表着从被动算法到智能系统的一次重大转变,这些智能系统能够在物理或模拟的 3D 环境中感知、推理并进行交互。不同于完全在静态数据集上运行的传统机器学习模型,这些系统拥有一个“身体”——无论是实体机器人底盘还是虚拟化身——使其能够执行动作,并从持续的环境反馈中学习。通过将传感器输入与智能决策相结合,具身智能体弥合了数字计算与现实世界执行之间的鸿沟。
具身系统如何感知世界#
这些动态系统的核心是先进的计算机视觉,它使智能体能够从空间角度理解周围环境。为了安全且有效地导航,具身智能体高度依赖实时目标检测和持续的姿态估计。开发者为这些智能体构建神经通路时,通常会集成PyTorch 生态系统或TensorFlow 部署工具中的深度学习框架,以处理复杂的空间数据。
为了实现真正的自主性,这些系统越来越多地将视觉语言模型与强大的实时推理引擎结合使用。这使 AI 不仅能够识别杯子,还能理解诸如“拿起桌边的红色杯子”这样的复杂指令。斯坦福大学以人为本的人工智能研究院(HAI)等机构的研究仍在不断拓展这些智能体融合多感官数据的能力边界。
区分相关的人工智能术语#
理解这一领域需要将其与密切相关的概念区分开来:
- 机器人技术:机器人技术主要关注机械硬件、执行器和电机控制。具身 AI 提供了认知软件层,使硬件实现自主运行,这一点在Boston Dynamics 的 Atlas 机器人等项目中有所体现。
- 物理 AI:虽然这两个术语经常互换使用,但物理 AI 严格要求具有实体的现实世界硬件。具身 AI 的范围更广,还包括在NVIDIA 的 Isaac 机器人平台这类模拟 3D 物理环境中训练的虚拟智能体。
- AI 智能体:传统 AI 智能体在数字空间中运行(例如浏览网页或编写代码)。具身智能体则专门用于处理空间维度、物理约束和连续的感知流。
实际应用#
将认知推理与物理动作相结合,已经推动了多个行业中的变革性应用,这些应用在ACM 的 AI 研究数字图书馆中有大量记录。
- 自动驾驶汽车:自动驾驶汽车依靠具身智能在城市街道上导航。它们持续处理激光雷达和摄像头数据,以解读交通标志和行人移动方式,类似于Waymo 的自动驾驶技术与动态城市环境进行安全交互。
- 智能制造:配备Ultralytics YOLO26模型的机械臂能够执行复杂的装配线任务。它们可以动态识别、抓取并分拣有缺陷的零件,体现了近期DeepMind 机器人研究所探讨的原理。
- 农业无人机:无人驾驶飞行器利用空间感知能力监测作物健康状况,并仅在需要的地方智能喷洒资源,从而减少浪费并提高产量。
为具身智能体构建感知能力#
构建这些物理系统的开发者通常会利用Ultralytics Platform标注动态的训练数据,并将轻量级的边缘 AI模型无缝部署到低功耗硬件上。
下面的 Python 示例演示了机器人智能体如何使用视觉模型,持续检测其环境中的可交互对象。
from ultralytics import YOLO
# Load the lightweight YOLO26 model designed for real-time edge hardware
model = YOLO("yolo26n.pt")
# Perform continuous object detection on a robotic camera feed
results = model.predict(source="camera_feed.mp4", stream=True)
# Process the spatial bounding boxes to guide robotic interaction
for r in results:
print(f"Detected {len(r.boxes)} objects ready for physical interaction.")随着硬件设计和认知建模领域不断成熟——在Anthropic 关于 AI 安全的研究和OpenAI 最新推理模型等对齐工作的指导下——具身系统将继续从研究实验室走入日常环境,这一点也经常在IEEE Spectrum 的机器人报道中得到强调。






