Merged Reality
探索合并现实 (MR) 及其如何融合物理和数字世界。了解 Ultralytics YOLO26 如何通过实时目标检测和分割为 MR 提供支持。
混合现实(MR)也被广泛称为融合现实,它描述了物理世界与计算机生成的数字内容的融合。与纯粹的虚拟环境或增强环境不同,混合现实创造了一个无缝的空间,使物理对象和数字对象能够实时共存并交互。这项技术严重依赖先进的 computer vision 和空间计算来准确映射现实世界环境,使数字人工制品能够锚定在物理表面上并对物理变化做出反应。通过利用传感器、摄像头和深度学习算法,MR系统能够理解深度、几何形状和光照,从而创造出具有真实感并扎根于用户实际周围环境的沉浸式体验。
在 AI 和机器学习中的相关性#
混合现实的发展与人工智能的进步密不可分。为了成功融合数字世界和物理世界,系统必须对环境有复杂的理解。这就是 visual perception tasks 变得至关重要的地方。诸如 object detection 等技术使系统能够识别家具或人,而 SLAM (Simultaneous Localization and Mapping) 则使设备能够跟踪其相对于这些对象自身的位置。
现代MR应用程序利用 deep learning models 立即处理复杂的感官数据。例如,pose estimation 用于跟踪手部运动以实现手势控制,从而消除了对物理控制器的需求。此外,semantic segmentation 帮助系统区分地板、墙壁和桌子,确保数字角色走在地板上而不是漂浮穿过桌子。
实际应用#
融合现实通过增强生产力和沉浸式模拟培训,正在改变各行各业。
- 工业维护和培训: 在 manufacturing 中,技术人员佩戴将数字原理图叠加到物理机械上的MR头显。如果工人查看特定的发动机零件,系统会使用 real-time inference 来识别组件并在零件上直接显示维修说明或扭矩规范。这种免提指导减少了错误并加速了复杂的任务。
- 医疗手术和规划: 外科医生利用MR在手术过程中将3D medical imaging 扫描(如MRI或CT数据)直接叠加到患者身体上。这允许在不开大刀口的情况下对内部解剖结构进行精确可视化。通过集成 segmentation models,系统可以实时高亮显示特定的器官或肿瘤,从而协助导航并改善手术结果。
区分关键术语#
将融合现实与“XR”(扩展现实)领域中的相关概念区分开来非常重要:
- Augmented Reality (AR): AR通常将数字信息叠加到相机画面上(例如智能手机滤镜),而没有深度的空间交互。MR走得更远,它确保数字对象与现实世界进行物理交互(例如,一个数字球从真实桌子上弹开)。
- Virtual Reality (VR): VR创建一个完全合成的环境,完全阻断物理世界。MR则让用户保持在其物理环境中,同时对其进行增强。
应用计算机视觉实现 MR#
为了构建MR系统的基本组件(例如检测表面或对象以锚定数字内容),开发者通常使用高速检测模型。Ultralytics YOLO26 模型非常适合此用途,因为它具有低延迟和高准确性,这对于维持现实错觉至关重要。
以下示例演示了如何在视频流上执行 instance segmentation。在MR上下文中,此像素级遮罩可以定义数字角色的“可行走”区域。
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Predict on a video source to identify physical objects and their boundaries
# This data helps anchor digital assets to real-world objects
results = model.predict(source="room_scan.mp4", show=True, stream=True)
for result in results:
# Process masks to determine occlusion or physics interactions
if result.masks:
print(f"Detected {len(result.masks)} physical segments for interaction.")融合现实的未来#
随着硬件变得更轻以及 edge computing 功能的提升,预计MR将变得无处不在。generative AI 的集成可能会允许MR环境动态填充自身,从而自动创建现实世界空间的 digital twins。借助诸如 Ultralytics Platform 之类的工具,开发者可以轻松训练自定义模型来识别这些合并环境中的特定对象,从而突破我们在三维空间中与信息交互的界限。






