探索 Google Beam:新一代 3D 视频会议工具
了解 Google Beam,这是一款新一代 3D 视频会议工具。探索它如何利用 3D 成像和 AI 实现逼真且沉浸式的虚拟会议。

视频通话和虚拟会议让远程工作成为可能,帮助团队跨越国家和时区保持联系。它们已经成为我们生活中的日常组成部分,也改变了我们的沟通方式。
然而,尽管视频会议得到广泛使用,其背后的核心技术多年来基本没有变化。得益于近期的技术进步,视频会议平台开始转型,力求让体验更加自然和逼真。
有趣的是,Google 在年度开发者大会(Google I/O 2025)上推出了名为 Google Beam 的全新视频通信工具。Beam 运用人工智能 (AI)和 3D 视频会议技术,突破传统平面屏幕的限制,营造更加沉浸式、仿佛面对面的体验。

图 1. Google CEO Sundar Pichai 介绍 Google Beam(来源)。
事实上,Google Beam 的设计目标是让你感觉正在交谈的人就站在你面前。与普通视频通话不同,它能还原眼神交流等细微的人类互动线索,以及会随你的视角变化而变化的自然动作,而这些细节在平面屏幕上往往会丢失。
本文将深入探讨 Google Beam 是什么、它如何开发、如何工作以及有哪些应用。让我们开始吧!
从 Project Starline 到 Google Beam#
在进一步了解 Google Beam 之前,让我们先更好地了解它的前身 Project Starline。
Project Starline 于 Google I/O 2021 上首次推出,是一项旨在让远程交流更加逼真、仿佛身处同一房间的研究计划。它通过实时生成真人大小的3D 图像来实现这一目标。尽管这项技术引起了广泛关注,但它需要复杂的设置和笨重的硬件。

图 2. 了解 Project Starline(来源)。
多年来,随着技术不断进步,Google 持续改进软件并简化硬件。经过四年的开发,Project Starline 已演变为 Google Beam,成为更加紧凑且易于使用的解决方案。
Google Beam 运用 AI,通过生成更加逼真、具有 3D 效果的交谈对象图像来增强视频通话。它将普通的 2D 视频转换为会随不同角度调整的视图,有助于保持眼神交流,也让面部表情更容易看清。此外,它还包含实时翻译、头部跟踪和空间音频等功能。
Google Beam 概览#
Google Beam 的开发目标是无需增强现实 (AR) 或虚拟现实 (VR) 头显等额外配件即可运行。相反,它配备了内置显示屏、摄像头系统和用于创建 3D 视觉效果的硬件。这让视频通话相比典型的虚拟会议更加自然、舒适且引人入胜。

图 3. 使用 Google Beam 的示例(来源)。
Google Beam 如何创建逼真的虚拟会议#
既然我们已经讨论了 Google Beam 的诞生过程,下面让我们进一步了解它的工作原理。
沉浸式远程协作的图像采集#
一切都从采集视觉信息开始。Beam 使用六个高分辨率摄像头,同时从不同角度拍摄图像。
这些摄像头有助于实时跟踪面部特征、肢体语言和细微动作。AI 在其中发挥着关键作用:它会优化摄像头设置,并让所有视频流保持完美同步。这为下一阶段——数据处理做好了准备。
从 2D 图像到 3D 视频会议#
接下来,系统使用 AI 将六路 2D 摄像头视频流合并,实时生成画面中人物的 3D 模型。它并非简单地叠加 2D 图像,而是重建深度、阴影和空间关系,从而创建完整的 3D 数字孪生体。
为了构建这个 3D 模型,Beam 使用 AI 和计算机视觉技术,例如深度估计和运动跟踪。这些方法有助于确定人物与摄像头的距离、人物的移动方式以及身体姿态。借助这些数据,系统可以在 3D 空间中准确映射面部特征和身体部位。
Beam 背后的 AI 模型以每秒 60 帧 (FPS)的速度更新 3D 表示,以保持对话流畅逼真。它还会实时调整,以准确反映人物的动作。

图 4. Google Beam 的六个摄像头从不同角度采集图像(来源)。
Google Beam 的光场显示系统#
3D 模型通过光场显示屏显示在接收方的 Beam 系统上。与向双眼呈现相同图像的传统屏幕不同,光场显示屏会向每只眼睛发出略有不同的图像,模拟我们在现实生活中感知深度的方式。这能带来更加逼真、立体的视觉体验。

图 5. 通过 Google Beam 进行虚拟击掌(来源)。
实时毫米级精准头部跟踪#
Google Beam 最令人印象深刻的功能之一,是其实时 AI 跟踪能力。系统通过精准的头部和眼部跟踪,捕捉细微到最小程度的动作。
例如,Beam 的 AI 引擎可以持续跟踪用户的头部位置,并对图像进行细微的实时调整。这会让你感觉屏幕中的人确实坐在你的对面。当你移动头部时,3D 图像也会相应变化,就像真实的面对面交谈一样。
用于 AI 增强型虚拟通信的音频处理#
Beam 还会使用与人物屏幕位置相匹配的空间音效来改善音频体验。如果某人在显示屏左侧,他的声音听起来就像是从左侧传来。当他改变位置时,音频也会随之调整。这让对话感觉更加自然,也帮助你的大脑无需额外努力就能判断是谁在说话。
这通过将定向音频技术与实时跟踪相结合来实现。Beam 使用空间音频模拟我们在现实世界中自然感知声音的方式(取决于声音传来的方向以及它到达每只耳朵的方式)。系统还会跟踪观看者的头部动作,并相应调整音频输出,让声音始终“附着”在屏幕中的人物身上。
Google Beam 的应用#
Google Beam 虽然仍处于早期阶段,但在视频会议领域展现出了很大的潜力。以下是它的一些主要应用:
- **远程协作:**Google Beam 可以让会议,尤其是领导层讨论或高风险谈判,感觉更加私人化且更有效。通过捕捉肢体语言和眼神交流等细微因素,它能帮助人们即使相隔很远,也感觉彼此更近在场。
- 教育**:**Beam 有望让虚拟学习更加精彩且易于参与。想象一下,一位科学家向远在世界另一端的学生进行现场授课,而学生感觉他仿佛就在同一个房间里。
- 医疗保健**:**Beam 可以让远程问诊感觉更加亲切。当医生和患者能够清楚地看到彼此并进行自然的眼神交流时,这有助于建立信任,也让互动更具人情味。
- **创意产业:**对于动画师、艺术家和制片人等创意领域从业者来说,Beam 可以让远程协作变得更加轻松自然。无论是头脑风暴还是评审项目,体验都更像是一起坐在工作室里,而不是进行视频通话。
Google Beam 的优缺点#
下面是 Google Beam 这类创新带来的一些主要优势:
- **无需头显:**与许多沉浸式技术不同,Beam 无需AR 或 VR 头显即可运行。这让体验更加舒适,也避免了晕动症或佩戴额外设备不便等常见问题。
- 减少屏幕疲劳:3D 显示屏提供了更加自然舒适的观看体验。与长时间注视平面屏幕相比,它有助于减轻眼睛疲劳。
- **实时语言翻译:**Beam 可以集成 AI 驱动的实时翻译,让使用不同语言的人在国际会议或学习环境中更轻松地进行自然交流。
Beam 是向前迈出的有力一步,但和任何新技术一样,它也存在一些局限。以下是一些需要考虑的事项:
- **硬件要求:**Beam 需要光场显示屏和多摄像头等专用高端设备,因此成本高昂,个人用户和小型组织更难使用。
- **不便携:**Beam 的系统设计用于固定安装,并不适合轻松移动,这限制了它在移动或不断变化环境中的灵活性和应用。
要点总结#
Google Beam 是让虚拟通信更具人情味的一次有趣尝试。虽然它仍处于早期阶段,但有潜力改变我们开会、建立联系和协作的方式。通过融合先进 AI、3D 成像和空间音频,它创造了更加逼真且引人入胜的远程体验。
随着 Google 继续改进 Beam 的硬件、进一步缩小设备体积,并可能将其带给日常用户,虚拟通信的未来将迎来令人振奋的可能性。结合全息会议和 3D 虚拟形象等新技术趋势,Beam 正在为虚拟会议树立新的标准。
加入我们的社区,查看我们的许可选项,立即开始使用计算机视觉。访问我们的 GitHub 代码库,进一步了解 AI。阅读我们的解决方案页面,深入了解零售业中的 AI和农业中的计算机视觉等各种应用场景。









