OpenAI 的 GPT-4o 展现 AI 的潜力
探索 OpenAI 全新的 GPT-4o,体验具备先进 AI 能力和逼真交互的模型,改变我们与技术沟通的方式。探索其突破性功能!

2024 年 5 月 13 日星期一,OpenAI 宣布推出其全新的旗舰模型 GPT-4o,其中“o”代表“全能”。GPT-4o 是一种先进的多模态 AI 模型,支持实时文本、音频和视觉交互,提供更快的处理速度、多语言支持和更强的安全性。
它带来了前所未有的生成式 AI 能力。在 ChatGPT 对话能力的基础上,GPT-4o 的功能标志着人们理解 AI 的方式向前迈出了一大步。现在,我们可以像与真人交谈一样与 GPT-4o 对话。让我们深入了解一下 GPT-4o 的具体能力!
了解 GPT-4o#
在 OpenAI 的春季更新中,人们了解到,GPT-4o 的智能水平与 GPT-4 相当,但它能更快地处理数据,也更擅长处理文本、视觉和音频。不同于以往专注于提升模型智能水平的版本,此次发布充分考虑了让普通大众更易于使用 AI 的需求。

图 1。 OpenAI 的春季更新
ChatGPT 的语音模式于去年年底发布,涉及三个不同的模型协同工作:将语音输入转录为文字、理解并生成书面回复,以及将文本转换为语音以便用户听到回复。这种模式存在延迟问题,使用起来也不够自然。GPT-4o 可以原生地一次性处理文本、视觉和音频,让用户感觉自己正在进行自然对话。
此外,与语音模式不同,你现在可以在 GPT-4o 说话时打断它,而它会像真人一样做出反应。它会暂停并倾听,然后根据你所说的内容实时回应。它还可以通过语音表达情绪,并理解你的语气。
令人兴奋的 GPT-4o 功能#
GPT-4o 的模型评估展示了它的先进程度。其中一个最有趣的结果是,与 Whisper-v3 相比,GPT-4o 大幅提升了所有语言的语音识别能力,尤其是那些使用人数较少的语言。
音频 ASR(自动语音识别)性能用于衡量模型将口语转录为文本的准确程度。GPT-4o 的性能通过 WER(词错误率)进行跟踪,该指标表示错误转录的词语所占的比例(WER 越低,质量越好)。下图展示了 GPT-4o 在不同地区的 WER 更低,说明它能有效提升资源较少语言的语音识别能力。

图 2。 GPT-4o 在多种语言中具有更出色的语音识别能力。
下面来看看 GPT-4o 的一些其他独特功能:
- 速度更快 - 它的速度是 GPT-4 Turbo 的两倍。它仅需 232 毫秒即可响应音频输入,与人类对话的响应时间相近。
- 成本效益高 - GPT-4o 的 API 版本比 GPT-4 Turbo 便宜 50%。
- 记忆 - GPT-4o 能够在不同对话之间保持上下文认知。它可以记住你在不同聊天中谈论的内容。
- 多语言 - GPT-4o 经过训练,可在 50 种不同语言中提供更快的速度和更高的质量。
GPT-4o 的应用示例#
现在,你可以在手机上打开 GPT-4o,开启摄像头,然后像询问朋友一样,让 GPT-4o 根据你的面部表情猜测你的心情。GPT-4o 可以通过摄像头看到你并作出回答。

图 3。 GPT-4o 通过视频理解人类的心情。
你甚至可以通过视频向 GPT-4o 展示你正在书写的内容,让它帮助你解决数学问题。或者,你可以共享屏幕,让它成为 Khan Academy 上的得力辅导老师,像下图所示,在几何学习中要求你指出三角形的不同部分。

图 4。 GPT-4o 在 Khan Academy 上充当辅导老师。
除了帮助孩子学习数学,开发者还可以与 GPT-4o 对话来调试代码。这得益于 ChatGPT 桌面应用的推出。如果你在与 GPT-4o 桌面语音应用对话时,使用 CTRL “C” 高亮并复制代码,它就能够读取你的代码。或者,你也可以用它来翻译使用不同语言交流的开发者之间的对话。
GPT-4o 的可能性似乎无穷无尽。OpenAI 最有趣的演示之一使用两部手机,展示了 GPT-4o 与不同实例的自己对话并一起唱歌。

图 5。 AI 与 AI 对话并一起唱歌。
GPT-4o 的应用#
正如演示所示,GPT-4o 可以让视力障碍人士更便捷地接触这个世界。它可以帮助他们更安全、更独立地进行互动和行动。例如,用户可以打开视频,将街道景象展示给 GPT-4o。然后,GPT-4o 可以实时描述周围环境,例如识别障碍物、读取街道标志,或引导他们前往特定地点。它甚至可以通过在出租车驶近时提醒用户,帮助他们拦出租车。

图 6。 GPT-4o 提醒出租车驶近。
同样,GPT-4o 凭借其先进能力可以改变各个行业。在 零售领域,它可以提供实时帮助、回答问题,并帮助客户在线上和实体店中找到商品,从而改善客户服务。比如,当你面对一货架商品却找不到想要的产品时,GPT-4o 就可以帮助你。
在 医疗保健领域,GPT-4o 可以通过分析患者数据、根据症状提出可能的病症,并就治疗方案提供指导来协助诊断。它还可以通过总结患者记录、快速提供医学文献,以及提供实时语言翻译,帮助医务人员与使用不同语言的患者沟通。这只是其中几个例子。GPT-4o 的应用可以提供量身定制且理解上下文的帮助,打破信息与沟通障碍,让日常生活更加轻松。
GPT-4o 与模型安全#
就像此前已影响数亿人生活的 GPT 系列版本一样,GPT-4o 很可能会在全球范围内处理实时音频和视频,因此安全性将成为这些应用中的关键要素。OpenAI 非常谨慎地构建 GPT-4o,重点在于降低潜在风险。
为确保安全性和可靠性,OpenAI 实施了严格的安全措施。这些措施包括过滤训练数据、在训练后优化模型行为,以及引入新的语音输出管理安全系统。此外,GPT-4o 还接受了 70 多位外部专家的大量测试,涉及社会心理学、偏见与公平性以及错误信息等领域。外部测试可确保识别并解决新功能引入或放大的任何风险。
为了保持高标准的安全性,OpenAI 将在接下来几周逐步推出 GPT-4o 的功能。分阶段发布可以让 OpenAI 监控性能、解决问题并收集用户反馈。采取谨慎的方式可以确保 GPT-4o 在提供先进能力的同时,保持最高标准的安全性和合乎道德的使用规范。
亲自试用 GPT-4o#
GPT-4o 可免费使用。要体验上文提到的实时对话功能,你可以直接将 ChatGPT 应用从 Google Play Store 或 Apple App Store 下载到手机上。
登录后,点击屏幕右上角的三个点,从显示的列表中选择 GPT-4o。进入启用 GPT-4o 的聊天后,点击屏幕左下角的加号,你会看到多个输入选项。在屏幕右下角,你会看到一个耳机图标。选择耳机图标后,系统会询问你是否想体验免手操作版本的 GPT-4o。确认后,你就可以如下图所示试用 GPT-4o。

图 7。在 ChatGPT 移动应用上试用 GPT-4o。
如果你想将 GPT-4o 的先进能力集成到自己的项目中,开发者可以通过 API使用它。你可以将 GPT-4o 强大的语音识别、多语言支持和实时对话能力集成到自己的应用中。通过使用 API,你可以提升用户体验、构建更智能的应用,并将尖端 AI 技术带入不同领域。
GPT-4o:还不完全像人类#
虽然 GPT-4o 比以往的 AI 模型先进得多,但需要记住的是,GPT-4o 也有自身的局限性。OpenAI 提到,它有时会在对话过程中随机切换语言,从英语切换到法语。他们还发现 GPT-4o 有时会在不同语言之间进行错误翻译。随着更多人试用该模型,我们将进一步了解 GPT-4o 擅长什么,以及哪些方面仍需改进。
归根结底#
OpenAI 的 GPT-4o 凭借先进的文本、视觉和音频处理能力,为 AI 打开了新的大门,提供自然、类人的交互体验。它在速度、成本效益和多语言支持方面表现出色。GPT-4o 是一种适用于教育、无障碍应用和实时帮助的多功能工具。随着用户探索 GPT-4o 的能力,反馈将推动其不断发展。GPT-4o 证明了 AI 正在真正改变我们的世界,并逐渐成为日常生活的一部分。
探索我们的 GitHub 代码库,加入我们的 社区,深入了解 AI。访问我们的解决方案页面,了解 AI 如何改变 制造业和 农业等行业。









