OpenAI o1:面向 AI 推理的全新 OpenAI 模型系列
了解新推出的 OpenAI o1 模型及其独特之处。我们还将介绍其工作原理以及对 AI 未来的影响。

AI 社区一直在热议 OpenAI 的 GPT 模型 的下一步发展,许多人将其称为“Project Strawberry”。之所以这样称呼,是因为如果你通过 提示 GPT-4o,询问单词 "strawberry" 中有几个 R,它会告诉你单词 "strawberry" 中有两个 R。考虑到 GPT-4o 的强大能力,这似乎有些奇怪。不过,该模型的设计目标是处理潜台词,而不是准确识别每个单词。此前有传言称,下一个模型将致力于解决这一问题。Sam Altman 在其 X(原名 Twitter)账号上发布草莓图片,进一步助推了这些传言。
随着 OpenAI 于 9 月 12 日星期四发布的最新公告,我们终于得到了对这些猜测的答案!OpenAI o1 是一系列旨在放慢速度、在回答前进行思考的新 AI 模型,现已发布。有趣的是,OpenAI o1 的推理能力更强,能够正确回答关于草莓的问题!本文将介绍 OpenAI o1 是什么、如何工作、可以应用于哪些领域,以及它对 AI 未来意味着什么。让我们开始吧!

图 1。 询问 OpenAI o1 草莓问题的示例。
OpenAI 在 AI 领域的新进展#
2024 年 7 月,OpenAI 高管表示,OpenAI 的研究正接近人类的问题解决水平,这被称为 AI 的第 2 级。显然,这一级别侧重于推理,因为 OpenAI 将其新模型系列 OpenAI o1 介绍为能够在回答前进行思考的模型。OpenAI o1 是一种新的 LLM(大型语言模型),它通过从海量语言数据中学习模式来理解并生成类似人类的文本。该模型旨在处理需要深入推理的复杂问题。

图 2。 OpenAI 对 AI 各阶段的看法。
该模型通过 强化学习 进行训练,这是一种让模型通过试错来学习做出更好决策的技术:模型会根据其行为获得奖励或惩罚。强化学习算法通过遵循思维链,帮助模型更有效地思考。OpenAI 还表示,o1 的性能会随着训练期间更多的强化学习以及解决问题时投入更多“思考”时间而持续提升,这表明延长训练和进行更充分的处理都有助于增强模型能力。
尽管 OpenAI o1 在复杂推理方面取得了重大进展,但它仍处于早期阶段,缺少一些让 ChatGPT 实用的功能,例如浏览网页或上传文件和图像。对于许多常见任务,目前 GPT-4o 可能仍然更具能力。不过,OpenAI o1 标志着 AI 处理复杂推理能力的一大进步,这也是 OpenAI 开启新系列并将其命名为 OpenAI o1 的原因。
新的 OpenAI 模型如何增强 AI 推理能力#
OpenAI o1 可用于解码密码、解决编程挑战、回答数学问题、完成填字游戏,甚至处理科学、安全和医疗保健等领域的复杂主题。为了有趣地呼应项目代号,OpenAI 展示了模型的推理能力:它破解了一段密码,揭示出消息 "THERE ARE THREE R’S IN STRAWBERRY."
除了破解密码之外,OpenAI o1 还擅长编程。它在 Codeforces 等竞技编程挑战中表现出色。Codeforces 是一个让程序员在限时条件下解决复杂编程问题的平台。在这些挑战中,该模型取得了较高的 Elo 评分(根据与其他参赛者对战时的表现衡量技能水平的评分系统),并超越了此前的模型。它在数学方面也表现出色,在美国数学邀请赛 (AIME) 等考试中发挥良好。

图 3。 OpenAI o1 编程能力基准测试。
这些进展使 OpenAI o1 成为相较 GPT-4o 等早期模型的一次重大升级。它为 AI 在商业、开发、研究和医疗保健等领域开辟了新的可能性。例如,在遗传学研究中,OpenAI o1 可以快速阅读大量研究论文,找出关键发现以及遗传标记与疾病之间的联系。它能够理解复杂的科学语言并总结要点,帮助研究人员专注于最相关的信息。
深入了解思维链#
我们之前提到,OpenAI o1 引入了“思维链”推理过程。它使模型能够以类似人类认知策略的方式处理复杂问题。模型可以将挑战拆分为更小、更易管理的步骤,并反复改进其处理方法。不同于依赖即时模式识别的早期模型,o1 通过探索多条推理路径来优化决策,并通过强化学习从成功和错误中学习。
OpenAI 决定对用户隐藏这些原始思维链,转而提供能够展现模型推理过程、但不披露每一步的摘要。这一决定有助于防止模型思维过程被滥用,同时仍允许开发者监控并改进 AI 的安全性和对齐性。通过观察内部隐藏的思维链,开发者可以确保 o1 遵循道德准则,避免有害行为。
OpenAI o1 基准测试#
在多个测试推理和问题解决能力的基准测试中,OpenAI o1 相较 GPT-4o 展现出显著提升。在 2024 年美国数学邀请赛 (AIME) 中,这项考试面向顶尖高中生且难度较高,o1 每道题仅使用一个样本就达到了 74% 的准确率,而 GPT-4o 为 12%。在 64 个样本中取得共识后,其准确率提升至 83%;使用 1,000 个样本和改进的重新排序方法后,准确率达到 93%,跻身全国前 500 名学生之列。
除了数学之外,o1 在测试科学知识的基准测试中也表现卓越,例如 GPQA Diamond。该测试涵盖化学、物理和生物学领域的博士水平问题。值得注意的是,o1 在这项测试中超过了拥有博士学位的人类专家,成为首个做到这一点的 AI 模型。在 MMLU 基准测试中,o1 还在 57 个类别中的 54 个类别超过了 GPT-4o。MMLU 用于测试模型对包括历史、法律和科学在内的多样化学科的理解。

图 4。 OpenAI o1 基准测试。
亲自体验 OpenAI o1#
OpenAI 在 o1 系列中推出了两种新的 AI 模型:o1-preview 和 o1-mini。o1-preview 旨在在回答前进行更深入的思考,在科学、编程和数学等复杂推理任务中表现出色。它为处理具有挑战性项目的用户提供了先进的问题解决能力。相比之下,o1-mini 是一种更小、更快、成本效益更高的模型,专门针对 STEM 推理进行了优化,尤其适用于数学和编程。虽然它掌握的广泛世界知识可能较少,但在 AIME 数学竞赛和 Codeforces 编程挑战等关键评测中,o1-mini 的表现几乎与 o1-preview 持平,而成本降低了 80%。

图 5。 OpenAI 模型对比。
你可以通过 OpenAI 的多个平台试用这些模型。ChatGPT Plus 和 Team 用户可以通过模型选择器访问 o1-preview 和 o1-mini,直接在 ChatGPT 中体验增强的推理能力。拥有 API 使用等级 5 权限的开发者可以开始使用这些模型进行原型设计,不过一些高级功能仍在开发中。OpenAI 还计划很快向所有 ChatGPT Free 用户提供 o1-mini。通过探索这些模型,你可以亲身体验 AI 推理方面的进展,并选择最符合你需求的模型。
OpenAI 对 AI 伦理的考量#
OpenAI 在开发 o1 模型系列时重点关注伦理与安全。在发布 o1-preview 和 o1-mini 模型之前,他们进行了全面评估,包括外部测试和内部检查,以识别违禁内容、幻觉和偏见等风险。这些模型具备先进的推理能力,旨在更好地理解并遵循安全规则。
OpenAI 还实施了屏蔽列表和安全分类器等防护措施来管理风险。o1 模型的总体风险评级为中等。在网络安全和模型自主性等领域,其风险较低;在 CBRN(化学、生物、放射性和核)内容及说服等领域,风险为中等。OpenAI 的安全顾问组和董事会已经审查了这些安全措施,以确保该模型使用起来安全且符合伦理。

图 6。 OpenAI o1 评分卡。
从传言到现实:OpenAI o1 登上舞台#
OpenAI o1 在 AI 推理方面迈出了一大步,将一些早期传言变成了现实。不同于 GPT-4o,o1 系列采用“思维链”方法进行更深入的思考,将复杂问题拆分为更小的步骤,从而提供更好的回答。目前,OpenAI o1 已作为早期预览版在 ChatGPT 和 API 中提供,OpenAI 计划加入网页浏览以及文件和图像上传等功能。OpenAI 还表示,他们计划继续开发并发布 GPT 系列模型,与新的 OpenAI o1 系列并行推进。随着 AI 持续发展,这类进展正在为更强大、更直观、更通用的 AI 系统铺平道路,使其能够更好地协助人类并理解人类需求。
加入我们的社区,了解 AI 领域的最新动态!前往我们的 GitHub 代码仓库,了解我们如何在制造业和医疗保健等行业开创 AI 解决方案。🚀









