OpenAI o1:用于 AI 推理的全新 OpenAI 模型系列
了解最新发布的 OpenAI o1 模型及其独特之处。我们还将深入探讨它们的工作原理以及对 AI 未来的影响。

AI 社区一直在猜测 OpenAI’s GPT models 的下一步发展,许多人将其称为“草莓计划”(Project Strawberry)。原因在于,如果你 prompt GPT-4o 询问单词“strawberry”中有多少个字母 R,它会告诉你单词“strawberry”中有两个 R。考虑到 GPT-4o 的强大功能,这似乎有点奇怪。然而,该模型的构建是为了处理潜台词,而不是确切的字面词汇。据传,新模型旨在解决这个问题。Sam Altman 在其 X (formerly known as Twitter) account 上发布了草莓的照片,进一步助长了这些传言。
随着 OpenAI 在 9 月 12 日星期四发布的 OpenAI’s latest announcement,我们终于得到了这些猜测的答案!OpenAI o1 已正式发布,这是一系列旨在放慢速度并在回复前进行思考的新型 AI 模型。有趣的是,OpenAI o1 能够更好地进行推理,并正确回答关于草莓的问题!在本文中,我们将讨论什么是 OpenAI o1、它是如何工作的、它可以用在哪里,以及它对 AI 的未来意味着什么。让我们开始吧!

Fig 1. 关于向 OpenAI o1 询问草莓的提示示例。
OpenAI 在 AI 领域的新进展#
2024 年 7 月,OpenAI 高管分享称,OpenAI 的研究正接近人类水平的问题解决能力,被称为 level 2 of AI。显然,随着 OpenAI 推出其新模型系列 OpenAI o1(即在回答前进行思考),这一级别专注于推理。OpenAI o1 是一款新的 LLM (large language model),这是一种通过从海量语言数据中学习模式来理解和生成类人文本的 AI 模型。它旨在处理需要深入推理的复杂问题。

Fig 2. OpenAI 关于 AI 发展阶段的看法。
该模型使用 reinforcement learning 进行了 trained,这是一种通过根据其行动接收奖励或惩罚,在试错中学习做出更好决策的技术。强化学习算法有助于模型通过遵循思维链更有效地思考。OpenAI 还分享说,随着训练期间更多的强化学习以及在解决问题期间花费更多时间“思考”,o1 的 performance 不断提高,这表明延长的训练和深思熟虑的处理都有助于增强模型的能力。
虽然 OpenAI o1 在复杂推理方面是一项重大进步,但它仍处于早期阶段,缺少一些让 ChatGPT 变得实用的功能,例如浏览网页或上传文件和图像。对于许多常见任务,目前 GPT-4o 可能仍然更强大。然而,OpenAI o1 代表了 AI 处理复杂推理能力的一大飞跃,这就是为什么 OpenAI 开辟了新系列并将其命名为 OpenAI o1。
OpenAI 的新模型如何增强 AI 推理能力#
OpenAI o1 可用于解码密码、解决编程挑战、回答数学问题、攻克纵横字谜,甚至处理 science、safety 和 healthcare 领域的复杂课题。为了向该项目的代号致以有趣的敬意,OpenAI 展示了该模型的 reasoning skills,成功破解了一个揭示“草莓里有三个 R”这一信息的密码。
除了破解密码,OpenAI o1 还精通编程。它在 Codeforces 等竞技编程挑战赛中表现出色,这是一个程序员在计时条件下解决复杂编程问题的平台。在这些挑战中,该模型获得了很高的 Elo 评级(一种根据与其他竞争对手的对决表现来衡量技能水平的评分系统),并且超越了以前的模型。它还在数学方面表现出色,并在像美国数学邀请赛 (AIME) 这样的 exams 中取得了优异成绩。

Fig 3. 对 o1 编码能力的基准测试。
这些进展使 OpenAI o1 成为早期模型(如 GPT-4o)的重大升级。它为 AI 在 business、开发、research 和 healthcare 等领域开辟了新的可能性。例如,在 genetics research 中,OpenAI o1 可以快速浏览大量研究论文,挑出关键发现以及基因标记与 diseases 之间的联系。它能够理解复杂的科学语言并总结要点,帮助研究人员专注于最相关的信息。
深入了解思维链#
我们之前看到,OpenAI o1 引入了“思维链”(Chain of Thought)推理过程。它使模型能够以类似于人类认知策略的方式处理复杂问题。模型可以将挑战分解为更小、更易管理的步骤,并迭代优化其方法。与依赖即时 pattern recognition 的早期 models 不同,o1 通过探索多条推理路径来优化其决策,通过强化学习从成功和错误中吸取教训。
OpenAI 决定对用户隐藏这些原始思维链,转而提供摘要,以便在不暴露每个步骤的情况下深入了解模型的推理过程。这一决定有助于防止滥用模型的思维过程,同时仍允许开发人员监控和改进 AI 安全性和对齐。通过在内部观察隐藏的思维链,开发人员可以确保 o1 遵守 ethical guidelines 并避免有害行为。
OpenAI o1 基准测试#
在测试推理和问题解决能力的几个 benchmarks 中,OpenAI o1 相比 GPT-4o 展现出了重大改进。在 2024 年美国数学邀请赛 (AIME) 这一面向顶尖高中生的极具挑战性的数学考试中,o1 在每个问题仅使用一个样本的情况下实现了 74% 的准确率,而 GPT-4o 仅为 12%。在对 64 个样本达成共识的情况下,其准确率提高到 83%;通过使用包含 1,000 个样本的精细重新排序方法,其准确率达到了 93%,使其跻身全国前 500 名学生之列。
除了数学,o1 在测试科学知识的基准测试中也表现异常出色,例如涵盖化学、physics 和 biology 博士级问题的 GPQA Diamond。值得注意的是,o1 在这项测试中击败了拥有博士学位的人类专家,成为第一个做到这一点的 AI 模型。它还在 MMLU 基准测试的 57 个类别中的 54 个类别上表现优于 GPT-4o,该基准测试用于测试对包括 history、law 和科学在内的各种学科的理解能力。

Fig 4. OpenAI o1 基准测试。
上手体验 OpenAI o1#
OpenAI 在 o1 系列中推出了两款新 AI 模型:o1-preview 和 o1-mini。o1-preview 模型旨在响应前进行更深入的思考,擅长科学、编码和数学方面的复杂推理任务。它为用户处理具有挑战性的项目提供了先进的问题解决能力。相比之下,o1-mini 是一款体积更小、速度更快且性价比更高的模型,专门针对 STEM 推理(特别是数学和编码)进行了优化。虽然它的通用知识可能较少,但 o1-mini 在 AIME 数学竞赛和 Codeforces 编码挑战等关键评估中的表现几乎与 o1-preview 持平,且成本降低了 80%。

Fig 5. 对比 OpenAI 模型。
你可以通过各种 OpenAI 平台尝试这些模型。ChatGPT Plus 和 Team 用户可以通过模型选择器访问 o1-preview 和 o1-mini,直接在 ChatGPT 中体验增强的推理能力。拥有 API 使用层级 5 权限的开发人员可以开始使用这些模型进行原型设计,尽管一些高级功能仍在开发中。OpenAI 还计划不久后向所有 ChatGPT 免费用户提供 o1-mini。通过探索这些模型,你可以亲身体验 AI 推理的进步,并选择最适合你需求的那一个。
OpenAI 考虑的道德 AI 问题#
OpenAI 在开发 o1 模型系列时,一直专注于 ethics and safety。在发布 o1-preview 和 o1-mini 模型之前,他们进行了彻底的评估,包括外部测试和针对违规内容、幻觉和偏见等风险的内部检查。这些模型在设计时具备先进的推理能力,能够更好地理解和遵守安全规则。
OpenAI 还实施了阻止列表和安全分类器等保障措施来管理风险。o1 模型具有中等的整体风险评级。它在网络安全和模型自主性等领域的风险较低,而在 CBRN(化学、生物、放射和核)内容和说服力等领域的风险中等。OpenAI 的安全咨询小组和董事会审查了这些 safety measures,以确保模型使用起来安全且合乎道德。

Fig 6. OpenAI o1 记分卡。
从传言到现实:OpenAI o1 登台亮相#
OpenAI o1 是 AI 推理领域的巨大进步,将一些早期的传言变成了现实。与 GPT-4o 不同,o1 系列通过使用“思维链”方法进行更深入的思考,将复杂问题分解为更小的步骤,从而获得更好的响应。目前,OpenAI o1 作为早期预览版可在 ChatGPT 和 API 中使用,OpenAI 计划后续添加网页浏览以及文件和图像上传等功能。OpenAI 还表示,他们计划在发布全新的 OpenAI o1 系列的同时,继续开发和发布 GPT 系列模型。随着 AI 的不断演进,这些进步正在为更强大、直观且多功能的 AI 系统铺平道路,使它们能够更好地辅助并理解人类需求。
加入 our community,紧跟 AI 的最新发展!前往我们的 GitHub repository 查看我们如何在 manufacturing 和 healthcare 等行业开拓 AI 解决方案。🚀






