Ultralytics YOLO27:
视觉 AI

OpenAI o1:面向 AI 推理的全新 OpenAI 模型系列

了解新推出的 OpenAI o1 模型及其独特之处。我们还将介绍其工作原理以及对 AI 未来的影响。

ABAbirami Vina6 min read
OpenAI o1:OpenAI 推出的全新 AI 推理模型系列

AI 社区一直在热议 OpenAI 的 GPT 模型 的下一步发展,许多人将其称为“Project Strawberry”。之所以这样称呼,是因为如果你通过 提示 GPT-4o,询问单词 "strawberry" 中有几个 R,它会告诉你单词 "strawberry" 中有两个 R。考虑到 GPT-4o 的强大能力,这似乎有些奇怪。不过,该模型的设计目标是处理潜台词,而不是准确识别每个单词。此前有传言称,下一个模型将致力于解决这一问题。Sam Altman 在其 X(原名 Twitter)账号上发布草莓图片,进一步助推了这些传言。

随着 OpenAI 于 9 月 12 日星期四发布的最新公告,我们终于得到了对这些猜测的答案!OpenAI o1 是一系列旨在放慢速度、在回答前进行思考的新 AI 模型,现已发布。有趣的是,OpenAI o1 的推理能力更强,能够正确回答关于草莓的问题!本文将介绍 OpenAI o1 是什么、如何工作、可以应用于哪些领域,以及它对 AI 未来意味着什么。让我们开始吧!

询问 OpenAI o1 草莓问题的示例

图 1。 询问 OpenAI o1 草莓问题的示例。

OpenAI 在 AI 领域的新进展#

2024 年 7 月,OpenAI 高管表示,OpenAI 的研究正接近人类的问题解决水平,这被称为 AI 的第 2 级。显然,这一级别侧重于推理,因为 OpenAI 将其新模型系列 OpenAI o1 介绍为能够在回答前进行思考的模型。OpenAI o1 是一种新的 LLM(大型语言模型),它通过从海量语言数据中学习模式来理解并生成类似人类的文本。该模型旨在处理需要深入推理的复杂问题。

OpenAI 对 AI 各阶段的看法

图 2。 OpenAI 对 AI 各阶段的看法。

该模型通过 强化学习 进行训练,这是一种让模型通过试错来学习做出更好决策的技术:模型会根据其行为获得奖励或惩罚。强化学习算法通过遵循思维链,帮助模型更有效地思考。OpenAI 还表示,o1 的性能会随着训练期间更多的强化学习以及解决问题时投入更多“思考”时间而持续提升,这表明延长训练和进行更充分的处理都有助于增强模型能力。

尽管 OpenAI o1 在复杂推理方面取得了重大进展,但它仍处于早期阶段,缺少一些让 ChatGPT 实用的功能,例如浏览网页或上传文件和图像。对于许多常见任务,目前 GPT-4o 可能仍然更具能力。不过,OpenAI o1 标志着 AI 处理复杂推理能力的一大进步,这也是 OpenAI 开启新系列并将其命名为 OpenAI o1 的原因。

新的 OpenAI 模型如何增强 AI 推理能力#

OpenAI o1 可用于解码密码、解决编程挑战、回答数学问题、完成填字游戏,甚至处理科学安全医疗保健等领域的复杂主题。为了有趣地呼应项目代号,OpenAI 展示了模型的推理能力:它破解了一段密码,揭示出消息 "THERE ARE THREE R’S IN STRAWBERRY."

除了破解密码之外,OpenAI o1 还擅长编程。它在 Codeforces 等竞技编程挑战中表现出色。Codeforces 是一个让程序员在限时条件下解决复杂编程问题的平台。在这些挑战中,该模型取得了较高的 Elo 评分(根据与其他参赛者对战时的表现衡量技能水平的评分系统),并超越了此前的模型。它在数学方面也表现出色,在美国数学邀请赛 (AIME) 等考试中发挥良好。

OpenAI o1 编程能力基准测试

图 3。 OpenAI o1 编程能力基准测试。

这些进展使 OpenAI o1 成为相较 GPT-4o 等早期模型的一次重大升级。它为 AI 在商业、开发、研究医疗保健等领域开辟了新的可能性。例如,在遗传学研究中,OpenAI o1 可以快速阅读大量研究论文,找出关键发现以及遗传标记与疾病之间的联系。它能够理解复杂的科学语言并总结要点,帮助研究人员专注于最相关的信息。

深入了解思维链#

我们之前提到,OpenAI o1 引入了“思维链”推理过程。它使模型能够以类似人类认知策略的方式处理复杂问题。模型可以将挑战拆分为更小、更易管理的步骤,并反复改进其处理方法。不同于依赖即时模式识别的早期模型,o1 通过探索多条推理路径来优化决策,并通过强化学习从成功和错误中学习。

OpenAI 决定对用户隐藏这些原始思维链,转而提供能够展现模型推理过程、但不披露每一步的摘要。这一决定有助于防止模型思维过程被滥用,同时仍允许开发者监控并改进 AI 的安全性和对齐性。通过观察内部隐藏的思维链,开发者可以确保 o1 遵循道德准则,避免有害行为。

OpenAI o1 基准测试#

在多个测试推理和问题解决能力的基准测试中,OpenAI o1 相较 GPT-4o 展现出显著提升。在 2024 年美国数学邀请赛 (AIME) 中,这项考试面向顶尖高中生且难度较高,o1 每道题仅使用一个样本就达到了 74% 的准确率,而 GPT-4o 为 12%。在 64 个样本中取得共识后,其准确率提升至 83%;使用 1,000 个样本和改进的重新排序方法后,准确率达到 93%,跻身全国前 500 名学生之列。

除了数学之外,o1 在测试科学知识的基准测试中也表现卓越,例如 GPQA Diamond。该测试涵盖化学、物理生物学领域的博士水平问题。值得注意的是,o1 在这项测试中超过了拥有博士学位的人类专家,成为首个做到这一点的 AI 模型。在 MMLU 基准测试中,o1 还在 57 个类别中的 54 个类别超过了 GPT-4o。MMLU 用于测试模型对包括历史法律和科学在内的多样化学科的理解。

OpenAI o1 基准测试

图 4。 OpenAI o1 基准测试。

亲自体验 OpenAI o1#

OpenAI 在 o1 系列中推出了两种新的 AI 模型:o1-preview 和 o1-mini。o1-preview 旨在在回答前进行更深入的思考,在科学、编程和数学等复杂推理任务中表现出色。它为处理具有挑战性项目的用户提供了先进的问题解决能力。相比之下,o1-mini 是一种更小、更快、成本效益更高的模型,专门针对 STEM 推理进行了优化,尤其适用于数学和编程。虽然它掌握的广泛世界知识可能较少,但在 AIME 数学竞赛和 Codeforces 编程挑战等关键评测中,o1-mini 的表现几乎与 o1-preview 持平,而成本降低了 80%。

OpenAI 模型对比

图 5。 OpenAI 模型对比。

你可以通过 OpenAI 的多个平台试用这些模型。ChatGPT Plus 和 Team 用户可以通过模型选择器访问 o1-preview 和 o1-mini,直接在 ChatGPT 中体验增强的推理能力。拥有 API 使用等级 5 权限的开发者可以开始使用这些模型进行原型设计,不过一些高级功能仍在开发中。OpenAI 还计划很快向所有 ChatGPT Free 用户提供 o1-mini。通过探索这些模型,你可以亲身体验 AI 推理方面的进展,并选择最符合你需求的模型。

OpenAI 对 AI 伦理的考量#

OpenAI 在开发 o1 模型系列时重点关注伦理与安全。在发布 o1-preview 和 o1-mini 模型之前,他们进行了全面评估,包括外部测试和内部检查,以识别违禁内容、幻觉和偏见等风险。这些模型具备先进的推理能力,旨在更好地理解并遵循安全规则。

OpenAI 还实施了屏蔽列表和安全分类器等防护措施来管理风险。o1 模型的总体风险评级为中等。在网络安全和模型自主性等领域,其风险较低;在 CBRN(化学、生物、放射性和核)内容及说服等领域,风险为中等。OpenAI 的安全顾问组和董事会已经审查了这些安全措施,以确保该模型使用起来安全且符合伦理。

OpenAI o1 评分卡

图 6。 OpenAI o1 评分卡。

从传言到现实:OpenAI o1 登上舞台#

OpenAI o1 在 AI 推理方面迈出了一大步,将一些早期传言变成了现实。不同于 GPT-4o,o1 系列采用“思维链”方法进行更深入的思考,将复杂问题拆分为更小的步骤,从而提供更好的回答。目前,OpenAI o1 已作为早期预览版在 ChatGPT 和 API 中提供,OpenAI 计划加入网页浏览以及文件和图像上传等功能。OpenAI 还表示,他们计划继续开发并发布 GPT 系列模型,与新的 OpenAI o1 系列并行推进。随着 AI 持续发展,这类进展正在为更强大、更直观、更通用的 AI 系统铺平道路,使其能够更好地协助人类并理解人类需求。

加入我们的社区,了解 AI 领域的最新动态!前往我们的 GitHub 代码仓库,了解我们如何在制造业医疗保健等行业开创 AI 解决方案。🚀

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅