OpenAI 最新更新:Canvas、视觉微调等
加入我们,深入了解 OpenAI 最近发布的 ChatGPT 更新。我们将探讨 Canvas、视觉功能微调以及最新的搜索功能。

在我们 9 月份最后一次关注 OpenAI's o1 models(旨在提升推理能力)之后,ChatGPT 又新增了许多令人兴奋的强大功能。其中一些更新面向开发者推出,另一些则旨在优化用户体验。总的来说,每项升级都让与 ChatGPT 的交互变得更加直观和高效。
像旨在实现协同写作和编码的 Canvas,以及改善 ChatGPT 处理图像方式的视觉能力微调等更新,引发了极大的关注,并鼓励用户探索更多创造性的可能性。同时,诸如新 API 和公平性测试报告等技术升级,则解决了模型集成和负责任的 AI(ethical AI)实践等问题。让我们深入了解 OpenAI 推出的最新 ChatGPT 功能吧!
OpenAI Canvas 功能概述#
Canvas 是自 ChatGPT 发布以来对其用户界面 (UI) 的首次重大更新。它是一种采用双屏布局的新界面,左侧边栏显示提示词,右侧窗口显示响应内容。新的 UI 取消了以往类聊天式的单屏结构,改为双屏布局,这更适合多任务处理,从而提高工作效率。

Fig 1. Canvas 为 ChatGPT 带来了 UI 更新。
在引入 Canvas 之前,在 ChatGPT 上处理长篇文档意味着必须上下滚动相当多的内容。在新布局中,提示词显示在左侧边栏,而文本文档或代码片段则占据了屏幕的大部分区域。如果需要,你甚至可以自定义左侧边栏和输出屏幕的大小。此外,你还可以选择部分文本或一段代码并编辑特定部分,而无需更改整个文档。

图 2. 使用 Canvas 编辑特定文本段落。
如果你使用 Canvas,你会发现 ChatGPT 界面上没有专门用于打开它的按钮或切换开关。相反,当你使用 GPT-4o 模型时,如果它检测到你正在进行编辑、写作或编码,Canvas 就会自动打开。对于较简单的提示词,它会保持不活动状态。如果你想手动打开它,可以使用诸如“打开 Canvas”或“调出 Canvas 布局”之类的提示词。
目前,Canvas 处于测试阶段,仅适用于 GPT-4o。不过,OpenAI 表示,当 Canvas 脱离测试阶段后,将对所有免费用户开放。
ChatGPT 的 API 更新#
OpenAI 发布了三项新的 ChatGPT API 更新,旨在提高效率、可扩展性和多功能性。让我们仔细看看这些更新。
模型蒸馏#
Using the Model Distillation feature through the OpenAI APIs, developers can use the outputs of advanced models like GPT-4o or o1-preview to enhance the performance of smaller, cost-efficient models like GPT-4o mini. Model distillation is a process that involves training smaller models to mimic the behavior of more advanced ones, making them more efficient for specific tasks.
在此功能推出之前,开发者必须使用不同的工具手动协调各种任务。这些任务包括生成数据集、测量模型性能以及微调模型,这通常使过程变得复杂且容易出错。模型蒸馏更新让开发者能够使用存储补全(Stored Completions)工具,该工具允许他们通过 API 自动捕获并存储由高级模型产生的输入-输出对,从而生成数据集。
模型蒸馏的另一项功能 Evals(目前处于测试阶段)有助于衡量模型在特定任务上的表现,而无需创建自定义评估脚本或使用单独的工具。通过使用利用存储补全生成的数据集并通过 Evals 评估性能,开发者可以微调他们自己的自定义 GPT 模型。

Fig 3. 你可以使用 Evals 来衡量模型性能。
提示词缓存#
构建AI 应用(尤其是聊天机器人)时,通常会针对多个 API 调用反复使用相同的上下文(理解当前请求所需的背景信息或先前的对话历史记录)。提示词缓存(Prompt Caching)使得开发者能够重复使用最近使用的输入令牌(模型处理以理解提示并生成响应的文本片段),从而有助于降低成本和延迟。
从 10 月 1 日起,OpenAI 已自动将提示词缓存应用于其模型,例如 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini。这意味着当开发者使用 API 与具有长提示词(超过 1,024 个令牌)的模型进行交互时,系统会保存它已经处理过的部分。
这样,如果再次使用相同或相似的提示词,它就可以跳过重新计算这些部分。系统会自动缓存之前遇到的提示词中最长的部分,从 1,024 个 token 开始,并随着提示词变长以 128 个 token 为单位进行块状添加。
实时 API#
创建语音助手通常需要将音频转录为文本、处理文本,然后将其转换回音频以播放响应。OpenAI 的实时 API(Realtime API)旨在通过单个 API 请求处理整个过程。通过简化流程,该 API 能够实现与 AI 的实时对话。
例如,集成了实时 API 的语音助手可以根据用户的请求执行特定操作,例如下订单或寻找信息。该 API 使语音助手响应更快,并且能够快速适应用户的需求。实时 API 于 10 月 1 日通过公开测试版上线,提供六种声音。10 月 30 日,又新增了五种声音,使可用声音总数达到十一种。

Fig 4. 使用实时 API 练习新语言对话的示例。
针对视觉任务微调 ChatGPT#
最初,GPT-4o 视觉语言模型只能使用纯文本数据集进行微调和定制。现在,随着视觉微调 API 的发布,开发者可以使用图像数据集来训练和定制 GPT-4o。自发布以来,视觉微调已成为开发者和计算机视觉工程师中的热门话题。
为了微调 GPT-4o 的视觉能力,开发者可以使用从 100 张到 50,000 张不等的图像数据集。在确保数据集符合 OpenAI 要求的格式后,即可将其上传到 OpenAI 平台,从而针对特定应用对模型进行微调。
例如,自动化公司 Automat 使用截图数据集来训练 GPT-4o,使其能够根据描述识别屏幕上的 UI 元素。这有助于简化机器人流程自动化(RPA),使机器人更容易与用户界面进行交互。模型不再依赖固定的坐标或复杂的选择器规则,而是可以根据简单的描述识别 UI 元素,从而使自动化设置在界面更改时更具适应性且更易于维护。

Fig 5. 使用微调后的 GPT-4o 模型检测 UI 元素。
ChatGPT 公平性和偏见检测#
随着 AI 越来越先进,围绕AI 应用的伦理问题成为了一个突出的讨论话题。由于 ChatGPT 的响应基于用户提供的提示词和互联网上可用的数据,要始终对其语言进行微调以做到负责任可能会具有挑战性。报告称,ChatGPT 的回答在姓名、性别和种族方面存在偏见。为了解决这个问题,OpenAI 的内部团队进行了第一人称公平性测试。
名字通常带有关于我们的文化和地理因素的微妙线索。在大多数情况下,ChatGPT 会忽略名字中的微妙线索。然而,在某些情况下,反映种族或文化的名称会导致 ChatGPT 给出不同的回答,其中约 1% 的回答反映了有害语言。对于语言模型而言,消除偏见和有害语言是一项具有挑战性的任务。不过,通过公开分享这些发现并承认模型的局限性,OpenAI 帮助用户改进他们的提示词,以获得更中立、无偏见的回答。

Fig 6. 由于用户的名字而导致 ChatGPT 响应不同的示例。
了解 ChatGPT 搜索#
当 ChatGPT 最初推出时,AI 社区就它是否能取代传统网络浏览进行了讨论。现在,许多用户已经开始使用 ChatGPT 而不是 Google 搜索。
OpenAI 的新更新——搜索功能,将这一点更进一步。通过搜索,ChatGPT 可以生成最新响应并包含相关来源的链接。截至 10 月 31 日,搜索功能已向所有 ChatGPT Plus 和 Team 用户开放,使 ChatGPT 的功能更像是一个 AI 驱动的搜索引擎。

Fig 7. 使用 ChatGPT 全新搜索功能的示例。
前路展望#
ChatGPT 最近的更新专注于使 AI 更加实用、灵活和公平。新的 Canvas 功能帮助用户更高效地工作,而视觉微调则允许开发者定制模型以更好地处理视觉任务。解决公平性和减少偏见也是关键优先事项,确保 AI 能为每个人带来良好的服务,无论他们是谁。无论你是正在微调模型的开发者,还是只是在使用最新功能,ChatGPT 都在不断进化以满足广泛的需求。凭借实时功能、视觉集成以及对负责任使用的关注,这些更新正在为大家构建一个更值得信赖和可靠的 AI 体验。
访问我们的GitHub 仓库并加入我们的社群,探索关于 AI 的更多信息。了解有关自动驾驶和医疗健康中 AI 应用的更多信息。






