OpenAI 最新更新:Canvas、视觉微调及更多功能
加入我们,一起深入了解 OpenAI 最近发布的 ChatGPT 更新。我们将探索 Canvas、视觉能力微调以及最新的 Search 功能。

上次我们在 9 月查看了 OpenAI 的 o1 模型(旨在提升推理能力),此后 ChatGPT 新增了许多令人兴奋的功能。其中一些版本更新面向开发者,另一些则旨在优化用户体验。总体而言,每次升级都能让与 ChatGPT 的互动更加直观高效。
Canvas 等旨在促进协作写作和编码的功能,以及面向视觉能力的微调,提升了 ChatGPT 处理图像的能力,引发了广泛关注,鼓励用户探索更多创意可能性。与此同时,新 API 和公平性测试报告等技术升级,解决了模型集成和道德 AI实践等方面的问题。让我们深入了解 OpenAI 最新的 ChatGPT 功能!
OpenAI Canvas 功能概览#
Canvas 是 ChatGPT 发布以来对其用户界面(UI)进行的首次重大更新。它采用全新的双屏布局,左侧边栏显示提示词,右侧窗口显示回复。这种新 UI 摒弃了聊天式单屏结构的常规工作流程,改用适合多任务处理的双屏布局,从而提升工作效率。

图 1。 Canvas 为 ChatGPT 带来 UI 更新。
在 Canvas 推出之前,在 ChatGPT 上处理较长的文档意味着需要频繁上下滚动。在新布局中,提示词显示在左侧边栏,文本文档或代码片段占据屏幕的大部分区域。如有需要,你还可以自定义左侧边栏和输出屏幕的大小。此外,你可以选择部分文本或一段代码,在不更改整个文档的情况下编辑指定部分。

图 2。使用 Canvas 编辑文本的特定部分。
如果你使用 Canvas,会发现 ChatGPT 界面中没有用于打开它的特定按钮或切换开关。相反,当你使用 GPT-4o 模型时,如果检测到你正在编辑、写作或编码,Canvas 就会自动打开。对于更简单的提示词,它会保持不活动状态。如果你想手动打开,可以使用“Open the Canvas”或“Get me the Canvas layout”等提示词。
目前,Canvas 处于测试阶段,仅适用于 GPT-4o。不过,OpenAI 表示,Canvas 结束测试后将向所有免费用户开放。
ChatGPT 的 API 更新#
OpenAI 发布了三项新的 ChatGPT API 更新,旨在提升效率、可扩展性和多功能性。下面让我们分别详细了解这些更新。
模型蒸馏#
通过 OpenAI APIs 使用 模型蒸馏功能,开发者可以利用 高级模型(如 GPT-4o 或 o1-preview)的输出,来提升小型且经济高效模型(如 GPT-4o mini)的 性能。模型蒸馏是一种通过 训练小型模型来模仿更高级模型行为的过程,从而使其在执行 特定任务时更加高效。
在该功能推出之前,开发者必须使用不同工具手动协调各种任务。这些任务包括生成数据集、衡量模型性能以及对模型进行微调,整个过程通常复杂且容易出错。模型蒸馏更新让开发者可以使用 Stored Completions,这是一种通过 API 捕获并存储高级模型生成的输入输出对,从而自动生成数据集的工具。
模型蒸馏的另一项功能 Evals(目前处于测试阶段)有助于衡量模型表现在特定任务上的效果,无需创建自定义评估脚本或使用独立工具。开发者可以使用通过 Stored Completions 生成的数据集,并通过 Evals 评估性能,从而对自己的自定义 GPT 模型进行微调。

图 3。你可以使用 Evals 衡量模型性能。
提示词缓存#
在构建AI 应用时,尤其是聊天机器人时,多个 API 调用往往会反复使用相同的上下文(用于理解当前请求的背景信息或先前对话历史)。提示词缓存使开发者能够重复使用最近使用过的输入令牌(模型为理解提示词并生成回复而处理的文本片段),从而降低成本和延迟。
从 10 月 1 日起,OpenAI 已自动将提示词缓存应用于 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 等模型。这意味着,当开发者使用 API 与包含较长提示词(超过 1,024 个令牌)的模型交互时,系统会保存已经处理过的部分。
这样一来,如果再次使用相同或相似的提示词,系统就可以跳过对这些部分的重新计算。系统会自动缓存此前遇到的提示词中最长的部分,从 1,024 个令牌开始,并随着提示词变长,以每次 128 个令牌的块逐步增加。
Realtime API#
创建语音助手通常需要将音频转为文本、处理文本,然后再将其转换回用于播放回复的音频。OpenAI 的 Realtime API 旨在通过单个 API 请求处理整个流程。通过简化流程,该 API 支持与 AI 进行实时对话。
例如,集成 Realtime API 的语音助手可以根据用户请求执行下单或查找信息等特定操作。该 API 让语音助手响应更迅速,也能快速适应用户需求。Realtime API 于 10 月 1 日通过公开测试版提供,共有六种语音。10 月 30 日又新增了五种语音,可用语音总数达到 11 种。

图 4。使用 Realtime API 练习新语言对话的示例。
针对视觉任务微调 ChatGPT#
最初,GPT-4o 视觉语言模型只能使用纯文本数据集进行微调和定制。现在,随着视觉微调 API 的发布,开发者可以使用图像数据集训练和定制 GPT-4o。自发布以来,视觉微调已成为开发者和计算机视觉工程师广泛关注的话题。
要微调 GPT-4o 的视觉能力,开发者可以使用包含 100 至 50,000 张图像的图像数据集。确认数据集符合 OpenAI 要求的格式后,即可将其上传到 OpenAI 平台,并针对特定应用对模型进行微调。
例如,自动化公司 Automat 使用屏幕截图数据集训练 GPT-4o,使其能够根据描述识别屏幕上的 UI 元素。这有助于简化机器人流程自动化(RPA),让机器人更容易与用户界面交互。模型不再依赖固定坐标或复杂的选择器规则,而是可以根据简单描述识别 UI 元素,使自动化设置更具适应性,并在界面发生变化时更易于维护。

图 5。使用微调后的 GPT-4o 模型版本检测 UI 元素。
ChatGPT 公平性与偏见检测#
随着 AI 变得日益先进,围绕AI 应用的伦理问题成为热门话题。由于 ChatGPT 的回复基于用户提供的提示词和互联网上可获取的数据,因此要始终将其语言调整得负责任可能颇具挑战。报告称,ChatGPT 的回答会因姓名、性别和种族而产生偏见。为解决这一问题,OpenAI 内部团队开展了首次第一人称公平性测试。
姓名通常会传递有关我们文化和地理因素的细微线索。在大多数情况下,ChatGPT 会忽略姓名中的这些细微线索。不过,在某些情况下,反映种族或文化的姓名会导致 ChatGPT 给出不同回复,其中约 1% 的回复包含有害语言。消除偏见和有害语言对于语言模型而言是一项艰巨任务。不过,通过公开分享这些发现并承认模型的局限性,OpenAI 帮助用户改进提示词,以获得更加中立、无偏见的回答。

图 6。因用户姓名而产生不同回复的示例。
了解 ChatGPT 搜索#
ChatGPT 刚推出时,AI 社区曾讨论它是否能够取代传统网页浏览。如今,许多用户正在使用 ChatGPT 代替 Google Search。
OpenAI 的新更新——Search 功能——让这一点更进一步。借助 Search,ChatGPT 可以生成最新回复,并附上相关来源的链接。截至 10 月 31 日,Search 功能已向所有 ChatGPT Plus 和 Team 用户开放,使 ChatGPT 的功能更接近 AI 驱动的搜索引擎。

图 7。使用 ChatGPT 新 Search 功能的示例。
未来展望#
ChatGPT 的近期更新侧重于让 AI 更实用、更灵活且更公平。新的 Canvas 功能帮助用户更高效地工作,而视觉微调则让开发者能够定制模型,使其更好地处理视觉任务。解决公平性问题和减少偏见同样是重点,确保无论人们是谁,AI 都能为每个人良好地工作。无论你是对模型进行微调的开发者,还是仅仅在使用最新功能,ChatGPT 都在不断发展,以满足广泛的需求。凭借实时能力、视觉集成以及对负责任使用的重视,这些更新正在为每个人打造更加值得信赖、可靠的 AI 体验。
访问我们的 GitHub repository并加入我们的社区,进一步探索 AI。详细了解 AI 在自动驾驶和医疗保健领域的应用。









