Ultralytics YOLO27:
视觉 AI

OpenAI 最新更新:Canvas、视觉微调及更多功能

加入我们,一起深入了解 OpenAI 最近发布的 ChatGPT 更新。我们将探索 Canvas、视觉能力微调以及最新的 Search 功能。

ABAbirami Vina6 min read
OpenAI 最新 ChatGPT 更新概览

上次我们在 9 月查看了 OpenAI 的 o1 模型(旨在提升推理能力),此后 ChatGPT 新增了许多令人兴奋的功能。其中一些版本更新面向开发者,另一些则旨在优化用户体验。总体而言,每次升级都能让与 ChatGPT 的互动更加直观高效。

Canvas 等旨在促进协作写作和编码的功能,以及面向视觉能力微调,提升了 ChatGPT 处理图像的能力,引发了广泛关注,鼓励用户探索更多创意可能性。与此同时,新 API 和公平性测试报告等技术升级,解决了模型集成道德 AI实践等方面的问题。让我们深入了解 OpenAI 最新的 ChatGPT 功能!

OpenAI Canvas 功能概览#

Canvas 是 ChatGPT 发布以来对其用户界面(UI)进行的首次重大更新。它采用全新的双屏布局,左侧边栏显示提示词,右侧窗口显示回复。这种新 UI 摒弃了聊天式单屏结构的常规工作流程,改用适合多任务处理的双屏布局,从而提升工作效率。

Canvas 为 ChatGPT 带来 UI 更新

图 1。 Canvas 为 ChatGPT 带来 UI 更新。

在 Canvas 推出之前,在 ChatGPT 上处理较长的文档意味着需要频繁上下滚动。在新布局中,提示词显示在左侧边栏,文本文档或代码片段占据屏幕的大部分区域。如有需要,你还可以自定义左侧边栏和输出屏幕的大小。此外,你可以选择部分文本或一段代码,在不更改整个文档的情况下编辑指定部分。

使用 Canvas 编辑文本的特定部分

图 2。使用 Canvas 编辑文本的特定部分。

如果你使用 Canvas,会发现 ChatGPT 界面中没有用于打开它的特定按钮或切换开关。相反,当你使用 GPT-4o 模型时,如果检测到你正在编辑写作编码,Canvas 就会自动打开。对于更简单的提示词,它会保持不活动状态。如果你想手动打开,可以使用“Open the Canvas”或“Get me the Canvas layout”等提示词。

目前,Canvas 处于测试阶段,仅适用于 GPT-4o。不过,OpenAI 表示,Canvas 结束测试后将向所有免费用户开放。

ChatGPT 的 API 更新#

OpenAI 发布了三项新的 ChatGPT API 更新,旨在提升效率、可扩展性和多功能性。下面让我们分别详细了解这些更新。

模型蒸馏#

通过 OpenAI APIs 使用 模型蒸馏功能,开发者可以利用 高级模型(如 GPT-4o 或 o1-preview)的输出,来提升小型且经济高效模型(如 GPT-4o mini)的 性能。模型蒸馏是一种通过 训练小型模型来模仿更高级模型行为的过程,从而使其在执行 特定任务时更加高效。

在该功能推出之前,开发者必须使用不同工具手动协调各种任务。这些任务包括生成数据集、衡量模型性能以及对模型进行微调,整个过程通常复杂且容易出错。模型蒸馏更新让开发者可以使用 Stored Completions,这是一种通过 API 捕获并存储高级模型生成的输入输出对,从而自动生成数据集的工具。

模型蒸馏的另一项功能 Evals(目前处于测试阶段)有助于衡量模型表现在特定任务上的效果,无需创建自定义评估脚本或使用独立工具。开发者可以使用通过 Stored Completions 生成的数据集,并通过 Evals 评估性能,从而对自己的自定义 GPT 模型进行微调。

使用 Evals 衡量模型性能

图 3。你可以使用 Evals 衡量模型性能。

提示词缓存#

在构建AI 应用时,尤其是聊天机器人时,多个 API 调用往往会反复使用相同的上下文(用于理解当前请求的背景信息或先前对话历史)。提示词缓存使开发者能够重复使用最近使用过的输入令牌(模型为理解提示词并生成回复而处理的文本片段),从而降低成本和延迟。

从 10 月 1 日起,OpenAI 已自动将提示词缓存应用于 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 等模型。这意味着,当开发者使用 API 与包含较长提示词(超过 1,024 个令牌)的模型交互时,系统会保存已经处理过的部分。

这样一来,如果再次使用相同或相似的提示词,系统就可以跳过对这些部分的重新计算。系统会自动缓存此前遇到的提示词中最长的部分,从 1,024 个令牌开始,并随着提示词变长,以每次 128 个令牌的块逐步增加。

Realtime API#

创建语音助手通常需要将音频转为文本、处理文本,然后再将其转换回用于播放回复的音频。OpenAI 的 Realtime API 旨在通过单个 API 请求处理整个流程。通过简化流程,该 API 支持与 AI 进行实时对话。

例如,集成 Realtime API 的语音助手可以根据用户请求执行下单查找信息等特定操作。该 API 让语音助手响应更迅速,也能快速适应用户需求。Realtime API 于 10 月 1 日通过公开测试版提供,共有六种语音。10 月 30 日又新增了五种语音,可用语音总数达到 11 种。

使用 Realtime API 练习新语言对话

图 4。使用 Realtime API 练习新语言对话的示例。

针对视觉任务微调 ChatGPT#

最初,GPT-4o 视觉语言模型只能使用纯文本数据集进行微调和定制。现在,随着视觉微调 API 的发布,开发者可以使用图像数据集训练和定制 GPT-4o。自发布以来,视觉微调已成为开发者和计算机视觉工程师广泛关注的话题。

要微调 GPT-4o 的视觉能力,开发者可以使用包含 100 至 50,000 张图像的图像数据集。确认数据集符合 OpenAI 要求的格式后,即可将其上传到 OpenAI 平台,并针对特定应用对模型进行微调。

例如,自动化公司 Automat 使用屏幕截图数据集训练 GPT-4o,使其能够根据描述识别屏幕上的 UI 元素。这有助于简化机器人流程自动化(RPA),让机器人更容易与用户界面交互。模型不再依赖固定坐标或复杂的选择器规则,而是可以根据简单描述识别 UI 元素,使自动化设置更具适应性,并在界面发生变化时更易于维护。

使用微调后的 GPT-4o 模型检测 UI 元素

图 5。使用微调后的 GPT-4o 模型版本检测 UI 元素。

ChatGPT 公平性与偏见检测#

随着 AI 变得日益先进,围绕AI 应用伦理问题成为热门话题。由于 ChatGPT 的回复基于用户提供的提示词和互联网上可获取的数据,因此要始终将其语言调整得负责任可能颇具挑战。报告称,ChatGPT 的回答会因姓名、性别和种族而产生偏见。为解决这一问题,OpenAI 内部团队开展了首次第一人称公平性测试。

姓名通常会传递有关我们文化和地理因素的细微线索。在大多数情况下,ChatGPT 会忽略姓名中的这些细微线索。不过,在某些情况下,反映种族或文化的姓名会导致 ChatGPT 给出不同回复,其中约 1% 的回复包含有害语言。消除偏见和有害语言对于语言模型而言是一项艰巨任务。不过,通过公开分享这些发现并承认模型的局限性,OpenAI 帮助用户改进提示词,以获得更加中立、无偏见的回答。

因用户姓名而产生不同 ChatGPT 回复的示例

图 6。因用户姓名而产生不同回复的示例。

了解 ChatGPT 搜索#

ChatGPT 刚推出时,AI 社区曾讨论它是否能够取代传统网页浏览。如今,许多用户正在使用 ChatGPT 代替 Google Search。

OpenAI 的新更新——Search 功能——让这一点更进一步。借助 Search,ChatGPT 可以生成最新回复,并附上相关来源的链接。截至 10 月 31 日,Search 功能已向所有 ChatGPT Plus 和 Team 用户开放,使 ChatGPT 的功能更接近 AI 驱动的搜索引擎。

使用 ChatGPT 新 Search 功能的示例

图 7。使用 ChatGPT 新 Search 功能的示例。

未来展望#

ChatGPT 的近期更新侧重于让 AI 更实用、更灵活且更公平。新的 Canvas 功能帮助用户更高效地工作,而视觉微调则让开发者能够定制模型,使其更好地处理视觉任务。解决公平性问题和减少偏见同样是重点,确保无论人们是谁,AI 都能为每个人良好地工作。无论你是对模型进行微调的开发者,还是仅仅在使用最新功能,ChatGPT 都在不断发展,以满足广泛的需求。凭借实时能力、视觉集成以及对负责任使用的重视,这些更新正在为每个人打造更加值得信赖、可靠的 AI 体验。

访问我们的 GitHub repository并加入我们的社区,进一步探索 AI。详细了解 AI 在自动驾驶医疗保健领域的应用。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅