Ultralytics YOLO27:
视觉 AI

深入了解 OpenAI GPT-4o Mini 的能力

探索 GPT-4o Mini 的功能和应用。OpenAI 最新且最具成本效益的模型提供先进的 AI 能力,价格比 GPT-3.5 Turbo 低 60%。

ABAbirami Vina6 min read
OpenAI GPT-4o Mini:高性价比多模态 AI 模型

2024 年 5 月,OpenAI 发布了 GPT-4o,而现在,仅仅三个月后,他们又带来了另一个令人印象深刻的模型:GPT-4o Mini。2024 年 7 月 18 日,OpenAI 推出了 GPT-4o Mini。他们称其为“性价比最高的模型”!GPT-4o Mini 是一个紧凑型模型,在以往模型能力的基础上进行了构建,旨在让先进 AI 更易于使用且更加经济实惠。

GPT-4o Mini 目前支持 文本和视觉交互,未来更新预计将增加处理图像、视频和音频的能力。在本文中,我们将探讨 GPT-4o Mini 是什么、它的突出特性、使用方式、GPT-4 与 GPT-4o Mini 之间的差异,以及它如何用于各种计算机视觉应用场景。让我们深入了解 GPT-4o Mini 的能力吧!

什么是 GPT-4o Mini?#

GPT-4o Mini 是 OpenAI AI 模型系列的最新成员,旨在实现更高的性价比和更广泛的可访问性。它是一种多模态 大型语言模型 (LLM),这意味着它可以处理和生成不同类型的数据,例如文本、图像、视频和音频。该模型继承了 GPT-4 和 GPT-4o 等以往模型的优势,以紧凑的形式提供强大的能力。

GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%,输入 token(模型处理的文本或数据单位)每百万个收费 15 美分,输出 token(模型生成的响应单位)每百万个收费 60 美分。作为参考,一百万个 token 大致相当于处理 2,500 页文本。GPT-4o Mini 拥有 128K token 的上下文窗口,并且每次请求最多可处理 16K 个输出 token,旨在兼顾高效性与经济性。

GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%

图 1。GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%。

GPT-4o Mini 的主要特性#

GPT-4o Mini 支持一系列任务,是各种应用的理想选择。在同时运行多项操作时,例如调用多个 API、处理完整代码库或对话历史等大量数据,以及在 客户支持聊天机器人 中提供快速的实时响应,都可以使用它。

以下是其他一些主要特性:

  • 更新后的知识库: 模型包含截至 2023 年 10 月的信息。
  • 改进的分词器: GPT-4o Mini 处理非英语文本时的成本效益更高。
  • 稳健的安全措施: 这些措施包括过滤有害内容,以及防范提示注入和系统操纵等安全问题。

开始使用 GPT-4o Mini#

你可以通过 ChatGPT 界面试用 GPT-4o Mini。免费版、Plus 和 Team 用户均可使用,它将取代 GPT-3.5,如下所示。Enterprise 用户也将在不久后获得访问权限,这与 OpenAI 让所有人受益于 AI 的目标一致。GPT-4o Mini 还可通过 API 提供给希望将其能力集成到应用中的开发者使用。目前,视觉能力只能通过 API 使用。

ChatGPT 中的模型选项

图 2。 ChatGPT 中的模型选项。

GPT-4o 与 GPT-4o Mini 的区别#

GPT-4o Mini 和 GPT-4o 在各种基准测试中都表现出色。GPT-4o 通常优于 GPT-4o Mini,但 GPT-4o Mini 仍然是日常任务中经济实惠的解决方案。基准测试包括推理任务、数学和编程能力,以及多模态推理。如下面的图像所示,与其他热门模型相比,GPT-4o Mini 的基准测试成绩相当高。

GPT-4o Mini 与其他热门模型的对比

图 3。 GPT-4o Mini 与其他热门模型的对比。

亲自体验 GPT-4o 和 GPT-4o Mini#

网上一直有人讨论一个有趣的提示词,涉及 热门 LLM 错误比较小数。我们测试 GPT-4o 和 GPT-4o Mini 后,发现它们的推理能力存在明显差异。在下图中,我们询问两个模型 9.11 和 9.9 哪个更大,然后让它们解释自己的推理过程。

测试 GPT-4o 和 GPT-4o Mini 的推理能力

图 4。测试 GPT-4o 和 GPT-4o Mini。

两个模型最初都回答错误,声称 9.11 更大。然而,GPT-4o 能够通过推理得出正确答案,并指出 9.9 更大。它提供了详细的解释,并准确比较了这两个小数。相比之下,GPT-4o Mini 尽管正确理解了 9.9 更大的推理过程,却仍固执地坚持最初的错误答案。

两个模型都展现出强大的推理能力。GPT-4o 的自我纠错能力使其更出色,也更适合复杂任务。GPT-4o Mini 的适应性较弱,但对于较简单的任务,仍能提供清晰且准确的推理。

使用 GPT-4o Mini 处理各种计算机视觉应用场景#

如果你想探索 GPT-4o Mini 的视觉能力,又不想深入研究代码,可以在 OpenAI Playground 中轻松测试 API。我们亲自进行了尝试,看看 GPT-4o Mini 处理各种计算机视觉相关应用场景的效果。

使用 GPT-4o Mini 进行图像分类#

我们让 GPT-4o Mini 对两张图像进行分类:一张是蝴蝶,另一张是地图。该 AI 模型成功识别出了蝴蝶和地图。鉴于两张图像差异很大,这是一项相当简单的任务。

使用 GPT-4o Mini 对蝴蝶和地图图像进行分类

图 5。借助 GPT-4o Mini 对图像进行分类。

接着,我们又让模型处理了两张图像:一张展示停在植物上的蝴蝶,另一张展示停在地面上的蝴蝶。AI 再次表现出色,正确识别出了植物上的蝴蝶和地面上的蝴蝶。因此,我们又进一步提升了任务难度。

使用 GPT-4o Mini 对相似蝴蝶图像进行分类

图 6。借助 GPT-4o Mini 对相似图像进行分类。

随后,我们让 GPT-4o Mini 对两张图像进行分类:一张展示蝴蝶在沼泽乳草的花朵上取食,另一张展示蝴蝶在百日菊花朵上取食。模型无需进一步微调,就能对如此具体的标签进行分类,实在令人惊叹。这些快速示例表明,GPT-4o Mini 可能无需定制训练即可用于 图像分类 任务。

使用 GPT-4o Mini 对细节丰富的蝴蝶图像进行分类

图 7。借助 GPT-4o Mini 对细节丰富的图像进行分类。

使用 GPT-4o Mini 理解姿态#

目前,GPT-4o Mini 无法处理 目标检测实例分割 等计算机视觉任务。GPT-4o 在准确性方面表现不佳,但可以用于此类任务。同样,对于 姿态理解,我们无法检测或估计图像中的姿态,但可以对姿态进行分类和理解。

使用 GPT-4o Mini 理解图像中的姿态

图 8。使用 GPT-4o Mini 理解图像中的姿态。

上图展示了 GPT-4o Mini 如何对姿态进行分类和理解,尽管它无法检测或估计姿态的精确坐标。这在不同应用中都可能有所帮助。例如,在 体育分析 中,它可以大致评估运动员的动作,并帮助预防受伤。同样,在 物理治疗 中,它可以协助监控训练,确保患者在康复期间完成正确的动作。此外,在 监控 中,它可以通过分析整体肢体语言来 识别可疑活动。虽然 GPT-4o Mini 无法检测特定关键点,但它分类一般姿态的能力使其适用于这些领域及其他场景。

GPT-4o Mini 适用的应用场景#

我们已经了解了 GPT-4o Mini 的能力。现在,让我们讨论最适合使用 GPT-4o Mini 的应用场景。

GPT-4o Mini 非常适合需要高级自然语言理解能力且计算开销较小的应用。它使 AI 能够集成到以往成本过高的应用中。事实上,Artificial Analysis 的详细分析显示,与大多数其他模型相比,GPT-4o Mini 能以极快的速度提供高质量响应。

GPT-4o Mini 的质量与输出速度

图 9。 GPT-4o Mini 的质量与输出速度。

以下是一些未来可能大放异彩的 关键领域

  • 虚拟助手和聊天机器人: GPT-4o Mini 可以提供快速且智能的响应,改善用户交互体验。
  • 教育工具: 该模型可用于构建提供 个性化辅导和内容生成 的工具。
  • 生产力工具: 它可以 改进任务处理,例如总结文档、起草电子邮件和翻译语言,从而提高效率。
  • 语言翻译: 最新版本的 GPT 可用于开发翻译器,为不同语言之间的交流提供准确的实时语言翻译。

GPT-4o Mini 开启新机遇#

GPT-4o Mini 正在为多模态 AI 的未来创造新的机遇。自 2022 年发布 GPT-3 模型 text-davinci-003 以来,处理每段文本或数据的成本(即每个 token 的成本)已大幅下降,降幅接近 99%。成本下降清晰地表明,先进 AI 正变得更加经济实惠。随着 AI 模型不断改进,将 AI 集成到每个应用和网站中在经济上可行的可能性正越来越高!

想亲自体验 AI?访问我们的 GitHub 代码库,了解我们的创新成果并加入活跃的 社区。在我们的解决方案页面上,进一步了解 AI 在 制造业农业 中的应用。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅