深入了解 OpenAI GPT-4o Mini 的能力
探索 GPT-4o Mini 的功能和应用。OpenAI 最新且最具成本效益的模型提供先进的 AI 能力,价格比 GPT-3.5 Turbo 低 60%。

2024 年 5 月,OpenAI 发布了 GPT-4o,而现在,仅仅三个月后,他们又带来了另一个令人印象深刻的模型:GPT-4o Mini。2024 年 7 月 18 日,OpenAI 推出了 GPT-4o Mini。他们称其为“性价比最高的模型”!GPT-4o Mini 是一个紧凑型模型,在以往模型能力的基础上进行了构建,旨在让先进 AI 更易于使用且更加经济实惠。
GPT-4o Mini 目前支持 文本和视觉交互,未来更新预计将增加处理图像、视频和音频的能力。在本文中,我们将探讨 GPT-4o Mini 是什么、它的突出特性、使用方式、GPT-4 与 GPT-4o Mini 之间的差异,以及它如何用于各种计算机视觉应用场景。让我们深入了解 GPT-4o Mini 的能力吧!
什么是 GPT-4o Mini?#
GPT-4o Mini 是 OpenAI AI 模型系列的最新成员,旨在实现更高的性价比和更广泛的可访问性。它是一种多模态 大型语言模型 (LLM),这意味着它可以处理和生成不同类型的数据,例如文本、图像、视频和音频。该模型继承了 GPT-4 和 GPT-4o 等以往模型的优势,以紧凑的形式提供强大的能力。
GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%,输入 token(模型处理的文本或数据单位)每百万个收费 15 美分,输出 token(模型生成的响应单位)每百万个收费 60 美分。作为参考,一百万个 token 大致相当于处理 2,500 页文本。GPT-4o Mini 拥有 128K token 的上下文窗口,并且每次请求最多可处理 16K 个输出 token,旨在兼顾高效性与经济性。

图 1。GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%。
GPT-4o Mini 的主要特性#
GPT-4o Mini 支持一系列任务,是各种应用的理想选择。在同时运行多项操作时,例如调用多个 API、处理完整代码库或对话历史等大量数据,以及在 客户支持聊天机器人 中提供快速的实时响应,都可以使用它。
以下是其他一些主要特性:
- 更新后的知识库: 模型包含截至 2023 年 10 月的信息。
- 改进的分词器: GPT-4o Mini 处理非英语文本时的成本效益更高。
- 稳健的安全措施: 这些措施包括过滤有害内容,以及防范提示注入和系统操纵等安全问题。
开始使用 GPT-4o Mini#
你可以通过 ChatGPT 界面试用 GPT-4o Mini。免费版、Plus 和 Team 用户均可使用,它将取代 GPT-3.5,如下所示。Enterprise 用户也将在不久后获得访问权限,这与 OpenAI 让所有人受益于 AI 的目标一致。GPT-4o Mini 还可通过 API 提供给希望将其能力集成到应用中的开发者使用。目前,视觉能力只能通过 API 使用。

图 2。 ChatGPT 中的模型选项。
GPT-4o 与 GPT-4o Mini 的区别#
GPT-4o Mini 和 GPT-4o 在各种基准测试中都表现出色。GPT-4o 通常优于 GPT-4o Mini,但 GPT-4o Mini 仍然是日常任务中经济实惠的解决方案。基准测试包括推理任务、数学和编程能力,以及多模态推理。如下面的图像所示,与其他热门模型相比,GPT-4o Mini 的基准测试成绩相当高。

图 3。 GPT-4o Mini 与其他热门模型的对比。
亲自体验 GPT-4o 和 GPT-4o Mini#
网上一直有人讨论一个有趣的提示词,涉及 热门 LLM 错误比较小数。我们测试 GPT-4o 和 GPT-4o Mini 后,发现它们的推理能力存在明显差异。在下图中,我们询问两个模型 9.11 和 9.9 哪个更大,然后让它们解释自己的推理过程。

图 4。测试 GPT-4o 和 GPT-4o Mini。
两个模型最初都回答错误,声称 9.11 更大。然而,GPT-4o 能够通过推理得出正确答案,并指出 9.9 更大。它提供了详细的解释,并准确比较了这两个小数。相比之下,GPT-4o Mini 尽管正确理解了 9.9 更大的推理过程,却仍固执地坚持最初的错误答案。
两个模型都展现出强大的推理能力。GPT-4o 的自我纠错能力使其更出色,也更适合复杂任务。GPT-4o Mini 的适应性较弱,但对于较简单的任务,仍能提供清晰且准确的推理。
使用 GPT-4o Mini 处理各种计算机视觉应用场景#
如果你想探索 GPT-4o Mini 的视觉能力,又不想深入研究代码,可以在 OpenAI Playground 中轻松测试 API。我们亲自进行了尝试,看看 GPT-4o Mini 处理各种计算机视觉相关应用场景的效果。
使用 GPT-4o Mini 进行图像分类#
我们让 GPT-4o Mini 对两张图像进行分类:一张是蝴蝶,另一张是地图。该 AI 模型成功识别出了蝴蝶和地图。鉴于两张图像差异很大,这是一项相当简单的任务。

图 5。借助 GPT-4o Mini 对图像进行分类。
接着,我们又让模型处理了两张图像:一张展示停在植物上的蝴蝶,另一张展示停在地面上的蝴蝶。AI 再次表现出色,正确识别出了植物上的蝴蝶和地面上的蝴蝶。因此,我们又进一步提升了任务难度。

图 6。借助 GPT-4o Mini 对相似图像进行分类。
随后,我们让 GPT-4o Mini 对两张图像进行分类:一张展示蝴蝶在沼泽乳草的花朵上取食,另一张展示蝴蝶在百日菊花朵上取食。模型无需进一步微调,就能对如此具体的标签进行分类,实在令人惊叹。这些快速示例表明,GPT-4o Mini 可能无需定制训练即可用于 图像分类 任务。

图 7。借助 GPT-4o Mini 对细节丰富的图像进行分类。
使用 GPT-4o Mini 理解姿态#
目前,GPT-4o Mini 无法处理 目标检测 和 实例分割 等计算机视觉任务。GPT-4o 在准确性方面表现不佳,但可以用于此类任务。同样,对于 姿态理解,我们无法检测或估计图像中的姿态,但可以对姿态进行分类和理解。

图 8。使用 GPT-4o Mini 理解图像中的姿态。
上图展示了 GPT-4o Mini 如何对姿态进行分类和理解,尽管它无法检测或估计姿态的精确坐标。这在不同应用中都可能有所帮助。例如,在 体育分析 中,它可以大致评估运动员的动作,并帮助预防受伤。同样,在 物理治疗 中,它可以协助监控训练,确保患者在康复期间完成正确的动作。此外,在 监控 中,它可以通过分析整体肢体语言来 识别可疑活动。虽然 GPT-4o Mini 无法检测特定关键点,但它分类一般姿态的能力使其适用于这些领域及其他场景。
GPT-4o Mini 适用的应用场景#
我们已经了解了 GPT-4o Mini 的能力。现在,让我们讨论最适合使用 GPT-4o Mini 的应用场景。
GPT-4o Mini 非常适合需要高级自然语言理解能力且计算开销较小的应用。它使 AI 能够集成到以往成本过高的应用中。事实上,Artificial Analysis 的详细分析显示,与大多数其他模型相比,GPT-4o Mini 能以极快的速度提供高质量响应。

图 9。 GPT-4o Mini 的质量与输出速度。
以下是一些未来可能大放异彩的 关键领域:
- 虚拟助手和聊天机器人: GPT-4o Mini 可以提供快速且智能的响应,改善用户交互体验。
- 教育工具: 该模型可用于构建提供 个性化辅导和内容生成 的工具。
- 生产力工具: 它可以 改进任务处理,例如总结文档、起草电子邮件和翻译语言,从而提高效率。
- 语言翻译: 最新版本的 GPT 可用于开发翻译器,为不同语言之间的交流提供准确的实时语言翻译。
GPT-4o Mini 开启新机遇#
GPT-4o Mini 正在为多模态 AI 的未来创造新的机遇。自 2022 年发布 GPT-3 模型 text-davinci-003 以来,处理每段文本或数据的成本(即每个 token 的成本)已大幅下降,降幅接近 99%。成本下降清晰地表明,先进 AI 正变得更加经济实惠。随着 AI 模型不断改进,将 AI 集成到每个应用和网站中在经济上可行的可能性正越来越高!
想亲自体验 AI?访问我们的 GitHub 代码库,了解我们的创新成果并加入活跃的 社区。在我们的解决方案页面上,进一步了解 AI 在 制造业 和 农业 中的应用。









