深入探讨 OpenAI 的 GPT-4o Mini 的功能
探索 GPT-4o Mini 的功能和应用。OpenAI 最新且最具成本效益的模型提供了先进的人工智能功能,价格比 GPT-3.5 Turbo 便宜 60%。

2024年5月,OpenAI发布了 GPT-4o,现在仅仅三个月后,他们又推出了另一款令人印象深刻的模型:GPT-4o Mini。2024年7月18日,OpenAI推出了 GPT-4o Mini。他们称其为“最具成本效益的模型”!GPT-4o Mini是一个紧凑型模型,它在前代模型的能力基础之上构建,旨在让先进的AI更加普及和经济实惠。
GPT-4o Mini目前支持 文本和视觉交互,预计未来的更新将增加处理图像、视频和音频的功能。在本文中,我们将探讨什么是GPT-4o Mini、其突出的功能、如何使用它、GPT-4与GPT-4o Mini之间的区别,以及它如何在各种计算机视觉用例中使用。让我们深入了解一下GPT-4o Mini能提供什么!
GPT-4o Mini 是什么?#
GPT-4o Mini是OpenAI AI模型阵容的最新成员,旨在更具成本效益和易用性。它是一个多模态 大语言模型 (LLM),这意味着它可以处理和生成不同类型的数据,例如文本、图像、视频和音频。该模型以GPT-4和GPT-4o等前代模型的优势为基础,在一个紧凑的包中提供了强大功能。
GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%,每百万输入 token(模型处理的文本或数据单元)收费 15 美分,每百万输出 token(模型响应生成的单元)收费 60 美分。为了让你有个直观感受,一百万 token 大约相当于处理 2,500 页文本。凭借 128K token 的上下文窗口以及处理每个请求高达 16K 输出 token 的能力,GPT-4o Mini 被设计得既高效又经济。

图 1. GPT-4o Mini 比 GPT-3.5 Turbo 便宜 60%。
GPT-4o Mini 的主要特点#
GPT-4o Mini支持一系列任务,使其成为各种应用的绝佳选择。当运行多个并发操作时,例如调用多个API、处理大量数据(如完整代码库或对话历史记录),以及在 客户支持聊天机器人 中提供快速、实时的响应,它都可以派上用场。
以下是其他一些关键功能:
- 更新的知识库: 该模型包含截至 2023 年 10 月的信息。
- 改进的分词器 (Tokenizer): GPT-4o Mini 使处理非英语文本更具成本效益。
- 强大的安全措施: 这些措施包括过滤有害内容,以及防止 prompt 注入和系统篡改等安全问题。
GPT-4o Mini 入门指南#
你可以通过ChatGPT界面尝试使用GPT-4o Mini。免费版、Plus版和Team版用户均可使用它,它取代了GPT-3.5,如下所示。符合OpenAI向所有人提供AI利益的目标,Enterprise 用户很快也将获得访问权限。对于希望将功能集成到其应用程序中的开发者,GPT-4o Mini也可通过API使用。目前,视觉功能仅通过API访问。

图 2. ChatGPT 中的模型选项。
GPT-4o 与 GPT-4o Mini 的区别#
GPT-4o 和 GPT-4o Mini 在各项基准测试中均表现出色。虽然 GPT-4o 的表现通常优于 GPT-4o Mini,但 GPT-4o Mini 仍然是日常任务的经济高效解决方案。基准测试涵盖推理任务、数学和编程能力以及多模态推理。如下图所示,与其他流行模型相比,GPT-4o Mini 的基准测试得分相当高。

图 3. 将 GPT-4o Mini 与其他流行模型进行比较。
上手体验 GPT-4o 和 GPT-4o Mini#
网上热议的一个有趣提示涉及 流行的LLM错误地比较小数。当我们对GPT-4o和GPT-4o Mini进行测试时,它们的推理能力显示出明显的差异。在下图中,我们询问两个模型哪个更大:9.11或9.9,然后让它们解释其推理过程。

图 4. 测试 GPT-4o 和 GPT-4o Mini。
两个模型最初都给出了错误回答,声称 9.11 更大。然而,GPT-4o 能够推理出正确答案,并指出 9.9 更大。它提供了详细的解释并准确地比较了小数。相比之下,GPT-4o Mini 虽然能正确理解 9.9 更大的推理逻辑,却固执地维持其最初的错误回答。
这两个模型都展现了强大的推理能力。GPT-4o 自我纠正的能力使其更胜一筹,更适用于复杂任务。GPT-4o Mini 虽然适应性稍弱,但对于简单任务仍能提供清晰准确的推理。
将 GPT-4o Mini 用于各种计算机视觉用例#
如果你不想深入代码,而是想探索GPT-4o Mini的视觉功能,你可以轻松地在 OpenAI Playground 上测试API。我们亲自进行了尝试,看看GPT-4o Mini处理各种计算机视觉相关用例的效果如何。
使用 GPT-4o Mini 进行图像分类#
我们要求GPT-4o Mini 对两张图像进行分类:一张是蝴蝶,一张是地图。AI模型成功识别了蝴蝶和地图。鉴于两张图像截然不同,这是一项相当简单的任务。

图 5. 在 GPT-4o Mini 的帮助下进行图像分类。
我们继续向模型输入了另外两张图片:一张显示蝴蝶停在植物上,另一张显示蝴蝶停在地面上。该 AI 再次表现出色,正确地识别出了植物上的蝴蝶和地面上的蝴蝶。因此,我们又更进了一步。

图 6. 在 GPT-4o Mini 的帮助下分类相似的图片。
然后我们要求GPT-4o Mini对两张图像进行分类:一张显示一只蝴蝶在沼泽马利筋的花朵上觅食,另一张显示一只蝴蝶在百日草花朵上觅食。令人惊奇的是,该模型无需进一步微调就能对如此具体的标签进行分类。这些快速示例表明,GPT-4o Mini可能可用于 图像分类 任务,而无需自定义训练。

图 7. 在 GPT-4o Mini 的帮助下分类细节图片。
使用 GPT-4o Mini 理解姿态#
截至目前,像 目标检测 和 实例分割 这样的计算机视觉任务无法使用GPT-4o Mini处理。GPT-4o在准确性方面较为吃力,但可用于此类任务。顺便说一句,关于 理解姿态,我们无法检测或估计图像中的姿态,但我们可以对姿态进行分类和理解。

图 8. 使用 GPT-4o Mini 理解图片中的姿态。
上图显示了GPT-4o Mini如何对姿态进行分类和理解,尽管无法检测或估计姿态的精确坐标。这在不同的应用程序中很有帮助。例如,在 体育分析 中,它广义上可以评估运动员的动作并帮助预防受伤。类似地,在 物理治疗 中,它有助于监测锻炼,以确保患者在康复期间做出正确的动作。同样对于 监控,它可以通过分析一般的肢体语言来帮助 识别可疑活动。虽然GPT-4o Mini无法检测具体的关键点,但其对一般姿态进行分类的能力使其在这些领域和其他领域都很有用。
GPT-4o Mini 适用的应用场景#
我们已经了解了 GPT-4o Mini 的功能。现在,让我们讨论一下最适合使用 GPT-4o Mini 的应用场景。
GPT-4o Mini非常适合需要高级自然语言理解且计算占用小的应用程序。它使得将AI集成到通常成本过高的应用程序中成为可能。事实上,Artificial Analysis 的详细分析表明,与大多数其他模型相比,GPT-4o Mini以惊人的速度提供高质量的响应。

图 9. GPT-4o Mini 的质量与输出速度。
以下是未来它可能大放异彩的一些 关键领域:
- 虚拟助手和聊天机器人: GPT-4o Mini 可以提供快速且智能的响应,以改善用户交互。
- 教育工具: 该模型可用于构建工具,以提供 个性化辅导和内容生成。
- 生产力工具: 它可以 改进任务,例如总结文档、起草电子邮件和翻译语言,从而提高效率。
- 语言翻译: 最新版本的 GPT 可用于开发翻译器,提供准确的实时语言翻译,从而实现不同语言之间更好的沟通。
GPT-4o Mini 开辟了新机遇#
GPT-4o Mini 正在为多模态 AI 的未来创造新的机遇。自 2022 年 GPT-3 模型 text-davinci-003 发布以来,处理每段文本或数据的成本(即每 token 成本)已经大幅下降了近 99%。成本的下降表明了一个明确的趋势,即让先进的 AI 变得更加负担得起。随着 AI 模型不断改进,将 AI 集成到每个应用程序和网站中在经济上变得越来越可行!
想要亲身体验AI吗?访问我们的 GitHub 存储库 查看我们的创新成果,并成为我们活跃的 社区 的一部分。在我们的解决方案页面上了解有关 制造业 和 农业 中AI应用的更多信息。






