Ultralytics YOLO27:
视觉 AI

xAI 推出集成 FLUX.1 的 Grok 2.0

了解 Elon Musk 的 xAI 推出的 Grok 2.0 及其与 FLUX.1 的集成。探索其功能、基准测试、模型比较以及试用方法等详细信息。

ABAbirami Vina6 min read
支持 FLUX.1 图像生成的 Grok 2.0

8 月 14 日,埃隆·马斯克的 AI 公司 xAI 在 X(前身为 Twitter)上宣布推出 Grok 2.0。这是一款集成了 FLUX.1 的聊天机器人,而 FLUX.1 是 Black Forest Labs 开发的图像生成模型。FLUX.1 是一款先进的模型,能够创建高度逼真的图像,其中包括可能被视为敏感或具有潜在误导性的图像。

与许多会屏蔽或过滤暴力、露骨或欺骗性图像等特定类型内容的热门图像生成器不同,FLUX.1 的限制较少。一些人认为这是言论自由的一次胜利,另一些人则对其先进能力印象深刻。不过,人们也担心这项强大技术的伦理影响以及潜在的滥用风险。让我们深入了解 Grok 2.0 能带来什么、FLUX.1 有哪些突出之处,以及你可以如何亲自尝试这些创新工具。

认识 FLUX.1:AI 图像生成器#

FLUX.1 是一款先进的开源 AI 图像生成器,由 Black Forest Labs 于 2024 年 8 月 1 日推出。Black Forest Labs 是一家由前 Stability AI 工程师创立的初创公司,这些工程师因开发广泛使用的 Stable Diffusion 模型而知名。FLUX.1 旨在与 MidJourney 和 DALL-E 3 等成熟产品直接竞争,为 AI 生成图像带来更高的质量和灵活性。例如,FLUX.1 在处理许多模型都难以应对的复杂细节方面表现出色,例如生成逼真的人手或标牌上的可读文字。

Black Forest Labs 提供 FLUX.1 的三种不同版本,可用于不同的应用场景。下面详细介绍这些版本:

  • FLUX.1 [pro]:旗舰模型,面向商业用途,旨在提供最高质量的输出。
  • FLUX.1 [dev]:可用于非商业用途的开放权重版本,非常适合研发。
  • FLUX.1 [schnell]:采用 Apache 2.0 许可证的速度优化模型,非常适合需要快速生成图像的个人项目和本地开发。

FLUX.1 各版本示意图

图 1。了解 FLUX.1 的各个版本

FLUX.1 是如何工作的?#

FLUX.1 采用混合模型架构,将 Transformer 和扩散技术相结合,模型规模为 120 亿个参数(神经网络中可调整的部分,可帮助模型从数据中学习)。Transformer 是一种神经网络,能够通过识别数据中的模式和关系来理解文本和图像等序列。扩散模型从随机噪声开始,逐步对其进行细化,直到形成清晰的图像。通过结合这两种方法,FLUX.1 可以发挥两种架构的优势,生成与给定文本提示相匹配的高质量图像。

FLUX.1 还采用了旋转位置嵌入和流匹配等先进技术。旋转位置嵌入帮助模型理解文本和图像中各元素的顺序与位置,确保它们组合起来具有合理性。流匹配是一种用于生成模型的技术,可以让从随机噪声生成图像的过程更加平滑、高效。

FLUX.1 基准测试#

将 FLUX.1 与 MidJourney v6.0、DALL·E 3(HD)和 SD3-Ultra 等其他热门模型进行比较时,FLUX.1 在 AI 图像生成领域树立了新的基准。它在图像质量、提示词遵循能力、输出多样性,以及对不同尺寸和宽高比的支持等关键方面表现出色。FLUX.1 [pro] 和 [dev] 模型擅长生成高度匹配用户需求的高质量图像,并且在提供清晰准确的结果方面通常优于其他模型。另一方面,FLUX.1 [schnell] 是快速图像生成领域最先进的模型之一,性能优于 MidJourney 等更复杂的模型。

Midjourney v6 与 FLUX.1 [pro] 的比较

图 2。Midjourney v6 与 FLUX.1[pro] 的比较

Grok 2.0:埃隆·马斯克的 xAI 最新成果#

Grok 2.0 是埃隆·马斯克的 AI 公司 xAI 开发的最新大型语言模型。Grok 2.0 于 2024 年 8 月发布,目前 X 平台(前身为 Twitter)的 X Premium 和 Premium+ 用户可以使用。此外,它很快还将通过企业 API 向开发者和企业开放。

Grok 2.0 解释梗图的示例

图 3。 Grok 2.0 解释梗图的示例。

Grok 2.0 基于 Transformer 架构。与旧版本 Grok 1.5 相比,它在遵循指令、推理解决问题以及提供准确信息方面表现得更好。这款聊天机器人已与其他领先的 AI 模型进行对比测试,并取得了令人印象深刻的结果。在涉及研究生水平科学问题、常识和复杂数学题的基准测试中,Grok 2.0 的表现优于 GPT-4 Turbo、Claude 3.5 Sonnet 和 Llama 3 405B 等热门模型。Grok 2.0 在需要视觉理解的任务中同样表现出色,并在视觉数学推理和基于文档的问答方面取得了高分。

Grok 2.0 与 FLUX.1 的连接#

FLUX.1 已集成到 Grok 2.0 中,从而实现文本生成与图像生成的无缝结合。如今,通过结合不同技术来改善功能和用户体验已很常见,但这次具体的集成受到了广泛关注。

一方面,FLUX.1 的集成因给 Grok 2.0 增添了“趣味”元素而受到一些人的称赞。用户可以尝试生成富有创意、有时甚至带有挑衅性的图像——其他 AI 工具可能会限制或严格审核这类内容。例如,一些用户在 X 上分享了描绘公众人物处于不当或有争议情境中的图像,并声称这支持言论自由的理念。

另一方面,批评者认为,FLUX.1 缺乏明确的伦理准则,可能导致虚假信息和深度伪造等严重的伦理与社会问题。一些人担心,在最具影响力的社交媒体平台之一上结合强大且不受审查的文本和图像生成功能,可能会加剧虚假信息的传播。

Grok 2.0 及其不受限制的方法#

这不仅关乎图像生成。Grok 2.0 本身比 ChatGPT 等我们最近熟悉的其他 AI 工具限制更少。这种缺乏审核的状况让模型能够以一些人觉得兴奋、另一些人觉得不安的方式突破界限。

例如,有人发现 Grok 2.0 会生成很容易被解读为虚假或误导性新闻的文本内容。最近的一起事件中,Grok 2.0 编造了一则关于 NBA 球员 Klay Thompson 的虚假故事,声称他在进行“砖块破坏狂欢”。这款 AI 聊天机器人误解了篮球术语“throwing bricks”,该术语仅指投篮不中。相反,Grok 2.0 按字面意思理解,捏造了一则 Thompson 使用真正的砖块实施破坏行为的故事。这条帖子很快在 X 上引发传播,甚至有一些用户添加虚假的受害者账号来助推虚假信息。

Grok 2 在 X 上发布的帖子

图 4。Grok 2 在 X 上发布的帖子。

尽管存在这些担忧,一些用户仍然欣赏 Grok 2.0 的“言论自由”立场。他们认为,与受到严格审核的 AI 模型相比,Grok 2.0 允许进行更开放的对话并提供更大的创作自由。他们将 Grok 2.0 视为对他们认为过于谨慎、会限制敏感话题讨论的“觉醒派”AI的一种制衡。对这些用户来说,Grok 2.0 提供了一个感觉不那么受社会规范约束的平台。

亲自试用 FLUX.1 和 Grok 2.0#

关于尝试 FLUX.1 和 Grok 2.0,有几种不同的选择。你可以直接通过 Hugging Face、Replicate 和 Fal.ai 等 AI 平台访问 FLUX.1。与此同时,Grok 2.0 仅向 X Premium 和 Premium+ 订阅用户提供。

要点总结#

FLUX.1 和 Grok 2.0 正在推动 AI 的边界,并引发富有洞察力的讨论。FLUX.1 凭借生成高度细致且逼真图像的能力,为 AI 生成图像树立了新标准。Grok 2.0 正在利用 FLUX.1 增强自身能力,使其不再局限于基于文本的交互。一方面,爱好者们对这些工具所提供的创作自由和不受审查的探索感到兴奋。另一方面,批评者正在警告虚假信息、深度伪造,以及在 X 这样具有影响力的平台上放任这些能力所带来的伦理影响风险。随着 FLUX.1 和 Grok 2.0 不断发展,它们正处于一场围绕数字时代的自由、创造力与责任的争论中心,而这场争论很可能在未来数年塑造 AI 的发展方向。

想进一步了解 Ultralytics,请查看我们的 GitHub 仓库、加入我们的社区,并探索我们面向医疗保健制造业等行业的最新 AI 解决方案!🚀

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅