Ultralytics YOLO27:
视觉 AI

2024 年以生成式 AI 浪潮开局

回顾 2024 年第一季度令人振奋的 AI 创新。我们将介绍 OpenAI 的 Sora AI、Neuralink 的脑机芯片以及最新 LLM 等突破性进展。

ABAbirami Vina7 min read
2024 年初的生成式 AI 突破

AI 社区似乎几乎每天都会登上头条。2024年的头几个月令人兴奋,新 AI 创新层出不穷。从强大的新型大型语言模型到人脑植入物,2024年正逐渐展现出惊人的一面。

我们正在见证 AI 改变各个行业,让信息更易获取,甚至迈出将人类思维与机器融合的第一步。让我们回顾2024年的第一季度,近距离看看短短几个月内 AI 取得的进展。

大型语言模型成为热门话题#

大型语言模型(LLMs)旨在基于海量文本数据理解、生成和处理人类语言,在2024年第一季度成为焦点。许多大型科技公司发布了自己的 LLM 模型,各自具备独特的能力。此前 GPT-3 等 LLM 的巨大成功推动了这一趋势。以下是2024年初最值得关注的一些 LLM 发布情况。

Anthropic 的 Claude 3#

Anthropic 于2024年3月14日发布了 Claude 3。Claude 3 模型分为三个版本:Opus、Sonnet 和 Haiku,分别服务于不同的市场和用途。Haiku 是速度最快的模型,针对快速、基础的响应进行了优化。Sonnet 在速度与智能之间取得平衡,面向企业应用。Opus 是最先进的版本,提供无与伦比的智能和推理能力,非常适合复杂任务和取得顶尖基准测试成绩。

Claude 3 具备许多先进功能和改进:

  • 增强的多语言对话:提升了包括西班牙语、日语和法语在内的多种语言能力。
  • 先进的视觉功能:能够处理各种视觉格式。
  • 减少拒答:理解能力更强,不必要的拒答更少,表明其上下文理解能力有所提升。
  • 扩展上下文窗口:提供 200K 上下文窗口,并可根据客户需求处理超过 100 万个 token 的输入。

展示 Claude 3 与之前版本上下文感知能力对比的图表

图1。 Claude 3 比之前的版本具备更强的上下文感知能力。

Databricks 的 DBRX#

Databricks DBRX 是 Databricks 于2024年3月27日发布的一款开放式通用 LLM。DBRX 在语言理解、编程和数学等多项基准测试中表现出色。它超越了其他成熟模型,同时体积约比同类模型小40%。

DBRX 与其他模型的对比

图2。 DBRX 与其他模型的对比。

DBRX 采用细粒度混合专家(MoE)架构,通过下一个 token 预测进行训练,因此我们可以看到训练和推理性能的显著提升。该架构允许模型通过参考一组多样化的专业子模型(即“专家”),更准确地预测序列中的下一个词。这些子模型擅长处理不同类型的信息或任务。

Google 的 Gemini 1.5#

Google 于2024年2月15日推出了 Gemini 1.5,这是一款计算高效的多模态 AI 模型,可以分析大量文本、视频和音频数据。最新模型在性能、效率和功能方面更加先进。Gemini 1.5 的一项关键特性是长上下文理解方面的突破。该模型能够稳定处理多达 100 万个 token。Gemini 1.5 的这些能力也得益于全新的基于 MoE 的架构。

热门 LLM 上下文长度对比

图3。热门 LLM 上下文长度对比

以下是 Gemini 1.5 最有趣的一些功能:

  • 改进的数据处理:支持直接上传大型 PDF、代码仓库或长视频作为提示词。模型可以跨模态进行推理并输出文本。
  • 多文件上传和查询:开发者现在可以上传多个文件并提出问题。
  • 可用于不同任务:该模型经过优化,可扩展应用于各种任务,并在数学、科学、推理、多语言能力、视频理解和代码等方面有所改进。

来自 AI 的惊艳视觉效果#

2024年第一季度发布了能够生成逼真视觉内容的生成式 AI 模型,引发了人们对社交媒体未来和 AI 发展方向的讨论。让我们深入了解这些引发热议的模型。

OpenAI 的 Sora#

OpenAI 于2024年2月15日宣布推出名为 Sora 的先进文本生成视频深度学习模型。OpenAI 是 ChatGPT 的创建者。Sora 是一款文本生成视频工具,能够根据用户的文本提示生成时长达一分钟、具有高视觉质量的视频。

例如,请看看下面的提示词。

“一个精美呈现的珊瑚礁纸艺世界,充满色彩斑斓的鱼类和海洋生物。”

下面是输出视频中的一帧。

OpenAI Sora 生成的视频画面

图4。 Sora 生成的视频画面。

Sora 的架构将用于生成纹理的扩散模型与用于保持结构连贯性的 Transformer 模型相结合,从而实现了这一点。目前,Sora 已向红队测试人员以及少数视觉艺术家、设计师和电影制作人开放,以了解相关风险并收集反馈。

Stability AI 的 Stable Diffusion 3#

Stability AI 于2024年2月22日宣布推出 Stable Diffusion 3,这是一款文本生成图像模型。该模型结合了扩散 Transformer 架构和流匹配技术。虽然他们尚未发布技术论文,但有几个关键特性值得关注。

Stable Diffusion 3 生成的巫师施放宇宙法术的图像

图 5。基于以下提示生成的输出图像:“一幅史诗般的动漫艺术作品:夜晚,一位巫师站在山顶,将宇宙魔法施向黑暗的天空,天空中由彩色能量组成的文字写着“Stable Diffusion 3””(来源

Stable Diffusion 的最新模型在生成包含多个主体的图像时,性能、图像质量和准确性均有所提升。Stable Diffusion 3 还将提供从8亿到80亿参数不等的多种模型。用户可以根据自身对可扩展性和细节的具体需求进行选择。

Google 的 Lumiere#

Google 于2024年1月23日推出了 Lumiere,这是一款文本生成视频的扩散模型。Lumiere 使用名为 Space-Time-U-Net 的架构,简称 STUNet。它能帮助 Lumiere 理解视频中物体的位置及其运动方式,从而生成流畅且逼真的视频。

Google Lumiere 生成的熊猫弹尤克里里视频画面

图6。根据提示词“熊猫在家里弹尤克里里”生成的视频画面。

Lumiere 每个视频能够生成80帧,正在突破 AI 领域的视频质量界限并树立新标准。以下是 Lumiere 的一些功能:

  • 图像生成视频:从一张图像和一个提示词开始,Lumiere 可以将图像制作成视频。
  • 风格化生成:Lumiere 可以使用单张参考图像生成特定风格的视频。
  • 动态照片:Lumiere 可以让图像中的特定区域动起来,创建动态场景,例如让某个物体移动而场景的其余部分保持静止。
  • 视频修复:它可以修改视频的部分内容,例如更换人物服装或改变背景细节。

未来仿佛已经到来#

2024年初还带来了许多仿佛科幻电影般的 AI 创新。过去我们认为不可能实现的事情,如今正在付诸实践。随着以下发现的出现,未来似乎已不再遥远。

Elon Musk 的 Neuralink 于2024年1月29日成功将无线脑机芯片植入人体。这是连接人脑与计算机道路上的重要一步。Elon Musk 分享称,Neuralink 的首款产品名为“Telepathy”,目前正在开发中。

Neuralink 植入物

图7。 Neuralink 植入物

其目标是让用户,尤其是肢体功能丧失的人,通过思维轻松控制设备。这项技术的潜在应用远不止提供便利。Elon Musk 设想了这样一个未来:瘫痪人士也能轻松交流。

Disney 的 HoloTile Floor#

2024年1月18日,Walt Disney Imagineering 展示了 HoloTile Floor。它被称为世界上首个多人全向跑步机地面。

Disney Imagineer Lanny Smoot 站在 HoloTile 地板上

图8。Disney Imagineer Lanny Smoot 在 HoloTile 地板上展示这项最新创新。

它可以像心灵感应一样在任何人或物体下方移动,为用户带来沉浸式虚拟现实和增强现实体验。你可以在上面向任意方向行走,同时避免碰撞。Disney 的 HoloTile Floor 还可以铺设在剧院舞台上,以富有创意的方式进行舞蹈和移动。

Apple 的 Vision Pro#

2024年2月2日,Apple 备受期待的 Vision Pro 头显上市。它具备一系列旨在重新定义虚拟现实和增强现实体验的功能与应用。Vision Pro 头显通过融合娱乐、生产力和空间计算,满足多样化的受众需求。Apple 自豪地宣布,在上市时已有超过600款应用针对 Vision Pro 进行了优化,涵盖生产力工具、游戏和娱乐服务等。

Cognition 的 Devin#

2024年3月12日,Cognition 发布了一款名为 Devin 的软件工程助手。Devin 是全球首个自主 AI 软件工程师尝试。与提供建议或完成特定任务的传统编码助手不同,Devin 旨在处理完整的软件开发项目,从最初构想到最终完成。

它可以学习新技术,构建和部署完整应用,查找并修复错误,训练自己的模型,为开源代码库和生产代码库做出贡献,甚至承接来自 Upwork 等网站的真实开发工作。

Devin 与其他模型的对比

图9。 Devin 与其他模型的对比。

Devin 在 SWE-bench 上接受了评估。这是一项具有挑战性的基准测试,要求智能体解决 Django 和 scikit-learn 等开源项目中的真实 GitHub 问题。它端到端正确解决了13.86%的问题,而此前最先进的水平为1.96%。

其他值得一提的项目#

近期发生了太多事情,本文不可能面面俱到。不过,以下还有一些值得一提的项目。

  • NVIDIA 于2024年3月21日宣布推出 LATTE3D,这是一款文本生成3D的 AI 模型,可以根据文本提示即时创建3D表示。
  • Midjourney 的新文本生成视频工具由 CEO David Holz 预告,已于1月开始训练,预计很快推出。
  • Lenovo 于2024年1月8日发布了搭载 E Ink Prism 技术的 ThinkBook 13x 以及高性能 AI 笔记本电脑,推动 AI PC 革命不断发展。

和我们一起关注 AI 趋势!#

2024年初见证了 AI 领域的突破性进展以及许多重大的技术里程碑。但这只是 AI 能力的起点。如果你想进一步了解最新的 AI 发展,Ultralytics 可以为你提供帮助。

查看我们的 GitHub repository,了解我们在计算机视觉和 AI 领域的最新贡献。你还可以浏览我们的解决方案页面,了解 AI 如何应用于制造业医疗保健等行业。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅