Ultralytics 在 YOLO Vision 2025 深圳大会的关键亮点!
重温 2025 年深圳 YOLO Vision 盛会的关键时刻,Ultralytics 在此汇聚了创新者、合作伙伴和 AI 社区,共同度过了充满灵感的一天。

10月26日,YOLO Vision 2025 (YV25)在深圳华侨城创意文化园B10栋迎来了中国首秀。Ultralytics 的这场混合视觉 AI 活动吸引了200多名线下与会者,还有更多人通过 YouTube 和哔哩哔哩线上参与。
YV25 深圳直播在 YouTube 上的观看量已经突破3,500次,随着活动亮点在社区中传播,关注度仍在持续上升。这一天充满了各种创意、交流以及对视觉 AI 未来发展方向的亲身体验。
活动伊始,主持人黄雪莹致欢迎词,邀请大家在整个活动期间积极交流、学习并参与讨论。她介绍道,继 9 月伦敦站之后,这是今年举办的第二场 YOLO Vision 大会,并分享了再次在深圳汇聚视觉 AI 社区成员的激动之情。
在本文中,我们将回顾当天活动的精华,包括模型更新、演讲会话、现场演示,以及将大家凝聚在一起的社区瞬间。让我们开始吧!
Ultralytics YOLO 模型的发展历程#
当天的第一场主题演讲由 Ultralytics 创始人兼 CEO Glenn Jocher主持,他分享了Ultralytics YOLO 模型如何从一项研究突破成长为全球应用最广泛的视觉 AI 模型之一。Glenn 解释说,他早期的工作主要致力于让 YOLO 更加易于使用。
他将这些模型移植到 PyTorch,改进了文档,并公开分享了一切,以便世界各地的开发者都能基于此进行构建。正如他回忆的那样:“我在 2018 年全身心地投入其中。我认定这就是我的未来。”当初的一项个人努力,很快演变成了一场全球性的开源运动。

图 1. Glenn Jocher 在 YOLO Vision 2025 深圳大会台上演讲。
如今,Ultralytics YOLO 模型每天驱动着数十亿次推理,Glenn 强调,这种规模的实现离不开贡献者的共同建设。来自全球的研究人员、工程师、学生、爱好者和开源贡献者们将 YOLO 塑造成了今天的模样。
正如 Glenn 所言:“外面有将近一千名贡献者,对此我们深表感激。没有这些人,我们就不会有今天的成就。”
关于 Ultralytics YOLO26 的更新#
Ultralytics YOLO26 的首次亮相是在今年早些时候的YOLO Vision 2025 伦敦活动上,当时它作为 Ultralytics YOLO 模型家族的下一个重大前沿进展被引入。在 YV25 深圳大会上,Glenn 更新了自该公告以来的进展,并让 AI 社区更近距离地了解了该模型的演进过程。
Ultralytics YOLO26 的设计宗旨是更小、更快、更准确,同时在实际应用中保持实用性。Glenn 解释说,团队在过去的一年里一直在精简架构、对不同设备进行性能基准测试,并吸收了来自研究和社区反馈的见解。我们的目标是提供最先进的性能,同时不增加模型部署的难度。
对 Ultralytics YOLO26 的期待#
Glenn 强调的核心更新之一是,Ultralytics YOLO26 配合了专门的超参数调优活动,从完全从头开始训练转变为在更大数据集上进行微调。他详细说明,这种方法更加符合实际的真实应用场景。
以下是大会分享的其他一些关键改进:
- 简化架构:移除了分布焦点损失 (DFL) 层。这使得模型更简洁、运行更快,同时保持了同等的准确度。
- 端到端推理支持:Ultralytics YOLO26 原生支持端到端,这意味着它可以在没有独立 NMS 层的情况下运行。这使得导出到 ONNX 和 TensorRT 等格式并在边缘硬件上部署变得容易得多。
- 更好的小目标性能:更新后的损失策略有助于模型更可靠地检测微小目标,这长期以来一直是计算机视觉中的一个挑战。
- 全新的混合优化器:YOLO26 包含了一个受近期大语言模型训练研究启发的新优化器,它提高了模型准确度,并且现在已直接内置于 Ultralytics Python 包中。
Ultralytics YOLO26 是实用型视觉 AI 的下一个里程碑#
这些更新共同使得模型的 CPU 运行速度比Ultralytics YOLO11快达 43%,同时准确率更高,这使得 YOLO26 对嵌入式设备、机器人和边缘系统具有特别重大的影响力。
Ultralytics YOLO26 将支持目前 YOLO11 中提供的所有相同任务和模型大小,整个系列共有 25 种模型变体。这包括用于检测、分割、姿态估计、旋转边界框和分类的模型,尺寸从 nano 到 extra large 不等。
团队还在开发五种可提示变体。这些模型无需训练,即可接收文本提示并直接返回边界框。
这是迈向更灵活、基于指令的视觉工作流的早期一步,这些工作流更容易适应不同的用例。Ultralytics YOLO26 模型仍在积极开发中,但早期的性能表现非常强劲,团队正致力于尽快发布它们。
预览 Ultralytics 平台#
在 YOLO26 的更新之后,Glenn 邀请了我们的产品工程负责人 Prateek Bhatnagar 上台,对 Ultralytics Platform 进行现场演示。该平台的构建旨在将计算机视觉工作流程的关键部分整合在一起,包括探索数据集、标注图像、训练模型以及对比结果。

图 2. Prateek Bhatnagar 展示 Ultralytics 平台。
Prateek 指出,该平台忠实于 Ultralytics 的开源根基,引入了两个社区空间——数据集社区和项目社区,开发者可以在其中贡献、复用并改进彼此的工作。在演示期间,他展示了 AI 辅助标注、便捷的云端训练,以及直接从社区微调模型而无需本地 GPU 资源的能力。
该平台目前处于开发阶段。Prateek 鼓励观众密切关注后续公告,并提到团队正在中国扩张以支持发布。
YOLO 背后的声音:作者座谈会#
随着声势不断壮大,活动转入了一场圆桌讨论,汇集了多位不同 YOLO 模型背后的研究人员。圆桌嘉宾包括 Glenn Jocher,以及我们的高级机器学习工程师京邱 (Jing Qiu)、Meta 机器学习工程师兼 YOLOv10 作者之一陈辉 (Chen Hui),以及美团算法策略专家兼 YOLOv6 作者之一张博 (Bo Zhang)。

图 3. YV25 深圳大会上的 YOLO 模型开发座谈会,嘉宾包括黄雪莹、Chen Hui、Bo Zhang、Jing Qiu 和 Glenn Jocher。
讨论重点在于 YOLO 如何通过实际使用不断进化。演讲嘉宾探讨了进展往往如何受到实际部署挑战的驱动,例如在边缘设备上的高效运行、改进小目标检测以及简化模型导出。
专家组指出,与其一味追求准确度,不如在生产环境中平衡速度、可用性和可靠性。另一个共识是迭代和社区反馈的重要性。
以下是对话中其他一些有趣的见解:
- 开放词汇检测在 YOLO 生态系统中势头渐长: 新模型展示了视觉-语言对齐和基于提示的工作流如何检测固定类别之外的目标。
- 轻量化注意力机制正在崛起: 嘉宾们讨论了如何利用高效的注意力机制(而非到处使用全局注意力)来提升准确率,同时保持轻量级的推理,以适应边缘设备。
- 通过社区尽早并频繁迭代: 专家组成员强化了“构建-测试-改进”的理念,即相比冗长的私有开发周期,更早发布模型并向用户学习能带来更好的结果。
定义 AI 与视觉未来的思想领袖#
接下来,我们深入了解一下 YV25 深圳站的主题演讲,AI 社区的领袖们分享了视觉 AI 如何演进,从数字人和机器人到多模态推理和高效边缘部署。
教会 AI 理解人类体验#
在一场富有洞察力的会议中,来自阿里巴巴通义实验室的张鹏博士分享了其团队如何开发大型视频模型,以生成更具自然动作和控制力的生动数字人。他详细介绍了 Wan S2V 和 Wan Animate,它们利用音频或运动参考来产生逼真的语音、手势和动画,解决了纯文本驱动生成的局限性。

图 4. 张鹏博士解释大型视频模型如何驱动数字人。
张博士还谈到了迈向实时交互式虚拟化身的进展,包括外表与动作的零样本克隆,以及能够直接根据实时相机画面驱动面部动画的轻量级模型,使栩栩如生的数字人更接近于在日常设备上流畅运行。
从感知到行动:具身智能时代#
YV25 深圳站的一个关键主题是从单纯观察世界的视觉模型向能够在世界中采取行动的系统转变。换句话说,感知不再是流水线的终点,它正在成为行动的起点。
例如,地平线(D-Robotics)的胡春旭在主题演讲中描述了他们的开发套件和 SoC(片上系统)解决方案如何在统一的软硬件栈上集成感知、实时运动控制和决策。通过将感知和动作视为连续的反馈循环而非独立的阶段,他们的方法支持机器人在真实环境中更加可靠地移动、适应和交互。

图 5. 地平线在 YOLO Vision 2025 深圳大会的演示。
百度飞桨的张 Alex在演讲中呼应了这一观点,解释了 YOLO 和 PaddleOCR 如何协同工作以检测对象,进而解读周围的文本和结构。这使得系统能够将图像和文档转换为可用的结构化信息,用于物流、巡检和自动化处理等任务。
边缘智能:适用于每台设备的高效 AI#
YV25 深圳大会的另一个有趣话题是视觉 AI 如何在边缘设备上变得更加高效和强大。
来自 DEEPX 的 Paul Jung 谈到了在嵌入式硬件上直接部署 YOLO 模型,减少对云端的依赖。通过聚焦低功耗、优化的推理和硬件感知模型调整,DEEPX 为在动态环境中运行的无人机、移动机器人和工业系统实现了实时感知。
同样,来自摩尔线程的 Liu Lingfei 分享了摩尔线程 E300 平台如何集成中央处理器 (CPU)、图形处理器 (GPU) 和神经网络处理器 (NPU) 计算,从而在紧凑型设备上提供高速视觉推理。
该平台能以高帧率运行多个 YOLO 流,其工具链简化了量化、静态编译和性能调优等步骤。摩尔线程还开源了一系列计算机视觉模型和部署示例,以降低开发者的准入门槛。
融合视觉与语言以打造更智能的 AI 系统#
直到最近,构建一个既能理解图像又能解释语言的单一模型还需要运行成本高昂的大型transformer架构。在 YV25 深圳大会上,元石智能的岳子音概述了 RWKV,这是一种将 transformer 的长文本推理能力与循环模型的效率融合在一起的架构。
他解释了 Vision-RWKV 如何通过以与分辨率线性扩展的方式处理图像来将此设计应用于计算机视觉。这使得它适用于高分辨率输入以及算力受限的边缘设备。
Yue 还展示了 RWKV 如何被应用于视觉-语言系统中,将图像特征与文本理解配对,从而超越目标检测,进而解析场景、文档和现实世界的上下文。

图 6. Yue Ziyin 谈论 RWKV 的应用。
让视觉 AI 成为现实的展台与现场演示#
舞台上的演讲展望了视觉 AI 的未来,而场内的展台则展示了它在当下的应用。参会者现场观察模型运行、比较硬件选项,并与构建这些系统的团队直接对话。
以下是展出技术的一瞥:
- 开发者与原型设计平台: Seeed、M5Stack 和 Infermove 展示了紧凑的开发板和入门套件,使实验 YOLO 相关应用并从创意快速转向工作演示变得轻而易举。
- 高性能边缘硬件: Hailo、DEEPX、Intel 和摩尔线程演示了为快速、高效推理而构建的芯片和模块。
- 视觉与语言工作流: 百度 Paddle 和 RWKV 展示了能够检测目标,还能阅读、解读和推理图像或文档内容的软件栈。
- 开源与社区工具: Ultralytics 和 Datawhale 通过现场模型演示、训练技巧和实操指导与开发者互动,强化了共享知识如何加速创新。

图 7. YV25 深圳大会上 M5Stack 的展台。
与视觉 AI 社区建立联系#
除了所有令人兴奋的技术外,YV25 深圳站最棒的部分之一是再次让计算机视觉社区与 Ultralytics 团队面对面交流。一整天里,人们围绕着演示讨论,在咖啡休息间分享创意,并在演讲结束后持续深入交流。
Grupo Osborne 的 Cinco Jotas 为我们带来了现切火腿,为活动增添了一抹西班牙文化风情,创造了温馨的交流时刻。美丽的环境、热情的观众以及共同的动力让这一天变得真正特别。
关键要点#
从振奋人心的主题演讲到亲自动手的演示,YOLO Vision 2025 深圳大会捕捉到了定义 Ultralytics 社区的创新精神。整天时间里,演讲嘉宾和参会者交流思想、探索新技术,并基于对 AI 未来的共同愿景建立了联系。大家满载动力,准备好迎接 Ultralytics YOLO 的下一个篇章。
重新构想 AI 与计算机视觉的无限可能。加入我们的社区和GitHub 仓库以发现更多内容。了解更多关于农业计算机视觉和零售 AI等应用的信息。探索我们的许可选项,立即开始你的计算机视觉之旅!






