Ultralytics 参加 YOLO Vision 2025 Shenzhen 的精彩亮点!
回顾 YOLO Vision 2025 Shenzhen 的精彩瞬间。Ultralytics 汇聚了创新者、合作伙伴和 AI 社区成员,共同度过了充满启发的一天。

10 月 26 日,YOLO Vision 2025 (YV25) 在深圳 OCT 创意文化园 B10 栋举办了中国首秀。Ultralytics 的混合式视觉 AI 活动吸引了 200 多人到场,还有更多观众通过 YouTube 和哔哩哔哩在线参与。
YV25 深圳直播 在 YouTube 上的观看次数已经超过 3,500 次,并且随着活动亮点在社区中持续分享,关注度还在不断提升。这是充满想法、交流和实践探索的一天,大家一起探讨视觉 AI 的下一步发展方向。
活动在主持人 Huang Xueying 的热情欢迎中拉开序幕。她邀请大家在整个活动期间彼此交流、学习并参与讨论。她介绍说,这是今年第二场 YOLO Vision,此前 9 月已在伦敦举办,并分享了此次在深圳再次汇聚视觉 AI 社区的激动心情。
本文将带你回顾当天的精彩内容,包括模型更新、演讲环节、现场演示,以及让大家相聚在一起的社区互动。让我们开始吧!
Ultralytics YOLO 模型的发展历程#
当天的首场主题演讲由 Ultralytics 创始人兼 CEO Glenn Jocher 主讲。他分享了 Ultralytics YOLO 模型 如何从一项研究突破发展为全球应用最广泛的视觉 AI 模型之一。Glenn 解释说,他早期的工作重点是让 YOLO 更易于使用。
他将模型移植到 PyTorch,改进文档,并开放分享所有内容,让世界各地的开发者都能在此基础上构建。正如他回忆道:“我在 2018 年一头扎了进去。我决定,这就是我的未来。”最初的个人努力很快发展成了一场全球开源运动。

图 1. Glenn Jocher 在 YOLO Vision 2025 深圳站的舞台上演讲。
如今,Ultralytics YOLO 模型每天支持数十亿次推理。Glenn 强调,这样的规模之所以成为可能,完全得益于帮助构建这一生态的众多参与者。来自世界各地的研究人员、工程师、学生、爱好者和开源贡献者共同塑造了今天的 YOLO。
正如 Glenn 所说:“外面大约有一千名[贡献者],我们对此非常感激。如果没有这些人,我们不可能走到今天这一步。”
Ultralytics YOLO26 更新#
今年早些时候,Ultralytics YOLO26 首次亮相于 YOLO Vision 2025 London 活动,并被介绍为 Ultralytics YOLO 模型家族向前迈进的重要一步。在 YV25 深圳站,Glenn 更新了该公告发布以来的进展,并让 AI 社区进一步了解模型的演进情况。
Ultralytics YOLO26 旨在实现更小的体积、更快的速度和更高的准确率,同时保持对实际应用的实用性。Glenn 介绍说,过去一年团队一直在优化架构、跨设备评测性能,并吸收研究成果和社区反馈。目标是在不增加模型部署难度的情况下,提供业界领先的性能。
Ultralytics YOLO26 有哪些期待#
Glenn 强调的一项核心更新是,Ultralytics YOLO26 配套开展了专门的超参数调优工作,将完全从头开始的训练转向在更大数据集上进行微调。他进一步说明,这种方法更贴近真实世界的实际使用场景。
以下是活动中分享的其他一些关键改进:
- 架构简化:移除了分布式焦点损失(DFL)层。这样可以让模型更简单、运行速度更快,同时保持相同水平的准确率。
- 端到端推理支持:Ultralytics YOLO26 原生支持端到端推理,也就是说无需单独的 NMS 层即可运行。这让模型导出为 ONNX 和 TensorRT 等格式,以及部署到边缘硬件上,都变得更加容易。
- 更出色的小目标性能:更新后的损失策略帮助模型更可靠地检测微小目标,这一直是计算机视觉领域的长期挑战。
- 全新的混合优化器:YOLO26 引入了一种受近期大语言模型训练研究启发的新优化器,可提升模型准确率,并已直接集成到 Ultralytics Python 包中。
Ultralytics YOLO26:实用视觉 AI 的下一步#
这些更新结合起来,使模型在 CPU 上的速度最高提升 43%,同时准确率也高于 Ultralytics YOLO11,让 YOLO26 尤其适用于嵌入式设备、机器人和边缘系统。
Ultralytics YOLO26 将支持 YOLO11 当前提供的全部任务和模型尺寸,使整个模型家族拥有 25 个模型变体。其中包括检测、分割、姿态估计、定向边界框和分类模型,尺寸从 nano 到 extra large 不等。
团队还在开发五种可提示变体。这些模型可以接收文本提示并直接返回边界框,无需训练。
这是迈向更灵活、基于指令的视觉工作流的早期一步,也更容易适应不同的使用场景。Ultralytics YOLO26 模型仍在积极开发中,但早期性能结果十分亮眼,团队正努力尽快发布。
一览 Ultralytics Platform#
YOLO26 更新之后,Glenn 邀请我们的产品工程负责人 Prateek Bhatnagar 现场演示 Ultralytics Platform。该平台旨在整合计算机视觉工作流中的关键环节,包括探索数据集、标注图像、训练模型和比较结果。

图 2. Prateek Bhatnagar 展示 Ultralytics Platform。
Prateek 指出,该平台延续了 Ultralytics 的开源基因,并引入了两个社区空间:数据集社区和项目社区。开发者可以在这里贡献、复用和改进彼此的工作。在演示中,他展示了 AI 辅助标注、便捷的云端训练,以及直接从社区微调模型的能力,无需本地 GPU 资源。
该平台目前仍在开发中。Prateek 鼓励观众关注后续公告,并指出团队正在中国扩大规模,以支持平台发布。
YOLO 背后的声音:作者圆桌讨论#
随着活动气氛逐渐升温,现场进入了圆桌讨论环节,几位不同 YOLO 模型背后的研究人员参与了讨论。圆桌嘉宾包括 Glenn Jocher,以及我们的高级机器学习工程师 Jing Qiu;Meta 机器学习工程师、YOLOv10 作者之一 Chen Hui;以及美团算法策略师、YOLOv6 作者之一 Bo Zhang。

图 3. 关于 YOLO 模型开发的圆桌讨论,嘉宾包括 Huang Xueying、Chen Hui、Bo Zhang、Jing Qiu 和 Glenn Jocher。
讨论聚焦于 YOLO 如何通过真实世界的应用持续演进。嘉宾谈到,模型进步往往由实际部署挑战推动,例如在边缘设备上高效运行、改进小目标检测以及简化模型导出。
圆桌嘉宾指出,与其只追求准确率,不如在生产环境中平衡速度、易用性和可靠性。另一个共同观点是,迭代和社区反馈非常有价值。
以下是交流中分享的其他一些有趣见解:
- 开放词汇检测正在 YOLO 生态中获得越来越多关注:新一代模型展示了视觉语言对齐和基于提示的工作流如何检测固定类别之外的目标。
- 轻量级注意力机制日益普及:圆桌嘉宾讨论了如何使用高效的注意力机制,而不是在所有位置都使用完整注意力,从而在提升准确率的同时,让推理保持足够轻量,以适用于边缘设备。
- 尽早并持续与社区迭代:圆桌嘉宾再次强调构建–测试–改进的思维方式。相比长期闭门开发,更早发布模型并从用户那里学习,能够带来更好的成果。
定义 AI 与视觉未来的思想领袖#
接下来,让我们进一步了解 YV25 深圳站的几场主题演讲。来自 AI 社区各领域的领袖分享了视觉 AI 如何演进,涵盖数字人、机器人、多模态推理和高效边缘部署等方向。
教会 AI 理解人类体验#
在一场富有启发性的分享中,来自阿里巴巴 Qwen Lab 的 Peng Zhang 博士介绍了他的团队如何开发大型视频模型,以生成动作和控制更加自然、表现力更强的数字人。他详细讲解了 Wan S2V 和 Wan Animate:这些模型利用音频或动作参考生成逼真的语音、手势和动画,解决了纯文本驱动生成的局限。

图 4. Peng Zhang 讲解大型视频模型如何赋能数字人。
Zhang 博士还谈到了实时交互式虚拟形象方面的进展,包括对外观和动作进行零样本克隆,以及使用轻量级模型直接根据实时摄像头画面驱动面部动画,让栩栩如生的数字人更接近在日常设备上流畅运行。
从感知到行动:具身智能时代#
YV25 深圳站的关键主题之一,是从单纯观察世界的视觉模型转向能够在世界中采取行动的系统。换句话说,感知不再是流水线的终点,而正逐渐成为行动的起点。
例如,来自 D-Robotics 的 Hu Chunxu 在主题演讲中介绍了他们的开发套件和 SoC(片上系统)解决方案如何在统一的软硬件栈上整合感知、实时运动控制和决策。通过将感知和行动视为连续的反馈回路,而不是彼此分离的阶段,他们的方法支持机器人在真实环境中更加可靠地移动、适应和交互。

图 5. D-Robotics 在中国深圳 YOLO Vision 2025 的演示。
来自百度 Paddle 的 Alex Zhang 在分享中呼应了这一观点。他解释了 YOLO 和 PaddleOCR 如何协同工作,先检测目标,再理解目标周围的文本和结构。这使系统能够将图像和文档转换为可用于物流、巡检和自动化处理等任务的实用结构化信息。
边缘智能:适用于各种设备的高效 AI#
YV25 深圳站的另一个有趣话题是,视觉 AI 如何在边缘设备上变得更加高效和强大。
来自 DEEPX 的 Paul Jung 分享了如何将 YOLO 模型直接部署到嵌入式硬件上,降低对云端的依赖。通过关注低功耗、优化推理和硬件感知的模型调优,DEEPX 为运行在动态环境中的无人机、移动机器人和工业系统提供实时感知能力。
同样,来自 Moore Threads 的 Liu Lingfei 分享了 Moore Threads E300 平台如何整合中央处理器(CPU)、图形处理器(GPU)和神经处理器(NPU)计算,在紧凑型设备上实现高速视觉推理。
该平台可以高帧率运行多个 YOLO 流,其工具链还简化了量化、静态编译和性能调优等步骤。Moore Threads 还开源了大量计算机视觉模型和部署示例,降低开发者的使用门槛。
融合视觉与语言,打造更智能的 AI 系统#
直到最近,要构建一个既能理解图像又能解析语言的单一模型,仍需要使用运行成本高昂的大型 Transformer 架构。在 YV25 深圳站,来自元始智能的 Yue Ziyin 介绍了 RWKV:这是一种将 Transformer 的长上下文推理能力与循环模型的高效率相结合的架构。
他解释了 Vision-RWKV 如何将这一设计应用于计算机视觉,通过一种随分辨率线性扩展的方式处理图像。这使其适用于高分辨率输入,以及计算资源有限的边缘设备。
Yue 还展示了 RWKV 如何应用于视觉语言系统:系统将图像特征与文本理解结合起来,从目标检测进一步扩展到理解场景、文档和真实世界语境。

图 6. Yue Ziyin 介绍 RWKV 的应用。
让视觉 AI 焕发生命力的展台与现场演示#
舞台上的演讲展望了视觉 AI 的未来,而现场展台则展示了它如今已经如何投入使用。参会者可以看到模型实时运行、比较不同硬件选项,并直接与构建这些系统的团队交流。
以下是现场展示的技术一览:
- 开发者与原型开发平台:Seeed、M5Stack 和 Infermove 展示了紧凑型开发板和入门套件,让大家可以轻松试验基于 YOLO 的应用,并快速将想法转化为可运行的演示。
- 高性能边缘硬件:Hailo、DEEPX、Intel 和 Moore Threads 展示了专为快速、高效推理打造的芯片和模块。
- 视觉与语言工作流:百度 Paddle 和 RWKV 展示了能够检测目标,并读取、理解和推理图像或文档内容的软件栈。
- 开源与社区工具:Ultralytics 和 Datawhale 通过现场模型演示、训练技巧和实践指导与开发者互动,进一步说明共享知识如何加速创新。

图 7. YV25 深圳站 M5Stack 展台一览。
与视觉 AI 社区交流#
除了令人兴奋的技术之外,YV25 深圳站最精彩的部分之一,就是再次让计算机视觉社区与 Ultralytics 团队在线下相聚。整个活动期间,大家围绕演示交流,在茶歇时分享想法,并在演讲结束很久之后仍继续讨论。
研究人员、工程师、学生和开发者交流经验、提出问题,并分享从部署到模型训练的真实实践。得益于来自 Grupo Osborne 的 Cinco Jotas,我们还通过现场切制的火腿为活动增添了一抹西班牙文化气息,营造出温暖的交流时刻。优美的场地、热情的观众和共同的前进动力,让这一天格外难忘。
要点总结#
从鼓舞人心的主题演讲到亲身参与的现场演示,YOLO Vision 2025 深圳站充分展现了 Ultralytics 社区所代表的创新精神。整个活动期间,演讲嘉宾和参会者交流想法、探索新技术,并围绕 AI 未来的共同愿景展开互动。最终,大家满怀活力地离开现场,准备与 Ultralytics YOLO 一起迎接下一步发展。
重新想象 AI 和计算机视觉的可能性。加入我们的社区和 GitHub 仓库,了解更多信息。进一步了解农业中的计算机视觉和零售业中的 AI等应用。探索我们的许可选项,立即开始使用计算机视觉!









