Ключевые моменты Ultralytics на YOLO Vision 2025 Shenzhen!
Вспомни ключевые моменты YOLO Vision 2025 Shenzhen, где Ultralytics объединила новаторов, партнёров и AI-сообщество для вдохновляющего дня.

26 октября YOLO Vision 2025 (YV25) дебютировал в Китае в здании B10 культурно-творческого парка OCT в Шэньчжэне. Гибридное мероприятие Ultralytics по теме Vision AI собрало более 200 участников очно, а ещё больше зрителей присоединились онлайн через YouTube и Bilibili.
Трансляция YV25 Shenzhen уже набрала более 3 500 просмотров на YouTube и продолжает привлекать внимание по мере того, как основные моменты мероприятия распространяются в сообществе. Это был день, наполненный идеями, общением и практическим знакомством с будущим Vision AI.
День начался с тёплого приветствия ведущей Huang Xueying, которая пригласила всех общаться, учиться и участвовать в обсуждениях на протяжении всего мероприятия. Она рассказала, что это был второй YOLO Vision в этом году после лондонского мероприятия в сентябре, и поделилась радостью от того, что сообщество Vision AI снова собралось вместе, на этот раз в Шэньчжэне.
В этой статье мы ещё раз рассмотрим основные моменты дня: обновления моделей, выступления спикеров, живые демонстрации и встречи участников сообщества. Давайте начнём!
Как развивались модели Ultralytics YOLO#
Первый основной доклад дня провёл основатель и генеральный директор Ultralytics Glenn Jocher. Он рассказал, как модели Ultralytics YOLO превратились из исследовательского прорыва в одни из самых широко используемых моделей Vision AI в мире. Glenn объяснил, что его ранняя работа была сосредоточена на том, чтобы сделать YOLO проще в использовании.
Он перенёс модели в PyTorch, улучшил документацию и открыл весь проект, чтобы разработчики по всему миру могли создавать решения на его основе. Как он вспоминал: «Я с головой погрузился в это в 2018 году. Я решил, что это моё будущее». То, что начиналось как личная инициатива, быстро превратилось в глобальное движение с открытым исходным кодом.

Рис. 1. Glenn Jocher выступает на сцене YOLO Vision 2025 в Шэньчжэне.
Сегодня модели Ultralytics YOLO обеспечивают миллиарды инференсов каждый день, и Glenn подчеркнул, что такой масштаб стал возможен только благодаря людям, которые помогали развивать проект. Исследователи, инженеры, студенты, энтузиасты и участники проектов с открытым исходным кодом со всего мира сформировали YOLO таким, каким мы знаем его сегодня.
Как выразился Glenn: «Их [участников] почти тысяча, и мы невероятно им благодарны. Без этих людей мы не были бы там, где находимся сегодня».
Обновления Ultralytics YOLO26#
Впервые Ultralytics YOLO26 показали ранее в этом году на мероприятии YOLO Vision 2025 London, где его представили как следующий крупный шаг в развитии семейства моделей Ultralytics YOLO. На YV25 Shenzhen Glenn рассказал о прогрессе с момента этого анонса и подробнее показал сообществу AI, как развивается модель.
Ultralytics YOLO26 создаётся более компактным, быстрым и точным, сохраняя практичность для реального применения. Glenn объяснил, что в течение прошлого года команда совершенствовала архитектуру, сравнивала производительность на разных устройствах и учитывала результаты исследований и отзывы сообщества. Цель — обеспечить передовую производительность, не усложняя развёртывание моделей.
Чего ожидать от Ultralytics YOLO26#
Одно из ключевых обновлений, отмеченных Glenn, заключается в том, что Ultralytics YOLO26 сопровождается специальной кампанией по настройке гиперпараметров: вместо полного обучения с нуля используется дообучение на более крупных наборах данных. Он пояснил, что такой подход гораздо лучше соответствует реальным сценариям применения.
Вот некоторые другие ключевые улучшения, представленные на мероприятии:
- Упрощённая архитектура: слой Distribution Focal Loss (DFL) удалён. Благодаря этому модели становятся проще и быстрее в работе, сохраняя прежний уровень точности.
- Поддержка сквозного инференса: Ultralytics YOLO26 изначально поддерживает сквозной режим, то есть может работать без отдельного слоя NMS. Это значительно упрощает экспорт в такие форматы, как ONNX и TensorRT, и развёртывание на периферийном оборудовании.
- Повышенная эффективность для малых объектов: обновлённые стратегии расчёта функции потерь помогают модели надёжнее обнаруживать очень маленькие объекты, что долгое время оставалось сложной задачей компьютерного зрения.
- Новый гибридный оптимизатор: YOLO26 включает новый оптимизатор, вдохновлённый последними исследованиями обучения больших языковых моделей. Он повышает точность модели и теперь встроен непосредственно в пакет Ultralytics для Python.
Ultralytics YOLO26 — следующий шаг в практическом применении Vision AI#
В совокупности эти обновления позволяют моделям работать на CPU до 43% быстрее и при этом точнее, чем Ultralytics YOLO11, что делает YOLO26 особенно полезным для встраиваемых устройств, робототехники и периферийных систем.
Ultralytics YOLO26 будет поддерживать все те же задачи и размеры моделей, которые сейчас доступны в YOLO11, — всего 25 вариантов моделей в семействе. В него входят модели для обнаружения, сегментации, оценки позы, ориентированных ограничивающих прямоугольников и классификации — от nano до extra large.
Команда также работает над пятью вариантами с поддержкой текстовых запросов. Эти модели могут принимать текстовый запрос и напрямую возвращать ограничивающие прямоугольники без необходимости обучения.
Это ранний шаг к более гибким рабочим процессам компьютерного зрения, управляемым инструкциями и адаптируемым под разные сценарии применения. Модели Ultralytics YOLO26 всё ещё активно разрабатываются, но первые результаты производительности впечатляют, и команда готовится вскоре их выпустить.
Знакомство с Ultralytics Platform#
После обновления YOLO26 Glenn пригласил Prateek Bhatnagar, руководителя инженерного направления продуктов, провести живую демонстрацию Ultralytics Platform. Платформа создаётся для объединения ключевых этапов рабочего процесса компьютерного зрения: изучения наборов данных, разметки изображений, обучения моделей и сравнения результатов.

Рис. 2. Prateek Bhatnagar демонстрирует Ultralytics Platform.
Prateek отметил, что платформа сохраняет приверженность принципам Ultralytics и открытого исходного кода, представляя два пространства для сообщества: сообщество наборов данных и сообщество проектов. Здесь разработчики могут вносить вклад, повторно использовать и улучшать работы друг друга. Во время демонстрации он показал разметку с помощью AI, аннотацию, простое облачное обучение и возможность дообучать модели непосредственно из сообщества без локальных ресурсов GPU.
Платформа сейчас находится в разработке. Prateek призвал аудиторию следить за анонсами и отметил, что команда расширяется в Китае для поддержки запуска.
Голоса, стоящие за YOLO: панель авторов#
По мере развития мероприятия состоялась панельная дискуссия с участием нескольких исследователей, стоящих за разными моделями YOLO. В панели участвовали Glenn Jocher, а также Jing Qiu, наш старший инженер по машинному обучению; Chen Hui, инженер по машинному обучению в Meta и один из авторов YOLOv10; и Bo Zhang, стратег по алгоритмам в Meituan и один из авторов YOLOv6.

Рис. 3. Панельная дискуссия о разработке моделей YOLO с участием Huang Xueying, Chen Hui, Bo Zhang, Jing Qiu и Glenn Jocher.
Обсуждение было посвящено тому, как YOLO продолжает развиваться благодаря применению в реальных условиях. Спикеры рассказали о том, как прогресс часто обусловлен практическими трудностями развёртывания, включая эффективную работу на периферийных устройствах, улучшение обнаружения малых объектов и упрощение экспорта моделей.
Панелисты отметили, что в производственных средах важно не просто стремиться к точности, а находить баланс между скоростью, удобством использования и надёжностью. Ещё одним общим выводом стала ценность итеративной разработки и обратной связи от сообщества.
Вот ещё несколько интересных выводов из обсуждения:
- Обнаружение объектов с открытым словарём набирает популярность в экосистеме YOLO: новые модели показывают, как согласование представлений зрения и языка, а также рабочие процессы на основе запросов позволяют обнаруживать объекты за пределами фиксированных категорий.
- Лёгкие механизмы внимания набирают популярность: панелисты обсудили, как использование эффективных механизмов внимания вместо полного внимания повсюду может повысить точность, сохраняя инференс достаточно лёгким для периферийных устройств.
- Рано и регулярно итерируйся вместе с сообществом: участники панели подтвердили подход «создавай — тестируй — улучшай», при котором более ранний выпуск моделей и обучение на опыте пользователей дают лучшие результаты, чем долгие циклы закрытой разработки.
Лидеры мнений, определяющие будущее AI и компьютерного зрения#
Теперь подробнее рассмотрим некоторые основные доклады на YV25 Shenzhen, где лидеры AI-сообщества рассказали о развитии Vision AI — от цифровых людей и робототехники до мультимодального рассуждения и эффективного развёртывания на периферии.
Как научить AI понимать человеческий опыт#
В содержательном выступлении Dr. Peng Zhang из Alibaba Qwen Lab рассказал, как его команда разрабатывает большие видеомодели, способные создавать выразительных цифровых людей с более естественными движениями и управлением. Он представил Wan S2V и Wan Animate, которые используют аудио или эталонные движения для создания реалистичной речи, жестикуляции и анимации, устраняя ограничения генерации, основанной исключительно на тексте.

Рис. 4. Peng Zhang объясняет, как большие видеомодели могут управлять цифровыми людьми.
Dr. Zhang также рассказал о прогрессе в создании интерактивных аватаров, работающих в реальном времени, включая zero-shot-клонирование внешности и движений, а также лёгкие модели, способные анимировать лицо непосредственно по видеопотоку с камеры. Это приближает плавную работу реалистичных цифровых людей на обычных устройствах.
От восприятия к действию: эпоха воплощённого интеллекта#
Одной из ключевых тем YV25 Shenzhen стал переход от моделей зрения, которые просто видят мир, к системам, способным действовать в нём. Иными словами, восприятие больше не является конечной точкой конвейера — оно становится началом действия.
Например, в своём основном докладе Hu Chunxu из D-Robotics рассказал, как их комплекты для разработки и решения на базе SoC (система на кристалле) объединяют сенсорику, управление движением в реальном времени и принятие решений в едином аппаратно-программном стеке. Рассматривая восприятие и действие как непрерывный цикл обратной связи, а не как отдельные этапы, их подход поддерживает роботов, которые могут надёжнее перемещаться, адаптироваться и взаимодействовать в реальных условиях.

Рис. 5. Демонстрация D-Robotics на YOLO Vision 2025 в Шэньчжэне, Китай.
Alex Zhang из Baidu Paddle развил эту идею в своём выступлении, объяснив, как YOLO и PaddleOCR вместе обнаруживают объекты, а затем интерпретируют окружающие их текст и структуру. Это позволяет системам преобразовывать изображения и документы в полезную структурированную информацию для таких задач, как логистика, инспекции и автоматизированная обработка.
Интеллект на периферии: эффективный AI для каждого устройства#
Ещё одной интересной темой YV25 Shenzhen стало повышение эффективности и возможностей Vision AI на периферийных устройствах.
Paul Jung из DEEPX рассказал о запуске моделей YOLO непосредственно на встраиваемом оборудовании, что снижает зависимость от облака. Благодаря низкому энергопотреблению, оптимизированному инференсу и настройке моделей с учётом особенностей оборудования DEEPX обеспечивает восприятие в реальном времени для дронов, мобильных роботов и промышленных систем, работающих в динамичных условиях.
А Liu Lingfei из Moore Threads рассказал, как платформа Moore Threads E300 объединяет вычисления на базе CPU, GPU и NPU, обеспечивая высокоскоростной инференс компьютерного зрения на компактных устройствах.
Платформа может запускать несколько потоков YOLO с высокой частотой кадров, а её набор инструментов упрощает такие этапы, как квантизация, статическая компиляция и настройка производительности. Moore Threads также открыла исходный код широкого набора моделей компьютерного зрения и примеров развёртывания, чтобы снизить порог входа для разработчиков.
Объединение зрения и языка для более интеллектуальных AI-систем#
До недавнего времени создание единой модели, способной одновременно понимать изображения и интерпретировать язык, требовало больших и дорогих в эксплуатации архитектур Transformer. На YV25 Shenzhen Yue Ziyin из Yuanshi Intelligence представил RWKV — архитектуру, которая сочетает способности Transformer к рассуждению в длинном контексте с эффективностью рекуррентных моделей.
Он объяснил, как Vision-RWKV применяет эту конструкцию к компьютерному зрению, обрабатывая изображения так, чтобы вычислительная сложность линейно зависела от разрешения. Это делает модель подходящей для изображений высокого разрешения и периферийных устройств с ограниченными вычислительными ресурсами.
Yue также показал, как RWKV используется в системах, объединяющих зрение и язык: признаки изображения сопоставляются с пониманием текста, что позволяет перейти от обнаружения объектов к интерпретации сцен, документов и контекста реального мира.

Рис. 6. Yue Ziyin рассказывает о применении RWKV.
Стенды и живые демонстрации, воплощающие Vision AI в жизнь#
Пока выступления на сцене заглядывали в будущее Vision AI, стенды показывали, как эта технология уже используется сегодня. Участники увидели работающие модели, сравнили варианты оборудования и напрямую пообщались с командами, создающими эти системы.
Вот краткий обзор представленных технологий:
- Платформы для разработки и прототипирования: Seeed, M5Stack и Infermove представили компактные отладочные платы и стартовые комплекты, которые упрощают эксперименты с приложениями на базе YOLO и помогают быстро переходить от идей к рабочим демонстрациям.
- Высокопроизводительное периферийное оборудование: Hailo, DEEPX, Intel и Moore Threads продемонстрировали чипы и модули, созданные для быстрого и эффективного инференса.
- Рабочие процессы объединения зрения и языка: Baidu Paddle и RWKV представили программные стеки, способные обнаруживать объекты, а также читать, интерпретировать и анализировать содержимое изображений и документов.
- Инструменты с открытым исходным кодом и для сообщества: Ultralytics и Datawhale взаимодействовали с разработчиками, демонстрируя модели в реальном времени, советы по обучению и практические рекомендации, подчёркивая, как обмен знаниями ускоряет инновации.

Рис. 7. Стенд M5Stack на YV25 Shenzhen.
Общение с сообществом Vision AI#
Помимо всех интересных технологий, одной из лучших частей YV25 Shenzhen стало очередное личное объединение сообщества компьютерного зрения и команды Ultralytics. В течение дня участники собирались у демонстраций, обменивались идеями за кофе и продолжали разговоры ещё долго после окончания выступлений.
Исследователи, инженеры, студенты и разработчики обменивались опытом, задавали вопросы и обсуждали практические аспекты — от развёртывания до обучения моделей. А благодаря Cinco Jotas из Grupo Osborne на мероприятии появилась частичка испанской культуры: свеженарезанный хамон создал тёплую атмосферу общения. Прекрасное место, увлечённая аудитория и общее ощущение движения вперёд сделали этот день по-настоящему особенным.
Основные выводы#
От вдохновляющих основных докладов до практических демонстраций — YOLO Vision 2025 Shenzhen передал дух инноваций, который определяет сообщество Ultralytics. В течение дня спикеры и участники обменивались идеями, изучали новые технологии и объединялись вокруг общего видения будущего AI. Все они ушли воодушевлёнными и готовыми к следующему этапу вместе с Ultralytics YOLO.
Переосмысли возможности AI и компьютерного зрения. Присоединяйся к нашему сообществу и репозиторию GitHub, чтобы узнать больше. Узнай больше о таких применениях, как компьютерное зрение в сельском хозяйстве и AI в розничной торговле. Изучи наши варианты лицензирования и начни использовать компьютерное зрение уже сегодня!









