YOLO Vision 2025 ShenzhenにおけるUltralyticsの主なハイライト!
YOLO Vision 2025 Shenzhenでの重要な瞬間を振り返ります。Ultralyticsはイノベーター、パートナー、AIコミュニティを集め、刺激に満ちた1日を実現しました。

10月26日、YOLO Vision 2025 (YV25)が、中国での初開催を深圳のOCTクリエイティブ・カルチャー・パークのB10棟で迎えました。Ultralyticsのハイブリッド型ビジョンAIイベントには、会場で200人を超える参加者が集まり、さらに多くの方々がYouTubeとBilibiliを通じてオンラインで参加しました。
YV25 Shenzhenのライブ配信は、すでにYouTubeで3,500回以上視聴されており、イベントのハイライトがコミュニティ全体で共有されるにつれて、さらに注目を集めています。ビジョンAIの次の方向性について、アイデアや対話、実践的な探究に満ちた一日となりました。
この日は、ホストのHuang Xueyingによる温かい歓迎の言葉で始まりました。Huangは、イベントを通して交流し、学び、議論に参加するよう参加者に呼びかけました。また、今回が今年2回目のYOLO Visionであり、9月に開催されたロンドン版に続くものだと説明し、ここ深圳で再びビジョンAIコミュニティを一つにできることの喜びを語りました。
この記事では、モデルのアップデート、講演セッション、ライブデモ、そして参加者を結び付けたコミュニティの交流など、この日のハイライトを振り返ります。さっそく始めましょう!
これまでのUltralytics YOLOモデルの歩み#
この日の最初の基調講演は、Ultralyticsの創設者兼CEOであるGlenn Jocherが担当しました。Glennは、Ultralytics YOLOモデルが研究上の画期的成果から、世界で最も広く使われるビジョンAIモデルの一つへと成長した経緯を紹介しました。Glennは、初期の取り組みがYOLOをより使いやすくすることに重点を置いていたと説明しました。
GlennはモデルをPyTorchに移植し、ドキュメントを改善するとともに、世界中の開発者がその上に構築できるよう、すべてをオープンに共有しました。本人の言葉を借りると、「2018年に真っ先に飛び込みました。ここが自分の未来だと決めたのです」。個人的な取り組みとして始まった活動は、すぐに世界的なオープンソース運動へと発展しました。

図1. YOLO Vision 2025 Shenzhenでステージ上で話すGlenn Jocher。
現在、Ultralytics YOLOモデルは毎日数十億回の推論を支えています。Glennは、この規模が実現できたのは、構築に貢献した人々がいたからこそだと強調しました。世界中の研究者、エンジニア、学生、ホビイスト、オープンソース貢献者が、今日のYOLOを形作ってきました。
Glennは次のように述べました。「そこには[contributors]が1,000人近くいて、本当に感謝しています。こうした人々なしには、私たちは今日ここまで来られなかったでしょう」。
Ultralytics YOLO26のアップデート#
Ultralytics YOLO26が初めて紹介されたのは、今年初めに開催されたYOLO Vision 2025 Londonでした。このイベントでは、Ultralytics YOLOモデルファミリーの次なる大きな進歩として発表されました。YV25 Shenzhenでは、Glennが発表以降の進捗を報告し、モデルがどのように進化しているのかをAIコミュニティに詳しく紹介しました。
Ultralytics YOLO26は、実環境での実用性を維持しながら、より小型で高速かつ高精度になるよう設計されています。Glennは、チームがこの1年間、アーキテクチャの改良、デバイス間での性能ベンチマーク、研究とコミュニティからのフィードバックの反映に取り組んできたと説明しました。目標は、モデルのデプロイを難しくすることなく、最先端の性能を提供することです。
Ultralytics YOLO26に期待されること#
Glennが強調した中核的なアップデートの一つは、Ultralytics YOLO26に専用のハイパーパラメータチューニング・キャンペーンが組み合わされることです。これにより、完全にゼロからのトレーニングから、より大規模なデータセットでのファインチューニングへと方針が変わります。Glennは、このアプローチの方が実際のユースケースにより合致すると説明しました。
イベントで紹介されたその他の主な改善点は次のとおりです。
- アーキテクチャの簡素化: 分布焦点損失(DFL)レイヤーが削除されました。これにより、同等の精度を維持しながら、モデルがよりシンプルになり、高速に実行できるようになります。
- エンドツーエンド推論のサポート: Ultralytics YOLO26はネイティブでエンドツーエンドに対応しているため、独立したNMSレイヤーなしで実行できます。これにより、ONNXやTensorRTなどの形式へのエクスポートや、エッジハードウェアへのデプロイが大幅に容易になります。
- 小物体の性能向上: 損失戦略が更新され、非常に小さな物体をより確実に検出できるようになりました。これは、コンピュータービジョンにおける長年の課題でした。
- 新しいハイブリッドオプティマイザー: YOLO26には、近年の大規模言語モデルのトレーニング研究に着想を得た新しいオプティマイザーが含まれています。モデルの精度を向上させるこのオプティマイザーは、Ultralytics Pythonパッケージに直接組み込まれています。
Ultralytics YOLO26は実用的なビジョンAIの次のステップ#
これらのアップデートにより、Ultralytics YOLO11よりも高精度でありながら、CPU上で最大43%高速なモデルが実現します。YOLO26は、組み込みデバイス、ロボティクス、エッジシステムに特に大きな効果をもたらします。
Ultralytics YOLO26は、現在YOLO11で利用できるすべてのタスクとモデルサイズをサポートする予定で、ファミリー全体で25種類のモデルが提供されます。これには、検出、セグメンテーション、姿勢推定、回転バウンディングボックス、分類に対応するモデルが含まれ、nanoからextra largeまでのサイズが揃います。
チームは、プロンプトに対応する5種類のバリアントにも取り組んでいます。これらは、トレーニングを必要とせず、テキストプロンプトを受け取ってバウンディングボックスを直接返せるモデルです。
これは、さまざまなユースケースに適応しやすい、より柔軟で指示ベースのビジョンワークフローに向けた初期段階です。Ultralytics YOLO26モデルは現在も活発に開発中ですが、初期の性能結果は良好であり、チームは近い将来のリリースに向けて取り組んでいます。
Ultralytics Platformの紹介#
YOLO26のアップデート後、Glennはプロダクトエンジニアリング責任者のPrateek Bhatnagarを招き、Ultralytics Platformのライブデモを行いました。このプラットフォームは、データセットの探索、画像のアノテーション、モデルのトレーニング、結果の比較など、コンピュータービジョンのワークフローにおける主要な要素を一つにまとめるために開発されています。

図2. Ultralytics Platformを紹介するPrateek Bhatnagar。
Prateekは、このプラットフォームがUltralyticsのオープンソースのルーツを忠実に受け継いでいると説明しました。データセットコミュニティとプロジェクトコミュニティという2つのコミュニティスペースを設け、開発者が互いの成果に貢献し、再利用し、改善できるようにしています。デモでは、AI支援アノテーション、簡単なクラウドトレーニング、ローカルGPUリソースを必要とせずにコミュニティから直接モデルをファインチューニングできる機能を紹介しました。
このプラットフォームは現在開発中です。Prateekは、今後の発表に注目するよう参加者に呼びかけ、中国でのローンチを支援するためにチームが中国で拡大していると説明しました。
YOLOを支える声:著者パネル#
勢いが増す中、イベントはさまざまなYOLOモデルを手がけた研究者が登壇するパネルディスカッションへと移りました。パネルにはGlenn Jocherに加え、シニア機械学習エンジニアのJing Qiu、Metaの機械学習エンジニアでYOLOv10の著者の一人であるChen Hui、MeituanのアルゴリズムストラテジストでYOLOv6の著者の一人であるBo Zhangが参加しました。

図3. Huang Xueying、Chen Hui、Bo Zhang、Jing Qiu、Glenn Jocherが登壇したYOLOモデル開発に関するパネル。
議論では、YOLOが実環境での利用を通じて進化し続ける仕組みに焦点が当てられました。登壇者は、エッジデバイスで効率的に動作させること、小物体検出を改善すること、モデルのエクスポートを簡素化することなど、実用的なデプロイ上の課題が進歩を促すことが多いと説明しました。
パネルでは、精度だけを追求するのではなく、本番環境における速度、使いやすさ、信頼性のバランスが重要だと指摘されました。もう一つの共通した見解は、反復的な改善とコミュニティからのフィードバックの価値でした。
対話から得られたその他の興味深い知見は次のとおりです。
- オープンボキャブラリー検出がYOLOエコシステムで広がっている: 新しいモデルは、ビジョンと言語のアライメントやプロンプトベースのワークフローによって、固定されたカテゴリを超えて物体を検出できることを示しています。
- 軽量アテンションが台頭している: パネルでは、すべての箇所で完全なアテンションを使うのではなく、効率的なアテンション機構を使うことで、エッジデバイスに適した軽量な推論を維持しながら精度を高められることが議論されました。
- コミュニティと早く、頻繁に反復する: パネリストは、構築、テスト、改善を繰り返す姿勢の重要性を強調しました。モデルを早期にリリースし、ユーザーから学ぶ方が、長期間にわたる非公開の開発サイクルよりも優れた成果につながります。
AIとビジョンの未来を切り開くオピニオンリーダー#
次に、YV25 Shenzhenで行われた基調講演の一部を詳しく見ていきましょう。AIコミュニティの各分野のリーダーが、デジタルヒューマンやロボティクスからマルチモーダル推論、効率的なエッジデプロイまで、ビジョンAIがどのように進化しているかを紹介しました。
AIに人間の体験を理解させる#
Alibaba Qwen LabのPeng Zhang博士は、示唆に富むセッションで、より自然な動きと制御を備えた表現力豊かなデジタルヒューマンを生成できる大規模動画モデルを、チームがどのように開発しているかを紹介しました。Wan S2VとWan Animateについて説明し、音声または動きのリファレンスを使ってリアルな発話、ジェスチャー、アニメーションを生成する仕組みに触れました。これは、テキストだけに基づく生成の限界に対応するものです。

図4. 大規模動画モデルがデジタルヒューマンを支える仕組みを説明するPeng Zhang。
Zhang博士は、リアルタイムでインタラクティブなアバターの実現に向けた進展についても説明しました。外見や動きのゼロショットクローニングや、ライブカメラ映像から顔を直接アニメーション化できる軽量モデルなどにより、日常的なデバイス上で生き生きとしたデジタルヒューマンを滑らかに動作させることが、より現実に近づいています。
知覚から行動へ:身体性知能の時代#
YV25 Shenzhenにおける重要なテーマの一つは、世界を単に見るビジョンモデルから、世界の中で行動できるシステムへの移行でした。つまり、知覚はもはやパイプラインの終点ではなく、行動の始点になりつつあります。
例えば、D-RoboticsのHu Chunxuは基調講演で、同社の開発キットとSoC(システムオンチップ)ソリューションが、センシング、リアルタイムのモーション制御、意思決定を統合されたハードウェアおよびソフトウェアスタックに組み込む仕組みを説明しました。知覚と行動を別々の段階ではなく、連続的なフィードバックループとして扱うことで、このアプローチは現実環境でより確実に移動、適応、相互作用できるロボットを実現します。

図5. 中国・深圳で開催されたYOLO Vision 2025におけるD-Roboticsのデモ。
Baidu PaddleのAlex Zhangも講演でこの考え方に同意し、YOLOとPaddleOCRを連携させて物体を検出し、その周囲にあるテキストや構造を解釈する仕組みを説明しました。これにより、画像やドキュメントを、物流、検査、自動処理などのタスクに利用できる構造化情報へ変換できます。
エッジでの知能:あらゆるデバイスに向けた効率的なAI#
YV25 Shenzhenで注目を集めたもう一つのテーマは、エッジデバイス上でビジョンAIがより効率的かつ高性能になっていることです。
DEEPXのPaul Jungは、YOLOモデルを組み込みハードウェア上で直接実行し、クラウドへの依存を減らす方法について講演しました。低消費電力、最適化された推論、ハードウェアを考慮したモデルチューニングに重点を置くことで、DEEPXは動的な環境で稼働するドローン、モバイルロボット、産業システム向けにリアルタイム知覚を実現します。
同様に、Moore ThreadsのLiu Lingfeiは、Moore Threads E300プラットフォームが中央処理装置(CPU)、グラフィックス処理装置(GPU)、ニューラルプロセッシングユニット(NPU)のコンピューティングを統合し、コンパクトなデバイス上で高速なビジョン推論を実現する仕組みを紹介しました。
このプラットフォームは高いフレームレートで複数のYOLOストリームを実行でき、ツールチェーンによって量子化、静的コンパイル、性能チューニングなどの手順が簡素化されます。Moore Threadsは、開発者の参入障壁を下げるため、幅広いコンピュータービジョンモデルとデプロイ例もオープンソース化しています。
ビジョンと言語を融合して、よりスマートなAIシステムを実現する#
最近まで、画像を理解しながら言語も解釈できる単一モデルの構築には、実行コストの高い大規模なトランスフォーマーアーキテクチャが必要でした。YV25 Shenzhenでは、Yuanshi IntelligenceのYue ZiyinがRWKVの概要を紹介しました。RWKVは、トランスフォーマーの長いコンテキストを推論する能力と、リカレントモデルの効率性を融合したアーキテクチャです。
Yueは、Vision-RWKVがこの設計をコンピュータービジョンに適用し、解像度に対して線形にスケールする方法で画像を処理すると説明しました。これにより、高解像度の入力や、計算リソースが限られたエッジデバイスに適しています。
Yueはまた、RWKVがビジョン・ランゲージシステムでどのように利用されているかも紹介しました。画像特徴とテキスト理解を組み合わせることで、物体検出を超えて、シーン、ドキュメント、現実世界のコンテキストを解釈できます。

図6. RWKVの応用について語るYue Ziyin。
ビジョンAIを身近にしたブースとライブデモ#
ステージ上の講演がビジョンAIの未来を見据える一方、会場のブースでは、ビジョンAIがすでにどのように活用されているかが紹介されました。参加者は、モデルのライブ実行を見たり、ハードウェアの選択肢を比較したり、こうしたシステムを構築するチームと直接話したりしました。
展示されていたテクノロジーを少しご紹介します。
- 開発・プロトタイピングプラットフォーム: Seeed、M5Stack、Infermoveは、YOLOベースのアプリケーションを簡単に試し、アイデアから動作するデモへ迅速に進められる、コンパクトな開発ボードとスターターキットを紹介しました。
- 高性能エッジハードウェア: Hailo、DEEPX、Intel、Moore Threadsは、高速で効率的な推論向けに設計されたチップとモジュールを実演しました。
- ビジョンと言語のワークフロー: Baidu PaddleとRWKVは、物体を検出するだけでなく、画像やドキュメントに現れる内容を読み取り、解釈し、推論できるソフトウェアスタックを紹介しました。
- オープンソースとコミュニティツール: UltralyticsとDatawhaleは、ライブモデルデモ、トレーニングのヒント、実践的なガイダンスを通じて開発者と交流し、知識の共有がイノベーションを加速させることを示しました。

図7. YV25 ShenzhenにおけるM5Stackのブース。
ビジョンAIコミュニティとの交流#
魅力的なテクノロジーに加えて、YV25 Shenzhenの大きな魅力の一つは、コンピュータービジョンコミュニティとUltralyticsチームが再び対面で集まれたことでした。一日を通して、参加者はデモを囲み、コーヒーブレイクにアイデアを共有し、講演終了後も長く対話を続けました。
研究者、エンジニア、学生、開発者たちは、意見を交換し、質問を投げかけ、デプロイからモデルのトレーニングまで、実環境での経験を共有しました。さらに、Grupo OsborneのCinco Jotasのおかげで、削りたてのハモンを通じてスペイン文化の一端もイベントに加わり、温かな交流のひとときが生まれました。美しい会場、熱心な参加者、共有された躍動感が、この日を本当に特別なものにしました。
主なポイント#
刺激的な基調講演から実践的なデモまで、YOLO Vision 2025 Shenzhenは、Ultralyticsコミュニティを象徴するイノベーションの精神を体現しました。一日を通して、登壇者と参加者はアイデアを交換し、新しいテクノロジーを探究し、AIの未来に対する共通のビジョンを通じて交流しました。そして、Ultralytics YOLOの次の展開に向けて、活力と期待を胸に会場を後にしました。
AIとコンピュータービジョンで可能性を再定義しましょう。コミュニティとGitHubリポジトリに参加して、さらに詳しく知ることができます。農業におけるコンピュータービジョンや小売業におけるAIなどのアプリケーションについて学びましょう。ライセンスの選択肢を確認し、今すぐコンピュータービジョンを始めましょう!









