生成AIがコンピュータービジョンの未来を変えています
YOLO Vision 2024のパネルトークから興味深い知見をご紹介します。生成AIがリアルタイムVision AIモデルの今後の方向性をどのように形作っているかを解説します。

生成AIは人工知能(AI)の一分野で、既存のデータからパターンを学習し、画像、テキスト、音声などの新しいコンテンツを作成します。近年の進歩により、人間の創造性を模倣することの多い、非常にリアルなコンテンツを生成できるようになりました。
しかし、生成AIの影響はコンテンツの作成だけにとどまりません。Ultralytics YOLO modelsのようなリアルタイムのコンピュータービジョンモデルが進化し続ける中、生成AIはビジュアルデータの処理や拡張方法も再定義し、現実世界のシナリオにおける革新的なアプリケーションへの道を切り開いています。
この新たな技術シフトは、Ultralyticsが主催する年次ハイブリッドイベント、YOLO Vision 2024 (YV24),で興味深い話題となりました。YV24には、AIの愛好家や業界のリーダーが集まり、computer visionにおける最新のブレークスルーについて議論しました。イベントでは、イノベーション、効率性、そしてリアルタイムAIソリューションの未来に焦点が当てられました。
イベントの主な見どころの一つは、YOLO in the Age of Generative AIをテーマとしたパネルディスカッションでした。パネルには、UltralyticsのFounder & CEOであるGlenn Jocher、UltralyticsのSenior Machine Learning EngineerであるJing Qiu、そして清華大学のAo Wangが登壇しました。生成AIがコンピュータービジョンに与える影響と、実用的なAIモデル構築の課題について検討しました。
この記事では、ディスカッションから得られた主要な洞察を振り返り、生成AIがVision AIをどのように変革しているのかを詳しく見ていきます。
Ultralytics YOLOモデルの開発#
Glenn Jocherとともに、多くの優れたエンジニアがUltralytics YOLOモデルの開発で重要な役割を果たしてきました。その一人であるJing Qiuは、YOLOとの意外な出会いについて語りました。AIへの情熱は大学時代に始まったと説明し、かなりの時間をかけてこの分野を探究し、学んだそうです。Jing Qiuは、GitHubでGlenn Jocherとつながり、さまざまなAIプロジェクトに参加するようになった経緯を振り返りました。
Jing Qiuの発言を受けて、Glenn JocherはGitHubについて、「会ったことのない人々が集まり、互いに助け合いながら、お互いの仕事に貢献できる、素晴らしい共有の場です。とても良いコミュニティであり、AIを始める本当に素晴らしい方法です」と述べました。

図1. YV24のステージで講演するGlenn JocherとJing Qiu。
Jing QiuのAIへの関心とUltralytics YOLOv5での取り組みが、モデルの改良に役立ちました。その後、さらなる改善を導入したUltralytics YOLOv8の開発でも重要な役割を果たしました。本人はこれを素晴らしい旅路だったと表現しています。現在もJing Qiuは、Ultralytics YOLO11のようなモデルの改良と開発に取り組み続けています。
YOLOv10:実世界のパフォーマンスに最適化#
中国からリモートでパネルディスカッションに参加したAo Wangは、自身を博士課程の学生として紹介しました。最初はソフトウェア工学を学んでいましたが、AIへの情熱からコンピュータービジョンとディープラーニングへと関心を移しました。
さまざまなAI技術やモデルを試しているときに、初めて有名なYOLOモデルに出会いました。その速度と精度に感銘を受け、物体検出などのcomputer vision tasksをさらに深く掘り下げるきっかけになりました。最近では、YOLOモデルの新しいバージョンであるYOLOv10の開発にも貢献しました。研究では、モデルをより高速かつ高精度にするための最適化に重点を置きました。
生成AIとVision AIの主な違い#
続いてパネルでは生成AIについて議論が始まり、Jing Qiuは生成AIとVision AIでは目的が大きく異なると指摘しました。生成AIはテキスト、画像、動画などを作成・生成する一方、Vision AIは主に画像など、すでに存在するものを分析します。
Glenn Jocherは、サイズも大きな違いだと強調しました。生成AIモデルは非常に大規模で、データからモデルが学習するための内部設定であるパラメーターを数十億個含むこともあります。コンピュータービジョンモデルははるかに小規模です。彼は、「私たちが提供する最小のYOLOモデルは、最小のLLM [大規模言語モデル]の約1,000分の1のサイズです。つまり、300万パラメーターと30億パラメーターの比較です」と述べました。

図2. YV24で行われた生成AIとVision AIに関するパネルディスカッション。
Jing Qiuは、生成AIとコンピュータービジョンではtrainingやデプロイのプロセスも大きく異なると付け加えました。生成AIの実行には、非常に大規模で高性能なサーバーが必要です。一方、YOLOのようなモデルは効率性を重視して構築されており、標準的なハードウェア上でトレーニングおよびデプロイできます。そのため、Ultralytics YOLOモデルは実世界でより実用的です。
異なる分野ではありますが、この2つの分野は結び付き始めています。Glenn Jocherは、生成AIがVision AIに新たな進歩をもたらし、モデルをよりスマートかつ効率的にしていると説明しました。
生成AIがコンピュータービジョンに与える影響#
生成AIは急速に進歩しており、こうしたブレークスルーはコンピュータービジョンを含む、人工知能のさまざまな分野に影響を与えています。次に、これについてパネルで語られた興味深い洞察をいくつか見ていきます。
ハードウェアの進歩がAIイノベーションを可能にする#
パネルの序盤でGlenn Jocherは、機械学習のアイデア自体は以前から存在していたものの、コンピューターの性能が十分ではなく実現できなかったと説明しました。AIのアイデアを現実のものにするには、より強力なハードウェアが必要でした。
過去20年間における、並列処理機能を備えたGPU(グラフィックス・プロセッシング・ユニット)の台頭が、すべてを変えました。GPUによってAIモデルのトレーニングがはるかに高速かつ効率的になり、ディープラーニングは急速に発展できるようになりました。
現在では、TPUs(テンソル・プロセッシング・ユニット)のようなAIチップや最適化されたGPUが、より大規模で複雑なモデルを処理しながら、消費電力を抑えています。これにより、AIはより利用しやすくなり、実世界のアプリケーションで役立つようになりました。
新たなハードウェアの改善が行われるたびに、生成AIとコンピュータービジョンのアプリケーションは、どちらもより強力になっています。こうした進歩により、リアルタイムAIはより高速かつ効率的になり、さらに多くの業界で利用できるようになっています。
生成AIが物体検出モデルを形作る方法#
生成AIがコンピュータービジョンにどのような影響を与えているか尋ねられたJing Qiuは、transformers(AIが画像の最も重要な部分に注目できるようにするモデル)が、AIによる画像の理解と処理の方法を変えたと述べました。最初の大きな一歩はDETR(Detection Transformer)で、この新しいアプローチを物体検出に活用しました。精度は向上しましたが、場合によっては処理が遅くなるパフォーマンス上の問題がありました。
これを解決するため、研究者たちはRT-DETRのようなハイブリッドモデルを作成しました。これらのモデルは、CNN(画像から特徴を自動的に学習・抽出するディープラーニングモデル)とtransformersを組み合わせ、速度と精度のバランスを取っています。このアプローチはtransformersの利点を活用しながら、物体検出を高速化します。
興味深いことに、YOLOv10は、transformerベースのアテンションレイヤー(画像内の重要な領域をスポットライトのように強調し、関連性の低い詳細を無視するモデルの構成要素)を使用して、パフォーマンスを向上させています。
Ao Wangは、生成AIがモデルのトレーニング方法を変えていることにも触れました。マスク画像モデリングのような技術により、大規模な手動ラベル付きデータセットの必要性を減らしながら、AIは画像からより効率的に学習できます。これにより、コンピュータービジョンのトレーニングはより高速になり、必要なリソースも少なくなります。
生成AIとVision AIの未来#
パネルで議論されたもう一つの重要な考えは、生成AIとVision AIを組み合わせて、より高性能なモデルを構築できる可能性です。Glenn Jocherは、この2つのアプローチにはそれぞれ異なる強みがあるものの、組み合わせることで新たな可能性が開けると説明しました。
たとえば、YOLOのようなVision AIモデルは、物体を特定するために画像をグリッドに分割することがよくあります。このグリッドベースの手法は、言語モデルが詳細を特定すると同時にそれを説明する能力の向上に役立つ可能性があります。これは、現在多くの言語モデルが直面している課題です。つまり、これらの技術を融合することで、見ているものを正確に検出し、明確に説明できるシステムにつながる可能性があります。

図3. 生成AIとVision AIの未来。画像:著者。
主なポイント#
生成AIとコンピュータービジョンは、ともに進歩しています。生成AIは画像や動画を作成するだけでなく、新しい革新的なアイデアをもたらすことで、画像や動画の分析も改善しています。これにより、Vision AIモデルの精度と効率が向上する可能性があります。
この洞察に満ちたYV24のパネルディスカッションで、Glenn Jocher、Jing Qiu、Ao Wangは、これらのテクノロジーが未来をどのように形作っているかについて意見を共有しました。AIハードウェアの向上により、生成AIとVision AIは進化を続け、さらに大きなイノベーションにつながるでしょう。この2つの分野は連携して、日常生活に役立つ、よりスマートで高速なAIを生み出しています。
our communityに参加し、GitHub repositoryを探索して、Vision AIについて詳しく学びましょう。our licensing optionsを確認して、コンピュータービジョンプロジェクトを始めましょう。AI in manufacturingやcomputer vision in self-drivingのようなイノベーションに関心がありますか?ソリューションページにアクセスして、さらに詳しくご覧ください。









