2024年、生成AIの波とともに始動
2024年第1四半期に登場した注目すべきAIイノベーションを振り返ります。OpenAIのSora AI、Neuralinkのブレインチップ、最新のLLMなどの画期的な進展を取り上げます。

AIコミュニティは、ほぼ毎日のようにニュースの見出しを飾っているようです。2024年の最初の数か月は刺激的で、新しいAIイノベーションに満ちています。強力な新しい大規模言語モデルから人間の脳へのインプラントまで、2024年は素晴らしい年になりそうです。
AIが産業を変革し、情報をより利用しやすくし、さらには私たちの心と機械を融合するための最初の一歩を踏み出している様子を目にしています。2024年の第1四半期を振り返り、わずか数か月でAIが遂げた進歩を詳しく見てみましょう。
LLMがトレンドに#
大規模言語モデル(LLMs)は、膨大なテキストデータに基づいて人間の言語を理解、生成、操作するように設計されており、2024年の第1四半期に注目の中心となりました。多くの大手テクノロジー企業が独自のLLMモデルをリリースし、それぞれが独自の機能を備えています。GPT-3のような従来のLLMの大きな成功が、このトレンドを後押ししました。ここでは、2024年初頭にリリースされた注目すべきLLMをいくつか紹介します。
AnthropicのClaude 3#
Anthropicは2024年3月14日にClaude 3をリリースしました。Claude 3モデルにはOpus、Sonnet、Haikuの3つのバージョンがあり、それぞれ異なる市場や目的に対応しています。最も高速なモデルであるHaikuは、迅速で基本的な応答に最適化されています。Sonnetは速度と知性のバランスを取り、エンタープライズアプリケーションを対象としています。最も高度なバージョンであるOpusは、卓越した知性と推論能力を提供し、複雑なタスクや最高水準のベンチマーク達成に適しています。
Claude 3には、多くの高度な機能と改善が備わっています。
- 多言語会話の強化:スペイン語、日本語、フランス語などの言語での能力が向上しています。
- 高度なビジョン機能:さまざまなビジュアル形式を処理できます。
- 拒否の最小化:不必要な拒否が減り、より深い理解を示すことで、コンテキスト把握の向上を示しています。
- コンテキストウィンドウの拡張:200Kのコンテキストウィンドウを提供しますが、顧客のニーズに応じて100万トークンを超える入力も処理できます。

図1. Claude 3は以前のバージョンよりもコンテキスト認識に優れています。
DatabricksのDBRX#
Databricks DBRXは、Databricksが2024年3月27日にリリースしたオープンな汎用LLMです。DBRXは、言語理解、プログラミング、数学など、さまざまなベンチマークで非常に優れた性能を発揮します。同等のモデルより約40%小さいにもかかわらず、他の確立されたモデルを上回っています。

図2. DBRXと他のモデルの比較。
DBRXは、きめ細かなMixture-of-Experts(MoE)アーキテクチャを用いた次トークン予測によって学習されました。そのため、学習と推論のパフォーマンスが大幅に向上しています。このアーキテクチャでは、専門化された多様なサブモデル(「エキスパート」)に照会することで、系列内の次の単語をより正確に予測できます。これらのサブモデルは、さまざまな種類の情報やタスクの処理を得意としています。
GoogleのGemini 1.5#
Googleは2024年2月15日、膨大なテキスト、動画、音声データを分析できる、計算効率に優れたマルチモーダルAIモデルGemini 1.5を発表しました。最新モデルは、パフォーマンス、効率、機能の面でより高度になっています。Gemini 1.5の主な特徴は、長いコンテキストの理解における画期的な進歩です。このモデルは、最大100万トークンを一貫して処理できます。Gemini 1.5の機能は、新しいMoEベースのアーキテクチャによっても実現されています。

図3. 主要なLLMのコンテキスト長の比較
Gemini 1.5の興味深い機能をいくつか紹介します。
- データ処理の改善:大容量のPDF、コードリポジトリ、長時間の動画をプロンプトとして直接アップロードできます。モデルはモダリティをまたいで推論し、テキストを出力できます。
- 複数ファイルのアップロードとクエリ:開発者は複数のファイルをアップロードして質問できるようになりました。
- さまざまなタスクに利用可能:多様なタスクに対応できるよう最適化されており、数学、科学、推論、多言語対応、動画理解、コードなどの分野で改善が見られます。
AIが生み出す驚異的なビジュアル#
2024年の第1四半期には、非常にリアルなビジュアルを作成できる生成AIモデルが登場し、ソーシャルメディアの未来やAIの進歩をめぐる議論を巻き起こしました。議論を呼んでいるモデルを詳しく見てみましょう。
OpenAIのSora#
ChatGPTの開発元であるOpenAIは、2024年2月15日、最先端のテキスト・トゥ・ビデオ深層学習モデルSoraを発表しました。Soraは、ユーザーのテキストプロンプトに基づいて、ビジュアル品質の高い1分間の動画を生成できるテキスト・トゥ・ビデオ生成モデルです。
たとえば、次のプロンプトを見てみましょう。
「色鮮やかな魚や海の生き物で満ちた、サンゴ礁の美しく描かれたペーパークラフトの世界。」
そして、こちらが出力動画の1フレームです。

図4. Soraが生成した動画の1フレーム。
Soraのアーキテクチャは、テクスチャ生成に拡散モデルを、構造的な一貫性の確保にTransformerモデルを組み合わせることで、これを可能にしています。現在、Soraへのアクセスは、リスクを把握してフィードバックを得るため、レッドチーム担当者と、選ばれた一部のビジュアルアーティスト、デザイナー、映像制作者に提供されています。
Stability AIのStable Diffusion 3#
Stability AIは2024年2月22日、テキスト・トゥ・イメージ生成モデルであるStable Diffusion 3の登場を発表しました。このモデルは、拡散Transformerアーキテクチャとフローマッチングを組み合わせています。技術論文はまだ公開されていませんが、注目すべき主な機能がいくつかあります。

図5. プロンプト「夜の山頂に立つ魔法使いが、暗い空にカラフルなエネルギーで作られた『Stable Diffusion 3』という宇宙の呪文を放つ、壮大なアニメ作品」に基づく出力画像(出典)
Stable Diffusionの最新モデルは、複数の被写体を含む画像の生成において、パフォーマンス、画像品質、精度が向上しています。Stable Diffusion 3では、8億から80億パラメーターまで、さまざまなモデルも提供されます。ユーザーは、スケーラビリティと詳細度に関する具体的なニーズに応じて選択できます。
GoogleのLumiere#
Googleは2024年1月23日、テキスト・トゥ・ビデオ拡散モデルのLumiereを公開しました。Lumiereは、Space-Time-U-Net、略してSTUNetと呼ばれるアーキテクチャを使用しています。これにより、動画内の物体の位置や動きを理解できます。その結果、滑らかで生き生きとした動画を生成できます。

図6. プロンプト「家でウクレレを弾くパンダ」に基づいて生成された動画の1フレーム。
動画1本あたり80フレームを生成できるLumiereは、限界を押し広げ、AI分野の動画品質に新たな基準を打ち立てています。Lumiereの機能をいくつか紹介します。
- 画像から動画へ:画像とプロンプトを起点として、Lumiereは画像を動画へアニメーション化できます。
- スタイル付き生成:Lumiereは、1枚の参照画像を使用して、特定のスタイルの動画を作成できます。
- シネマグラフ:Lumiereは画像内の特定の領域をアニメーション化し、残りのシーンを静止させたまま特定の物体を動かすなど、動的なシーンを作成できます。
- 動画インペインティング:動画内の人物の服装を変更したり、背景の細部を変えたりするなど、動画の一部を変更できます。
未来はすでに到来しているようです#
2024年の幕開けには、SF映画に登場するような多くのAIイノベーションももたらされました。以前なら不可能だと言っていたことが、今では実際に取り組まれています。次の発見を目にすると、未来はそれほど遠くないように感じられます。
Elon MuskのNeuralink#
Elon MuskのNeuralinkは、2024年1月29日、人間にワイヤレス脳チップを正常に埋め込みました。これは人間の脳とコンピューターを接続するための大きな一歩です。Elon Muskは、Neuralinkの最初の製品「Telepathy」が開発計画に入っていると共有しました。

図7. Neuralinkのインプラント
目標は、特に四肢の機能を失ったユーザーが、思考だけでデバイスを簡単に操作できるようにすることです。応用の可能性は利便性にとどまりません。Elon Muskは、麻痺のある人々が容易にコミュニケーションできる未来を思い描いています。
DisneyのHoloTile Floor#
2024年1月18日、Walt Disney ImagineeringはHoloTile Floorを公開しました。これは世界初の複数人対応・全方向型トレッドミルフロアと呼ばれています。

図8。Disney ImagineerのLanny Smootが、最新のイノベーションであるHoloTile Floorの上でポーズを取っています。
テレキネシスのように人や物の下で動き、没入型のバーチャルリアリティおよび拡張現実体験を実現できます。その上では、あらゆる方向に歩きながら衝突を避けられます。DisneyのHoloTile Floorは、劇場のステージに設置して、創造的な方法で踊ったり動かしたりすることもできます。
AppleのVision Pro#
2024年2月2日、Appleが大きく期待されていたVision Proヘッドセットを市場に投入しました。バーチャルリアリティおよび拡張現実体験を一新するよう設計された、さまざまな機能とアプリケーションを備えています。Vision Proヘッドセットは、エンターテインメント、生産性、空間コンピューティングを融合し、多様なユーザーに対応します。Appleは、発売時点で生産性ツールからゲーム、エンターテインメントサービスまで、600以上のアプリがVision Pro向けに最適化されていると誇らしげに発表しました。
CognitionのDevin#
2024年3月12日、CognitionはDevinというソフトウェアエンジニアリングアシスタントをリリースしました。Devinは、自律型AIソフトウェアエンジニアとして世界で初めて試みられたものです。提案を行ったり特定のタスクを完了したりする従来のコーディングアシスタントとは異なり、Devinは初期構想から完成まで、ソフトウェア開発プロジェクト全体を処理するように設計されています。
新しいテクノロジーを学習し、完全なアプリを構築してデプロイし、バグを発見・修正し、自身のモデルを学習させ、オープンソースや本番コードベースに貢献できます。さらに、Upworkなどのサイトから実際の開発業務を請け負うこともできます。

図9. Devinと他のモデルの比較。
Devinは、Djangoやscikit-learnなどのオープンソースプロジェクトに存在する実際のGitHub issueの解決をエージェントに求める、難易度の高いベンチマークSWE-benchで評価されました。以前の最先端記録が1.96%だったのに対し、Devinはissueの13.86%をエンドツーエンドで正しく解決しました。
注目すべきその他の話題#
あまりにも多くの出来事が起きているため、この記事ですべてを取り上げることはできません。そこで、その他の注目すべき話題をいくつか紹介します。
- NVIDIAが2024年3月21日に発表したNVIDIAのLATTE3Dは、テキストプロンプトから3D表現を即座に作成するテキスト・トゥ・3D AIモデルです。
- CEOのDavid Holzが予告したMidjourneyの新しいテキスト・トゥ・ビデオ生成モデルは、1月に学習を開始しており、近日中のリリースが見込まれています。
- LenovoはAI PC革命を推進するため、2024年1月8日にE Ink Prismテクノロジー搭載のThinkBook 13xと、高性能AIノートPCをリリースしました。
AIトレンドの最新情報を私たちと一緒にチェックしましょう。#
2024年の幕開けには、AIの画期的な進歩と多くの主要な技術的マイルストーンが見られました。しかし、AIができることはまだ始まったばかりです。最新のAI開発について詳しく知りたい方は、Ultralyticsにお任せください。
GitHubリポジトリをチェックして、コンピュータービジョンとAIにおける最新の貢献をご覧ください。また、製造や医療などの業界でAIがどのように活用されているかを、ソリューションページで確認することもできます。









