Large Action Models (LAM)
Large Action Models(LAM)と、自律型AIエージェントを駆動する仕組みを説明します。Ultralytics YOLO26を統合して、ビジョンからアクションへのワークフローとタスク自動化を実現する方法を学びます。
大規模アクションモデル(LAM)は、テキスト生成を超えて、タスクを自律的に実行し、デジタル環境と対話するよう設計された、生成AIの高度なカテゴリです。テキストの処理と生成に限定された従来のモデルとは異なり、LAMはAIエージェントの中核となる認知エンジンとして機能し、人間の意図を具体的な複数ステップのアクションに変換します。自然言語の理解と現実世界での実行の隔たりを埋めることで、これらのモデルは汎用人工知能(AGI)と高度な自律システムの実現に向けた大きな進歩を示しています。
大規模アクションモデル(LAM)の仕組み#
LAMは従来の基盤モデルの基盤アーキテクチャを土台としていますが、ソフトウェア、API、Web環境と連携するよう特別にトレーニングされています。強化学習や関数呼び出しなどの手法を使用することで、LAMは複雑なユーザーリクエストを論理的なステップに分解し、グラフィカルユーザーインターフェースを操作して、APIエンドポイントを実行できます。たとえば、AnthropicのClaude 3.5 computer useやSalesforceのxLAMファミリーによる最近の開発は、これらのシステムが人間のオペレーターと同じように、ボタンを自律的にクリックし、フォームに入力し、ワークフローを管理できることを示しています。
コンピュータービジョンシステムと組み合わせると、LAMはさらに強力になります。視覚入力をUltralytics YOLO26のような高効率モデルで処理することで、LAMは環境を「見て」、視覚的なコンテキストを解釈し、検出した内容に基づいて特定のプログラムによるアクションを実行できます。
実世界での利用例#
LAMはタスク自動化への各業界のアプローチを変革し、受動的な支援から能動的な実行へと移行させています。
- 小売業におけるAIとカスタマーサポート: LAMは顧客の質問に答えるだけでなく、商品の返品処理を自律的に実行できます。ユーザーが注文のキャンセルを依頼すると、モデルは企業の請求ソフトウェアを操作し、ポリシーを確認して返金を実行し、在庫データベースを更新するまでを、人間の介入なしに行えます。
- ヘルスケアにおけるAIの管理業務: 臨床現場では、LAMが複雑なワークフローを調整します。患者からの依頼を抽出し、医師の対応可能時間を照合し、院内の医療ソフトウェアを通じて電子健康記録(EHR)を自動的に更新し、予約スケジュールを確定できます。
コードによるビジョンワークフローの自動化#
LAMは、ビジュアル検査を自動化するためにビジョンモデルと統合されることがよくあります。以下の Python の例では、仮想的なLAMワークフローが ultralytics を活用して画像をスキャンし、物体検出の結果に基づいて在庫に関する自動アクションを実行する方法を示します。
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")ユーザーは、最新のAIソリューション向けに堅牢なクラウドインフラストラクチャを提供するUltralytics Platformを使用して、このような統合されたビジュアルアクションワークフローをシームレスにデプロイおよびモニタリングできます。
関連する概念との違い#
現代のAIの状況を十分に理解するには、LAMと密接に関連する他の用語を区別すると役立ちます。
- LAMと大規模言語モデル(LLM)の違い: LLMは、高度なテキスト予測モデルと同様に、言語の処理、要約、生成に特化して設計されています。LAMはこの言語理解を組み込みつつ、外部ツールと連携し、デジタルアクションを完了するよう特別に設計されています。
- LAMとエージェンティックAIの違い: 「エージェンティックAI」は、自律的に動作する包括的なシステムまたはソフトウェアエンティティを指します。大規模アクションモデルは、そのエージェントにアクションを計画して実行する能力を与える基盤ニューラルネットワーク、つまり「脳」です。
- LAMとエージェンティックRAGの違い: エージェンティックRAGは、生成される回答の精度を高めるために、外部情報を自律的に取得して統合することに重点を置いています。一方、LAMはデータを取得するだけでなく、システムを操作して状態を変更すること(フライトの予約やファイルの移動など)に重点を置いています。









