Computer Use Agents (CUAs)
Computer Use Agents (CUA) がどのように人間のようにGUIを自動化するかを解説します。Ultralytics YOLO26を使用して高度なCUA知覚システムを構築する方法を学びましょう。
Computer Use Agents (CUAs) は、人工知能システムがデジタル環境と対話する方法における大きな飛躍を表しています。バックエンドAPIやテキストベースのプロンプトに排他的に依存する従来の AI Agents と異なり、CUAは人間が行うのとまったく同様にグラフィカルユーザーインターフェース (GUI) と対話するように設計されています。画面の観察、カーソルの移動、要素のクリック、仮想キーボードでのタイピングを通じて、CUAは抽象的な Generative AI の機能と実用的で日常的なソフトウェア操作との間のギャップを埋めます。
AIに直感的な視覚環境をシームレスに知覚してナビゲートすることを要求するため、この進化はしばしば Artificial General Intelligence (AGI) に向けた一歩とみなされ、機械知能の歴史的限界(Moravec's Paradox と呼ばれることもある)に挑戦するものです。
視覚的インターフェースへのシフト#
歴史的に、さまざまなソフトウェアアプリケーションにわたるタスクの自動化には、直接的な統合や厳格な DOM-based parsing が必要でした。しかし、最新世代のCUAは、高度な Vision-Language Models (VLM) と洗練された Computer Vision (CV) 技術を活用して、画面上のピクセルを解釈します。
2024年後半から2025年前半にかけての大きなブレークスルーが、CUAの採用を加速させました。例えば、Anthropic's Claude Computer Use は、モデルがデスクトップを確認してアプリケーション内をクリックするための汎用APIを導入しました。同様に、OpenAI's Operator は、オープンエンドなウェブブラウジングタスクを実行できるリサーチプレビューとして登場しました。現在、これらのシステムは、複雑でマルチステップのデジタルワークフローを完了する能力を測定するために、WebArena や OSWorld のような厳格なベンチマークで日常的に評価されています。
これらのエージェントはシステムを直接制御するため、意図しないアクションや悪意のある Prompt Injection などのリスクを軽減するために、サンドボックス化された Virtual Machines 内で実行することが強く推奨されます。
実社会での応用#
CUA は、分離されたソフトウェアエコシステム全体で複雑なマルチステップタスクを実行することで、産業を急速に変革しています。
- Autonomous Quality Assurance (QA): GUI automation testing において、CUAは脆弱なテストスクリプトを使用せずに、ウェブアプリケーションを視覚的にナビゲートし、ユーザーワークフローをクリックして進み、レイアウト要素を検証できます。ボタンの色が変わったり移動したりしても、エージェントは自然に適応します。
- Legacy Robotic Process Automation: モダンなAPIを持たない古いデスクトップアプリケーションに対して、CUAは Robotic Process Automation (RPA) を超高速化します。エージェントはレガシーなCRMを開き、構造化されていない請求書を読み取り、抽出されたデータをシステムに手動で入力して、企業のデータ入力を効率化できます。
CUA のための認識機能の構築#
大規模なVLMはスクリーンショット全体を分析できますが、ローカライズされた object detection モデルと組み合わせる方が、多くの場合により効率的かつ正確です。これらのモデルは、ボタン、アイコン、テキストフィールドなどの UI elements をリアルタイムでマッピングし、エージェントがクリックするための正確な座標を提供します。
開発者は PyTorch を Ultralytics YOLO26 モデルとともに使用して、CUA向けの非常に応答性の高い認識レイヤーを構築できます。Ultralytics Platform は、カスタムGUIデータセットでの model training に利用できます。次のPythonスニペットは、CUAが ultralytics パッケージの predict mode を使用して画面上のボタンを見つける方法を示しています。
from ultralytics import YOLO
# Initialize a YOLO26 model specifically trained to detect GUI components
model = YOLO("yolo26n-gui.pt")
# The CUA captures a screenshot and maps out the visual interface
results = model.predict("desktop_screenshot.png")
# The agent extracts coordinates to execute a physical action (e.g., mouse click)
for box in results[0].boxes:
if model.names[int(box.cls)] == "button":
x1, y1, x2, y2 = box.xyxy[0].tolist()
print(f"CUA Action: Moving cursor to center of button at ({(x1 + x2) / 2}, {(y1 + y2) / 2})")CUA と関連コンセプトの比較#
Computer Use Agentsがより広いAIエコシステムにどのように適合するかを理解することは、適切な action chunking 戦略を実装するために不可欠です。
- vs. Auto-GPT: Auto-GPT は主にテキスト生成と事前定義されたスクリプトに依存してタスクをループ処理する自律型エージェントですが、CUAは本質的に視覚インターフェースやオペレーティングシステムと直接対話します。
- vs. Function Calling (Tool Use): Function Calling (Tool Use) を使用すると、AIは特定の事前定義されたバックエンドコード関数(天気予報APIの取得など)を実行できます。対照的に、CUAはフロントエンドのUIアクションを実行し、エンドユーザーが行うのとまったく同じようにデジタル環境を操作します。






