Large Action Models (LAM)
Изучи большие модели действий (LAM) и то, как они обеспечивают работу автономных ИИ-агентов. Научись интегрировать Ultralytics YOLO26 в рабочие процессы от зрения к действию и автоматизацию задач.
Большие модели действий (LAM) — это продвинутый класс генеративного искусственного интеллекта, созданный для выхода за рамки генерации текста за счёт автономного выполнения задач и взаимодействия с цифровыми средами. В отличие от традиционных моделей, которые строго обрабатывают и создают текст, LAM выступают в роли основного когнитивного механизма для ИИ-агентов, преобразуя намерения человека в конкретные многошаговые действия. Устраняя разрыв между пониманием естественного языка и выполнением действий в реальном мире, эти модели представляют собой значительный шаг на пути к искусственному общему интеллекту (AGI) и высокоавтономным системам.
Как работают большие модели действий#
LAM строятся на основе базовой архитектуры традиционных базовых моделей, но специально обучаются для взаимодействия с программным обеспечением, API и веб-средами. Используя такие методы, как обучение с подкреплением и вызов функций, LAM может разбить сложный запрос пользователя на логические шаги, перемещаться по графическим интерфейсам и выполнять конечные точки API. Например, последние разработки Claude 3.5 computer use от Anthropic и семейство xLAM от Salesforce демонстрируют, как эти системы могут автономно нажимать кнопки, заполнять формы и управлять рабочими процессами так же, как это делал бы человек-оператор.
В сочетании с системами компьютерного зрения LAM становятся ещё мощнее. Визуальные входные данные могут обрабатываться высокоэффективными моделями, такими как Ultralytics YOLO26, что позволяет LAM «видеть» окружающую среду, интерпретировать визуальный контекст и запускать определённые программные действия на основе обнаруженных объектов.
Практические применения#
LAM меняют подход отраслей к автоматизации задач, переводя её от пассивной помощи к активному выполнению.
- ИИ в розничной торговле и поддержке клиентов: вместо того чтобы просто отвечать на вопросы клиентов, LAM может автономно обработать возврат товара. Если пользователь просит отменить заказ, модель может перейти в платёжное программное обеспечение компании, проверить соответствие политике, оформить возврат средств и обновить базу данных о запасах без вмешательства человека.
- ИИ в административных процессах здравоохранения: в клинических условиях LAM координируют сложные рабочие процессы. Они могут извлекать запросы пациентов, сопоставлять их с доступностью врачей, автоматически обновлять электронные медицинские карты (EHR) через внутреннее медицинское программное обеспечение и завершать планирование приёмов.
Автоматизация рабочих процессов компьютерного зрения с помощью кода#
LAM часто интегрируются с моделями компьютерного зрения для автоматизации визуальных проверок. В следующем примере на Python показано, как гипотетический рабочий процесс LAM может использовать ultralytics для сканирования изображения и запуска автоматического действия с запасами на основе результатов обнаружения объектов.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")Пользователи могут без проблем развёртывать и отслеживать такие интегрированные рабочие процессы визуального управления с помощью Ultralytics Platform, которая предоставляет надёжную облачную инфраструктуру для современных решений на основе ИИ.
Различие между связанными понятиями#
Чтобы полностью понять современный ландшафт ИИ, полезно отличать LAM от других тесно связанных терминов:
- LAM и большая языковая модель (LLM): LLM предназначена исключительно для обработки, обобщения и генерации языка, подобно высокоразвитому предиктору текста. LAM включает такое понимание языка, но специально разработана для взаимодействия с внешними инструментами и выполнения цифровых действий.
- LAM и агентный ИИ: «Агентный ИИ» описывает общую систему или программную сущность, работающую автономно. Большая модель действий — это лежащая в основе нейронная сеть, то есть «мозг», который даёт агенту способность планировать и выполнять эти действия.
- LAM и агентный RAG: агентный RAG сосредоточен на автономном извлечении и синтезе внешней информации для повышения точности сгенерированного ответа. LAM сосредоточена на управлении системами и изменении состояний, например при бронировании авиабилета или перемещении файлов, а не только на извлечении данных.








