Large Action Models (LAM)
대규모 액션 모델(LAM)과 이것이 자율 AI 에이전트를 구동하는 방법을 살펴봅니다. 비전-액션 워크플로와 작업 자동화를 위해 Ultralytics YOLO26을 통합하는 방법을 알아봅니다.
대규모 액션 모델(LAM)은 작업을 자율적으로 실행하고 디지털 환경과 상호작용함으로써 텍스트 생성을 넘어서는 고급 생성형 인공지능의 한 종류입니다. 텍스트만 엄격하게 처리하고 생성하는 기존 모델과 달리, LAM은 AI 에이전트의 핵심 인지 엔진으로 작동하여 인간의 의도를 구체적인 다단계 작업으로 변환합니다. 이러한 모델은 자연어 이해와 실제 환경에서의 실행 사이의 간극을 해소하여 인공 일반 지능(AGI)과 고도의 자율 시스템을 향한 중요한 도약을 나타냅니다.
대규모 액션 모델의 작동 방식#
LAM은 기존 파운데이션 모델의 기본 아키텍처를 기반으로 하지만, 소프트웨어, API 및 웹 환경과 연동하도록 특별히 학습됩니다. 강화 학습과 함수 호출 같은 기술을 사용하면 LAM은 복잡한 사용자 요청을 논리적인 단계로 나누고, 그래픽 사용자 인터페이스를 탐색하며, API 엔드포인트를 실행할 수 있습니다. 예를 들어, Anthropic의 Claude 3.5 컴퓨터 사용과 Salesforce의 xLAM 제품군의 최근 발전은 이러한 시스템이 인간 작업자와 마찬가지로 자율적으로 버튼을 클릭하고, 양식을 작성하며, 워크플로를 관리할 수 있음을 보여줍니다.
컴퓨터 비전 시스템과 결합하면 LAM은 더욱 강력해집니다. 시각적 입력을 Ultralytics YOLO26과 같은 매우 효율적인 모델로 처리할 수 있으므로, LAM은 환경을 "보고", 시각적 맥락을 해석하며, 감지한 내용에 따라 특정 프로그래밍 작업을 실행할 수 있습니다.
실제 적용 사례#
LAM은 작업 자동화에 대한 업계의 접근 방식을 변화시키며, 수동적인 지원에서 능동적인 실행으로 전환하고 있습니다.
- 리테일 분야의 AI 및 고객 지원: 단순히 고객의 질문에 답하는 대신 LAM은 제품 반품을 자율적으로 처리할 수 있습니다. 사용자가 주문 취소를 요청하면 모델은 회사의 청구 소프트웨어를 탐색하고, 정책을 확인하고, 환불을 처리하며, 사람의 개입 없이 재고 데이터베이스를 업데이트할 수 있습니다.
- 헬스케어 분야의 AI 행정: 임상 환경에서 LAM은 복잡한 워크플로를 조정합니다. 환자의 요청을 추출하고, 의사의 진료 가능 여부를 상호 참조하며, 내부 의료 소프트웨어를 통해 전자의무기록(EHR)을 자동으로 업데이트하고, 예약 일정을 최종 확정할 수 있습니다.
코드로 비전 워크플로 자동화#
LAM은 시각적 검사를 자동화하기 위해 비전 모델과 자주 통합됩니다. 다음 Python 예제는 가상의 LAM 워크플로가 ultralytics을 활용하여 이미지를 스캔하고 객체 감지 결과를 기반으로 자동화된 재고 작업을 실행하는 방식을 보여줍니다.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")사용자는 강력한 클라우드 인프라를 제공하는 Ultralytics Platform을 사용하여 이러한 통합 시각-액션 워크플로를 원활하게 배포하고 모니터링할 수 있습니다.
관련 개념 구분하기#
최신 AI 환경을 제대로 이해하려면 밀접하게 관련된 다른 용어와 LAM을 구분하는 것이 도움이 됩니다.
- LAM과 대규모 언어 모델(LLM)의 비교: LLM은 고도로 발전된 텍스트 예측기와 마찬가지로 언어를 처리하고, 요약하고, 생성하도록 엄격하게 설계되었습니다. LAM은 이러한 언어 이해 기능을 포함하면서도 외부 도구와 상호작용하고 디지털 작업을 완료하도록 특별히 설계되었습니다.
- LAM과 에이전틱 AI의 비교: "에이전틱 AI"는 자율적으로 작동하는 포괄적인 시스템 또는 소프트웨어 개체를 의미합니다. 대규모 액션 모델은 에이전트에 이러한 작업을 계획하고 수행할 수 있는 능력을 부여하는 기반 신경망, 즉 "두뇌"입니다.
- LAM과 에이전틱 RAG의 비교: 에이전틱 RAG는 생성된 답변의 정확도를 높이기 위해 외부 정보를 자율적으로 검색하고 종합하는 데 중점을 둡니다. LAM은 단순히 데이터를 검색하는 것이 아니라 시스템을 조작하고 상태를 변경하는 작업(예: 항공편 예약 또는 파일 이동)에 중점을 둡니다.








