Large Action Models (LAM)
Explora os Large Action Models (LAM) e como impulsionam agentes de IA autónomos. Aprende a integrar o Ultralytics YOLO26 em workflows de visão-para-ação e automatização de tarefas.
Os Modelos de Ação de Grande Escala (LAM) são uma classe avançada de inteligência artificial generativa concebida para ir além da geração de texto, executando tarefas e interagindo autonomamente com ambientes digitais. Ao contrário dos modelos tradicionais, que processam e produzem exclusivamente texto, os LAMs atuam como o motor cognitivo central dos agentes de IA, traduzindo a intenção humana em ações concretas e executadas em várias etapas. Ao colmatar a lacuna entre a compreensão da linguagem natural e a execução no mundo real, estes modelos representam um avanço significativo rumo à Inteligência Artificial Geral (AGI) e a sistemas altamente autónomos.
Como funcionam os Modelos de Ação de Grande Escala#
Os LAMs baseiam-se na arquitetura fundamental dos modelos fundacionais tradicionais, mas são especificamente treinados para interagir com software, APIs e ambientes Web. Utilizando técnicas como a aprendizagem por reforço e a chamada de funções, um LAM pode decompor um pedido complexo do utilizador em etapas lógicas, navegar por interfaces gráficas e executar endpoints de API. Por exemplo, os desenvolvimentos recentes da utilização de computadores do Claude 3.5 da Anthropic e da família xLAM da Salesforce demonstram como estes sistemas podem clicar autonomamente em botões, preencher formulários e gerir fluxos de trabalho tal como faria um operador humano.
Quando combinados com sistemas de visão computacional, os LAMs tornam-se ainda mais poderosos. As entradas visuais podem ser processadas por modelos altamente eficientes, como o Ultralytics YOLO26, permitindo que o LAM "veja" o seu ambiente, interprete o contexto visual e acione ações programáticas específicas com base no que deteta.
Aplicações no mundo real#
Os LAMs estão a transformar a forma como os setores abordam a automatização de tarefas, passando da assistência passiva para a execução ativa.
- IA no Varejo e Suporte ao Cliente: Em vez de se limitar a responder às perguntas dos clientes, um LAM pode processar autonomamente uma devolução de produto. Se um utilizador pedir o cancelamento de um pedido, o modelo pode navegar pelo software de faturação da empresa, verificar a política, emitir o reembolso e atualizar a base de dados de inventário sem intervenção humana.
- IA na Administração de Saúde: Em ambientes clínicos, os LAMs coordenam fluxos de trabalho complexos. Podem extrair pedidos de pacientes, cruzar a disponibilidade dos médicos, atualizar automaticamente os Registros Eletrónicos de Saúde (EHR) através do software médico interno e concluir o agendamento de consultas.
Automatização de Fluxos de Trabalho de Visão com Código#
Os LAMs são frequentemente integrados com modelos de visão para automatizar inspeções visuais. O exemplo seguinte em Python demonstra como um fluxo de trabalho hipotético de LAM pode utilizar ultralytics para analisar uma imagem e acionar uma ação automatizada de inventário com base nos resultados da deteção de objetos.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")Os utilizadores podem implementar e monitorizar estes tipos de fluxos de trabalho integrados de ação visual de forma contínua utilizando a Ultralytics Platform, que fornece uma infraestrutura de nuvem robusta para soluções modernas de IA.
Distinguir conceitos relacionados#
Para compreender plenamente o panorama moderno da IA, é útil distinguir os LAMs de outros termos estreitamente relacionados:
- LAM vs. Modelo de Linguagem de Grande Escala (LLM): Um LLM foi concebido estritamente para processar, resumir e gerar linguagem, tal como um preditor de texto altamente avançado. Um LAM incorpora esta compreensão da linguagem, mas foi especificamente desenvolvido para interagir com ferramentas externas e concluir ações digitais.
- LAM vs. IA Agêntica: A "IA Agêntica" descreve o sistema abrangente ou a entidade de software que opera de forma autónoma. O Modelo de Ação de Grande Escala é a rede neural subjacente — o "cérebro" — que confere ao agente a capacidade de planear e executar essas ações.
- LAM vs. RAG Agêntico: O RAG Agêntico centra-se na recuperação e síntese autónomas de informações externas para melhorar a precisão de uma resposta gerada. Um LAM centra-se na manipulação de sistemas e na alteração de estados, como reservar um voo ou mover ficheiros, em vez de apenas recuperar dados.








