Large Action Models (LAM)
Explora los modelos de acción de gran escala (LAM) y cómo impulsan agentes de IA autónomos. Aprende a integrar Ultralytics YOLO26 en flujos de trabajo de visión a acción y automatización de tareas.
Los modelos de acción de gran escala (LAM) son una clase avanzada de inteligencia artificial generativa diseñada para ir más allá de la generación de texto mediante la ejecución autónoma de tareas y la interacción con entornos digitales. A diferencia de los modelos tradicionales, que se limitan a procesar y producir texto, los LAM actúan como el motor cognitivo central de los agentes de IA, traduciendo la intención humana en acciones concretas de varios pasos. Al cerrar la brecha entre la comprensión del lenguaje natural y la ejecución en el mundo real, estos modelos representan un avance significativo hacia la inteligencia artificial general (AGI) y los sistemas altamente autónomos.
Cómo funcionan los modelos de acción de gran escala#
Los LAM se basan en la arquitectura fundamental de los modelos fundacionales tradicionales, pero se entrenan específicamente para interactuar con software, API y entornos web. Mediante técnicas como el aprendizaje por refuerzo y las llamadas a funciones, un LAM puede descomponer una solicitud compleja de un usuario en pasos lógicos, navegar por interfaces gráficas de usuario y ejecutar endpoints de API. Por ejemplo, los avances recientes de Claude 3.5 de Anthropic para el uso del ordenador y de la familia xLAM de Salesforce demuestran cómo estos sistemas pueden hacer clic de forma autónoma en botones, rellenar formularios y gestionar flujos de trabajo tal como lo haría un operador humano.
Cuando se combinan con sistemas de visión por ordenador, los LAM son aún más potentes. Las entradas visuales se pueden procesar con modelos altamente eficientes como Ultralytics YOLO26, lo que permite al LAM «ver» su entorno, interpretar el contexto visual y activar acciones programáticas específicas según lo que detecte.
Aplicaciones en el mundo real#
Los LAM están transformando la forma en que las industrias abordan la automatización de tareas, pasando de la asistencia pasiva a la ejecución activa.
- IA en el comercio minorista y atención al cliente: En lugar de limitarse a responder a las preguntas de los clientes, un LAM puede procesar de forma autónoma la devolución de un producto. Si un usuario solicita cancelar un pedido, el modelo puede navegar por el software de facturación de la empresa, verificar la política, emitir el reembolso y actualizar la base de datos de inventario sin intervención humana.
- IA en la administración sanitaria: En entornos clínicos, los LAM coordinan flujos de trabajo complejos. Pueden extraer las solicitudes de los pacientes, consultar la disponibilidad de los médicos, actualizar automáticamente las historias clínicas electrónicas (EHR) mediante el software médico interno y finalizar la programación de citas.
Automatización de flujos de trabajo de visión con código#
Los LAM se integran con frecuencia con modelos de visión para automatizar las inspecciones visuales. El siguiente ejemplo de Python demuestra cómo un flujo de trabajo hipotético con un LAM podría utilizar ultralytics para analizar una imagen y activar una acción automatizada de inventario basándose en los resultados de la detección de objetos.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")Los usuarios pueden implementar y supervisar sin problemas este tipo de flujos de trabajo integrados de visión y acción mediante la Ultralytics Platform, que proporciona una infraestructura en la nube sólida para soluciones modernas de IA.
Diferenciación de conceptos relacionados#
Para comprender plenamente el panorama actual de la IA, es útil distinguir los LAM de otros términos estrechamente relacionados:
- LAM frente a modelo de lenguaje de gran escala (LLM): Un LLM está diseñado estrictamente para procesar, resumir y generar lenguaje, como un predictor de texto muy avanzado. Un LAM incorpora esta comprensión del lenguaje, pero está diseñado específicamente para interactuar con herramientas externas y completar acciones digitales.
- LAM frente a la IA agéntica: «IA agéntica» describe el sistema general o la entidad de software que funciona de forma autónoma. El modelo de acción de gran escala es la red neuronal subyacente —el «cerebro»— que proporciona al agente la capacidad de planificar y realizar esas acciones.
- LAM frente a la RAG agéntica: La RAG agéntica se centra en recuperar y sintetizar de forma autónoma información externa para mejorar la precisión de una respuesta generada. Un LAM se centra en manipular sistemas y cambiar estados, como reservar un vuelo o mover archivos, en lugar de limitarse a recuperar datos.








