Small Language Models (SLMs)
Descubre cómo los modelos de lenguaje pequeños (SLM) permiten una IA eficiente, privada y de bajo coste en dispositivos periféricos. Aprende a combinar SLM con Ultralytics YOLO26 para la IA en el edge.
Los modelos de lenguaje pequeños (SLMs) son modelos de inteligencia artificial optimizados, diseñados para comprender y generar lenguaje humano de forma eficiente. A diferencia de sus homólogos de mayor tamaño, los SLM suelen tener desde unos pocos millones hasta unos 15.000 millones de parámetros, lo que les permite ejecutarse localmente en dispositivos perimetrales en lugar de requerir una enorme infraestructura de computación en la nube. Al funcionar localmente, estos modelos ofrecen un procesamiento más rápido, una mayor privacidad del usuario y unos costes de implementación significativamente menores.
Diferencias entre términos clave#
Para comprender mejor el panorama de la IA, conviene distinguir los SLM de las tecnologías relacionadas:
- SLM frente a modelos de lenguaje grandes (LLMs): Mientras que los LLM contienen cientos de miles de millones de parámetros y requieren amplios recursos de servidor, los SLM están muy optimizados. Esto les permite funcionar con una latencia de inferencia mínima, por lo que son ideales para aplicaciones especializadas y específicas de un dominio que no necesitan una escala enorme.
- SLM frente a modelos visión-lenguaje (VLMs): Los SLM se centran principalmente en tareas de procesamiento del lenguaje natural. En cambio, los VLM pueden interpretar tanto texto como imágenes de forma nativa. Sin embargo, muchos desarrolladores combinan ahora los SLM con modelos de visión rápidos para crear sistemas multimodales ligeros.
Aplicaciones en el mundo real#
Los modelos de lenguaje pequeños están transformando rápidamente distintos sectores al llevar inteligencia avanzada directamente a los dispositivos electrónicos de consumo y a las redes empresariales.
- Asistentes virtuales en el dispositivo: Los smartphones modernos y los dispositivos IoT aprovechan los SLM para procesar comandos de voz localmente. Esto permite responder en tiempo real y mantiene los datos sensibles en el dispositivo. Modelos de última generación como Phi-3 de Microsoft y OpenELM de Apple están abriendo camino en esta revolución de la inteligencia en el dispositivo.
- Chatbots específicos de un dominio: Las empresas implementan SLM muy ajustados para automatizar la atención al cliente. Al combinar estos modelos compactos con la generación aumentada por recuperación (RAG), las empresas pueden consultar de forma segura sus bases de datos internas y resolver problemas sin depender de API de terceros costosas.
- Computación perimetral en la fabricación: En las instalaciones de fabricación inteligente, los SLM ayudan a los técnicos a resumir rápidamente manuales de equipos complejos. Al combinarse con modelos de detección de objetos en tiempo real, estos sistemas analizan defectos visuales y generan al instante informes de diagnóstico en texto sin formato directamente en la planta de producción.
Implementación de SLM en flujos de trabajo modernos#
Los avances recientes de 2024 y 2025 han demostrado que los datos de entrenamiento de alta calidad pueden ofrecer un rendimiento comparable al de modelos enormes de años anteriores. Innovaciones como Gemma de Google y Llama 3 8B de Meta muestran hasta qué punto han avanzado las arquitecturas más pequeñas.
Al desarrollar soluciones de IA completas, los desarrolladores suelen usar Python para integrar el razonamiento lingüístico de un SLM con la precisión visual de las herramientas disponibles en la Plataforma Ultralytics. Por ejemplo, un SLM en el dispositivo podría procesar un comando de voz para iniciar una tarea de visión artificial. El siguiente fragmento conciso muestra cómo cargar un modelo ligero como Ultralytics YOLO26 para el seguimiento de objetos, una operación muy adecuada para el mismo hardware perimetral que ejecuta un SLM:
from ultralytics import YOLO
# Carga el modelo nano YOLO26 de alta eficiencia, adecuado para dispositivos perimetrales
model = YOLO("yolo26n.pt")
# Ejecuta el seguimiento de objetos en tiempo real en una transmisión de vídeo local
results = model.track(source="video.mp4", show=True, tracker="botsort.yaml")Al priorizar la ejecución local, los ingenieros reducen significativamente las necesidades de ancho de banda y los costes operativos. A medida que el sector sigue avanzando en las tecnologías de IA perimetral, la potente combinación de visión artificial optimizada y modelos de lenguaje pequeños eficientes impulsará la próxima generación de sistemas inteligentes y autónomos.









