Conoce Llama 3.1: la última familia de modelos de código abierto de Meta
Descubre la nueva familia de modelos de código abierto Llama 3.1 de Meta, que incluye el versátil 8B, el polivalente 70B y el modelo insignia 405B, el modelo más grande y avanzado de la compañía hasta la fecha.

El 23 de julio de 2024, Meta lanzó la nueva familia de modelos de código abierto Llama 3.1, que incluye el versátil modelo 8B, el capaz modelo 70B y el modelo Llama 3.1 405B, y este último destaca por ser el modelo de lenguaje de gran tamaño (LLM) de código abierto más grande hasta la fecha.
Quizá te preguntes qué diferencia a estos nuevos modelos de sus predecesores. A medida que avancemos en este artículo, descubrirás que el lanzamiento de los modelos Llama 3.1 marca un hito importante en la tecnología de IA. Los modelos recién lanzados ofrecen mejoras significativas en el procesamiento del lenguaje natural; además, introducen nuevas funciones y mejoras que no estaban presentes en versiones anteriores. Este lanzamiento promete cambiar la forma en que aprovechamos la IA para tareas complejas, al proporcionar un potente conjunto de herramientas tanto para investigadores como para desarrolladores.
En este artículo, exploraremos la familia de modelos Llama 3.1 y profundizaremos en su arquitectura, sus mejoras principales, sus usos prácticos y una comparación detallada de su rendimiento.
¿Qué es Llama 3.1?#
El último modelo de lenguaje de gran tamaño de Meta, Llama 3.1, está logrando avances significativos en el panorama de la IA y rivaliza con las capacidades de modelos de primer nivel como Chat GPT-4o de OpenAI y Claude 3.5 Sonnet de Anthropic.
Aunque podría considerarse una actualización menor del modelo Llama 3 anterior, Meta ha llevado la nueva familia de modelos un paso más allá al introducir varias mejoras importantes, entre ellas:
- Compatibilidad con ocho idiomas: inglés, alemán, francés, italiano, portugués, hindi, español y tailandés, lo que amplía su alcance a una audiencia global.
- Ventana de contexto de 128.000 tokens: permite a los modelos gestionar entradas mucho más largas y mantener el contexto durante conversaciones o documentos extensos.
- Mejores capacidades de razonamiento: permiten que los modelos sean más versátiles y capaces de gestionar tareas complejas de forma eficaz.
- Seguridad rigurosa: se han implementado pruebas para mitigar riesgos, reducir sesgos y evitar resultados perjudiciales, fomentando un uso responsable de la IA.
Además de todo lo anterior, la nueva familia de modelos Llama 3.1 destaca por un avance importante: su impresionante modelo de 405.000 millones de parámetros. Esta considerable cantidad de parámetros representa un salto significativo en el desarrollo de la IA y mejora enormemente la capacidad del modelo para comprender y generar textos complejos. El modelo 405B incluye una amplia variedad de parámetros, cada uno de los cuales representa los pesos y sesgos de la red neuronal que el modelo aprende durante el entrenamiento. Esto permite al modelo captar patrones lingüísticos más complejos, estableciendo un nuevo estándar para los modelos de lenguaje de gran tamaño y mostrando el potencial futuro de la tecnología de IA. Este modelo a gran escala no solo mejora el rendimiento en una amplia variedad de tareas, sino que también amplía los límites de lo que la IA puede lograr en términos de generación y comprensión de texto.
Arquitectura del modelo#
Llama 3.1 utiliza la arquitectura de modelo Transformer únicamente de decodificador, un pilar fundamental de los modelos de lenguaje de gran tamaño modernos. Esta arquitectura es conocida por su eficiencia y eficacia al gestionar tareas lingüísticas complejas. El uso de Transformer permite a Llama 3.1 destacar en la comprensión y generación de texto similar al humano, lo que le proporciona una ventaja significativa frente a los modelos que utilizan arquitecturas más antiguas, como LSTMs y GRUs.
Además, la familia de modelos Llama 3.1 utiliza un Transformer denso estándar en lugar de la arquitectura de mezcla de expertos (MoE), una elección deliberada que mejora la eficiencia y la estabilidad del entrenamiento. Al evitar la arquitectura MoE, se garantiza un proceso de entrenamiento más uniforme y fiable, ya que MoE puede introducir a veces complejidades que podrían afectar a la estabilidad y el rendimiento del modelo.

Fig. 1. Diagrama ilustrativo de la arquitectura del modelo Transformer de Llama 3.1.
La arquitectura del modelo Llama 3.1 funciona de la siguiente manera:
1. Tokens de texto de entrada: el proceso comienza con la entrada, que consta de tokens de texto. Estos tokens son unidades individuales de texto, como palabras o subpalabras, que el modelo procesará.
2. Embeddings de tokens: a continuación, los tokens de texto se convierten en embeddings de tokens. Los embeddings son representaciones vectoriales densas de los tokens que capturan su significado semántico y sus relaciones dentro del texto. Esta transformación es esencial, ya que permite al modelo trabajar con datos numéricos.
3. Mecanismo de autoatención: la autoatención permite al modelo ponderar la importancia de los distintos tokens de la secuencia de entrada al codificar cada token. Este mecanismo ayuda al modelo a comprender el contexto y las relaciones entre los tokens, independientemente de su posición en la secuencia. En el mecanismo de autoatención, cada token de la secuencia de entrada se representa como un vector de números. Estos vectores se utilizan para crear tres tipos diferentes de representaciones: consultas, claves y valores.
El modelo calcula cuánta atención debe prestar cada token a los demás comparando los vectores de consulta con los vectores de clave. Esta comparación produce puntuaciones que indican la relevancia de cada token en relación con los demás.
4. Red feedforward: después del proceso de autoatención, los datos pasan por una red feedforward. Esta red es una red neuronal totalmente conectada que aplica transformaciones no lineales a los datos, lo que ayuda al modelo a reconocer y aprender patrones complejos.
5. Capas repetidas: las capas de autoatención y de la red feedforward se apilan varias veces. Esta aplicación repetida permite al modelo captar dependencias y patrones más complejos en los datos.
6. Token de texto de salida: finalmente, los datos procesados se utilizan para generar el token de texto de salida. Este token es la predicción del modelo para la siguiente palabra o subpalabra de la secuencia, basándose en el contexto de entrada.
Rendimiento de la familia de modelos Llama 3.1 y comparaciones con otros modelos#
Las pruebas de referencia revelan que Llama 3.1 no solo está a la altura de estos modelos de última generación, sino que también los supera en determinadas tareas, lo que demuestra su rendimiento superior.
Llama 3.1 405B: gran capacidad#
El modelo Llama 3.1 se ha sometido a una evaluación exhaustiva en más de 150 conjuntos de datos de referencia, en los que se ha comparado rigurosamente con otros modelos de lenguaje de gran tamaño líderes. El modelo Llama 3.1 405B, reconocido como el más capaz de la serie recién lanzada, se ha comparado con gigantes del sector como GPT-4 de OpenAI y Claude 3.5 Sonnet. Los resultados de estas comparaciones revelan que Llama 3.1 ofrece una ventaja competitiva y demuestra un rendimiento y unas capacidades superiores en diversas tareas.

Fig. 2. Tabla comparativa del rendimiento del modelo Llama 3.1 405B frente a modelos similares.
La impresionante cantidad de parámetros y la avanzada arquitectura de este modelo le permiten destacar en tareas complejas de comprensión y generación de texto, superando a menudo a sus competidores en determinados benchmarks. Estas evaluaciones ponen de relieve el potencial de Llama 3.1 para establecer nuevos estándares en el ámbito de los modelos de lenguaje de gran tamaño y proporcionar a investigadores y desarrolladores una herramienta potente para diversas aplicaciones.
Llama 3.1 70B: gama media#
Los modelos Llama más pequeños y ligeros también demuestran un rendimiento extraordinario en comparación con sus homólogos. El modelo Llama 3.1 70B se ha evaluado frente a modelos más grandes, como Mistral 8x22B y GPT-3.5 Turbo. Por ejemplo, el modelo Llama 3.1 70B demuestra sistemáticamente un rendimiento superior en conjuntos de datos de razonamiento, como el conjunto de datos ARC Challenge, y en conjuntos de datos de programación, como los conjuntos de datos HumanEval. Estos resultados ponen de relieve la versatilidad y solidez de la serie Llama 3.1 en distintos tamaños de modelo, lo que la convierte en una herramienta valiosa para una amplia variedad de aplicaciones.
Llama 3.1 8B: ligero#
Además, el modelo Llama 3.1 8B se ha comparado con modelos de tamaño similar, como Gemma 2 9B y Mistral 7B. Estas comparaciones revelan que el modelo Llama 3.1 8B supera a sus competidores en diversos conjuntos de datos de referencia y en distintos ámbitos, como el conjunto de datos GPQA para razonamiento y MBPP EvalPlus para programación, lo que demuestra su eficiencia y capacidad a pesar de su menor cantidad de parámetros.

Fig. 3. Tabla comparativa del rendimiento de los modelos Llama 3.1 70B y 8B frente a modelos similares.
¿Cómo puedes beneficiarte de los modelos de la familia Llama 3.1?#
Meta ha permitido aplicar los nuevos modelos de diversas formas prácticas y beneficiosas para los usuarios:
Ajuste fino#
Ahora puedes ajustar los modelos Llama 3.1 más recientes para casos de uso específicos. Este proceso consiste en entrenar el modelo con nuevos datos externos a los que no había estado expuesto anteriormente, mejorando así su rendimiento y adaptabilidad para aplicaciones concretas. El ajuste fino proporciona al modelo una ventaja significativa, ya que le permite comprender y generar mejor contenido relevante para dominios o tareas específicos.
Integración en un sistema RAG#
Los modelos Llama 3.1 ahora se pueden integrar fácilmente en sistemas de generación aumentada mediante recuperación (RAG). Esta integración permite al modelo aprovechar dinámicamente fuentes de datos externas, mejorando su capacidad para proporcionar respuestas precisas y relevantes en contexto. Al recuperar información de grandes conjuntos de datos e incorporarla al proceso de generación, Llama 3.1 mejora significativamente su rendimiento en tareas que requieren muchos conocimientos y ofrece a los usuarios resultados más precisos y fundamentados.
Generación de datos sintéticos#
También puedes utilizar el modelo de 405.000 millones de parámetros para generar datos sintéticos de alta calidad y mejorar el rendimiento de modelos especializados para casos de uso concretos. Este enfoque aprovecha las amplias capacidades de Llama 3.1 para producir datos específicos y relevantes, mejorando así la precisión y la eficiencia de las aplicaciones de IA personalizadas.
Conclusiones principales#
El lanzamiento de Llama 3.1 representa un salto significativo en el ámbito de los modelos de lenguaje de gran tamaño y demuestra el compromiso de Meta con el avance de la tecnología de IA.
Con su considerable cantidad de parámetros, su extenso entrenamiento con conjuntos de datos diversos y su enfoque en procesos de entrenamiento sólidos y estables, Llama 3.1 establece nuevos referentes de rendimiento y capacidad en el procesamiento del lenguaje natural. Ya sea en generación de texto, resumen o tareas conversacionales complejas, Llama 3.1 demuestra una ventaja competitiva frente a otros modelos líderes. Este modelo no solo amplía los límites de lo que la IA puede lograr actualmente, sino que también prepara el terreno para futuras innovaciones en el panorama en constante evolución de la inteligencia artificial.
En Ultralytics, nos dedicamos a ampliar los límites de la tecnología de IA. Para explorar nuestras soluciones de IA de vanguardia y mantenerte al día de nuestras últimas innovaciones, consulta nuestro repositorio de GitHub. Únete a nuestra activa comunidad en Discord y descubre cómo estamos revolucionando sectores como los vehículos autónomos y la fabricación. 🚀









