A conhecer o Llama 3.1: A mais recente família de modelos open-source da Meta
Explora a nova família de modelos open-source Llama 3.1 da Meta, que inclui o versátil 8B, o polivalente 70B e o emblemático 405B, o seu modelo mais completo e avançado até à data.

Em 23 de julho de 2024, a Meta lançou a nova família de modelos open-source Llama 3.1, apresentando os versáteis modelos de 8B, os capazes de 70B e o Llama 3.1 405B, sendo este último o maior large language model (LLM) open-source até o momento.
Você deve estar se perguntando o que diferencia esses novos modelos de seus antecessores. Bem, ao mergulharmos neste artigo, você descobrirá que o lançamento dos modelos Llama 3.1 marca um marco significativo na tecnologia de IA. Os modelos recém-lançados oferecem melhorias importantes no processamento de linguagem natural; além disso, introduzem novos recursos e aprimoramentos não encontrados em versões anteriores. Este lançamento promete mudar a forma como aproveitamos a IA para tarefas complexas, fornecendo um conjunto de ferramentas poderoso para pesquisadores e desenvolvedores.
Neste artigo, exploraremos a família de modelos Llama 3.1, aprofundando-nos em sua arquitetura, principais melhorias, usos práticos e uma comparação detalhada de seu desempenho.
O que é a Llama 3.1?#
O mais recente Grande Modelo de Linguagem da Meta, Llama 3.1, está a dar passos significativos no panorama da IA, rivalizando com as capacidades de modelos de topo como OpenAI's Chat GPT-4o e Claude 3.5 Sonnet da Anthropic.
Apesar de poder ser considerado uma atualização menor em relação ao modelo Llama 3 anterior, a Meta deu mais um passo em frente ao introduzir algumas melhorias importantes na nova família de modelos, oferecendo:
- Suporte a oito idiomas: Incluindo inglês, alemão, francês, italiano, português, hindi, espanhol e tailandês, expandindo seu alcance para um público global.
- 128.000 tokens de janela de contexto: Permitindo que os modelos lidem com entradas muito mais longas e mantenham o contexto em conversas ou documentos extensos.
- Melhores capacidades de raciocínio: Permitindo que os modelos sejam mais versáteis e capazes de gerenciar tarefas complexas de forma eficaz.
- Segurança rigorosa: Testes foram implementados para mitigar riscos, reduzir preconceitos e evitar resultados prejudiciais, promovendo o uso responsável da IA.
Além de tudo o que foi mencionado, a nova família de modelos Llama 3.1 destaca um grande avanço com seu impressionante modelo de 405 bilhões de parâmetros. Essa contagem substancial de parâmetros representa um salto significativo no desenvolvimento de IA, aprimorando muito a capacidade do modelo de entender e gerar textos complexos. O modelo 405B inclui uma vasta gama de parâmetros, com cada parâmetro referindo-se aos weights e biases na rede neural que o modelo aprende durante o treinamento. Isso permite que o modelo capture padrões de linguagem mais intrincados, estabelecendo um novo padrão para large language models e mostrando o potencial futuro da tecnologia de IA. Este modelo de grande escala não apenas melhora o desempenho em uma ampla gama de tarefas, mas também expande os limites do que a IA pode alcançar em termos de geração e compreensão de texto.
Arquitetura do modelo#
O Llama 3.1 utiliza a arquitetura de modelo transformer apenas com descodificador, uma pedra angular para os grandes modelos de linguagem modernos. Esta arquitetura é reconhecida pela sua eficiência e eficácia no manuseamento de tarefas linguísticas complexas. A utilização de transformers permite ao Llama 3.1 destacar-se na compreensão e geração de texto semelhante ao humano, proporcionando uma vantagem significativa sobre os modelos que utilizam arquiteturas mais antigas, tais como LSTMs e GRUs.
Além disso, a família de modelos Llama 3.1 utiliza um transformer denso padrão em vez da Mixture of Experts (MoE) architecture, uma escolha deliberada que melhora a eficiência e a estabilidade do treino. Evitar a arquitetura MoE garante um processo de treino mais consistente e fiável, uma vez que a MoE pode por vezes introduzir complexidades que podem afetar a estabilidade e o desempenho do modelo.

Fig 1. Um diagrama que ilustra a arquitetura do modelo transformer Llama 3.1.
A arquitetura do modelo Llama 3.1 funciona da seguinte forma:
1. Input Text Tokens: O processo começa com a entrada, consistindo em tokens de texto. Esses tokens são unidades individuais de texto, como palavras ou subpalavras, que o modelo processará.
2. Token Embeddings: Os tokens de texto são então convertidos em token embeddings. Embeddings são representações vetoriais densas dos tokens que capturam seu significado semântico e relacionamentos dentro do texto. Essa transformação é crucial, pois permite que o modelo trabalhe com dados numéricos.
3. Self-Attention Mechanism: O self-attention permite que o modelo pondere a importância de diferentes tokens na sequência de entrada ao codificar cada token. Esse mecanismo ajuda o modelo a entender o contexto e os relacionamentos entre os tokens, independentemente de suas posições na sequência. No mecanismo de self-attention, cada token na sequência de entrada é representado como um vetor de números. Esses vetores são usados para criar três tipos diferentes de representações: queries, keys e values.
O modelo calcula quanta atenção cada token deve dar a outros tokens comparando os vetores de query com os vetores de key. Essa comparação resulta em pontuações que indicam a relevância de cada token em relação aos outros.
4. Feedforward Network: Após o processo de self-attention, os dados passam por uma feedforward network. Esta rede é uma rede neural totalmente conectada que aplica transformações não lineares aos dados, ajudando o modelo a reconhecer e aprender padrões complexos.
5. Repeated Layers: As camadas de self-attention e feedforward network são empilhadas várias vezes. Essa aplicação repetida permite que o modelo capture dependências e padrões mais complexos nos dados.
6. Output Text Token: Finalmente, os dados processados são usados para gerar o output text token. Este token é a previsão do modelo para a próxima palavra ou subpalavra na sequência, com base no contexto de entrada.
Desempenho da família de modelos Llama 3.1 e comparações com outros modelos#
Testes de benchmark revelam que a Llama 3.1 não apenas se mantém competitiva frente a esses modelos de ponta, mas também os supera em certas tarefas, demonstrando seu desempenho superior.
Llama 3.1 405B: Alta capacidade#
O modelo Llama 3.1 foi submetido a uma avaliação exaustiva em mais de 150 conjuntos de dados de referência, onde foi rigorosamente comparado com outros grandes modelos de linguagem líderes. O modelo Llama 3.1 405B, reconhecido como o mais capaz da série recém-lançada, foi testado contra gigantes da indústria como o GPT-4 da OpenAI e o Claude 3.5 Sonnet. Os resultados destas comparações revelam que o Llama 3.1 demonstra uma vantagem competitiva, mostrando o seu desempenho superior e capacidades em várias tarefas.

Fig 2. Uma tabela que compara o desempenho do modelo Llama 3.1 405B com modelos semelhantes.
A impressionante contagem de parâmetros e a arquitetura avançada deste modelo permitem que ele se destaque na compreensão complexa e na geração de texto, superando frequentemente seus concorrentes em benchmarks específicos. Essas avaliações destacam o potencial da Llama 3.1 para estabelecer novos padrões no campo dos large language models, fornecendo a pesquisadores e desenvolvedores uma ferramenta poderosa para diversas aplicações.
Llama 3.1 70B: Médio porte#
Os modelos Llama menores e mais leves também demonstram um desempenho notável quando comparados aos seus equivalentes. O modelo Llama 3.1 70B foi avaliado frente a modelos maiores, como o Mistral 8x22B e o GPT-3.5 Turbo. Por exemplo, o modelo Llama 3.1 70B demonstra consistentemente um desempenho superior em datasets de raciocínio, como o dataset ARC Challenge, e em datasets de codificação, como os datasets HumanEval. Esses resultados destacam a versatilidade e a robustez da série Llama 3.1 em diferentes tamanhos de modelo, tornando-a uma ferramenta valiosa para uma ampla gama de aplicações.
Llama 3.1 8B: Leve#
Além disso, o modelo Llama 3.1 8B foi comparado com modelos de tamanho semelhante, incluindo o Gemma 2 9B e o Mistral 7B. Estas comparações revelam que o modelo Llama 3.1 8B supera os seus concorrentes em vários datasets de referência em diferentes géneros, como o conjunto de dados GPQA para raciocínio e o MBPP EvalPlus para programação, demonstrando a sua eficiência e capacidade apesar da sua menor contagem de parâmetros.

Fig 3. Uma tabela que compara os desempenhos dos modelos Llama 3.1 70B e 8B com modelos semelhantes.
Como você pode se beneficiar da família de modelos Llama 3.1?#
A Meta permitiu que os novos modelos sejam aplicados de várias maneiras práticas e benéficas para os usuários:
Fine-tuning#
Os utilizadores podem agora fine-tune os modelos Llama 3.1 mais recentes para casos de uso específicos. Este processo envolve o training do modelo em novos dados externos a que não tinha sido exposto anteriormente, melhorando assim o seu desempenho e adaptabilidade para aplicações direcionadas. O ajuste fino dá ao modelo uma vantagem significativa, permitindo-lhe compreender e gerar melhor conteúdos relevantes para domínios ou tasks específicos.
Integração em um sistema RAG#
Os modelos Llama 3.1 podem agora ser integrados perfeitamente em Retrieval-Augmented Generation (RAG) systems. Esta integração permite que o modelo utilize fontes de dados externas dinamicamente, melhorando a sua capacidade de fornecer respostas precisas e contextualmente relevantes. Ao recuperar informações de grandes conjuntos de dados e incorporá-las no processo de geração, o Llama 3.1 melhora significativamente o seu desempenho em tarefas intensivas em conhecimento, oferecendo aos utilizadores resultados mais precisos e informados.
Geração de dados sintéticos#
Podes também utilizar o modelo de 405 mil milhões de parâmetros para gerar synthetic data de alta qualidade, melhorando o desempenho de modelos especializados para casos de uso específicos. Esta abordagem tira partido das extensas capacidades do Llama 3.1 para produzir dados direcionados e relevantes, melhorando assim a precisão e a eficiência de aplicações de IA personalizadas.
As conclusões#
O lançamento da Llama 3.1 representa um salto significativo no campo dos large language models, demonstrando o compromisso da Meta com o avanço da tecnologia de IA.
Com sua contagem substancial de parâmetros, treinamento extensivo em datasets diversos e foco em processos de treinamento robustos e estáveis, a Llama 3.1 estabelece novos benchmarks de desempenho e capacidade no processamento de linguagem natural. Seja na geração de texto, sumarização ou tarefas conversacionais complexas, a Llama 3.1 demonstra uma vantagem competitiva sobre outros modelos líderes. Este modelo não apenas expande os limites do que a IA pode alcançar hoje, mas também prepara o terreno para inovações futuras no cenário em constante evolução da inteligência artificial.
Na Ultralytics, dedicamo-nos a ultrapassar os limites da tecnologia de IA. Para explorar as nossas soluções de IA de ponta e acompanhar as nossas últimas inovações, consulta o nosso GitHub repository. Junta-te à nossa vibrante comunidade no Discord e vê como estamos a revolucionar indústrias como self-driving cars e manufacturing! 🚀






