认识 Meta 的 Llama 3
Meta 的 Llama 3 最近发布,在 AI 社区引起了热烈反响。让我们进一步了解 Llama 3——Meta 在 AI 领域的最新进展。

在我们汇总(AI)创新在 2024 年第一季度的发展时,我们发现不同组织纷纷发布 LLM,也就是大型语言模型。延续这一趋势,Meta 于 2024 年 4 月 18 日发布了Llama 3,这是一款新一代、最先进的开源 LLM。
你可能会想:这不就是另一个 LLM 吗?AI 社区为什么会对此如此兴奋?
虽然你可以对 GPT-3 或 Gemini 等模型进行微调,以生成定制化响应,但它们不会完全公开其内部工作机制,例如训练数据、模型参数或算法。相比之下,Meta 的 Llama 3 更加透明,其架构和权重都可以下载。对 AI 社区而言,这意味着可以更自由地进行实验。
在本文中,我们将了解 Llama 3 能做什么、它是如何诞生的,以及它对 AI 领域的影响。让我们马上开始吧!
Meta 的 Llama 模型演进#
在深入了解 Llama 3 之前,让我们先回顾一下它的早期版本。
Meta 于 2023 年 2 月发布了 Llama 1,该模型有四种变体,参数量从 70 亿到 650 亿不等。在机器学习中,“参数”指的是从训练数据中学习得到的模型元素。由于参数量较少,Llama 1 有时难以进行细致入微的理解,生成的响应也不稳定。
Llama 1 发布后不久,Meta 于 2023 年 7 月发布了Llama 2。它使用 2 万亿个 token 进行训练。token 代表一段文本,例如一个单词或单词的一部分,是模型处理数据时使用的基本单位。该模型还进行了多项增强,例如将上下文窗口扩大一倍至 4096 个 token,以理解更长的文本片段,并加入超过 100 万条人工标注以减少错误。尽管有所改进,Llama 2 仍然需要大量计算能力,而 Meta 希望通过 Llama 3 解决这一问题。
Meta Llama 3 介绍#
Llama 3 有四种变体,使用数量惊人的 15 万亿个 token 进行训练。其中超过 5% 的训练数据(约 8 亿个 token)来自 30 种不同语言的数据。所有 Llama 3 变体都可以在各种类型的消费级硬件上运行,并且上下文长度均为 8k token。

图 1。Llama 3 与 Llama 2 对比。
这些模型变体有两种规模:8B 和 70B,分别表示 80 亿和 700 亿个参数。此外还有两个版本:基础版和指令版。“基础版”指标准的预训练版本。“指令版”是经过微调的版本,通过在相关数据上进行额外训练,针对特定应用或领域进行了优化。
以下是 Llama 3 的模型变体:
- Meta-Llama-3-8b:8B 基础模型提供基本的 AI 能力,非常适合开发客服聊天机器人等通用任务。
- Meta-Llama-3-8b-instruct:8B 模型的指令微调版本,针对特定任务进行了优化。例如,它可以用于创建能够解释复杂主题的教育工具。
- Meta-Llama-3-70b:70B 基础模型专为高性能 AI 应用而设计。它非常适合处理大量生物医学文献等应用,用于药物研发。
- Meta-Llama-3-70b-instruct:该版本基于 70B 模型进行微调,适用于高度精确的应用,例如分析法律或医疗文档,因为这些场景对准确性要求很高。
Meta 的 Llama 3 模型架构#
与 Meta 的其他 AI 进展一样,在开发 Llama 3 的过程中实施了严格的质量控制措施,以维护数据完整性并最大限度地减少偏差。因此,最终得到的是一个以负责任的方式创建的强大模型。
Llama 3 模型架构注重自然语言处理任务中的效率和性能,因此脱颖而出。它基于 Transformer 框架构建,通过采用仅解码器架构,强调计算效率,尤其是在文本生成过程中。
该模型仅根据前面的上下文生成输出,不使用用于编码输入的编码器,因此速度更快。

图 2。Llama 3 负责任的模型架构。
Llama 3 模型配备了词汇量为 128K token 的分词器。更大的词汇量意味着模型可以更好地理解和处理文本。此外,这些模型现在使用分组查询注意力(GQA)来提高推理效率。你可以将 GQA 理解为一盏聚光灯,它帮助模型聚焦于输入数据中相关的部分,从而生成更快速、更准确的响应。
以下是 Llama 3 模型架构的更多有趣细节:
- 边界感知文档处理:Llama 3 能在文档边界之间保持清晰性,这对于摘要生成等任务至关重要。
- 更出色的代码理解能力:Llama 3 的训练数据包含多出四倍的代码样本,从而提升了其编码能力。
- 强大的质量控制:包括启发式过滤器和 NSFW 内容移除在内的严格措施,可确保数据完整性并最大限度地减少偏差。
Llama 3 正在改变我们进行模型训练的方式#
为了训练最大的 Llama 3 模型,研究人员结合使用了三种并行化方式:数据并行、模型并行和流水线并行。
数据并行将训练数据分配到多个 GPU 上,而模型并行则对模型架构进行划分,以利用每个 GPU 的计算能力。流水线并行将训练过程划分为按顺序执行的阶段,从而优化计算和通信。
最高效的实现方式取得了显著的计算利用率:在 16,000 个 GPU 上同时训练时,每个 GPU 的性能超过 400 TFLOPS。这些训练运行在两个定制构建的 GPU 集群上进行,每个集群包含 24,000 个 GPU。这样的庞大计算基础设施为高效训练大规模 Llama 3 模型提供了必要的算力。
为了最大限度地提高 GPU 在线时间,研究人员开发了新的高级训练堆栈,实现错误检测、处理和维护的自动化。硬件可靠性和检测机制得到大幅改进,以降低静默数据损坏的风险。此外,他们还开发了新的可扩展存储系统,以减少检查点和回滚开销。
这些改进使总体训练时间的有效率超过 95%。综合来看,与 Llama 2 相比,这些改进使 Llama 3 的训练效率提高了约三倍。这种效率不仅令人印象深刻,也为 AI 训练方法开辟了新的可能性。
Llama 3 开启无限可能#
由于 Llama 3 是开源的,研究人员和学生可以研究其代码、开展实验,并围绕伦理问题和偏差展开讨论。不过,Llama 3 并不只是面向学术群体。它也正在实际应用中产生广泛影响。Llama 3 正逐渐成为 Meta AI 聊天界面的核心,并无缝集成到 Facebook、Instagram、WhatsApp 和 Messenger 等平台中。借助 Meta AI,用户可以进行自然语言对话、获取个性化推荐、执行任务,并轻松与他人联系。

图 3。Meta AI:由 Llama 3 驱动。
Llama 3 与其他 LLM 的对比#
Llama 3 在多个评估复杂语言理解和推理能力的关键基准测试中表现出色。以下是用于测试 Llama 3 各项能力的一些基准测试:
- 大规模多任务语言理解(MMLU)——衡量模型在各个领域的知识。
- 通用问题回答(GPQA)——评估模型针对广泛常识问题生成连贯且正确答案的能力。
- HumanEval——专注于编码和问题解决任务,测试模型生成可运行编程代码以及解决算法挑战的能力。
Llama 3 在这些测试中的出色结果,明显使其区别于 Google 的 Gemma 7B、Mistral 的 Mistral 7B 以及 Anthropic 的 Claude 3 Sonnet 等竞争模型。根据已发布的统计数据,尤其是 70B 模型的数据,Llama 3 在上述所有基准测试中都优于这些模型。

图 4。Llama 3 与其他 LLM 对比。
Meta Llama 3 正变得广泛可用#
Meta 正通过让 Llama 3 在各种平台上可用来扩大其覆盖范围,同时满足普通用户和开发者的需求。对于日常用户,Llama 3 已集成到 WhatsApp、Instagram、Facebook 和 Messenger 等 Meta 热门平台中。用户可以直接在这些应用中使用实时搜索和生成创意内容等高级功能。
Llama 3 还被集成到 Ray-Ban Meta 智能眼镜和 Meta Quest VR 头戴设备等可穿戴技术中,以提供交互式体验。
Llama 3 已在 AWS、Databricks、Google Cloud、Hugging Face、Kaggle、IBM WatsonX、Microsoft Azure、NVIDIA NIM 和 Snowflake 等多种面向开发者的平台上提供。你也可以直接从 Meta 访问这些模型。丰富的选择让开发者能够轻松地将这些先进 AI 模型的能力集成到自己的项目中,无论他们倾向于直接使用 Meta,还是通过其他热门平台进行开发。
总结#
机器学习的进步持续改变着我们每天与技术互动的方式。Meta 的 Llama 3 表明,LLM 已不再只是用于生成文本。LLM 正在解决复杂问题并处理多种语言。总体而言,Llama 3 正让 AI 变得比以往更加灵活和易用。展望未来,Llama 3 的计划升级将带来更多能力,例如处理多个模型和理解更大的上下文。
查看我们的GitHub 代码仓库,并加入我们的社区,进一步了解 AI。访问我们的解决方案页面,了解 AI 如何应用于制造业和农业等领域。









