Tìm hiểu về Llama 3 của Meta
Llama 3 của Meta vừa được phát hành và nhận được sự hào hứng lớn từ cộng đồng AI. Hãy cùng tìm hiểu thêm về Llama 3 - những tiến bộ mới nhất của Meta AI.

Khi tổng hợp các đổi mới về trí tuệ nhân tạo (AI) trong quý đầu tiên của năm 2024, chúng tôi nhận thấy các LLM, hay mô hình ngôn ngữ lớn, đang liên tục được nhiều tổ chức phát hành. Tiếp nối xu hướng này, vào ngày 18 tháng 4 năm 2024, Meta đã phát hành Llama 3, một LLM mã nguồn mở tiên tiến thuộc thế hệ mới.
Bạn có thể đang nghĩ: Chỉ là một LLM khác thôi mà. Tại sao cộng đồng AI lại hào hứng đến vậy?
Mặc dù bạn có thể fine-tune các model như GPT-3 hoặc Gemini để tạo ra phản hồi tùy chỉnh, chúng không cung cấp đầy đủ tính minh bạch về cách vận hành bên trong, chẳng hạn như dữ liệu huấn luyện, tham số model hoặc thuật toán. Ngược lại, Llama 3 của Meta minh bạch hơn, với kiến trúc và weights có sẵn để tải xuống. Đối với cộng đồng AI, điều này mang lại nhiều tự do hơn để thử nghiệm.
Trong bài viết này, chúng ta sẽ tìm hiểu Llama 3 có thể làm gì, nó được phát triển như thế nào và tác động của nó đến lĩnh vực AI. Hãy bắt đầu ngay!
Sự phát triển của các model Llama của Meta#
Trước khi tìm hiểu sâu về Llama 3, hãy cùng nhìn lại các phiên bản trước đó.
Meta ra mắt Llama 1 vào tháng 2 năm 2023 với bốn biến thể, có số lượng tham số từ 7 tỷ đến 65 tỷ. Trong machine learning, "tham số" đề cập đến các thành phần của model được học từ dữ liệu huấn luyện. Do có ít tham số hơn, Llama 1 đôi khi gặp khó khăn trong việc hiểu các sắc thái và đưa ra phản hồi không nhất quán.
Không lâu sau Llama 1, Meta ra mắt Llama 2 vào tháng 7 năm 2023. Model này được huấn luyện trên 2 nghìn tỷ token. Token là một phần của văn bản, chẳng hạn như một từ hoặc một phần của từ, được sử dụng làm đơn vị dữ liệu cơ bản để model xử lý. Model này cũng có các cải tiến như context window được tăng gấp đôi lên 4096 token để hiểu các đoạn văn dài hơn, cùng hơn 1 triệu chú thích của con người nhằm giảm lỗi. Mặc dù có những cải tiến này, Llama 2 vẫn cần rất nhiều computing power, và Meta hướng đến việc khắc phục điều đó với Llama 3.
Giới thiệu Llama 3 của Meta#
Llama 3 có bốn biến thể được huấn luyện trên con số đáng kinh ngạc là 15 nghìn tỷ token. Hơn 5% dữ liệu huấn luyện đó, tương đương khoảng 800 triệu token, là dữ liệu bằng 30 ngôn ngữ khác nhau. Tất cả biến thể Llama 3 đều có thể chạy trên nhiều loại consumer hardware và có context length là 8k token.

Hình 1. Llama 3 so với Llama 2.
Các biến thể model có hai kích thước: 8B và 70B, lần lượt biểu thị 8 tỷ và 70 tỷ tham số. Ngoài ra còn có hai phiên bản: base và instruct. "Base" đề cập đến phiên bản được pre-train tiêu chuẩn. "Instruct" là phiên bản được fine-tune, tối ưu cho các ứng dụng hoặc lĩnh vực cụ thể thông qua việc huấn luyện bổ sung trên dữ liệu liên quan.
Sau đây là các biến thể model Llama 3:
- Meta-Llama-3-8b: Model 8B base cung cấp các khả năng AI nền tảng và lý tưởng cho các tác vụ phổ biến như phát triển chatbot chăm sóc khách hàng.
- Meta-Llama-3-8b-instruct: Phiên bản instruct được fine-tune từ model 8B và tối ưu cho các tác vụ cụ thể. Ví dụ, model có thể được sử dụng để tạo các công cụ giáo dục giải thích những chủ đề phức tạp.
- Meta-Llama-3-70b: Model 70B base được thiết kế cho các ứng dụng AI hiệu năng cao. Model này phù hợp với những ứng dụng như xử lý khối lượng lớn tài liệu y sinh phục vụ khám phá thuốc.
- Meta-Llama-3-70b-instruct: Phiên bản này được fine-tune từ model 70B cho các ứng dụng đòi hỏi độ chính xác cao, chẳng hạn như phân tích tài liệu pháp lý hoặc y khoa, nơi độ chính xác là yếu tố then chốt.
Kiến trúc model Llama 3 của Meta#
Cũng như các tiến bộ AI khác của Meta, những biện pháp kiểm soát chất lượng nghiêm ngặt đã được áp dụng để duy trì tính toàn vẹn của dữ liệu và giảm thiểu thiên lệch trong quá trình phát triển Llama 3. Vì vậy, sản phẩm cuối cùng là một model mạnh mẽ được tạo ra một cách có trách nhiệm.
Kiến trúc model Llama 3 nổi bật nhờ tập trung vào hiệu quả và hiệu năng trong các tác vụ xử lý ngôn ngữ tự nhiên. Được xây dựng trên framework dựa trên Transformer, kiến trúc này nhấn mạnh hiệu quả tính toán, đặc biệt trong quá trình sinh văn bản, bằng cách sử dụng kiến trúc chỉ gồm decoder.
Model tạo output chỉ dựa trên context đứng trước mà không cần encoder để mã hóa input, nhờ đó nhanh hơn đáng kể.

Hình 2. Kiến trúc model có trách nhiệm của Llama 3.
Các model Llama 3 có tokenizer với vocabulary gồm 128K token. Vocabulary lớn hơn giúp model hiểu và xử lý văn bản tốt hơn. Ngoài ra, các model hiện sử dụng grouped query attention (GQA) để cải thiện hiệu quả inference. Bạn có thể hình dung GQA như một đèn spotlight giúp model tập trung vào các phần liên quan của dữ liệu input, từ đó tạo ra phản hồi nhanh và chính xác hơn.
Dưới đây là một số chi tiết thú vị khác về kiến trúc model Llama 3:
- Xử lý tài liệu nhận biết ranh giới: Llama 3 duy trì tính rõ ràng qua các ranh giới tài liệu, yếu tố quan trọng đối với những tác vụ như tóm tắt.
- Hiểu code tốt hơn: Dữ liệu huấn luyện của Llama 3 bao gồm số lượng mẫu code nhiều gấp bốn lần, giúp nâng cao khả năng lập trình.
- Kiểm soát chất lượng mạnh mẽ: Các biện pháp nghiêm ngặt, bao gồm heuristic filter và loại bỏ nội dung NSFW, giúp đảm bảo tính toàn vẹn của dữ liệu và giảm thiểu thiên lệch.
Llama 3 đang thay đổi cách chúng ta tiếp cận việc huấn luyện model#
Để huấn luyện các model Llama 3 lớn nhất, ba loại parallelization đã được kết hợp: data parallelization, model parallelization và pipeline parallelization.
Data parallelization phân chia dữ liệu huấn luyện trên nhiều GPU, trong khi model parallelization phân vùng kiến trúc model để tận dụng sức mạnh tính toán của từng GPU. Pipeline parallelization chia quy trình huấn luyện thành các giai đoạn tuần tự, tối ưu hóa việc tính toán và giao tiếp.
Cách triển khai hiệu quả nhất đạt mức sử dụng tài nguyên tính toán đáng kể, vượt 400 TFLOPS trên mỗi GPU khi huấn luyện đồng thời trên 16.000 GPU. Các lần chạy huấn luyện này được thực hiện trên hai GPU cluster được xây dựng tùy chỉnh, mỗi cluster gồm 24.000 GPU. Hạ tầng tính toán quy mô lớn này cung cấp năng lực cần thiết để huấn luyện hiệu quả các model Llama 3 quy mô lớn.
Để tối đa hóa thời gian GPU hoạt động, một training stack mới và tiên tiến đã được phát triển nhằm tự động hóa việc phát hiện, xử lý lỗi và bảo trì. Độ tin cậy của hardware và các cơ chế phát hiện đã được cải thiện đáng kể để giảm thiểu rủi ro hỏng dữ liệu âm thầm. Ngoài ra, các hệ thống storage có khả năng mở rộng mới cũng được phát triển để giảm overhead của việc checkpoint và rollback.
Những cải tiến này giúp tổng thời gian huấn luyện đạt hiệu quả trên 95%. Khi kết hợp, chúng tăng hiệu quả huấn luyện Llama 3 lên khoảng ba lần so với Llama 2. Hiệu quả này không chỉ ấn tượng mà còn mở ra những khả năng mới cho các phương pháp huấn luyện AI.
Mở ra những cơ hội mới với Llama 3#
Vì Llama 3 là mã nguồn mở, các nhà nghiên cứu và sinh viên có thể nghiên cứu code, tiến hành thử nghiệm và tham gia thảo luận về các vấn đề đạo đức cũng như thiên lệch. Tuy nhiên, Llama 3 không chỉ dành cho giới học thuật. Model này cũng đang tạo ra ảnh hưởng lớn trong các ứng dụng thực tế. Nó đang trở thành nền tảng cho Meta AI Chat Interface, được tích hợp liền mạch vào các nền tảng như Facebook, Instagram, WhatsApp và Messenger. Với Meta AI, người dùng có thể trò chuyện bằng ngôn ngữ tự nhiên, nhận đề xuất được cá nhân hóa, thực hiện tác vụ và dễ dàng kết nối với những người khác.

Hình 3. Meta AI: Được hỗ trợ bởi Llama 3.
So sánh Llama 3 với các LLM khác#
Llama 3 đạt kết quả đặc biệt tốt trên một số benchmark quan trọng dùng để đánh giá khả năng hiểu ngôn ngữ và suy luận phức tạp. Dưới đây là một số benchmark kiểm tra các khía cạnh khác nhau trong khả năng của Llama 3:
- Đánh giá hiểu biết ngôn ngữ đa nhiệm quy mô lớn (MMLU) - Đo lường kiến thức của model trên nhiều lĩnh vực khác nhau.
- Hỏi đáp mục đích chung (GPQA) - Đánh giá khả năng tạo ra câu trả lời mạch lạc và chính xác cho nhiều câu hỏi kiến thức phổ thông.
- HumanEval - Tập trung vào các tác vụ lập trình và giải quyết vấn đề, kiểm tra khả năng tạo code lập trình có thể chạy được và giải quyết các bài toán thuật toán của model.
Kết quả nổi bật của Llama 3 trong các bài kiểm tra này giúp phân biệt rõ model với những đối thủ như Gemma 7B của Google, Mistral 7B của Mistral và Claude 3 Sonnet của Anthropic. Theo các số liệu đã công bố, đặc biệt là model 70B, Llama 3 vượt trội hơn các model này trên tất cả benchmark nêu trên.

Hình 4. So sánh Llama 3 với các LLM khác.
Meta Llama 3 được cung cấp rộng rãi#
Meta đang mở rộng phạm vi tiếp cận của Llama 3 bằng cách cung cấp model trên nhiều nền tảng cho cả người dùng phổ thông và developer. Đối với người dùng hằng ngày, Llama 3 được tích hợp vào các nền tảng phổ biến của Meta như WhatsApp, Instagram, Facebook và Messenger. Người dùng có thể truy cập các tính năng nâng cao như tìm kiếm theo thời gian thực và khả năng tạo nội dung sáng tạo ngay trong các ứng dụng này.
Llama 3 cũng được tích hợp vào các công nghệ đeo được như kính thông minh Ray-Ban Meta và headset VR Meta Quest để mang lại trải nghiệm tương tác.
Llama 3 có sẵn trên nhiều nền tảng dành cho developer, bao gồm AWS, Databricks, Google Cloud, Hugging Face, Kaggle, IBM WatsonX, Microsoft Azure, NVIDIA NIM và Snowflake. Bạn cũng có thể truy cập trực tiếp các model này từ Meta. Sự đa dạng về lựa chọn giúp developer dễ dàng tích hợp các khả năng AI nâng cao của model vào dự án, dù họ muốn làm việc trực tiếp với Meta hay thông qua các nền tảng phổ biến khác.
Điểm chính#
Những tiến bộ trong machine learning tiếp tục thay đổi cách chúng ta tương tác với công nghệ mỗi ngày. Llama 3 của Meta cho thấy LLM không còn chỉ dùng để tạo văn bản. LLM đang giải quyết các vấn đề phức tạp và xử lý nhiều ngôn ngữ. Nhìn chung, Llama 3 đang giúp AI trở nên linh hoạt và dễ tiếp cận hơn bao giờ hết. Trong tương lai, các bản nâng cấp được lên kế hoạch cho Llama 3 hứa hẹn mang lại nhiều khả năng hơn, chẳng hạn như xử lý nhiều model và hiểu context lớn hơn.
Hãy xem repository GitHub và tham gia cộng đồng của chúng tôi để tìm hiểu thêm về AI. Truy cập các trang giải pháp của chúng tôi để xem AI đang được ứng dụng như thế nào trong các lĩnh vực như sản xuất và nông nghiệp.









