LLaMA (Meta AI) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — họ các mô hình ngôn ngữ lớn (LLM) với mã nguồn chủ yếu mở, được phát triển bởi bộ phận nghiên cứu Meta AI. Các mô hình LLaMA được xây dựng trên kiến trúc transformer đã được sửa đổi, hướng đến hiệu quả tính toán cao, dân chủ hóa khả năng tiếp cận công nghệ AI tiên tiến và dễ dàng thích ứng với các tác vụ chuyên biệt. Họ mô hình này đã phát triển từ bản phát hành nghiên cứu ban đầu LLaMA 1 (tháng 2 năm 2023) đến các mô hình đa phương thức LLaMA 4 (dự kiến phát hành năm 2026).

Tên gọi

Từ viết tắt LLaMA được giải nghĩa là Large Language Model Meta AI (Mô hình Ngôn ngữ Lớn Meta AI).

  • Large Language Model — nhấn mạnh quy mô của các mô hình, với số tham số được đo từ hàng tỷ đến hàng nghìn tỷ.
  • Meta AI — chỉ nhà phát triển, nhóm nghiên cứu của Meta.

Lịch sử hình thành

Việc phát triển LLaMA bắt đầu vào cuối năm 2022 như một phản ứng chiến lược của Meta trước thành công của ChatGPT từ OpenAI. Mark Zuckerberg đã thành lập một nhóm đa ngành, bao gồm các nhà nghiên cứu từ phòng thí nghiệm FAIR (Facebook AI Research). Yann LeCun, người đứng đầu FAIR, người từ năm 2013 đã tuân theo nguyên tắc công khai hoàn toàn tất cả các nghiên cứu của phòng thí nghiệm, đóng vai trò quan trọng trong triết lý của dự án.

Phiên bản đầu tiên, LLaMA 1, được phát hành vào tháng 2 năm 2023 với giấy phép nghiên cứu. Ngay sau khi phát hành, vào tháng 3 năm 2023, trọng số mô hình đã bị rò rỉ lên mạng qua BitTorrent. Sự kiện này, trái với những lo ngại, không làm dừng mà ngược lại thúc đẩy sự phát triển của dự án, vì nó tạo cơ hội cho các nhà nghiên cứu độc lập và những người đam mê trên khắp thế giới thử nghiệm với mô hình. Kết quả là hàng chục nghìn mô hình dẫn xuất đã xuất hiện trên nền tảng Hugging Face. Các phiên bản tiếp theo, bắt đầu từ LLaMA 2, đã được phát hành với giấy phép thương mại[1], củng cố vị thế của LLaMA như một nhân tố chủ chốt trên thị trường các mô hình AI mã nguồn mở.

Sự phát triển của các mô hình và niên đại phát hành

Niên đại phát triển các mô hình LLaMA
Phiên bản Ngày phát hành Phạm vi tham số Các cải tiến và tính năng chính
LLaMA 1 Tháng 2 năm 2023 7B – 65B Kiến trúc cơ bản (RMSNorm, SwiGLU, RoPE). Huấn luyện trên 1,4 nghìn tỷ token. Cửa sổ ngữ cảnh 2048 token. Giấy phép nghiên cứu.
LLaMA 2 Tháng 7 năm 2023 7B – 70B Fine-tuning cho hội thoại (RLHF). Áp dụng Grouped-Query Attention (GQA). Cửa sổ ngữ cảnh 4096 token. Giấy phép thương mại đầu tiên.
Code Llama Tháng 8 năm 2023 7B – 70B Phiên bản chuyên biệt cho lập trình. Fine-tuning trên 500 tỷ token mã nguồn. Các biến thể: cơ bản, chuyên biệt Python, instruction-tuned.
LLaMA 3 Tháng 4 năm 2024 8B, 70B Huấn luyện trên 15 nghìn tỷ token. Tokenizer cải tiến với từ vựng 128 nghìn token. Hiệu suất cao (82% trên MMLU).
LLaMA 3.1 Tháng 7 năm 2024[2] 8B, 70B, 405B Mô hình hàng đầu 405B với hiệu suất ngang tầm GPT-4o. Cửa sổ ngữ cảnh lên đến 128 nghìn token. Bổ sung khả năng xử lý hình ảnh.
LLaMA 4 (kế hoạch: tháng 4 năm 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Kiến trúc Mixture-of-Experts (MoE). Đa phương thức gốc (văn bản, hình ảnh, video). Cửa sổ ngữ cảnh lên đến 10 triệu token.

Kiến trúc

LLaMA sử dụng kiến trúc transformer-decoder tự hồi quy, nhưng đưa ra một số cải tiến chính giúp tăng hiệu quả tính toán và chất lượng văn bản được tạo ra:

  • Pre-normalization (Chuẩn hóa trước). Chuẩn hóa được áp dụng ở đầu vào của mỗi lớp con trong transformer, chứ không phải ở đầu ra. Cách tiếp cận này giúp ổn định quá trình huấn luyện các mạng rất sâu và ngăn chặn các vấn đề về gradient.
  • RMSNorm (Root Mean Square Layer Normalization). Thay vì LayerNorm tiêu chuẩn, RMSNorm được sử dụng. Kỹ thuật chuẩn hóa này loại bỏ phép trừ trung bình, giúp tăng tốc tính toán 10–50% trong khi vẫn duy trì sự ổn định.
  • SwiGLU (Swish-Gated Linear Unit). SwiGLU được sử dụng làm hàm kích hoạt thay vì ReLU hoặc GELU. Cơ chế gating này tạo ra luồng gradient mượt mà hơn và cải thiện chất lượng mô hình.
  • RoPE (Rotary Position Embeddings - Embedding vị trí xoay). Các embedding vị trí tương đối RoPE được sử dụng để mã hóa vị trí của các token, cho phép mô hình ngoại suy tốt hơn trên các chuỗi dài hơn những gì được sử dụng trong quá trình huấn luyện.
  • GQA (Grouped-Query Attention). Được giới thiệu trong LLaMA 2, kỹ thuật này là một tối ưu hóa của cơ chế attention đa đầu, giúp giảm đáng kể yêu cầu bộ nhớ và tăng tốc độ tạo văn bản.
  • Mixture-of-Experts (MoE) (dự kiến trong LLaMA 4). Kiến trúc chia các tham số của mô hình thành các mạng con "chuyên gia", chỉ kích hoạt một phần nhỏ trong số đó cho mỗi yêu cầu. Điều này làm giảm đáng kể chi phí tính toán cho quá trình inference.

Các cấu hình của LLaMA 1

Các tham số kiến trúc của các mô hình LLaMA 1
Mô hình Tham số Số chiều trạng thái ẩn Số lớp Số đầu attention Khối lượng dữ liệu huấn luyện
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

Dữ liệu huấn luyện

Khối lượng kho ngữ liệu huấn luyện đã tăng từ 1,4 nghìn tỷ token đối với LLaMA 1 lên 15 nghìn tỷ đối với LLaMA 3. Các nguồn công khai được sử dụng để huấn luyện, bao gồm Common Crawl (chiếm đến 67% dữ liệu), C4, GitHub, Wikipedia, Books, ArXiv và Stack Exchange. Đối với LLaMA 3, các dữ liệu riêng tư chất lượng cao cũng được sử dụng.

Hiệu suất và so sánh

  • Trên các benchmark: Mô hình LLaMA 3.1 (405B) cho thấy kết quả gần với GPT-4o: trên bài kiểm tra MMLU, mô hình đạt 88,6%, chỉ kém GPT-4o 0,1 điểm phần trăm. Trên tác vụ tạo mã HumanEval, LLaMA 3.1 đạt 89% (GPT-4o — 90,2%).
  • Hiệu quả tham số: Các mô hình LLaMA với số lượng tham số nhỏ hơn thường vượt trội so với các mô hình lớn hơn của đối thủ cạnh tranh. Ví dụ, LLaMA 1 (13B) đã vượt qua GPT-3 (175B) trên hầu hết các bài kiểm tra.
  • Chi phí: Khi triển khai cục bộ, chi phí inference của LLaMA có thể thấp hơn đến 50 lần so với việc sử dụng các API độc quyền, khiến công nghệ này trở nên tiếp cận được đối với doanh nghiệp vừa và nhỏ.

Cấp phép

  • LLaMA 1 được phân phối theo giấy phép nghiên cứu phi thương mại với quyền truy cập theo yêu cầu.
  • LLaMA 2 và các phiên bản sau được phân phối theo giấy phép Llama Community License, cho phép sử dụng và sửa đổi vì mục đích thương mại. Tuy nhiên, giấy phép có các hạn chế: các công ty với hơn 700 triệu người dùng hoạt động hàng tháng phải xin phép đặc biệt từ Meta. Điều này gây ra những tranh luận về việc liệu LLaMA có thực sự là mô hình hoàn toàn mã nguồn mở hay không.

Ứng dụng

Các mô hình LLaMA được tích hợp vào sản phẩm của hàng nghìn công ty và được sử dụng trong nhiều lĩnh vực:

  • Lĩnh vực doanh nghiệp: Zoom sử dụng LLaMA trong AI Companion để tóm tắt cuộc họp; Shopify — để xử lý 40–60 triệu yêu cầu mỗi ngày nhằm làm phong phú metadata sản phẩm; Instacart — trong trợ lý nội bộ Ava.
  • Khoa học và xã hội: Meditron (một phiên bản thích ứng của LLaMA) được sử dụng để chẩn đoán y tế ở các khu vực có nguồn lực hạn chế;
  • Lĩnh vực nhà nước và công nghiệp: Meta đã ký kết quan hệ đối tác với Lockheed Martin và Palantir. NASA sử dụng LLaMA 3 trên ISS như một trợ lý ngoại tuyến để thực hiện các thao tác quan trọng mà không cần kết nối với Trái Đất.

Hạn chế và phê bình

  • Thiên kiến và an toàn: Các cuộc kiểm toán độc lập cho thấy rằng các mô hình LLaMA, bất chấp các biện pháp an toàn, có thể tái tạo các khuôn mẫu có hại. Việc rò rỉ trọng số LLaMA 1 đã làm gia tăng các câu hỏi về khả năng sử dụng công nghệ với mục đích xấu.
  • Khoảng trống kiến thức: Trong các lĩnh vực chuyên biệt hẹp, LLaMA có thể bộc lộ những thiếu sót. Ví dụ, độ chính xác trên bài kiểm tra y tế nephSAP chỉ đạt 17–30% so với 73% của GPT-4.
  • Tiêu thụ năng lượng: Việc huấn luyện các mô hình lớn đòi hỏi nguồn tài nguyên khổng lồ. Quá trình huấn luyện LLaMA 1 tiêu thụ 2.638 MWh, tương đương với lượng phát thải 1.015 tấn CO₂.

Tương lai

Meta có kế hoạch đầu tư lên đến 65 tỷ đô la vào cơ sở hạ tầng AI vào năm 2025. Mô hình LLaMA 4 Behemoth với 2 nghìn tỷ tham số đang được phát triển, sẽ hỗ trợ hơn 200 ngôn ngữ và được tích hợp sâu với các sản phẩm metaverse.

Tài liệu tham khảo

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Chú thích

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

Xem thêm

  • GPT
  • Mô hình ngôn ngữ lớn
  • Transformer (kiến trúc mạng neural)