Mixtral (Mistral AI) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — là một mô hình ngôn ngữ lớn (LLM) mã nguồn mở, được phát triển bởi công ty Pháp Mistral AI và ra mắt vào tháng 12 năm 2023. Mô hình dựa trên kiến trúc hỗn hợp chuyên gia thưa (Sparse Mixture of Experts, SMoE), cho phép nó kết hợp hiệu suất tương đương với các mô hình lớn hơn nhiều (chẳng hạn Llama 2 70B và GPT-3.5) với tốc độ và hiệu quả inference cao[1].

Mô hình được phân phối theo giấy phép tự do Apache 2.0, giúp nó có thể sử dụng cho mục đích học thuật và thương mại. Mixtral 8x7B thể hiện khả năng mạnh mẽ trong các tác vụ đa ngôn ngữ, sinh mã lệnh và tuân theo hướng dẫn, khiến nó trở thành một trong những mô hình mã nguồn mở phổ biến nhất tại thời điểm ra mắt[2].

Lịch sử phát triển

Công ty Mistral AI được thành lập vào tháng 4 năm 2023 bởi các cựu nhà nghiên cứu từ Meta và Google. Vào tháng 9 năm 2023, công ty phát hành mô hình đầu tiên của mình, Mistral 7B, được đánh giá cao vì hiệu quả vượt trội với kích thước nhỏ gọn.

Ngày 11 tháng 12 năm 2023, Mistral AI công bố phát hành Mixtral 8x7B, mô hình đầu tiên của họ dựa trên kiến trúc hỗn hợp chuyên gia. Mô hình ngay lập tức thu hút sự chú ý của cộng đồng như một LLM mã nguồn mở mạnh nhất tại thời điểm đó, thể hiện chất lượng ngang tầm GPT-3.5 với tốc độ inference cao hơn đáng kể. Vào tháng 1 năm 2024, mô tả kỹ thuật chi tiết của mô hình được công bố dưới dạng bài báo khoa học trên arXiv, cho phép các nhà nghiên cứu độc lập tìm hiểu chi tiết kiến trúc và kết quả kiểm thử[2].

Kiến trúc: Hỗn hợp chuyên gia thưa (SMoE)

Điểm mới quan trọng nhất của Mixtral 8x7B là việc áp dụng kiến trúc Sparse Mixture of Experts. Khác với các transformer tiêu chuẩn ("dày đặc"), nơi mỗi lớp thực hiện cùng một phép tính cho tất cả các token, trong Mixtral mỗi lớp chứa nhiều khối "chuyên gia" song song.

Các đặc điểm kiến trúc chính:

  • Cấu trúc MoE: Mỗi lớp transformer chứa 8 khối feed-forward ("chuyên gia"). Để xử lý mỗi token, một mạng router đặc biệt chọn ra 2 chuyên gia phù hợp nhất (Top-2 routing).
  • Tham số: Tổng số tham số của mô hình là 46,7 tỷ, tuy nhiên nhờ cơ chế kích hoạt thưa, chỉ 12,9 tỷ tham số được sử dụng trong quá trình suy luận cho mỗi token. Điều này đảm bảo tốc độ inference tương đương với các mô hình khoảng 13 tỷ tham số.
  • Tối ưu hóa attention: Mô hình sử dụng các kỹ thuật hiện đại để xử lý hiệu quả các chuỗi dài, bao gồm Sliding Window Attention (SWA)Grouped Query Attention (GQA).
  • Độ dài ngữ cảnh: Mô hình hỗ trợ cửa sổ ngữ cảnh lên đến 32 768 token.

Huấn luyện

Dòng Mixtral 8x7B bao gồm hai phiên bản chính:

  1. Mixtral-8x7B-v0.1 (mô hình cơ sở): Mô hình được tiền huấn luyện trên kho ngữ liệu web lớn bằng nhiều ngôn ngữ châu Âu (tiếng Anh, Pháp, Đức, Tây Ban Nha, Ý). Nhiệm vụ chính là dự đoán token tiếp theo.
  2. Mixtral-8x7B-Instruct-v0.1 (mô hình theo hướng dẫn): Phiên bản được tinh chỉnh bằng supervised fine-tuning (SFT)Direct Preference Optimization (DPO). Mô hình này tuân theo hướng dẫn của người dùng tốt hơn và được thiết kế cho định dạng hội thoại.

Hiệu suất

Mixtral 8x7B vượt trội hoặc tương đương về chất lượng so với mô hình Llama 2 70B trên hầu hết các benchmark tiêu chuẩn, trong khi có số tham số được kích hoạt ít hơn 5 lần và do đó tốc độ suy luận cao hơn đáng kể (nhanh hơn tới 6 lần)[2].

So sánh hiệu suất của Mixtral 8x7B với Llama 2 70B và GPT-3.5[2]
Chỉ số Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (kiến thức tổng quát) 69,9% 70,0% 70,6%
GSM-8K (toán học) 53,6% 57,1% 58,4%
MBPP (sinh mã lệnh) 49,8% 52,2% 60,7%
MT-Bench (đánh giá hội thoại, phiên bản Instruct) 6,86 8,32 8,30
  • Đa ngôn ngữ: Nhờ tỷ lệ dữ liệu đa ngôn ngữ cao hơn trong kho huấn luyện, Mixtral vượt trội đáng kể so với Llama 2 70B trong các tác vụ tiếng Pháp, Đức, Tây Ban Nha và Ý.
  • Thiên lệch và ảo giác: So với Llama 2 70B, mô hình thể hiện độ chính xác cao hơn trên benchmark BBQ (đánh giá định kiến xã hội) và hồ sơ cảm xúc tích cực hơn trên benchmark BOLD.

Cấp phép và tính sẵn có

Cả hai phiên bản Mixtral 8x7B (cơ sở và Instruct) đều được phát hành theo giấy phép Apache 2.0, cho phép sử dụng tự do cho mục đích học thuật và thương mại. Mã nguồn và trọng số mô hình có sẵn trên GitHub và Hugging Face.

Liên kết

  • Mixtral of Experts — thông báo chính thức trên blog của Mistral AI
  • Mô hình Mixtral 8x7B trên Hugging Face

Tài liệu tham khảo

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Ghi chú

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]