Mixtral (Mistral AI) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — това е голям езиков модел (LLM) с отворен изходен код, разработен от френската компания Mistral AI и публикуван през декември 2023 година. Моделът се основава на архитектурата разредена смес от експерти (Sparse Mixture of Experts, SMoE), която му позволява да съчетава производителност, сравнима с много по-големи модели (например Llama 2 70B и GPT-3.5), с висока скорост и ефективност на инференса[1].

Моделът се разпространява под свободния лиценз Apache 2.0, което го прави достъпен за академично и търговско използване. Mixtral 8x7B демонстрира силни способности в многоезични задачи, генериране на код и следване на инструкции, което го направи един от най-популярните отворени модели към момента на публикуването му[2].

История на разработката

Компанията Mistral AI е основана през април 2023 година от бивши изследователи от Meta и Google. През септември 2023 година компанията публикува своя първи модел, Mistral 7B, който получи признание за висока ефективност при малък размер.

На 11 декември 2023 година Mistral AI обяви публикуването на Mixtral 8x7B — своя първи модел, базиран на архитектурата смес от експерти. Моделът веднага привлече вниманието на общността като най-мощния по това време отворен LLM, демонстрирайки качество на ниво GPT-3.5 при значително по-висока скорост на инференса. През януари 2024 година беше публикувано подробно техническо описание на модела под формата на научна статия в arXiv, което позволи на независими изследователи да се запознаят с детайлите на архитектурата и резултатите от тестовете[2].

Архитектура: Разредена смес от експерти (SMoE)

Главното нововъведение на Mixtral 8x7B е внедряването на архитектурата Sparse Mixture of Experts. За разлика от стандартните („плътни") transformer-и, при които всеки слой извършва едно и също изчисление за всички token-и, в Mixtral всеки слой съдържа няколко паралелни блока-„експерти".

Ключови особености на архитектурата:

  • Структура MoE: Всеки transformer слой съдържа 8 feed-forward блока („експерти"). За обработката на всеки token специална router-мрежа избира 2 най-подходящи експерта (Top-2 routing).
  • Параметри: Общият брой параметри на модела е 46,7 млрд, но благодарение на разредената активация за всеки token по време на извода се използват само 12,9 млрд активни параметъра. Това осигурява скорост на инференса, сравнима с модели с ~13 млрд параметъра.
  • Оптимизация на вниманието: Моделът използва съвременни техники за ефективна обработка на дълги последователности, включително Sliding Window Attention (SWA) и Grouped Query Attention (GQA).
  • Дължина на контекста: Моделът поддържа контекстен прозорец с дължина до 32 768 token-а.

Обучение

Семейството Mixtral 8x7B включва две основни версии:

  1. Mixtral-8x7B-v0.1 (базов модел): Предварително обучен модел, натрениран върху голям корпус от уеб данни на няколко европейски езика (английски, френски, немски, испански, италиански). Основната задача е предсказване на следващия token.
  2. Mixtral-8x7B-Instruct-v0.1 (инструктивен модел): Версия, дообучена с помощта на supervised fine-tuning (SFT) и Direct Preference Optimization (DPO). Този модел по-добре следва инструкциите на потребителя и е предназначен за използване в диалогов формат.

Производителност

Mixtral 8x7B превъзхожда или е сравним по качество с модела Llama 2 70B на повечето стандартни benchmark-и, като същевременно има 5 пъти по-малко активни параметри и, като следствие, значително по-висока скорост на извода (до 6 пъти по-бърза)[2].

Сравнение на производителността на Mixtral 8x7B с Llama 2 70B и GPT-3.5[2]
Метрика Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (общи знания) 69,9% 70,0% 70,6%
GSM-8K (математика) 53,6% 57,1% 58,4%
MBPP (генериране на код) 49,8% 52,2% 60,7%
MT-Bench (оценка на диалог, Instruct-версии) 6,86 8,32 8,30
  • Многоезичност: Благодарение на увеличения дял на многоезични данни в обучаващия корпус, Mixtral значително превъзхожда Llama 2 70B в задачи на френски, немски, испански и италиански език.
  • Отклонения и халюцинации: В сравнение с Llama 2 70B моделът демонстрира по-висока точност на benchmark-а BBQ (оценка на социални предубеждения) и по-позитивен профил на настроенията на benchmark-а BOLD.

Лицензиране и достъпност

Двете версии на Mixtral 8x7B (базова и Instruct) са публикувани под лиценза Apache 2.0, който разрешава свободно академично и търговско използване. Изходните кодове и теглата на моделите са достъпни в GitHub и Hugging Face.

Връзки

  • Mixtral of Experts — официално обявление в блога на Mistral AI
  • Модел Mixtral 8x7B в Hugging Face

Литература

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Бележки

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]