---
title: "Large language model architectures — معماری‌های مدل‌های زبانی بزرگ"
source: "https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF"
wiki: "systems-analysis.info/int"
article: "Large_language_model_architectures_—_معماری‌های_مدل‌های_زبانی_بزرگ"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 3789
wiki_created_at: 2026-09-06T23:26:09Z
wiki_modified_at: 2026-09-06T23:26:09Z
downloaded_at: 2026-09-07T22:59:02Z
---

# Large language model architectures — معماری‌های مدل‌های زبانی بزرگ

**معماری‌های مدل‌های زبانی بزرگ (LLM)** — اصول و ساختارهای بنیادی‌ای هستند که تعیین می‌کنند مدل‌های زبانی بزرگ چگونه ساخته، آموزش داده و اجرا می‌شوند. LLMهای مدرن که قادر به درک و تولید زبان انسانی هستند، تقریباً به‌طور کامل بر معماری **Transformer**<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)</sup> مبتنی‌اند، اما شامل بهبودها و رویکردهای گوناگونی برای افزایش کارایی، مقیاس‌پذیری و قابلیت‌ها می‌شوند.

## خانواده‌های معماری LLM (ترانسفورمرها)

مدل‌های زبانی بزرگ مدرن بر معماری transformer<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)</sup> استوارند، اما بسته به هدف — درک متن، تولید ادامه یا تبدیل یک متن به متن دیگر — از آن به شیوه‌های متفاوتی استفاده می‌کنند. در عمل، با حفظ اصول پایه transformer، سه خانواده متمایز شناسایی می‌شود<sup>[\[2\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-2)[\[3\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-3)[\[4\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-4)</sup>.

### ۱. Encoder‑only (فقط کدگذار)

مدل تنها از پشته کدگذار استفاده می‌کند و کل متن ورودی را به صورت دوطرفه پردازش می‌کند. پیش‌آموزش معمولاً به صورت masked‑language modeling (MLM، مدل‌سازی زبانی با پنهان‌سازی) انجام می‌شود: بخشی از token‌ها پنهان می‌شوند و مدل یاد می‌گیرد آن‌ها را از روی محیط اطراف بازیابی کند. به دلیل زمینه دوطرفه، این مدل‌ها در وظایف درک و امتیازدهی قوی عمل می‌کنند: طبقه‌بندی، شناسایی موجودیت‌ها، بازرتبه‌بندی اسناد و QA استخراجی. برای تولید خودبازگشتی «از صفر» مناسب نیستند.

علاوه بر این، در عمل اهداف پیش‌آموزش جایگزینی نیز برای خانواده encoder‑only به کار می‌روند: *replaced token detection (RTD) در ELECTRA* (مدل تبعیض‌دهنده token‌های جایگزین‌شده را تشخیص می‌دهد) و *یادگیری تضادی* bi-encoderها برای جستجوی معنایی/بازیابی (InfoNCE/softmax‑loss روی جفت‌های «پرسش-سند»، مانند Dense Passage Retrieval). هنگام استفاده در RAG، encoder‑only یا به عنوان *bi-encoder* (کدگذاری جداگانه پرسش و سند برای جستجوی سریع ANN) یا به عنوان *cross-encoder* (کدگذاری مشترک جفت برای بازرتبه‌بندی دقیق) عمل می‌کند.

**مزایا:**

- کیفیت بالای درک متن به دلیل زمینه دوطرفه: طبقه‌بندی، NER، استخراج حقایق، بازرتبه‌بندی، QA استخراجی.
- پردازش موازی و توان عملیاتی بالا: یک پاس رو به جلو بدون خودبازگشت؛ batch‌بندی امتیازدهی انبوه راحت است.
- یکپارچه‌سازی طبیعی با جستجو و RAG: در نقش bi-encoder — جستجوی معنایی سریع؛ در نقش cross-encoder — بازرتبه‌بندی دقیق.
- انطباق کارآمد: نسخه‌های نسبتاً فشرده (≈۱۰۰–۳۰۰ میلیون پارامتر؛ BERT‑base ≈۱۱۰ میلیون) پس از fine-tuning هدفمند کیفیت بالایی ارائه می‌دهند.
- تأخیر پایدار مستقل از طول پاسخ تولیدی (فاقد رمزگشایی گام‌به‌گام)؛ برای امتیازدهی آفلاین مجموعه‌های بزرگ مناسب است.
- امکان افزایش پنجره زمینه در کدگذارها از طریق موقعیت‌های نسبی/دورانی و/یا توجه محلی-پراکنده (مثلاً Longformer/BigBird)، که برای اسناد طولانی مفید است.

**معایب:**

- فاقد قابلیت‌های تولیدی ذاتی: برای گفتگو و پاسخ‌های مفصل به یک decoder یا ماژول تولیدی خارجی نیاز است.
- محدودیت در سناریوهای تعاملی: فاقد تولید مرحله‌به‌مرحله با حفظ وضعیت.
- عدم تطابق هدف پیش‌آموزش با وظایف تولید آزاد: MLM نسبت به مدل‌سازی علّی هم‌راستایی کمتری با تولید دارد.
- پنجره زمینه تاریخاً محدود (اغلب ۵۱۲ token در پیکربندی‌های پایه موقعیت مطلق)؛ گسترش نیازمند طرح‌های موقعیت/توجه خاص و/یا fine-tuning است.
- برای وظایف بازیابی، fine-tuning تضادی جداگانه bi-encoder و/یا cross-encoder لازم است؛ بدون آن کیفیت جستجو/بازرتبه‌بندی معمولاً از مدل‌های آموزش‌دیده تخصصی پایین‌تر است.

**مدل‌های نمونه:** BERT و مشتقات آن، همچنین RoBERTa و DeBERTa (نسخه‌های پیشرفته encoder‑only)؛ از اهداف پیش‌آموزش جایگزین — ELECTRA (RTD). <sup>[\[5\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-5)[\[6\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-6)[\[7\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-7)[\[8\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-8)[\[9\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-9)[\[10\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-10)</sup>

### ۲. Decoder‑only (فقط رمزگشا)

تنها پشته decoder با توجه علّی (چپ‌به‌راست) فعال است: مدل token بعدی را بر اساس پیشوند داده‌شده پیش‌بینی می‌کند. این رژیم آموزشی — causal language modeling (CLM) — این مدل‌ها را به انتخاب طبیعی برای تولید تبدیل می‌کند: گفتگو، پاسخ‌های مفصل، متن خلاقانه، کد برنامه. مصالحه آن افزایش تأخیر و حجم KV‑cache با prompt‌های طولانی است. در عمل برای decoder‑only تکنیک‌های مهندسی گسترده‌ای به کار می‌روند: کاهش KV‑cache از طریق MQA و GQA، تسریع استنتاج از طریق رمزگشایی انتزاعی و بهینه‌سازی‌های سرور (PagedAttention/vLLM، continuous batching، chunked prefill).<sup>[\[11\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-11)[\[12\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-12)[\[13\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-13)[\[14\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-14)[\[15\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-15)</sup>

**مزایا:**

- تولید طبیعی متن (CLM): قابلیت‌های قوی zero‑shot و few‑shot؛ به خوبی مقیاس می‌شود.<sup>[\[16\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-16)</sup>
- تطبیق‌پذیری کاربردی: یک مدل وظایف متعدد را از طریق دستورالعمل‌ها و مثال‌ها در prompt حل می‌کند؛ به طور طبیعی با RAG و فراخوانی ابزار (tool use) ترکیب می‌شود.
- اکوسیستم بالغ: روش‌های fine-tuning دستوری و همسوسازی رفتار (RLHF، DPO)؛ پیاده‌سازی‌های متن‌باز و تجاری در دسترس هستند.<sup>[\[17\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-17)[\[18\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-18)</sup>
- پشته غنی از بهینه‌سازی‌های استنتاج: MQA/GQA حجم KV‑cache را کاهش و توان عملیاتی را افزایش می‌دهند؛ رمزگشایی انتزاعی بدون تغییر توزیع استنتاج را تسریع می‌کند؛ PagedAttention/vLLM با continuous batching و chunked prefill بهره‌وری کلی GPU را افزایش می‌دهند.<sup>[\[19\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-19)[\[20\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-20)[\[21\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-21)[\[22\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-22)[\[23\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-23)</sup>
- پشتیبانی از تولید ساختاریافته برای فرمت‌های پاسخ دقیق (JSON/SQL/DSL)، که یکپارچه‌سازی با سیستم‌های اطلاعاتی و API را ساده‌تر می‌کند.<sup>[\[24\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-24)[\[25\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-25)</sup>

**معایب:**

- تأخیر تولید بالا: استنتاج متوالی؛ هزینه token جدید با طول زمینه «خوانده‌شده» (KV‑cache) افزایش می‌یابد.
- در پروفایل «ورودی طولانی – خروجی کوتاه» (خلاصه‌سازی، ترجمه) نسبت به encoder–decoder که ورودی را یک‌بار کدگذاری می‌کند، کمتر مقرون‌به‌صرفه است.
- محدودیت زمینه یک‌طرفه: در وظایف درک گاهی از مدل‌های با بازنمایی دوطرفه (encoder‑only / encoder–decoder) ضعیف‌تر عمل می‌کند.
- حافظه زیر KV‑cache می‌تواند در prompt‌های طولانی و batch‌های بزرگ «گلوگاه» باشد؛ <sup>[\[26\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-26)</sup>
- کوانتیزاسیون activation/KV (INT8/FP8) استنتاج را تسریع می‌کند اما ممکن است کیفیت را در زمینه‌های طولانی/کد کاهش دهد؛ نیازمند اعتبارسنجی دقیق است (به‌ویژه با SLA سختگیرانه).

**مدل‌های نمونه:** GPT‑3، GPT‑4 (جزئیات معماری و مجموعه داده به صورت عمومی منتشر نشده)، LLaMA و *Llama 3* (8B/70B، 2024).<sup>[\[27\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-27)[\[28\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-28)[\[29\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-29)[\[30\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-30)</sup>

### ۳. Encoder–decoder (کدگذار–رمزگشا)

این معماری هر دو مؤلفه را ترکیب می‌کند. کدگذار در حالت دوطرفه عمل می‌کند و decoder به صورت علّی. کدگذار ورودی را یک‌بار تحلیل کرده و بازنمایی آن را شکل می‌دهد؛ decoder خروجی را تولید می‌کند و از طریق cross‑attention به این بازنمایی دسترسی دارد. این رویکرد جداگانه به‌ویژه در جایی که تبدیل یک متن ورودی طولانی به خروجی کوتاه نیاز است مفید است: ترجمه ماشینی، خلاصه‌سازی، پاسخ‌دهی بر اساس اسناد. اگرچه این روش به هزینه محاسباتی کلی بیشتری نیاز دارد (دو پشته و cross-attention)، مزیت آن تولید کنترل‌شده بر اساس تحلیل کامل متن منبع است؛ در عین حال کدگذاری یک‌بار انجام شده و در طول فرآیند استنتاج مجدداً استفاده می‌شود.

**مزایا:**

- تولید شرطی: decoder از cross‑attention به بازنمایی ورودی استفاده می‌کند. <sup>[\[31\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-31)</sup>
- در سناریوی «ورودی طولانی → خروجی کوتاه» کارآمد است: ورودی یک‌بار کدگذاری می‌شود.
- برای فرمت «text‑to‑text» و استنتاج کنترل‌شده مناسب است (پیشوندهای وظیفه، دستورالعمل‌های ویژه). <sup>[\[32\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-32)</sup>
- پایداری و کارایی با منبع طولانی: در فاز رمزگشایی تنها self‑attention روی خروجی رشد می‌کند، در حالی که cross‑attention از کلیدها/مقادیر ثابت کدگذار مجدداً استفاده می‌کند (ورودی در هر گام «بازخوانی» نمی‌شود).

**معایب:**

- دو پشته نیازمندی‌های حافظه و محاسبات را در آموزش و استفاده افزایش می‌دهند.
- برای دنباله‌های بسیار طولانی، تأخیر کلی با decoder‑only قابل مقایسه است؛ خودبازگشت همچنان گلوگاه باقی می‌ماند.
- مدل‌های چت جهانی کمتری نسبت به decoder‑only وجود دارد؛ اغلب به عنوان موتور seq2seq با کیفیت بالا برای وظایف خاص استفاده می‌شود.
- با ورودی بسیار طولانی، حافظه زیر کلیدها/مقادیر cross‑attention در هر لایه decoder (برای کل منبع) افزایش می‌یابد که نیازمند برنامه‌ریزی دقیق سرویس‌دهی است.

**مدل‌های نمونه:** T5 (شامل T5 v1.1 و رویه fine-tuning دستوری در *FLAN‑T5*) و BART. <sup>[\[33\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-33)[\[34\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-34)[\[35\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-35)</sup>

## ترانسفورمرهای چگال (Dense)

معماری کلاسیک و رایج‌ترین نوع LLM: هنگام پردازش هر token، تقریباً تمام پارامترهای مدل شرکت می‌کنند. برخلاف رویکردهای پراکنده (مثلاً Mixture‑of‑Experts)، فعال‌سازی انتخابی زیرشبکه‌ها وجود ندارد — هر بلوک برای هر token کار می‌کند. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)</sup>

### اصل کار و معماری

**ساختار پایه.** مدل یک پشته از N بلوک transformer همسان است. هر بلوک شامل:

1.  **توجه چندسر خودانتساب (Multi‑Head Self‑Attention).** برای هر token سه بردار محاسبه می‌شود: Q (query)، K (key)، V (value)؛ توجه به صورت $\operatorname{softmax}\!\left( \frac{QK^{\top} + M}{\sqrt{d_{k}}} \right) \cdot V$ تعریف می‌شود، که در آن $M$ ماسکی (علّی و/یا padding-ماسک) است که موقعیت‌های غیرمجاز را حذف می‌کند. چند «سر» توجه به طور موازی جنبه‌های مختلف زمینه را در نظر می‌گیرند (H سر، معمولاً $d_{head} = \frac{d_{model}}{H}$)؛ تعداد آن‌ها با مقیاس مدل رشد می‌کند. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)</sup>
2.  **شبکه تمام‌متصل (Feed‑Forward Network, FFN).** دو لایه خطی با غیرخطی بودن بین آن‌ها (معمولاً GELU/SiLU؛ در برخی مدل‌های مدرن — SwiGLU). بعد میانی معمولاً $\approx 4\, d_{model}$ است؛ هنگام استفاده از SwiGLU اغلب $\approx \frac{8}{3}\, d_{model}$ برای حفظ تعداد مشابه پارامتر انتخاب می‌شود. FFN سهم قابل توجهی از پارامترها را در خود دارد. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-36)</sup>

**اجزای اضافی.** اتصالات residual و نرمال‌سازی لایه‌ها استفاده می‌شوند؛ در LLMهای مدرن Pre‑LN (نرمال‌سازی قبل از زیربلوک‌ها) بیشتر به کار می‌رود — این پایداری آموزش را در عمق‌های بزرگ بهبود می‌بخشد. علاوه بر LayerNorm کلاسیک، **RMSNorm** به طور فزاینده‌ای استفاده می‌شود (هزینه محاسباتی را کاهش داده و در مدل‌های بزرگ به خوبی عمل می‌کند)؛ همچنین در برخی خانواده‌ها نرمال‌سازی در فضای توجه به کار می‌رود (مثلاً نرمال‌سازی Q/K قبل از softmax). بازنمایی‌های موقعیتی می‌توانند مطلق یا نسبی باشند؛ برای زمینه طولانی RoPE به استاندارد de facto تبدیل شده است.

##### نمونه‌های مدل و مقیاس

- BERT‑Large: 24 لایه، بعد 1024، 16 سر توجه، ≈340 میلیون پارامتر. <sup>[\[37\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-37)</sup>
- GPT‑3 (175B): 96 لایه، بعد 12288، 96 سر توجه، ≈175 میلیارد پارامتر. <sup>[\[38\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-38)</sup>
- LLaMA‑65B: 80 لایه، بعد 8192، 64 سر توجه، ≈65 میلیارد پارامتر. <sup>[\[39\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-39)</sup>
- PaLM‑540B: 118 لایه، بعد حدود 18432، ≈540 میلیارد پارامتر. <sup>[\[40\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-40)</sup>

##### مزایا

- بلوک‌های یکنواخت، رژیم‌های آموزشی کاملاً شناخته‌شده و رفتار قابل پیش‌بینی هنگام مقیاس‌بندی.
- کیفیت با رشد توانی با افزایش پارامترها و داده‌ها بهبود می‌یابد؛ رژیم compute‑optimal افزایش توأمان اندازه مدل و حجم token‌های آموزشی را پیش‌بینی می‌کند. <sup>[\[41\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-41)[\[42\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-42)</sup>
- همان معماری پس از fine-tuning طیف گسترده‌ای از وظایف را بدون تغییر در سطح لایه‌ها پوشش می‌دهد.

##### معایب

- توجه کامل خودانتساب پیچیدگی درجه دوم نسبت به طول دنباله دارد ($O(n^{2})$)، که پنجره زمینه را محدود می‌کند. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)</sup>
- فعال‌سازی کامل پارامترها در گام تولید: در decoder بدون MoE هزینه استنتاج به ازای هر token تقریباً به تعداد پارامترها متناسب است.
- گلوگاه پهنای باند حافظه (memory‑bound): بارگذاری وزن‌ها از HBM اغلب سرعت استنتاج را محدود می‌کند.

##### محدودیت‌های مقیاس‌بندی و زمینه

- حافظه زیر پارامترها با اندازه مدل به صورت خطی رشد می‌کند؛ حافظه آموزشی به دلیل گرادیان‌ها و حالت‌های بهینه‌ساز افزایش می‌یابد.
- پیکربندی‌های پایه تاریخاً به ۲–۴ هزار token محدود بودند. طرح‌های موقعیتی مدرن (RoPE) و تکنیک‌های گسترش (Position Interpolation، YaRN و غیره) امکان افزایش پنجره را یک‌ مرتبه بزرگی یا بیشتر فراهم می‌کنند، اما با هزینه محاسباتی/حافظه‌ای بیشتر. <sup>[\[43\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-43)[\[44\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-44)</sup>

### بهینه‌سازی‌های مدرن

- **FlashAttention.** توجه دقیق با در نظر گرفتن سلسله‌مراتب حافظه GPU؛ مصرف حافظه را کاهش داده و آموزش/استنتاج را برای دنباله‌های طولانی تسریع می‌کند. <sup>[\[45\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-45)</sup>
- **کاهش و مدیریت KV‑cache.** Multi‑Query Attention و Grouped‑Query Attention حجم cache و ترافیک حافظه را کاهش می‌دهند؛ در سطح سرور، PagedAttention (vLLM) با مدیریت صفحه‌ای cache توان عملیاتی را افزایش می‌دهد. <sup>[\[46\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-46)[\[47\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-47)[\[48\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-48)</sup>
- **رمزگشایی انتزاعی (Speculative Decoding).** مدل پیش‌نویس (draft) ادامه را پیشنهاد می‌دهد و مدل اصلی آن را سریعاً تأیید می‌کند؛ تسریع بدون تغییر توزیع خروجی حاصل می‌شود. <sup>[\[49\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-49)</sup>

## مدل‌های پراکنده (Sparse Models) و Mixture‑of‑Experts (MoE)

MoE روشی است برای افزایش ظرفیت مدل بدون رشد متناسب محاسبات به ازای هر token. به جای یک بلوک FFN بزرگ در یک لایه، مجموعه‌ای از «متخصصان» موازی (چند FFN مستقل) استفاده می‌شود، و یک شبکه مسیریاب قابل‌یادگیری (gating network) برای هر token متخصصان top‑k مرتبط‌تر را انتخاب می‌کند (معمولاً k=1–2؛ در برخی مدل‌ها k=4). تنها متخصصان انتخاب‌شده فعال می‌شوند؛ خروجی‌های آن‌ها وزن‌دهی و جمع می‌شوند. بدین ترتیب تعداد کل پارامترها می‌تواند صدها میلیارد تا تریلیون باشد، اما در هر گام تنها بخش کوچکی فعال می‌شود. <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-GLAM-51)</sup>

#### نمونه‌های مدل و مقیاس

- **Switch Transformer (Google)**: تا ~1.6T پارامتر؛ مسیریابی top‑1 (یک متخصص به ازای هر token). نشان داد که MoE امکان افزایش شدید ظرفیت با هزینه مشابه به ازای هر token را فراهم می‌کند. <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1.2T پارامتر، 64 متخصص در لایه، top‑2؛ برای هر token ≈96.6B پارامتر (~8%) فعال می‌شود. <sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: ~46.7B پارامتر کل، ≈12.9B پارامتر فعال به ازای هر token، top‑2. <sup>[\[52\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: ~141B پارامتر کل، ≈39B پارامتر فعال به ازای هر token، top‑2. <sup>[\[54\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: 132B پارامتر کل، ≈36B پارامتر فعال به ازای هر token؛ 16 متخصص و مسیریابی top‑4 (fine‑grained MoE). <sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-DBRX-55)</sup>

##### مزایا

- هزینه محاسبات توسط تعداد متخصصان فعال k تعیین می‌شود نه تعداد کل پارامترها: می‌توان مدل‌هایی در مقیاس تریلیونی را با هزینه‌ای قابل مقایسه با مدل‌های چگال به مراتب کوچک‌تر آموزش داد و استفاده کرد. <sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-GLAM-51)</sup>
- تخصص‌گرایی: متخصصان به طور خودکار برای زبان‌ها/حوزه‌ها/الگوها «تنظیم می‌شوند» و کیفیت را در وظایف چندحوزه‌ای بهبود می‌بخشند.
- استقرار انعطاف‌پذیر: می‌توان متخصصان پرکاربرد را در حافظه نگه داشت و موارد نادر را در صورت نیاز بارگذاری کرد (با زیرساخت مناسب).

##### محدودیت‌ها

- تعادل بار: بدون تنظیم‌سازی، مسیریاب ممکن است روی برخی متخصصان «قفل کند» (router collapse). نیاز به auxiliary losses (load‑balancing) و طرح‌های بهتر مسیریابی است. <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Switch-50)</sup>
- پیچیدگی محاسبات توزیع‌شده: نیازمند expert parallelism و تبادل all‑to‑all است؛ هزینه‌های ارتباطی و مدیریت حافظه به گلوگاه تبدیل می‌شوند. <sup>[\[56\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-NVIDIA_MoE-56)</sup>
- پایداری آموزش: تنظیمات router و محدودیت‌های ظرفیت (capacity) مهم هستند، وگرنه افت کیفیت/همگرایی ممکن است رخ دهد.

#### بهبودهای مدرن

- **Expert‑Choice routing**: متخصصان token‌ها را «انتخاب می‌کنند»، که تعادل بار و همگرایی را با هزینه مشابه بهبود می‌دهد. <sup>[\[57\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-ExpertChoice-57)</sup>
- **Fine‑grained MoE**: تعداد بیشتری از متخصصان ریزتر (مانند DBRX) گرانولاریتی ظریف‌تری از تخصص‌گرایی ارائه می‌دهند. <sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: تبدیل یک مدل چگال به MoE از نقطه بازرسی آن امکان بهبود قابل توجه کیفیت با هزینه متوسط را فراهم می‌کند. <sup>[\[58\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-SparseUpcycling-58)</sup>

#### مناسب بودن استفاده از MoE

- دستیارهای چندحوزه‌ای بزرگ با بودجه محاسباتی محدود.
- آموزش روی corpus‌های گسترده که تخصص‌گرایی مزیت ایجاد می‌کند.
- سناریوهایی با زیرساخت توزیع‌شده پیشرفته (GPU/TPU زیاد و شبکه‌های سریع).

**زمانی که مدل‌های چگال بهترند**: زیرساخت محدود (۱–۲ GPU)، نیازمندی‌های سختگیرانه به تأخیر قابل پیش‌بینی و سادگی استقرار.

## Retrieval‑Augmented Generation (RAG)

RAG یک **الگوی سیستمی** پیرامون LLM است، نه معماری داخلی خود مدل. این الگو LLM (مؤلفه تولیدی) را با یک پایگاه دانش خارجی (مؤلفه بازیابی) ترکیب می‌کند، که به جبران محدودیت «حافظه پارامتری» مدل کمک می‌کند.

- **اصل کار:** قبل از تولید، LLM اسناد مرتبط را از یک منبع خارجی (ویکی، پایگاه دانش سازمانی، وب) بازیابی کرده و هنگام شکل‌دادن پاسخ به آن‌ها متکی می‌شود. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RAG-59)</sup>
- **مزایا:**
  - کاهش توهم‌زایی و بهبود دقت واقعی. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-60)</sup>
  - به‌روزرسانی بدون بازآموزش کامل مدل. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RAG-59)</sup>
  - قابلیت استناد و ردیابی پاسخ‌ها.
- **کاربرد:** استاندارد de facto برای دستیارهای سازمانی و سیستم‌هایی که نیاز به حقایق قابل تأیید و کار با داده‌های خصوصی/تخصصی دارند. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RAG-59)</sup>

## مکانیزم‌های توجه و کار با زمینه

توجه خودانتساب پایه پیچیدگی درجه دوم نسبت به طول دنباله دارد ($O(n^{2})$)، بنابراین بهینه‌سازی‌هایی ظهور کرده‌اند.

- **توجه پراکنده (Sparse Attention):** محدود کردن توجه به پنجره‌های محلی/الگوها. نمونه‌ها: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-61)</sup>، **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-62)</sup>.
- **FlashAttention:** بازسازی ترتیب محاسبات با در نظر گرفتن سلسله‌مراتب حافظه GPU؛ بهره‌وری قابل توجهی در زمان و حافظه ارائه می‌دهد و به استاندارد de facto در آموزش LLM با زمینه طولانی تبدیل شده است<sup>[\[63\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-63)[\[64\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-64)[\[65\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-65)</sup>.
- **MQA/GQA (تسریع رمزگشایی):** *Multi‑Query Attention* (کلیدها/مقادیر مشترک برای همه سرها) ترافیک KV‑cache را کاهش می‌دهد<sup>[\[66\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-66)</sup>. *Grouped‑Query Attention* تعادل کیفیت/سرعت را فراهم می‌کند<sup>[\[67\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-67)</sup>.
- **بازنمایی‌های موقعیتی بهبودیافته:**
  - **ALiBi (Attention with Linear Biases):** انحرافات خطی به امتیازات توجه برای بهبود تعمیم به طول‌های بزرگ‌تر. <sup>[\[68\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** اطلاعات موقعیت نسبی از طریق چرخش Q/K؛ به طور گسترده در مدل‌های مدرن استفاده می‌شود (مثلاً LLaMA). <sup>[\[69\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-69)[\[70\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-70)</sup>
  - **گسترش زمینه برای مدل‌های RoPE:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-71)</sup>، *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-72)</sup> و تغییرات NTK-aware امکان افزایش کارآمد پنجره زمینه بدون تغییر معماری را فراهم می‌کنند.

<!-- -->

- **رویکردهای دیگر برای دنباله‌های طولانی:**
  - **Transformer‑XL:** حافظه بازگشتی بین قطعات برای مدل‌سازی وابستگی‌های دوردست. <sup>[\[73\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-73)</sup>
  - **Reformer:** LSH‑attention و بلوک‌های residual برگشت‌پذیر برای صرفه‌جویی در حافظه. <sup>[\[74\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-74)</sup>
  - **Performer:** تقریب خطی softmax‑attention (FAVOR+). <sup>[\[75\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-75)</sup>
  - **Linformer:** تقریب کم‌رتبه ماتریس توجه. <sup>[\[76\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-76)</sup>

## بهینه‌سازی مدل‌ها و زیرساخت آموزش

برای آموزش و استقرار LLM از تکنیک‌ها و فریمورک‌های تخصصی استفاده می‌شود.

- **کوانتیزاسیون (Quantization):** کاهش دقت وزن‌ها حافظه را کاهش داده و استنتاج را تسریع می‌کند. **QLoRA** امکان fine-tuning کارآمد مدل‌های ۴ بیتی (از جمله 65B) را با کیفیت نزدیک به دقت کامل فراهم می‌کند<sup>[\[77\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-77)</sup>.
- **تقطیر دانش (Knowledge Distillation):** آموزش Teacher→Student برای مدل‌های فشرده<sup>[\[78\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-78)</sup>؛ نمونه — **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-79)</sup>.
- **آموزش توزیع‌شده:**
  - **DeepSpeed** و **ZeRO** — توزیع پارامترها/گرادیان‌ها/حالت‌های بهینه‌ساز برای آموزش مدل‌های تریلیونی<sup>[\[80\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-80)</sup>.
  - **Megatron‑LM** — موازی‌سازی تانسوری و خط لوله‌ای برای transformer‌های بسیار بزرگ<sup>[\[81\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-81)</sup>.
- **اکوسیستم و ابزارها:** **Hugging Face Transformers** و **Accelerate** پیاده‌سازی‌های استاندارد مدل و یکپارچه‌سازی با DeepSpeed/FSDP برای آموزش و استنتاج را فراهم می‌کنند<sup>[\[82\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-82)[\[83\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-83)</sup>.

## قوانین مقیاس‌بندی و آموزش compute‑optimal

**قوانین مقیاس‌بندی** تجربی نشان می‌دهند که خطای کراس‌آنتروپی با رشد پارامترها، داده‌ها و محاسبات به صورت قانون توانی کاهش می‌یابد. <sup>[\[84\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-84)</sup> کار **Chinchilla** رژیم‌های **compute‑optimal** را دقیق‌تر کرد: برای بهترین کارایی، اندازه مدل و تعداد token‌های آموزشی باید به طور مشترک مقیاس شوند (نمونه — مدل 70B آموزش‌دیده روی ~1.4T token، که از مدل‌های بزرگ‌تر کم‌آموزش‌دیده بهتر است). <sup>[\[85\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-85)</sup>

## مدل‌های فضای حالت (State Space Models, SSM)

**State Space Models (SSM)** — معماری جایگزین نسبت به transformer‌ها برای کار با دنباله‌های طولانی. این معماری ایده‌هایی از نظریه کنترل و پردازش سیگنال دیجیتال را به کار می‌گیرد و مشکل اصلی self‑attention را حل می‌کند: رشد درجه دوم محاسبات با افزایش طول متن.

### مشکل اصلی و راه‌حل

**مشکل transformer‌ها.** مشکل اصلی transformer‌های سنتی پیچیدگی درجه دوم توجه است: متنی ۱۰ برابر طولانی‌تر به تقریباً ۱۰۰ برابر محاسبات بیشتر نیاز دارد.

**رویکرد SSM.** به جای «توجه همزمان به همه کلمات»، مدل به صورت متوالی روی متن حرکت می‌کند و یک **حالت حافظه** داخلی فشرده را حفظ می‌کند که در هر گام به‌روزرسانی می‌شود. در نتیجه زمان و مصرف حافظه تقریباً به صورت خطی با طول متن رشد می‌کنند. در عین حال آموزش می‌تواند به صورت موازی انجام شود — از طریق بازنمایی کانولوشنی هسته (توان عملیاتی بالا روی دنباله‌های طولانی). <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-S4-86)</sup>

### اصل کار

SSM گسسته توسط معادلات حالت و خروجی توصیف می‌شود:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

که در آن $x_{t}$ — حالت حافظه، $u_{t}$ — ورودی (token)، $y_{t}$ — خروجی. در SSMهای عمیق ماتریس‌های $A,B,C,D$ به گونه‌ای پارامتریزه می‌شوند که پایداری و محاسبات کارآمد روی دنباله‌های طولانی را تضمین کنند. همان لایه را می‌توان به صورت:

- بازگشتی (پویش گام‌به‌گام) — استنتاج کارآمد از نظر حافظه بدون KV‑cache؛
- کانولوشنی — آموزش موازی با هسته پیش‌محاسبه‌شده در نظر گرفت. <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-S4-86)</sup>

### معماری‌های اصلی و ترکیبی

- **S4 (Structured State Spaces).** خط پایه SSM با پارامتریزاسیون پایدار ماتریس حالت؛ کارایی روی دنباله‌های بسیار طولانی را نشان می‌دهد. <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-S4-86)</sup>
- **Mamba.** SSMهای *انتخابی*: قوانین به‌روزرسانی حافظه به ورودی جاری وابسته است (مدل خودش تصمیم می‌گیرد چه چیزی را «در حافظه نگه دارد» و چه چیزی را «فراموش کند»). پیاده‌سازی بر اساس سلسله‌مراتب حافظه GPU بهینه شده؛ بر اساس گزارش نویسندگان، افزایش چندبرابری در توان عملیاتی استنتاج با پیچیدگی خطی نسبت به طول حاصل می‌شود. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mamba-87)</sup>
- **RetNet.** مکانیزم *retention* با سه حالت: آموزش موازی، استنتاج بازگشتی و بازگشتی-بلوکی. هدف — ترکیب آموزش سریع (مانند transformer‌ها) با جریان کارآمد در استنتاج (حافظه O(1) به ازای هر token). <sup>[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RetNet-88)</sup>
- **ترکیبی Attention+SSM.** نمونه — **Jamba** (تناوب لایه‌های Transformer و Mamba به علاوه MoE): از پشتیبانی زمینه‌هایی در حدود ~256 K token با نیاز حافظه به مراتب کمتر نسبت به مدل‌های کاملاً transformer از همان رده گزارش می‌دهد. <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Jamba-89)</sup>

#### مزایا

- پیچیدگی خطی و صرفه‌جویی در حافظه در استنتاج. فاقد self‑attention و KV‑cache جهانی است؛ تنها حالت فشرده‌ای ذخیره می‌شود. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RetNet-88)</sup>
- آموزش موازی روی دنباله‌های طولانی. حالت کانولوشنی توان عملیاتی آموزش را افزایش می‌دهد. <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-S4-86)</sup>
- کارایی سخت‌افزاری. پیاده‌سازی‌ها برای سلسله‌مراتب حافظه مدرن (HBM/SRAM) بهینه شده‌اند. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mamba-87)</sup>
- زمینه‌های طولانی و پردازش جریانی. ترکیبی‌های SSM+Attention برای صدها هزار token با منابع متعادل عملی هستند. <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Jamba-89)</sup>

#### محدودیت‌ها و رویه جاری

- بلوغ اکوسیستم. ابزارها و «دستورالعمل‌های» مقیاس‌بندی (دستورالعمل‌ها، RLHF/DPO) هنوز از پشته transformer عقب هستند. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mamba-87)</sup>
- کیفیت و پایداری. در برخی وظایف، ترکیبی‌ها (Attention+SSM) مصالحه پایدارتری از «کیفیت/سرعت/حافظه» نسبت به SSMهای «خالص» نشان می‌دهند. <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Jamba-89)</sup>

#### مقایسه رویکردها (به صورت کلی)

| ویژگی                            | Transformer‌ها               | SSM                 | ترکیبی (Attention+SSM) |
|----------------------------------|-----------------------------|---------------------|------------------------|
| پیچیدگی نسبت به طول              | درجه دوم (self‑attention)   | خطی (پویش/کانولوشن) | نزدیک به خطی           |
| حافظه به ازای هر token (استنتاج) | KV‑cache با زمینه رشد می‌کند | حالت O(1)           | رشد متعادل             |
| زمینه‌های طولانی                  | نیازمند بهینه‌سازی‌های خاص    | پشتیبانی طبیعی      | تا ~256 K عملی         |
| بلوغ اکوسیستم                    | بالا                        | در حال توسعه        | در حال توسعه           |

#### کاربردهای عملی

- تحلیل اسناد بسیار طولانی (کتاب‌ها، گزارش‌ها، مرورهای علمی).
- پردازش جریانی و سناریوهای چت با تاریخچه طولانی بدون افزایش هزینه حافظه.
- محیط‌هایی با منابع محدود (دستگاه‌های موبایل/edge).
- سری‌های زمانی و سایر داده‌های متوالی.

**مدل‌های نمونه:** S4، Mamba، RetNet؛ ترکیبی‌های Attention+SSM (Jamba). <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Jamba-89)</sup>

## تکامل معماری‌ها

- 2017 — مقاله «Attention Is All You Need» منتشر شد. معماری transformer معرفی شد: توجه چندسر خودانتساب و کدگذاری‌های موقعیتی امکان آموزش مدل‌ها بدون بازگشت و کانولوشن را فراهم کردند؛ با این حال توجه پیچیدگی درجه دوم نسبت به طول زمینه دارد.<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 — GPT‑1 و BERT معرفی شدند. GPT‑1 از پشته فقط decoder با توجه علّی برای تولید و fine-tuning بعدی استفاده می‌کند؛ BERT کدگذار دوطرفه و پیش‌آموزش MLM را برای وظایف درک متن معرفی می‌کند. <sup>[\[90\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-90)[\[91\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-91)</sup>

<!-- -->

- 2019 — روش‌هایی برای کار با دنباله‌های طولانی پیشنهاد شد و decoder‑only مقیاس‌بندی شد. Transformer‑XL «حافظه» و موقعیت‌های نسبی را برای خروج از پنجره ثابت اضافه می‌کند؛ GPT‑2 رشد قابلیت‌های zero-shot با افزایش مقیاس را نشان می‌دهد؛ BART اثربخشی پیش‌آموزش denoising برای seq2seq را نشان می‌دهد. <sup>[\[92\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-92)[\[93\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-93)[\[94\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-94)</sup>

<!-- -->

- 2020 — فرمت «text‑to‑text» یکپارچه شد و روش‌هایی برای اسناد طولانی نشان داده شد. T5 رویکرد یکپارچه encoder–decoder را برای وظایف مختلف فرموله می‌کند؛ Longformer و BigBird از توجه پراکنده/ساختاریافته برای متون طولانی استفاده می‌کنند؛ GPT‑3 اثربخشی مقیاس‌بندی decoder‑only چگال را تأیید می‌کند. <sup>[\[95\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-95)[\[96\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-96)[\[97\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-97)[\[98\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-98)</sup>

<!-- -->

- 2021 — بازنمایی‌های موقعیتی بهبود یافتند و پراکندگی پارامتری (MoE) نشان داده شد. RoPE و ALiBi تعمیم‌پذیری را در طول‌های بزرگ‌تر بهبود می‌بخشند؛ Switch Transformer و GLaM تنها بخشی از متخصصان را به ازای هر token فعال می‌کنند و ظرفیت را بدون افزایش متناسب هزینه استنتاج بالا می‌برند. <sup>[\[99\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-99)[\[100\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-100)[\[101\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-101)[\[102\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-102)</sup>

<!-- -->

- 2022 — رژیم compute‑optimal دقیق‌تر شد و استنتاج روی prompt‌های طولانی تسریع شد. Chinchilla مزیت تعداد بیشتر token‌های آموزشی با اندازه متعادل مدل را نشان می‌دهد؛ PaLM با Multi‑Query Attention حجم KV‑cache را کاهش می‌دهد؛ FlashAttention توجه را روی GPU تسریع می‌کند. <sup>[\[103\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-103)[\[104\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-104)[\[105\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-105)[\[106\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-106)</sup>

<!-- -->

- 2023 — پنجره‌های زمینه بدون تغییر لایه‌ها افزایش یافتند و ارائه سرور بهبود یافت. خانواده LLaMA رویه‌ها را (RMSNorm، SwiGLU، RoPE) تثبیت کرد؛ Position Interpolation و YaRN زمینه را گسترش دادند؛ vLLM/PagedAttention مدیریت KV‑cache را کارآمدتر کرد. <sup>[\[107\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-107)[\[108\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-108)[\[109\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-109)[\[110\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-110)[\[111\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-111)[\[112\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-112)</sup>

<!-- -->

- 2023 — GPT‑4 و Gemini پردازش و تولید چندوجهی را در قالب یک خانواده مدلی نشان دادند. <sup>[\[113\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-113)[\[114\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-114)</sup>

<!-- -->

- 2023 — مدل‌های فضای حالت (SSM) پیشنهاد شدند. Mamba و RetNet پردازش متوالی با حالت فشرده به جای KV‑cache را بازگرداندند و پایه‌ای برای معماری‌های ترکیبی گذاشتند. <sup>[\[115\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-115)[\[116\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-116)</sup>

<!-- -->

- 2024 — مدل‌های MoE متن‌باز و ترکیبی‌های Attention+SSM منتشر شدند؛ توجه روی GPU‌های جدید تسریع یافت. Mixtral 8×7B/8×22B و DBRX عملی‌بودن MoE را تأیید کردند؛ Jamba Transformer و Mamba را برای زمینه‌های بسیار طولانی ترکیب کرد؛ FlashAttention‑3 توان عملیاتی را افزایش داد. <sup>[\[117\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-117)[\[118\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-118)[\[119\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-119)[\[120\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-120)[\[121\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_note-121)</sup>

## منابع

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — توضیح تصویری

## منابع

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## یادداشت‌ها

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%DB%8C%E2%80%8C%D9%87%D8%A7%DB%8C_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
