---
title: "Large language model architectures — معماريات LLM"
source: "https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM"
wiki: "systems-analysis.info/int"
article: "Large_language_model_architectures_—_معماريات_LLM"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3788
wiki_created_at: 2026-09-06T23:26:07Z
wiki_modified_at: 2026-09-06T23:26:07Z
downloaded_at: 2026-09-07T22:59:01Z
---

# Large language model architectures — معماريات LLM

**معماريات النماذج اللغوية الكبيرة (LLM)** هي المبادئ والهياكل الأساسية التي تحدد كيفية بناء النماذج اللغوية الكبيرة وتدريبها وعملها. تعتمد النماذج اللغوية الكبيرة الحديثة، القادرة على فهم وتوليد اللغة البشرية، بشكل شبه كامل على معمارية المحوِّل (Transformer)<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)</sup>، لكنها تتضمن العديد من التحسينات والنهج المختلفة التي تهدف إلى زيادة الكفاءة والقابلية للتوسع والقدرات.

## عائلات معماريات LLM (المحوِّلات)

تعتمد النماذج اللغوية الكبيرة الحديثة على معمارية المحوِّل<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)</sup>، لكنها تستخدمها بطرق مختلفة حسب الهدف: فهم النص، أو توليد تكملة له، أو تحويل نص إلى آخر. من الناحية العملية، يمكن تمييز ثلاث عائلات مع الحفاظ على المبادئ الأساسية للمحوِّل<sup>[\[2\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-2)[\[3\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-3)[\[4\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-4)</sup>.

### 1. Encoder-only - المُشفِّر فقط

يستخدم النموذج مكدسًا من المُشفِّرات فقط ويعالج النص المدخل بأكمله بشكل ثنائي الاتجاه. عادةً ما يعتمد التدريب المسبق على نمذجة اللغة المقنَّعة (masked-language modeling, MLM)، حيث يتم إخفاء بعض التوكنات ويتعلم النموذج استعادتها بناءً على سياقها. بفضل السياق ثنائي الاتجاه، تتفوق هذه النماذج في مهام الفهم والتصنيف: مثل تصنيف النصوص، والتعرف على الكيانات، وإعادة ترتيب المستندات، والإجابة على الأسئلة الاستخراجية (extractive QA). وهي غير مصممة للتوليد التلقائي الانحداري (autoregressive generation) "من الصفر".

بالإضافة إلى ذلك، تُستخدم أهداف تدريب مسبق بديلة لعائلة المُشفِّر فقط عمليًا: *اكتشاف التوكنات المستبدلة (RTD) في ELECTRA* (حيث يتعرف نموذج مميِّز على التوكنات المستبدلة) و*التعلم التبايني* للمُشفِّرات المزدوجة (bi-encoders) للبحث الدلالي/الاسترجاع (InfoNCE/softmax-loss على أزواج "استعلام-مستند"، كما في Dense Passage Retrieval). عند استخدامها في RAG، تعمل نماذج المُشفِّر فقط إما *كمُشفِّر مزدوج* (تشفير منفصل للاستعلام والمستند للبحث السريع باستخدام ANN)، أو *كمُشفِّر متقاطع* (تشفير مشترك للزوج لإعادة الترتيب الدقيقة).

**المزايا:**

- جودة عالية في فهم النصوص بفضل السياق ثنائي الاتجاه: التصنيف، NER، استخراج الحقائق، إعادة الترتيب، والإجابة على الأسئلة الاستخراجية.
- معالجة متوازية وإنتاجية عالية: تمريرة أمامية واحدة بدون انحدار ذاتي؛ ملائمة للمعالجة الدفعية لتقييم كميات كبيرة من البيانات.
- تكامل طبيعي مع البحث وRAG: كـ bi-encoder للبحث الدلالي السريع؛ وكـ cross-encoder لإعادة الترتيب الدقيقة.
- تكييف فعال: النماذج المدمجة نسبيًا (≈100–300 مليون معامل؛ BERT-base ≈110 مليون) تحقق جودة عالية بعد الضبط الدقيق الموجه.
- زمن استجابة مستقر لا يعتمد على طول الإجابة المولَّدة (لا يوجد فك تشفير تدريجي)؛ مناسبة لتقييم المجموعات الكبيرة في وضع عدم الاتصال.
- إمكانية زيادة نافذة السياق في المُشفِّرات باستخدام المواضع النسبية/الدورانية و/أو الانتباه المتفرق المحلي (مثل Longformer/BigBird)، وهو أمر مفيد للمستندات الطويلة.

**العيوب:**

- لا تمتلك قدرات توليدية خاصة بها: تتطلب مُفكِّكًا أو وحدة توليد خارجية للحوارات والإجابات المطولة.
- محدودة في السيناريوهات التفاعلية: لا تدعم التوليد التدريجي مع الحفاظ على الحالة.
- عدم تطابق هدف التدريب المسبق مع مهام التوليد الحر: يتوافق MLM بشكل أسوأ مع التوليد مقارنة بالنمذجة السببية.
- نافذة سياق محدودة تاريخيًا (غالبًا 512 توكن في التكوينات الأساسية للمواضع المطلقة)؛ يتطلب توسيعها مخططات مواضع/انتباه خاصة و/أو ضبطًا دقيقًا.
- لمهام الاسترجاع، يتطلب الأمر ضبطًا دقيقًا تباينيًا منفصلاً لـ bi-encoder و/أو cross-encoder؛ بدون ذلك، تكون جودة البحث/إعادة الترتيب عادةً أقل من النماذج المدربة خصيصًا.

**النماذج الممثِّلة:** BERT ومشتقاته، وكذلك RoBERTa وDeBERTa (إصدارات محسنة من المُشفِّر فقط)؛ ومن أهداف التدريب المسبق البديلة — ELECTRA (RTD). <sup>[\[5\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-5)[\[6\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-6)[\[7\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-7)[\[8\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-8)[\[9\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-9)[\[10\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-10)</sup>

### 2. Decoder-only - المُفكِّك فقط

يستخدم هذا النوع مكدس المُفكِّكات فقط مع انتباه سببي (causal attention) أحادي الاتجاه (من اليسار لليمين): يتنبأ النموذج بالتوكن التالي بناءً على البادئة المتوفرة بالفعل. هذا النمط من التدريب — نمذجة اللغة السببية (CLM) — يجعل هذه النماذج الخيار الطبيعي لمهام التوليد: الحوارات، الإجابات المطولة، النصوص الإبداعية، وكتابة الشيفرة البرمجية. المقايضة هي زيادة زمن الاستجابة وحجم ذاكرة التخزين المؤقت للمفاتيح والقيم (KV-cache) مع المُوجِّهات الطويلة. عمليًا، تُستخدم تقنيات هندسية على نطاق واسع لنماذج المُفكِّك فقط: تقليل KV-cache باستخدام MQA وGQA، تسريع الاستدلال عبر فك التشفير التكهني (speculative decoding) وتحسينات الخادم (PagedAttention/vLLM, continuous batching, chunked prefill).<sup>[\[11\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-11)[\[12\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-12)[\[13\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-13)[\[14\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-14)[\[15\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-15)</sup>

**المزايا:**

- توليد طبيعي للنصوص (CLM): قدرات قوية في مهام التعلم بدون أمثلة (zero-shot) والقليل من الأمثلة (few-shot)؛ قابلة للتوسع بشكل جيد.<sup>[\[16\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-16)</sup>
- تعددية الاستخدام: نموذج واحد يحل العديد من المهام عبر التعليمات والأمثلة في المُوجِّه؛ يتكامل بشكل طبيعي مع RAG واستدعاء الأدوات (tool use).
- بيئة عمل ناضجة: ممارسات راسخة للضبط الدقيق التوجيهي ومواءمة السلوك (RLHF، DPO)؛ تتوفر تطبيقات مفتوحة المصدر وتجارية.<sup>[\[17\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-17)[\[18\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-18)</sup>
- مجموعة غنية من تحسينات الاستدلال: MQA/GQA تقلل حجم KV-cache وتزيد الإنتاجية؛ فك التشفير التكهني يسرع الاستدلال دون تغيير توزيع المخرجات؛ PagedAttention/vLLM مع continuous batching وchunked prefill تزيد من الاستفادة الشاملة من وحدات معالجة الرسوميات (GPU).<sup>[\[19\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-19)[\[20\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-20)[\[21\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-21)[\[22\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-22)[\[23\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-23)</sup>
- دعم التوليد المنظم لتنسيقات الإجابات الصارمة (JSON/SQL/DSL)، مما يبسط التكامل مع نظم المعلومات وواجهات برمجة التطبيقات (API).<sup>[\[24\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-24)[\[25\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-25)</sup>

**العيوب:**

- زيادة زمن استجابة التوليد: إخراج تسلسلي؛ تزداد تكلفة كل توكن جديد مع طول السياق المقروء بالفعل (KV-cache).
- أقل كفاءة في سيناريوهات "مدخل طويل - مخرج قصير" (مثل التلخيص والترجمة) مقارنة بمعمارية المُشفِّر-المُفكِّك، حيث يتم تشفير المدخل مرة واحدة فقط.
- محدودية السياق أحادي الاتجاه: في مهام الفهم، قد يكون أداؤه أحيانًا أقل من النماذج ذات التمثيل ثنائي الاتجاه (المُشفِّر فقط / المُشفِّر-المُفكِّك).
- يمكن أن تكون الذاكرة المخصصة لـ KV-cache عنق زجاجة عند التعامل مع المُوجِّهات الطويلة والدفعات الكبيرة. <sup>[\[26\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-26)</sup>
- تكميم التفعيلات/KV (INT8/FP8) يسرع الاستدلال، لكنه قد يقلل من جودة الأداء مع السياقات الطويلة أو الشيفرات البرمجية؛ يتطلب التحقق الدقيق (خاصة مع اتفاقيات مستوى الخدمة (SLA) الصارمة).

**النماذج الممثِّلة:** GPT‑3، GPT‑4 (تفاصيل المعمارية ومجموعة البيانات غير معلنة)، LLaMA و*Llama 3* (8B/70B, 2024).<sup>[\[27\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-27)[\[28\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-28)[\[29\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-29)[\[30\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-30)</sup>

### 3. Encoder–decoder - المُشفِّر-المُفكِّك

تجمع هذه المعمارية بين كلا المكونين. يعمل المُشفِّر في وضع ثنائي الاتجاه، بينما يعمل المُفكِّك في وضع سببي. يقوم المُشفِّر بتحليل المدخل مرة واحدة ويشكل تمثيلاً له؛ ثم يقوم المُفكِّك بتوليد المخرج، بالاعتماد على هذا التمثيل عبر الانتباه المتقاطع (cross-attention). هذا النهج المنفصل مفيد بشكل خاص في الحالات التي تتطلب تحويل نص مدخل طويل إلى مخرج قصير: الترجمة الآلية، التلخيص، والإجابة على الأسئلة بناءً على المستندات. على الرغم من أن هذه الطريقة تتطلب تكاليف حسابية إجمالية أكبر (مكدسان وانتباه متقاطع)، إلا أن ميزتها تكمن في التوليد المتحكم فيه بناءً على تحليل كامل للنص الأصلي؛ بالإضافة إلى ذلك، يتم التشفير مرة واحدة فقط ويعاد استخدامه طوال عملية الاستدلال.

**المزايا:**

- التوليد الشرطي: يستخدم المُفكِّك الانتباه المتقاطع (cross-attention) لتمثيل المدخل. <sup>[\[31\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-31)</sup>
- فعال في سيناريو "مدخل طويل ← مخرج قصير": يتم تشفير المدخل مرة واحدة فقط.
- مناسب لتنسيق "نص-إلى-نص" (text-to-text) والمخرجات المتحكم فيها (بادئات المهام، تعليمات خاصة). <sup>[\[32\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-32)</sup>
- استقرار وكفاءة مع المصادر الطويلة: خلال مرحلة فك التشفير، يزداد الانتباه الذاتي (self-attention) للمخرجات فقط، بينما يعيد الانتباه المتقاطع استخدام المفاتيح/القيم الثابتة من المُشفِّر (لا تتم "إعادة قراءة" المدخل في كل خطوة).

**العيوب:**

- وجود مكدسين يزيد من متطلبات الذاكرة والحوسبة أثناء التدريب والاستخدام.
- في التسلسلات الطويلة جدًا، يكون زمن الاستجابة الإجمالي مشابهًا لنماذج المُفكِّك فقط؛ ويظل الانحدار الذاتي هو عنق الزجاجة.
- عدد نماذج المحادثة العامة أقل مقارنة بنماذج المُفكِّك فقط؛ غالبًا ما تستخدم كمحركات seq2seq عالية الجودة لمهام محددة.
- مع المدخلات الطويلة جدًا، تزداد الذاكرة المطلوبة لمفاتيح/قيم الانتباه المتقاطع في كل طبقة من المُفكِّك (لكامل المصدر)، مما يتطلب تخطيطًا دقيقًا لخدمة النموذج.

**النماذج الممثِّلة:** T5 (بما في ذلك T5 v1.1 وممارسة الضبط الدقيق التوجيهي في *FLAN-T5*) وBART. <sup>[\[33\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-33)[\[34\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-34)[\[35\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-35)</sup>

## المحوِّلات الكثيفة (Dense)

هي المعمارية الكلاسيكية والأكثر شيوعًا للنماذج اللغوية الكبيرة: عند معالجة كل توكن، تشارك مجموعة المعاملات بأكملها تقريبًا في النموذج. على عكس الأساليب المتفرقة (مثل Mixture-of-Experts)، لا يوجد تنشيط انتقائي للشبكات الفرعية — فكل كتلة تعمل لكل توكن. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)</sup>

### مبدأ العمل والمعمارية

**الهيكل الأساسي.** النموذج عبارة عن مكدس من N من كتل المحوِّل المتماثلة. تتضمن كل كتلة ما يلي:

1.  **انتباه ذاتي متعدد الرؤوس (Multi-Head Self-Attention).** لكل توكن، يتم حساب ثلاثة متجهات: Q (الاستعلام)، K (المفتاح)، V (القيمة)؛ يتم تعريف الانتباه كـ $\operatorname{softmax}\!\left( \frac{QK^{\top} + M}{\sqrt{d_{k}}} \right) \cdot V$، حيث $M$ هو قناع (سببي و/أو قناع حشو)، يستبعد المواضع غير المسموح بها. تقوم عدة "رؤوس" انتباه بمعالجة جوانب مختلفة من السياق بالتوازي (H رؤوس، عادةً $d_{head} = \frac{d_{model}}{H}$)؛ ويزداد عددها مع حجم النموذج. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)</sup>
2.  **شبكة التمرير الأمامي (Feed-Forward Network, FFN).** طبقتان خطيتان مع دالة غير خطية بينهما (عادةً GELU/SiLU؛ وفي عدد من النماذج الحديثة — SwiGLU). عادة ما يكون البعد الوسيط $\approx 4\, d_{model}$؛ عند استخدام SwiGLU، غالبًا ما يؤخذ $\approx \frac{8}{3}\, d_{model}$ للحفاظ على عدد مماثل من المعاملات. تحتوي FFN على نسبة كبيرة من المعاملات. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-36)</sup>

**المكونات الإضافية.** تُستخدم الوصلات المتبقية (residual) وتطبيع الطبقات (layer normalization)؛ في النماذج اللغوية الكبيرة الحديثة، يُستخدم Pre-LN (التطبيع قبل الكتل الفرعية) بشكل أكثر شيوعًا — وهذا يحسن استقرار التدريب في الأعماق الكبيرة. بالإضافة إلى LayerNorm الكلاسيكي، يُستخدم **RMSNorm** بشكل متزايد (يقلل من التكاليف الحسابية ويعمل بشكل جيد في النماذج الكبيرة)؛ كما يُستخدم في بعض العائلات التطبيع في فضاء الانتباه (مثل تطبيع Q/K قبل softmax). يمكن أن تكون التمثيلات الموضعية مطلقة أو نسبية؛ للسياق الطويل، أصبح RoPE هو المعيار الفعلي.

#### أمثلة على النماذج وحجمها

- BERT-Large: 24 طبقة، بُعد 1024، 16 رأس انتباه، ≈340 مليون معامل. <sup>[\[37\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-37)</sup>
- GPT-3 (175B): 96 طبقة، بُعد 12288، 96 رأس انتباه، ≈175 مليار معامل. <sup>[\[38\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-38)</sup>
- LLaMA-65B: 80 طبقة، بُعد 8192، 64 رأس انتباه، ≈65 مليار معامل. <sup>[\[39\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-39)</sup>
- PaLM-540B: 118 طبقة، بُعد حوالي 18432، ≈540 مليار معامل. <sup>[\[40\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-40)</sup>

#### المزايا

- كتل موحدة، وأنماط تدريب مدروسة جيدًا، وسلوك يمكن التنبؤ به عند التوسع.
- تتحسن الجودة بشكل أسي مع زيادة المعاملات والبيانات؛ يفترض وضع التدريب الأمثل حسابيًا (compute-optimal) زيادة حجم النموذج وحجم بيانات التدريب معًا. <sup>[\[41\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-41)[\[42\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-42)</sup>
- نفس المعمارية تغطي مجموعة واسعة من المهام بعد الضبط الدقيق دون تغييرات على مستوى الطبقات.

#### العيوب

- الانتباه الذاتي الكامل له تعقيد تربيعي بالنسبة لطول التسلسل ($O(n^{2})$)، مما يحد من نافذة السياق. <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)</sup>
- تنشيط كامل للمعاملات في خطوة التوليد: في المُفكِّك بدون MoE، تزداد تكلفة الاستدلال لكل توكن بشكل متناسب تقريبًا مع عدد المعاملات.
- عنق الزجاجة هو عرض النطاق الترددي للذاكرة (memory-bound): غالبًا ما يحد تحميل الأوزان من HBM من سرعة الاستدلال.

#### قيود التوسع والسياق

- تزداد الذاكرة المطلوبة للمعاملات خطيًا مع حجم النموذج؛ تزداد ذاكرة التدريب بسبب التدرجات وحالات المحسِّن (optimizer).
- كانت التكوينات الأساسية محدودة تاريخيًا بـ 2-4 آلاف توكن. تسمح مخططات المواضع الحديثة (RoPE) وتقنيات التوسيع (Position Interpolation, YaRN، وغيرها) بزيادة النافذة بأضعاف، ولكن على حساب عبء حسابي/ذاكرة إضافي. <sup>[\[43\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-43)[\[44\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-44)</sup>

### التحسينات الحديثة

- **FlashAttention.** انتباه دقيق يأخذ في الاعتبار التسلسل الهرمي لذاكرة GPU؛ يقلل من استهلاك الذاكرة ويسرع التدريب/الاستدلال مع التسلسلات الطويلة. <sup>[\[45\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-45)</sup>
- **تقليل وإدارة KV-cache.** تقلل Multi-Query Attention وGrouped-Query Attention من حجم ذاكرة التخزين المؤقت وحركة البيانات في الذاكرة؛ على مستوى الخادم، تزيد PagedAttention (vLLM) من الإنتاجية من خلال إدارة الذاكرة المؤقتة بنظام الصفحات. <sup>[\[46\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-46)[\[47\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-47)[\[48\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-48)</sup>
- **فك التشفير التكهني (Speculative Decoding).** يقترح نموذج مسودة (draft) تكملة للنص، ويقوم النموذج الرئيسي بالتحقق منها بسرعة؛ يتم تحقيق تسريع دون تغيير توزيع المخرجات. <sup>[\[49\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-49)</sup>

## Sparse Models and Mixture-of-Experts (MoE) - النماذج المتفرقة وخليط الخبراء

MoE هي طريقة لزيادة سعة النموذج دون زيادة متناسبة في الحسابات لكل توكن. بدلاً من كتلة FFN كبيرة واحدة في الطبقة، يتم استخدام مجموعة من "الخبراء" المتوازيين (عدة شبكات FFN مستقلة)، وتقوم شبكة توجيه قابلة للتدريب (gating network) باختيار أفضل k من الخبراء الأكثر صلة لكل توكن (عادة k=1–2؛ في بعض النماذج k=4). يتم تنشيط الخبراء المختارين فقط؛ ثم يتم ترجيح مخرجاتهم وجمعها. بهذه الطريقة، يمكن أن يصل إجمالي عدد المعاملات إلى مئات المليارات أو حتى تريليونات، ولكن في كل خطوة يتم استخدام جزء صغير فقط. <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-GLAM-51)</sup>

#### أمثلة على النماذج وحجمها

- **Switch Transformer (Google)**: يصل إلى ~1.6 تريليون معامل؛ توجيه top-1 (خبير واحد لكل توكن). أظهر أن MoE يسمح بزيادة السعة بشكل كبير بتكاليف مماثلة لكل توكن. <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1.2 تريليون معامل، 64 خبيرًا في الطبقة، top-2؛ لكل توكن يتم تنشيط ≈96.6 مليار معامل (≈8%). <sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: إجمالي ≈46.7 مليار معامل، ≈12.9 مليار معامل نشط لكل توكن، top-2. <sup>[\[52\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: إجمالي ≈141 مليار معامل، ≈39 مليار معامل نشط لكل توكن، top-2. <sup>[\[54\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: إجمالي 132 مليار معامل، ≈36 مليار معامل نشط لكل توكن؛ 16 خبيرًا وتوجيه top-4 (fine-grained MoE). <sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-DBRX-55)</sup>

##### المزايا

- تكلفة الحسابات تحددها عدد الخبراء النشطين k، وليس العدد الإجمالي للمعاملات: يمكن تدريب واستخدام نماذج بحجم تريليوني بتكاليف مماثلة لنماذج كثيفة أصغر بكثير. <sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-GLAM-51)</sup>
- التخصص: يتكيف الخبراء تلقائيًا مع اللغات/المجالات/الأنماط، مما يحسن الجودة في المهام متعددة المجالات.
- مرونة النشر: يمكن الاحتفاظ بالخبراء المستخدمين بشكل متكرر في الذاكرة وتحميل النادرين عند الحاجة (مع بنية تحتية مناسبة).

##### القيود

- موازنة الحمل: بدون تنظيم، قد "يلتصق" الموجِّه بجزء من الخبراء (router collapse). يتطلب الأمر خسائر مساعدة (load-balancing) ومخططات توجيه محسنة. <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Switch-50)</sup>
- تعقيد الحوسبة الموزعة: يتطلب توازي الخبراء (expert parallelism) وتبادل all-to-all؛ تصبح تكاليف الاتصال وإدارة الذاكرة عنق الزجاجة. <sup>[\[56\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-NVIDIA_MoE-56)</sup>
- استقرار التدريب: إعدادات الموجِّه وقيود السعة (capacity) مهمة، وإلا قد يحدث تدهور في الجودة/التقارب.

#### التحسينات الحديثة

- **توجيه Expert-Choice**: يختار الخبراء التوكنات، مما يحسن موازنة الحمل والتقارب بتكاليف مماثلة. <sup>[\[57\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-ExpertChoice-57)</sup>
- **Fine-grained MoE**: عدد أكبر من الخبراء الأصغر حجمًا (كما في DBRX) يوفر تخصصًا دقيقًا. <sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: تحويل نموذج كثيف إلى MoE من نقطة حفظه (checkpoint) يسمح بزيادة الجودة بشكل كبير بتكاليف معتدلة. <sup>[\[58\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-SparseUpcycling-58)</sup>

#### جدوى تطبيق MoE

- المساعدون الكبار متعددو المجالات بميزانية حوسبة محدودة.
- التدريب على مجموعات بيانات ضخمة حيث يوفر التخصص ميزة.
- السيناريوهات ذات البنية التحتية الموزعة المتقدمة (العديد من وحدات GPU/TPU والشبكات السريعة).

**متى تكون النماذج الكثيفة أفضل**: بنية تحتية محدودة (1-2 GPU)، متطلبات صارمة لزمن استجابة يمكن التنبؤ به وبساطة في النشر.

## Retrieval-Augmented Generation (RAG) - التوليد المعزز بالاسترجاع

RAG هو **نمط معماري لنظام** يُبنى حول LLM، وليس معمارية داخلية للنموذج نفسه. يجمع بين LLM (المكون التوليدي) وقاعدة معرفة خارجية (مكون الاسترجاع)، مما يسمح بالتعويض عن محدودية "الذاكرة البارامترية" للنموذج.

- **مبدأ العمل:** قبل التوليد، يسترجع LLM المستندات ذات الصلة من مصدر خارجي (ويكي، قاعدة معرفة للشركة، الويب) ويعتمد عليها عند صياغة الإجابة. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RAG-59)</sup>
- **المزايا:**
  - تقليل الهلوسة وتحسين الدقة الواقعية. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-60)</sup>
  - مواكبة المعلومات الحديثة دون إعادة تدريب النموذج بالكامل. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RAG-59)</sup>
  - إمكانية الاقتباس وتتبع مصادر الإجابات.
- **التطبيق:** المعيار الفعلي للمساعدين في الشركات والأنظمة التي تتطلب حقائق يمكن التحقق منها والعمل مع بيانات خاصة/متخصصة للغاية. <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RAG-59)</sup>

## آليات الانتباه والتعامل مع السياق

الانتباه الذاتي الأساسي له تعقيد تربيعي بالنسبة لطول التسلسل ($O(n^{2})$)، ولهذا السبب ظهرت تحسينات.

- **الانتباه المتفرق (Sparse Attention):** تقييد الانتباه بنوافذ/أنماط محلية. أمثلة: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-61)</sup>، **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-62)</sup>.
- **FlashAttention:** إعادة ترتيب ترتيب العمليات الحسابية مع مراعاة التسلسل الهرمي لذاكرة GPU؛ يحقق مكاسب كبيرة في الوقت والذاكرة وأصبح المعيار الفعلي عند تدريب LLM بسياق طويل<sup>[\[63\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-63)[\[64\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-64)[\[65\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-65)</sup>.
- **MQA/GQA (تسريع فك التشفير):** *Multi-Query Attention* (مفاتيح/قيم مشتركة لجميع الرؤوس) تقلل من حركة بيانات KV-cache<sup>[\[66\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-66)</sup>. *Grouped-Query Attention* توازن بين الجودة والسرعة<sup>[\[67\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-67)</sup>.
- **تمثيلات موضعية محسنة:**
  - **ALiBi (Attention with Linear Biases):** انحيازات خطية لدرجات الانتباه تحسن التعميم على الأطوال الكبيرة. <sup>[\[68\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** معلومات موضعية نسبية من خلال دوران Q/K؛ تُستخدم على نطاق واسع في النماذج الحديثة (مثل LLaMA). <sup>[\[69\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-69)[\[70\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-70)</sup>
  - **توسيع السياق لنماذج RoPE:** تقنيات مثل *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-71)</sup>، *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-72)</sup>، بالإضافة إلى تعديلات NTK-aware تسمح بزيادة نافذة السياق بكفاءة دون تغيير المعمارية.

<!-- -->

- **أساليب أخرى للتسلسلات الطويلة:**
  - **Transformer-XL:** ذاكرة متكررة بين الأجزاء لنمذجة التبعيات بعيدة المدى. <sup>[\[73\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-73)</sup>
  - **Reformer:** انتباه LSH وكتل متبقية قابلة للعكس لتوفير الذاكرة. <sup>[\[74\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-74)</sup>
  - **Performer:** تقريب خطي لانتباه softmax (FAVOR+). <sup>[\[75\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-75)</sup>
  - **Linformer:** تقريب منخفض الرتبة لمصفوفة الانتباه. <sup>[\[76\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-76)</sup>

## تحسينات النماذج والبنية التحتية للتدريب

لتدريب ونشر النماذج اللغوية الكبيرة، تُستخدم تقنيات وأطر عمل متخصصة.

- **التكميم (Quantization):** تقليل دقة الأوزان يقلل من استهلاك الذاكرة ويسرع الاستدلال. تسمح **QLoRA** بالضبط الدقيق الفعال لنماذج 4 بت (بما في ذلك 65B) بجودة قريبة من الدقة الكاملة<sup>[\[77\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-77)</sup>.
- **تقطير المعرفة (Knowledge Distillation):** تدريب *المعلم ← الطالب* للنماذج المدمجة<sup>[\[78\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-78)</sup>؛ مثال — **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-79)</sup>.
- **التدريب الموزع:**
  - **DeepSpeed** و**ZeRO** — توزيع المعاملات/التدرجات/حالات المحسِّن لتدريب نماذج بحجم تريليوني<sup>[\[80\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-80)</sup>.
  - **Megatron-LM** — توازي الموترات وخطوط الأنابيب للمحوِّلات الكبيرة جدًا<sup>[\[81\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-81)</sup>.
- **البيئة والأدوات:** يوفر **Hugging Face Transformers** و**Accelerate** تطبيقات قياسية للنماذج وتكاملًا مع DeepSpeed/FSDP للتدريب والاستدلال<sup>[\[82\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-82)[\[83\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-83)</sup>.

## قوانين التوسع والتدريب الأمثل حسابيًا (compute-optimal)

تُظهر **قوانين التوسع** التجريبية أن خطأ الانتروبيا المتقاطعة يتناقص بشكل أسي مع زيادة المعاملات والبيانات والحسابات. <sup>[\[84\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-84)</sup> أوضحت ورقة **Chinchilla** أنماط التدريب **الأمثل حسابيًا (compute-optimal)**: لتحقيق الكفاءة المثلى، يجب توسيع حجم النموذج وعدد توكنات التدريب معًا (مثال — نموذج 70B مدرب على ~1.4 تريليون توكن يتفوق على نماذج أكبر غير مدربة بشكل كافٍ). <sup>[\[85\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-85)</sup>

## State Space Models (SSM) - نماذج فضاء الحالة

**نماذج فضاء الحالة (SSM)** هي معمارية بديلة للمحوِّلات للتعامل مع التسلسلات الطويلة. تستعير أفكارًا من نظرية التحكم ومعالجة الإشارات الرقمية وتحل المشكلة الرئيسية للانتباه الذاتي: النمو التربيعي للحسابات مع زيادة طول النص.

### المشكلة الأساسية والحل

**مشكلة المحوِّلات.** المشكلة الرئيسية للمحوِّلات التقليدية هي التعقيد التربيعي للانتباه: نص أطول بـ 10 مرات يتطلب حسابات أكثر بـ 100 مرة تقريبًا.

**نهج SSM.** بدلاً من "الانتباه المتزامن لجميع الكلمات"، يمر النموذج عبر النص بشكل تسلسلي ويحافظ على **حالة ذاكرة** داخلية مدمجة يتم تحديثها في كل خطوة. نتيجة لذلك، ينمو الوقت واستهلاك الذاكرة بشكل خطي تقريبًا مع طول النص. في الوقت نفسه، يمكن إجراء التدريب بالتوازي — من خلال تمثيل نواة التفافية (convolutional kernel) (إنتاجية عالية على التسلسلات الطويلة). <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-S4-86)</sup>

### مبدأ العمل

يتم وصف SSM المتقطع بمعادلات الحالة والمخرج:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

حيث $x_{t}$ هي حالة الذاكرة، $u_{t}$ هو المدخل (التوكن)، $y_{t}$ هو المخرج. في SSM العميقة، يتم تحديد معاملات المصفوفات $A,B,C,D$ لضمان الاستقرار والحسابات الفعالة على التسلسلات الطويلة. يمكن اعتبار نفس الطبقة:

- متكررة (مسح خطوة بخطوة) — استدلال موفر للذاكرة بدون KV-cache؛
- التفافية (convolutional) — تدريب متوازٍ مع نواة محسوبة مسبقًا. <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-S4-86)</sup>

### المعماريات الأساسية والهجينة

- **S4 (Structured State Spaces).** الخط الأساسي لـ SSM مع تحديد مستقر لمعاملات مصفوفة الحالة؛ يظهر كفاءة على التسلسلات الطويلة جدًا. <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-S4-86)</sup>
- **Mamba.** SSM *انتقائية*: تعتمد قواعد تحديث الذاكرة على المدخل الحالي (يقرر النموذج بنفسه ما يجب "الاحتفاظ به في الذاكرة" وما يجب "نسيانه"). التنفيذ موجه نحو التسلسل الهرمي لذاكرة GPU؛ وفقًا للمؤلفين، يتم تحقيق زيادة مضاعفة في إنتاجية الاستدلال بتعقيد خطي بالنسبة للطول. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mamba-87)</sup>
- **RetNet.** آلية *الاحتفاظ (retention)* بثلاثة أوضاع: تدريب متوازٍ، استدلال متكرر، واستدلال متكرر بالكتل. الهدف هو الجمع بين التدريب السريع (مثل المحوِّلات) والاستدلال الاقتصادي (ذاكرة O(1) لكل توكن). <sup>[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RetNet-88)</sup>
- **الهجينة Attention+SSM.** مثال — **Jamba** (طبقات متناوبة من Transformer وMamba بالإضافة إلى MoE): يُقال إنه يدعم سياقات تصل إلى ~256 ألف توكن بمتطلبات ذاكرة أقل بكثير مقارنة بنماذج المحوِّلات البحتة من نفس الفئة. <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Jamba-89)</sup>

#### المزايا

- تعقيد خطي وتوفير في الذاكرة عند الاستدلال. لا يوجد انتباه ذاتي عالمي وKV-cache؛ يتم تخزين حالة مدمجة فقط. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RetNet-88)</sup>
- تدريب متوازٍ على التسلسلات الطويلة. يزيد الوضع الالتفافي من إنتاجية التدريب. <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-S4-86)</sup>
- كفاءة على مستوى العتاد. التنفيذات موجهة نحو التسلسل الهرمي الحديث للذاكرة (HBM/SRAM). <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mamba-87)</sup>
- سياقات طويلة وبث مستمر. نماذج SSM+Attention الهجينة عملية لمئات الآلاف من التوكنات بموارد معتدلة. <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Jamba-89)</sup>

#### القيود والممارسات الحالية

- نضج البيئة. الأدوات و"الوصفات" للتوسع (التعليمات، RLHF/DPO) لا تزال أقل تطورًا من مكدس المحوِّلات. <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mamba-87)</sup>
- الجودة والاستقرار. في بعض المهام، تُظهر النماذج الهجينة (Attention+SSM) توازنًا أكثر استقرارًا بين "الجودة/السرعة/الذاكرة" من نماذج SSM "النقية". <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Jamba-89)</sup>

#### مقارنة بين الأساليب (بشكل عام)

| الخاصية                    | المحوِّلات                | SSM              | الهجينة (Attention+SSM) |
|----------------------------|-------------------------|------------------|-------------------------|
| التعقيد بالنسبة للطول      | تربيعي (self-attention) | خطي (مسح/التفاف) | قريب من الخطي           |
| الذاكرة لكل توكن (استدلال) | ينمو KV-cache مع السياق | حالة O(1)        | نمو معتدل               |
| السياقات الطويلة           | تتطلب تحسينات خاصة      | دعم طبيعي        | عملية حتى ~256 ألف      |
| نضج البيئة                 | عالية                   | قيد التطوير      | قيد التطوير             |

#### التطبيقات العملية

- تحليل المستندات الطويلة جدًا (الكتب، التقارير، المراجعات العلمية).
- المعالجة المتدفقة وسيناريوهات المحادثة بتاريخ طويل دون زيادة تكلفة الذاكرة.
- البيئات ذات الموارد المحدودة (الأجهزة المحمولة/الطرفية).
- السلاسل الزمنية والبيانات التسلسلية الأخرى.

**النماذج الممثِّلة:** S4, Mamba, RetNet؛ الهجينة Attention+SSM (Jamba). <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Jamba-89)</sup>

## تطور المعماريات

- 2017 — نُشرت ورقة «Attention Is All You Need». قُدمت معمارية المحوِّل: الانتباه الذاتي متعدد الرؤوس والتضمينات الموضعية تسمح بتدريب النماذج بدون تكرار أو التفاف؛ ومع ذلك، فإن للانتباه تعقيدًا تربيعيًا بالنسبة لطول السياق.<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 — قُدمت GPT-1 وBERT. يستخدم GPT-1 مكدسًا من المُفكِّكات فقط مع انتباه سببي للتوليد ثم الضبط الدقيق؛ يقدم BERT مُشفِّرًا ثنائي الاتجاه وتدريبًا مسبقًا بأسلوب MLM لمهام فهم النص. <sup>[\[90\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-90)[\[91\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-91)</sup>

<!-- -->

- 2019 — اقتُرحت طرق للتعامل مع التسلسلات الطويلة وتم توسيع نطاق نماذج المُفكِّك فقط. يضيف Transformer-XL "ذاكرة" ومواضع نسبية لتجاوز النافذة الثابتة؛ يُظهر GPT-2 زيادة في قدرات التعلم بدون أمثلة (zero-shot) مع زيادة الحجم؛ يُظهر BART فعالية التدريب المسبق بإزالة التشويش (denoising) لمهام seq2seq. <sup>[\[92\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-92)[\[93\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-93)[\[94\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-94)</sup>

<!-- -->

- 2020 — تم توحيد تنسيق "text-to-text" وعرض أساليب للمستندات الطويلة. يصيغ T5 نهجًا موحدًا للمُشفِّر-المُفكِّك لمهام مختلفة؛ يستخدم Longformer وBigBird انتباهًا متفرقًا/منظمًا للنصوص الطويلة؛ يؤكد GPT-3 فعالية توسيع نطاق نماذج المُفكِّك فقط الكثيفة. <sup>[\[95\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-95)[\[96\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-96)[\[97\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-97)[\[98\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-98)</sup>

<!-- -->

- 2021 — تم تحسين التمثيلات الموضعية وإظهار تفريق المعاملات (MoE). تحسن RoPE وALiBi التعميم على الأطوال الكبيرة؛ ينشط Switch Transformer وGLaM جزءًا فقط من الخبراء لكل توكن، مما يزيد من السعة دون زيادة كبيرة في تكلفة الاستدلال. <sup>[\[99\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-99)[\[100\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-100)[\[101\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-101)[\[102\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-102)</sup>

<!-- -->

- 2022 — تم توضيح وضع التدريب الأمثل حسابيًا (compute-optimal) وتسريع الاستدلال على المُوجِّهات الطويلة. يُظهر Chinchilla فائدة عدد أكبر من توكنات التدريب مع حجم نموذج معتدل؛ يقلل PaLM مع Multi-Query Attention من حجم KV-cache؛ يسرع FlashAttention الانتباه على GPU. <sup>[\[103\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-103)[\[104\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-104)[\[105\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-105)[\[106\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-106)</sup>

<!-- -->

- 2023 — تمت زيادة نوافذ السياق دون تغيير الطبقات وتحسين خدمة الخادم. ترسخ سلسلة LLaMA الممارسات (RMSNorm, SwiGLU, RoPE)؛ توسع Position Interpolation وYaRN السياق؛ يدير vLLM/PagedAttention ذاكرة KV-cache بكفاءة أكبر. <sup>[\[107\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-107)[\[108\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-108)[\[109\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-109)[\[110\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-110)[\[111\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-111)[\[112\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-112)</sup>

<!-- -->

- 2023 — يُظهر GPT-4 وGemini معالجة وتوليدًا في وسائط متعددة ضمن عائلة نماذج واحدة. <sup>[\[113\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-113)[\[114\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-114)</sup>

<!-- -->

- 2023 — اقتُرحت نماذج فضاء الحالة (SSM). تعيد Mamba وRetNet المعالجة التسلسلية مع حالة مدمجة بدلاً من KV-cache وتضع الأساس للمعماريات الهجينة. <sup>[\[115\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-115)[\[116\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-116)</sup>

<!-- -->

- 2024 — نُشرت نماذج MoE مفتوحة المصدر ونماذج هجينة من Attention+SSM؛ تم تسريع الانتباه على وحدات GPU الجديدة. يؤكد Mixtral 8×7B/8×22B وDBRX على التطبيق العملي لـ MoE؛ يجمع Jamba بين Transformer وMamba للسياقات الطويلة جدًا؛ يزيد FlashAttention-3 من الإنتاجية. <sup>[\[117\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-117)[\[118\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-118)[\[119\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-119)[\[120\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-120)[\[121\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_note-121)</sup>

## روابط خارجية

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — شرح مرئي

## المراجع

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## ملاحظات

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%D9%85%D8%B9%D9%85%D8%A7%D8%B1%D9%8A%D8%A7%D8%AA_LLM#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
