---
title: "Large language model architectures — LLM आर्किटेक्चर"
source: "https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0"
wiki: "systems-analysis.info/int"
article: "Large_language_model_architectures_—_LLM_आर्किटेक्चर"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3782
wiki_created_at: 2026-09-06T23:25:57Z
wiki_modified_at: 2026-09-06T23:25:57Z
downloaded_at: 2026-09-07T22:58:55Z
---

# Large language model architectures — LLM आर्किटेक्चर

**बड़े भाषा मॉडलों (LLM) की आर्किटेक्चर** — ये वे मूलभूत सिद्धांत और संरचनाएँ हैं जो यह निर्धारित करती हैं कि बड़े भाषा मॉडल कैसे बनाए जाते हैं, प्रशिक्षित होते हैं और कार्य करते हैं। आधुनिक LLM, जो मानवीय भाषा को समझने और उत्पन्न करने में सक्षम हैं, लगभग पूर्णतः **Transformer** आर्किटेक्चर<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)</sup> पर आधारित हैं, किंतु इनमें अनेक सुधार और विविध दृष्टिकोण शामिल हैं जो दक्षता, मापनीयता और क्षमताओं को बढ़ाने के उद्देश्य से विकसित किए गए हैं।

## LLM आर्किटेक्चर के परिवार (Transformer)

आधुनिक बड़े भाषा मॉडल Transformer आर्किटेक्चर<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)</sup> पर आधारित हैं, किंतु उद्देश्य के अनुसार इसका उपयोग भिन्न-भिन्न तरीके से होता है: पाठ को समझना, उसका विस्तार उत्पन्न करना या एक पाठ को दूसरे में रूपांतरित करना। व्यवहार में Transformer के मूलभूत सिद्धांतों को बनाए रखते हुए तीन परिवार प्रतिष्ठित किए जाते हैं<sup>[\[2\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-2)[\[3\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-3)[\[4\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-4)</sup>।

### 1. Encoder‑only (केवल एन्कोडर)

मॉडल केवल एन्कोडर स्टैक का उपयोग करता है और संपूर्ण इनपुट पाठ को द्विदिशीय रूप से देखता है। प्री-ट्रेनिंग सामान्यतः masked‑language modeling (MLM, मास्किंग-सहित भाषा मॉडलिंग) के रूप में निर्मित होती है: कुछ token छिपाए जाते हैं और मॉडल उन्हें आसपास के संदर्भ से पुनर्स्थापित करना सीखता है। द्विदिशीय संदर्भ के कारण ऐसे मॉडल समझ और स्कोरिंग के कार्यों में सशक्त होते हैं: वर्गीकरण, इकाई पहचान, दस्तावेज़ पुनर्क्रमांकन और निष्कर्षणात्मक QA। स्वतः-प्रत्यावर्ती पीढ़ी के लिए ये "शून्य से" नहीं बने हैं।

व्यवहार में encoder‑only परिवार के लिए वैकल्पिक प्री-ट्रेनिंग लक्ष्य भी प्रयुक्त होते हैं: *ELECTRA में replaced token detection (RTD)* (discriminator मॉडल प्रतिस्थापित token को पहचानता है) और शब्दार्थ खोज/रिट्रीवर के लिए bi-एन्कोडर का *contrastive learning* (Dense Passage Retrieval की तरह "क्वेरी-दस्तावेज़" युग्मों पर InfoNCE/softmax‑loss)। RAG में उपयोग के दौरान encoder‑only या तो *bi-एन्कोडर* (त्वरित ANN-खोज के लिए क्वेरी और दस्तावेज़ का पृथक एन्कोडिंग) या *cross-एन्कोडर* (सटीक पुनर्क्रमांकन के लिए युग्म का संयुक्त एन्कोडिंग) की भूमिका निभाते हैं।

**लाभ:**

- द्विदिशीय संदर्भ के कारण पाठ समझ की उच्च गुणवत्ता: वर्गीकरण, NER, तथ्य निष्कर्षण, पुनर्क्रमांकन, निष्कर्षणात्मक QA।
- समानांतर प्रसंस्करण और उच्च थ्रूपुट: स्वतः-प्रत्यावर्तन के बिना एकल फॉरवर्ड पास; सामूहिक स्कोरिंग को बैच करना सुविधाजनक।
- खोज और RAG के साथ स्वाभाविक एकीकरण: bi-एन्कोडर की भूमिका में — त्वरित शब्दार्थ खोज; cross-एन्कोडर की भूमिका में — सटीक पुनर्क्रमांकन।
- कुशल अनुकूलन: लक्षित fine-tuning के बाद अपेक्षाकृत संक्षिप्त संस्करण (≈100–300 मिलियन पैरामीटर; BERT‑base ≈110 मिलियन) उच्च गुणवत्ता देते हैं।
- स्थिर विलंबता जो उत्पन्न उत्तर की लंबाई पर निर्भर नहीं (कोई चरण-दर-चरण डिकोडिंग नहीं); बड़े संग्रहों के ऑफलाइन-स्कोरिंग के लिए उपयुक्त।
- सापेक्ष/घूर्णन स्थितियों और/या स्थानीय-विरल attention के माध्यम से एन्कोडर की context window बढ़ाने की संभावना (जैसे Longformer/BigBird), जो लंबे दस्तावेज़ों के लिए उपयोगी है।

**कमियाँ:**

- अपनी कोई जनरेटिव क्षमता नहीं: संवाद और विस्तृत उत्तरों के लिए decoder या बाहरी जनरेटिव मॉड्यूल आवश्यक।
- इंटरेक्टिव परिदृश्यों में सीमितता: स्थिति-संरक्षण के साथ चरण-दर-चरण पीढ़ी नहीं।
- प्री-ट्रेनिंग लक्ष्य और स्वतंत्र पीढ़ी कार्यों में असंगति: MLM कारण-आधारित मॉडलिंग की तुलना में पीढ़ी के साथ कम संगत।
- ऐतिहासिक रूप से सीमित context window (अक्सर पूर्ण स्थिति के आधार संरचनाओं में 512 token); विस्तार के लिए विशेष स्थिति/attention योजनाओं और/या fine-tuning की आवश्यकता।
- रिट्रीवल कार्यों के लिए bi-एन्कोडर और/या cross-एन्कोडर का अलग contrastive fine-tuning आवश्यक; इसके बिना खोज/पुनर्क्रमांकन की गुणवत्ता विशेष रूप से प्रशिक्षित मॉडलों से सामान्यतः कम होती है।

**प्रतिनिधि मॉडल:** BERT और इसके व्युत्पन्न, तथा RoBERTa और DeBERTa (encoder‑only के विस्तारित संस्करण); वैकल्पिक प्री-ट्रेनिंग लक्ष्यों में — ELECTRA (RTD)। <sup>[\[5\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-5)[\[6\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-6)[\[7\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-7)[\[8\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-8)[\[9\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-9)[\[10\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-10)</sup>

### 2. Decoder‑only (केवल डिकोडर)

केवल decoder स्टैक का उपयोग होता है जिसमें कारण-आधारित (बाएँ-दिशा) attention होती है: मॉडल पहले से दिए गए prefix के आधार पर अगले token की भविष्यवाणी करता है। यह प्रशिक्षण मोड — causal language modeling (CLM) — इन मॉडलों को पीढ़ी के लिए स्वाभाविक विकल्प बनाता है: संवाद, विस्तृत उत्तर, रचनात्मक पाठ, प्रोग्राम कोड। समझौता — लंबे prompt पर विलंब और KV-cache का आकार बढ़ना। व्यवहार में decoder‑only के लिए इंजीनियरिंग तकनीकें व्यापक रूप से प्रयुक्त होती हैं: MQA और GQA द्वारा KV-cache में कमी, speculative decoding और सर्वर अनुकूलन (PagedAttention/vLLM, continuous batching, chunked prefill) द्वारा अनुमान गति में वृद्धि।<sup>[\[11\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-11)[\[12\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-12)[\[13\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-13)[\[14\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-14)[\[15\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-15)</sup>

**लाभ:**

- स्वाभाविक पाठ पीढ़ी (CLM): सशक्त zero‑shot और few‑shot क्षमताएँ; अच्छी तरह मापनीय।<sup>[\[16\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-16)</sup>
- उपयोग की बहुमुखिता: एक मॉडल prompt में निर्देशों और उदाहरणों से अनेक कार्य हल करता है; RAG और tool use के साथ स्वाभाविक संयोजन।
- परिपक्व पारिस्थितिकी तंत्र: instructional fine-tuning और व्यवहार संरेखण की प्रथाएँ (RLHF, DPO); खुले और व्यावसायिक कार्यान्वयन उपलब्ध।<sup>[\[17\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-17)[\[18\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-18)</sup>
- inference अनुकूलन का समृद्ध स्टैक: MQA/GQA KV-cache का आकार घटाते हैं और थ्रूपुट बढ़ाते हैं; speculative decoding वितरण बदले बिना अनुमान गति बढ़ाता है; PagedAttention/vLLM के साथ continuous batching और chunked prefill GPU उपयोग दक्षता बढ़ाते हैं।<sup>[\[19\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-19)[\[20\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-20)[\[21\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-21)[\[22\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-22)[\[23\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-23)</sup>
- कड़े उत्तर प्रारूपों (JSON/SQL/DSL) के लिए structured generation का समर्थन, जो सूचना प्रणालियों और API के साथ एकीकरण को सरल बनाता है।<sup>[\[24\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-24)[\[25\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-25)</sup>

**कमियाँ:**

- पीढ़ी की बढ़ी हुई विलंबता: क्रमिक अनुमान; नए token की लागत पहले से "पढ़े" संदर्भ की लंबाई (KV-cache) के साथ बढ़ती है।
- "लंबा इनपुट – छोटा आउटपुट" प्रोफ़ाइल (सारांशीकरण, अनुवाद) में encoder–decoder की तुलना में कम लाभदायक, जहाँ इनपुट एक बार एन्कोड होता है।
- एकदिशीय संदर्भ की सीमा: समझ के कार्यों में कभी-कभी द्विदिशीय प्रतिनिधित्व वाले मॉडलों (encoder‑only / encoder–decoder) से पीछे।
- लंबे prompt और बड़े batch पर KV-cache की मेमोरी "बाधक" हो सकती है; <sup>[\[26\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-26)</sup>
- activation/KV का क्वांटीकरण (INT8/FP8) अनुमान गति बढ़ाता है, किंतु लंबे संदर्भ/कोड पर गुणवत्ता घटा सकता है; सावधान सत्यापन आवश्यक (विशेषतः कड़े SLA के साथ)।

**प्रतिनिधि मॉडल:** GPT‑3, GPT‑4 (आर्किटेक्चर और dataset विवरण सार्वजनिक रूप से उपलब्ध नहीं), LLaMA और *Llama 3* (8B/70B, 2024)।<sup>[\[27\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-27)[\[28\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-28)[\[29\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-29)[\[30\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-30)</sup>

### 3. Encoder–decoder (एन्कोडर-डिकोडर)

यह आर्किटेक्चर दोनों घटकों को संयुक्त करती है। एन्कोडर द्विदिशीय मोड में कार्य करता है, और decoder — कारण-आधारित। एन्कोडर एक बार इनपुट का विश्लेषण करता है और उसका प्रतिनिधित्व बनाता है; decoder इस प्रतिनिधित्व को cross‑attention के माध्यम से उपयोग करते हुए आउटपुट उत्पन्न करता है। यह पृथक दृष्टिकोण विशेष रूप से तब उपयोगी होता है जब लंबे इनपुट पाठ को छोटे आउटपुट में रूपांतरित करना हो: मशीन अनुवाद, सारांशीकरण, दस्तावेज़-आधारित प्रश्नोत्तर। यद्यपि विधि को अधिक कुल वैकल्पिक लागत (दो स्टैक और cross-attention) की आवश्यकता होती है, इसका लाभ — पूर्ण स्रोत पाठ विश्लेषण के आधार पर नियंत्रित पीढ़ी; साथ ही एन्कोडिंग एक बार होती है और अनुमान की पूरी प्रक्रिया में पुनः उपयोग होती है।

**लाभ:**

- सशर्त पीढ़ी: decoder इनपुट के प्रतिनिधित्व को cross‑attention का उपयोग करता है। <sup>[\[31\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-31)</sup>
- "लंबा इनपुट → छोटा आउटपुट" परिदृश्य में दक्षता: इनपुट एक बार एन्कोड होता है।
- "text‑to‑text" प्रारूप और नियंत्रित अनुमान (कार्य prefix, विशेष निर्देश) के लिए सुविधाजनक। <sup>[\[32\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-32)</sup>
- लंबे स्रोत के साथ स्थिरता और दक्षता: डिकोडिंग चरण में केवल आउटपुट पर self‑attention बढ़ता है, जबकि cross‑attention एन्कोडर की निश्चित keys/values पुनः उपयोग करता है (प्रत्येक चरण पर इनपुट "पुनः पढ़ा" नहीं जाता)।

**कमियाँ:**

- दो स्टैक प्रशिक्षण और उपयोग में मेमोरी और गणना की आवश्यकताएँ बढ़ाते हैं।
- अत्यंत लंबी अनुक्रमों पर कुल विलंब decoder‑only से तुलनीय; स्वतः-प्रत्यावर्तन बाधा बना रहता है।
- decoder‑only की तुलना में कम सार्वभौमिक chat मॉडल; अक्सर विशिष्ट कार्यों के लिए उच्च-गुणवत्ता seq2seq इंजन के रूप में उपयोग।
- बहुत लंबे इनपुट पर decoder के प्रत्येक layer में cross‑attention keys/values (पूरे स्रोत पर) की मेमोरी बढ़ती है, जिसके लिए सावधान सर्विंग योजना आवश्यक।

**प्रतिनिधि मॉडल:** T5 (T5 v1.1 सहित और *FLAN‑T5* में instructional fine-tuning की प्रथा) और BART। <sup>[\[33\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-33)[\[34\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-34)[\[35\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-35)</sup>

## Dense Transformer - प्लॉट (घना) Transformer

LLM की सर्वाधिक प्रचलित क्लासिक आर्किटेक्चर: प्रत्येक token के प्रसंस्करण में मॉडल के लगभग सभी पैरामीटर भाग लेते हैं। विरल दृष्टिकोणों (जैसे Mixture‑of‑Experts) के विपरीत, उपनेटवर्क का चयनात्मक सक्रियण नहीं है — प्रत्येक ब्लॉक प्रत्येक token के लिए कार्य करता है। <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)</sup>

### कार्य सिद्धांत और आर्किटेक्चर

**मूल संरचना।** मॉडल — N एकसमान Transformer ब्लॉकों का स्टैक। प्रत्येक ब्लॉक में शामिल हैं:

1.  **बहु-शीर्ष स्व-attention (Multi‑Head Self‑Attention)।** प्रत्येक token के लिए तीन वेक्टर गणित किए जाते हैं: Q (query), K (key), V (value); attention परिभाषित होता है $\operatorname{softmax}\!\left( \frac{QK^{\top} + M}{\sqrt{d_{k}}} \right) \cdot V$ के रूप में, जहाँ $M$ — mask (कारण-आधारित और/या padding-mask) जो अस्वीकार्य स्थितियों को बाहर करती है। कई "attention शीर्ष" समानांतर में संदर्भ के विभिन्न पहलुओं को ध्यान में रखते हैं (H शीर्ष, सामान्यतः $d_{head} = \frac{d_{model}}{H}$); उनकी संख्या मॉडल के पैमाने के साथ बढ़ती है। <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)</sup>
2.  **पूर्ण-संयोजित नेटवर्क (Feed‑Forward Network, FFN)।** दो रैखिक परतें जिनके बीच अरैखिकता है (सामान्यतः GELU/SiLU; कुछ आधुनिक मॉडलों में — SwiGLU)। मध्यवर्ती आयाम सामान्यतः $\approx 4\, d_{model}$; SwiGLU उपयोग करते समय तुलनीय पैरामीटर संख्या बनाए रखने के लिए अक्सर $\approx \frac{8}{3}\, d_{model}$ लेते हैं। FFN में पैरामीटर का महत्वपूर्ण अनुपात होता है। <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-36)</sup>

**अतिरिक्त घटक।** अवशिष्ट (residual) संयोजन और परत सामान्यीकरण उपयोग होते हैं; आधुनिक LLM में अक्सर Pre‑LN (उप-ब्लॉक से पहले सामान्यीकरण) का उपयोग होता है — यह बड़ी गहराई पर प्रशिक्षण स्थिरता सुधारता है। क्लासिक LayerNorm के अलावा **RMSNorm** का उपयोग और अधिक हो रहा है (गणना लागत घटाती है और बड़े मॉडलों में अच्छा काम करती है); कुछ परिवारों में attention स्थान में सामान्यीकरण भी प्रयुक्त होता है (जैसे softmax से पहले Q/K का सामान्यीकरण)। स्थितीय प्रतिनिधित्व पूर्ण या सापेक्ष हो सकते हैं; लंबे संदर्भ के लिए RoPE वास्तविक मानक बन गया है।

##### मॉडल उदाहरण और पैमाना

- BERT‑Large: 24 परतें, आयाम 1024, 16 attention शीर्ष, ≈340 मिलियन पैरामीटर। <sup>[\[37\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-37)</sup>
- GPT‑3 (175B): 96 परतें, आयाम 12288, 96 attention शीर्ष, ≈175 अरब पैरामीटर। <sup>[\[38\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-38)</sup>
- LLaMA‑65B: 80 परतें, आयाम 8192, 64 attention शीर्ष, ≈65 अरब पैरामीटर। <sup>[\[39\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-39)</sup>
- PaLM‑540B: 118 परतें, आयाम लगभग 18432, ≈540 अरब पैरामीटर। <sup>[\[40\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-40)</sup>

##### लाभ

- एकसमान ब्लॉक, अच्छी तरह अध्ययन किए गए प्रशिक्षण मोड और पैमाने पर पूर्वानुमेय व्यवहार।
- पैरामीटर और डेटा बढ़ने पर गुणवत्ता घातांकीय रूप से सुधरती है; compute‑optimal मोड मॉडल आकार और प्रशिक्षण token की मात्रा का संयुक्त वृद्धि मानता है। <sup>[\[41\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-41)[\[42\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-42)</sup>
- fine-tuning के बाद एक ही आर्किटेक्चर परत-स्तर परिवर्तन के बिना कार्यों की विस्तृत श्रृंखला कवर करती है।

##### कमियाँ

- पूर्ण self‑attention की अनुक्रम लंबाई पर द्विघात जटिलता है ($O(n^{2})$), जो context window को सीमित करती है। <sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)</sup>
- पीढ़ी चरण में पैरामीटर का पूर्ण सक्रियण: MoE के बिना decoder में प्रति token अनुमान लागत लगभग पैरामीटर संख्या के समानुपाती बढ़ती है।
- बाधा — मेमोरी बैंडविड्थ (memory‑bound): HBM से वजन लोडिंग अक्सर inference गति को सीमित करती है।

##### मापनीयता और संदर्भ की सीमाएँ

- पैरामीटर के लिए मेमोरी मॉडल आकार के साथ रैखिक रूप से बढ़ती है; प्रशिक्षण मेमोरी gradient और optimizer अवस्थाओं के कारण बढ़ती है।
- मूल संरचनाएँ ऐतिहासिक रूप से 2–4 हजार token तक सीमित थीं। आधुनिक स्थितीय योजनाएँ (RoPE) और विस्तार तकनीकें (Position Interpolation, YaRN आदि) window को कई गुना और अधिक बढ़ाने की अनुमति देती हैं, किंतु अतिरिक्त गणना/मेमोरी भार के साथ। <sup>[\[43\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-43)[\[44\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-44)</sup>

### आधुनिक अनुकूलन

- **FlashAttention।** GPU मेमोरी पदानुक्रम को ध्यान में रखते हुए सटीक attention; लंबी अनुक्रमों पर मेमोरी लागत घटाता है और प्रशिक्षण/inference तेज़ करता है। <sup>[\[45\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-45)</sup>
- **KV-cache में कमी और प्रबंधन।** Multi‑Query Attention और Grouped‑Query Attention cache का आकार और मेमोरी ट्रैफ़िक घटाते हैं; सर्वर स्तर पर PagedAttention (vLLM) पृष्ठ-आधारित cache प्रबंधन द्वारा थ्रूपुट बढ़ाता है। <sup>[\[46\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-46)[\[47\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-47)[\[48\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-48)</sup>
- **Speculative decoding।** Draft मॉडल विस्तार प्रस्तावित करता है, और मुख्य मॉडल उसे शीघ्र सत्यापित करता है; आउटपुट वितरण बदले बिना गति में वृद्धि होती है। <sup>[\[49\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-49)</sup>

## Sparse Models और Mixture‑of‑Experts (MoE)

MoE — प्रति token गणना के आनुपातिक वृद्धि के बिना मॉडल क्षमता बढ़ाने का एक तरीका। एक बड़े FFN-ब्लॉक के स्थान पर परत में समानांतर "विशेषज्ञों" का समूह (कई स्वतंत्र FFN) उपयोग होता है, और प्रशिक्षण योग्य राउटर (gating network) प्रत्येक token के लिए top‑k सर्वाधिक प्रासंगिक विशेषज्ञों का चयन करता है (सामान्यतः k=1–2; कुछ मॉडलों में k=4)। केवल चुने गए विशेषज्ञ सक्रिय होते हैं; उनके आउटपुट भारित और संकलित होते हैं। इस प्रकार कुल पैरामीटर सैकड़ों अरब और यहाँ तक कि खरबों हो सकते हैं, किंतु प्रत्येक चरण में केवल छोटा अंश सक्रिय होता है। <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-GLAM-51)</sup>

#### मॉडल उदाहरण और पैमाना

- **Switch Transformer (Google)**: ~1.6T पैरामीटर तक; top‑1 रूटिंग (प्रति token एक विशेषज्ञ)। दर्शाया कि MoE प्रति token तुलनीय लागत पर क्षमता तेज़ी से बढ़ा सकता है। <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1.2T पैरामीटर, परत में 64 विशेषज्ञ, top‑2; प्रत्येक token पर ≈96.6B पैरामीटर सक्रिय (≈8%)। <sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: कुल ~46.7B पैरामीटर, प्रति token ≈12.9B सक्रिय, top‑2। <sup>[\[52\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: कुल ~141B पैरामीटर, प्रति token ≈39B सक्रिय, top‑2। <sup>[\[54\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: कुल 132B पैरामीटर, प्रति token ≈36B सक्रिय; 16 विशेषज्ञ और top‑4 रूटिंग (fine‑grained MoE)। <sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-DBRX-55)</sup>

##### लाभ

- गणना की लागत सक्रिय विशेषज्ञों की संख्या k से निर्धारित होती है, कुल पैरामीटर से नहीं: अनुमान लागत के साथ खरब पैमाने के मॉडल प्रशिक्षित और उपयोग किए जा सकते हैं जो उल्लेखनीय रूप से छोटे dense मॉडलों से तुलनीय हो। <sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-GLAM-51)</sup>
- विशेषज्ञता: विशेषज्ञ स्वतः भाषाओं/डोमेन/पैटर्न के अनुसार "समायोजित" होते हैं, बहु-डोमेन कार्यों में गुणवत्ता सुधरती है।
- लचीला परिनियोजन: अक्सर उपयोग किए जाने वाले विशेषज्ञों को मेमोरी में रख सकते हैं और दुर्लभ विशेषज्ञों को लोड कर सकते हैं (उपयुक्त अवसंरचना के साथ)।

##### सीमाएँ

- भार संतुलन: नियमितीकरण के बिना राउटर विशेषज्ञों के एक हिस्से पर "अटक" सकता है (router collapse)। auxiliary losses (load‑balancing) और बेहतर रूटिंग योजनाएँ आवश्यक। <sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Switch-50)</sup>
- वितरित गणना की जटिलता: expert parallelism और all‑to‑all आदान-प्रदान आवश्यक; संचार overhead और मेमोरी प्रबंधन बाधक बनते हैं। <sup>[\[56\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-NVIDIA_MoE-56)</sup>
- प्रशिक्षण स्थिरता: router और क्षमता (capacity) बाधाओं की सेटिंग महत्वपूर्ण, अन्यथा गुणवत्ता/अभिसरण में गिरावट संभव।

#### आधुनिक सुधार

- **Expert‑Choice routing**: विशेषज्ञ token "चुनते" हैं, जो तुलनीय लागत पर संतुलन और अभिसरण सुधारता है। <sup>[\[57\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-ExpertChoice-57)</sup>
- **Fine‑grained MoE**: अधिक संख्या में छोटे विशेषज्ञ (जैसे DBRX में) विशेषज्ञता की बारीक दानेदारी देते हैं। <sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: dense मॉडल को उसके checkpoint से MoE में परिवर्तन मध्यम लागत पर गुणवत्ता में उल्लेखनीय वृद्धि की अनुमति देता है। <sup>[\[58\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-SparseUpcycling-58)</sup>

#### MoE के उपयोग की उचितता

- सीमित compute बजट पर बड़े बहु-डोमेन सहायक।
- विशाल corpus पर प्रशिक्षण, जहाँ विशेषज्ञता लाभ देती है।
- विकसित वितरित अवसंरचना वाले परिदृश्य (अनेक GPU/TPU और तेज़ नेटवर्क)।

**Dense मॉडल कब बेहतर**: सीमित अवसंरचना (1–2 GPU), अनुमानित विलंब और सरल परिनियोजन की कड़ी आवश्यकताएँ।

## Retrieval‑Augmented Generation (RAG)

RAG — यह LLM के इर्द-गिर्द **प्रणाली का आर्किटेक्चरल पैटर्न** है, न कि स्वयं मॉडल की आंतरिक आर्किटेक्चर। यह LLM (जनरेटिव घटक) को बाहरी ज्ञान आधार (निष्कर्षण घटक) के साथ जोड़ता है, जो मॉडल की "पैरामीट्रिक मेमोरी" की सीमाओं को क्षतिपूरित करने की अनुमति देता है।

- **कार्य सिद्धांत:** पीढ़ी से पहले LLM बाहरी स्रोत (विकी, कॉर्पोरेट ज्ञान आधार, वेब) से प्रासंगिक दस्तावेज़ निकालता है और उत्तर बनाते समय उन पर निर्भर करता है। <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RAG-59)</sup>
- **लाभ:**
  - भ्रम (hallucination) में कमी और तथ्यात्मक सटीकता में सुधार। <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-60)</sup>
  - मॉडल के पूर्ण पुनः-प्रशिक्षण के बिना अद्यतनता। <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RAG-59)</sup>
  - उत्तरों की उद्धरण-योग्यता और पता लगाने योग्यता।
- **उपयोग:** कॉर्पोरेट सहायकों और उन प्रणालियों के लिए वास्तविक मानक जहाँ सत्यापन योग्य तथ्य और निजी/अत्यंत विशिष्ट डेटा के साथ कार्य आवश्यक है। <sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RAG-59)</sup>

## Attention तंत्र और संदर्भ के साथ कार्य

मूल self‑attention की अनुक्रम लंबाई पर द्विघात जटिलता है ($O(n^{2})$), इसलिए अनुकूलन उत्पन्न हुए।

- **Sparse Attention (विरल attention):** attention को स्थानीय windows/patterns तक सीमित करना। उदाहरण: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-61)</sup>, **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-62)</sup>।
- **FlashAttention:** GPU मेमोरी पदानुक्रम को ध्यान में रखते हुए गणना क्रम का पुनर्गठन; समय और मेमोरी में महत्वपूर्ण लाभ देता है और लंबे संदर्भ के साथ LLM प्रशिक्षण में वास्तविक मानक बन गया है<sup>[\[63\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-63)[\[64\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-64)[\[65\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-65)</sup>।
- **MQA/GQA (डिकोडिंग त्वरण):** *Multi‑Query Attention* (सभी शीर्षों के लिए साझा keys/values) KV-cache ट्रैफ़िक घटाता है<sup>[\[66\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-66)</sup>। *Grouped‑Query Attention* गुणवत्ता/गति संतुलन बनाता है<sup>[\[67\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-67)</sup>।
- **बेहतर स्थितीय प्रतिनिधित्व:**
  - **ALiBi (Attention with Linear Biases):** attention स्कोर में रैखिक विस्थापन बड़ी लंबाइयों पर सामान्यीकरण सुधारते हैं। <sup>[\[68\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** Q/K के घुमाव के माध्यम से सापेक्ष स्थितीय जानकारी; आधुनिक मॉडलों में व्यापक रूप से उपयोग (जैसे LLaMA)। <sup>[\[69\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-69)[\[70\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-70)</sup>
  - **RoPE-मॉडलों के लिए संदर्भ विस्तार:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-71)</sup>, *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-72)</sup>, तथा NTK-aware संशोधन आर्किटेक्चर बदले बिना context window प्रभावी ढंग से बढ़ाने की अनुमति देते हैं।

<!-- -->

- **लंबी अनुक्रमों के अन्य दृष्टिकोण:**
  - **Transformer‑XL:** दूरस्थ निर्भरताओं के मॉडलिंग के लिए खंडों के बीच आवर्ती मेमोरी। <sup>[\[73\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-73)</sup>
  - **Reformer:** मेमोरी बचाने के लिए LSH‑attention और उत्क्रमणीय residual ब्लॉक। <sup>[\[74\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-74)</sup>
  - **Performer:** softmax‑attention का रैखिक सन्निकटन (FAVOR+)। <sup>[\[75\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-75)</sup>
  - **Linformer:** attention मैट्रिक्स का निम्न-रैंक सन्निकटन। <sup>[\[76\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-76)</sup>

## मॉडल अनुकूलन और प्रशिक्षण अवसंरचना

LLM के प्रशिक्षण और परिनियोजन के लिए विशेष तकनीकें और framework उपयोग होते हैं।

- **Quantization (परिमाणीकरण):** वजन की बिट-गहराई कम करना मेमोरी घटाता है और inference तेज़ करता है। **QLoRA** 4-बिट मॉडलों (65B सहित) को पूर्ण-सटीकता के करीब गुणवत्ता के साथ प्रभावी ढंग से fine-tune करने की अनुमति देता है<sup>[\[77\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-77)</sup>।
- **Knowledge Distillation (ज्ञान आसवन):** संक्षिप्त मॉडलों के लिए *Teacher→Student*-प्रशिक्षण<sup>[\[78\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-78)</sup>; उदाहरण — **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-79)</sup>।
- **वितरित प्रशिक्षण:**
  - **DeepSpeed** और **ZeRO** — खरब मॉडलों के प्रशिक्षण के लिए पैरामीटर/gradient/optimizer अवस्थाओं का वितरण<sup>[\[80\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-80)</sup>।
  - **Megatron‑LM** — बहुत बड़े Transformer के लिए tensor और pipeline parallelism<sup>[\[81\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-81)</sup>।
- **पारिस्थितिकी तंत्र और उपकरण:** **Hugging Face Transformers** और **Accelerate** मॉडलों के मानक कार्यान्वयन और प्रशिक्षण व inference के लिए DeepSpeed/FSDP के साथ एकीकरण प्रदान करते हैं<sup>[\[82\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-82)[\[83\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-83)</sup>।

## Scaling Laws और Compute‑Optimal प्रशिक्षण

अनुभवजन्य **scaling laws** दर्शाते हैं कि cross-entropy त्रुटि पैरामीटर, डेटा और गणना बढ़ने पर घातांकीय नियम से घटती है। <sup>[\[84\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-84)</sup> **Chinchilla** कार्य ने **compute‑optimal** मोड को परिष्कृत किया: इष्टतम दक्षता के लिए मॉडल आकार और प्रशिक्षण token की संख्या संयुक्त रूप से बढ़ाई जानी चाहिए (उदाहरण — 70B मॉडल ~1.4T token पर प्रशिक्षित, बड़े अल्प-प्रशिक्षित मॉडलों से बेहतर)। <sup>[\[85\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-85)</sup>

## State Space Models (SSM) - स्थिति स्थान मॉडल

**State Space Models (SSM)** — लंबी अनुक्रमों के साथ कार्य के लिए Transformer का वैकल्पिक आर्किटेक्चर। यह नियंत्रण सिद्धांत और डिजिटल सिग्नल प्रसंस्करण से विचार उधार लेता है और self‑attention की मुख्य समस्या हल करता है: पाठ लंबाई बढ़ने पर गणना की द्विघात वृद्धि।

### मुख्य समस्या और समाधान

**Transformer की समस्या।** पारंपरिक Transformer की मुख्य समस्या — attention की द्विघात जटिलता: 10 गुना लंबे पाठ के लिए लगभग 100 गुना अधिक गणना आवश्यक।

**SSM का दृष्टिकोण।** "सभी शब्दों पर एक साथ attention" के बजाय मॉडल पाठ पर क्रमिक रूप से चलता है और एक संक्षिप्त आंतरिक **मेमोरी अवस्था** बनाए रखता है जो प्रत्येक चरण पर अद्यतन होती है। परिणामस्वरूप समय और मेमोरी खपत पाठ लंबाई के साथ लगभग रैखिक रूप से बढ़ती है। साथ ही प्रशिक्षण समानांतर रूप से किया जा सकता है — kernel के convolution प्रतिनिधित्व के माध्यम से (लंबी अनुक्रमों पर उच्च थ्रूपुट)। <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-S4-86)</sup>

### कार्य सिद्धांत

विवेकी SSM अवस्था और आउटपुट समीकरणों द्वारा वर्णित है:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

जहाँ $x_{t}$ — मेमोरी अवस्था, $u_{t}$ — इनपुट (token), $y_{t}$ — आउटपुट। गहरी SSM में मैट्रिक्स $A,B,C,D$ को इस प्रकार पैरामीट्रीकृत किया जाता है ताकि लंबी अनुक्रमों पर स्थिरता और कुशल गणना सुनिश्चित हो। उसी परत को माना जा सकता है:

- आवर्ती (चरणों पर स्कैन) — KV-cache के बिना मेमोरी-कुशल inference;
- convolution — पूर्व-गणित kernel के साथ समानांतर प्रशिक्षण। <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-S4-86)</sup>

### मुख्य आर्किटेक्चर और हाइब्रिड

- **S4 (Structured State Spaces)।** अवस्था मैट्रिक्स के स्थिर पैरामीट्रीकरण के साथ SSM baseline; बहुत लंबी अनुक्रमों पर दक्षता दर्शाता है। <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-S4-86)</sup>
- **Mamba।** *चयनात्मक* SSM: मेमोरी अद्यतन नियम वर्तमान इनपुट पर निर्भर (मॉडल स्वयं तय करता है कि "मेमोरी में रखना" है और क्या "भूलना")। कार्यान्वयन GPU मेमोरी पदानुक्रम के उन्मुख; लेखकों के अनुसार, रैखिक जटिलता पर inference थ्रूपुट में कई गुना वृद्धि होती है। <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mamba-87)</sup>
- **RetNet।** तीन मोड के साथ *retention* तंत्र: समानांतर प्रशिक्षण, आवर्ती और खंड-आवर्ती inference। लक्ष्य — तेज़ प्रशिक्षण (Transformer की तरह) और कुशल inference प्रवाह (प्रति token O(1) मेमोरी) को संयुक्त करना। <sup>[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RetNet-88)</sup>
- **Attention+SSM हाइब्रिड।** उदाहरण — **Jamba** (Transformer और Mamba परतों का चक्रण और MoE): ~256 K token के क्रम के संदर्भ का समर्थन करने की रिपोर्ट करता है, समान वर्ग के विशुद्ध Transformer मॉडलों की तुलना में काफी कम मेमोरी आवश्यकता के साथ। <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Jamba-89)</sup>

#### लाभ

- रैखिक जटिलता और inference पर मेमोरी बचत। कोई वैश्विक self‑attention और KV-cache नहीं; केवल संक्षिप्त अवस्था संग्रहीत। <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RetNet-88)</sup>
- लंबी अनुक्रमों पर समानांतर प्रशिक्षण। Convolution मोड प्रशिक्षण थ्रूपुट बढ़ाता है। <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-S4-86)</sup>
- हार्डवेयर दक्षता। कार्यान्वयन आधुनिक मेमोरी पदानुक्रम (HBM/SRAM) के उन्मुख। <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mamba-87)</sup>
- लंबे संदर्भ और streaming। SSM+Attention हाइब्रिड मध्यम संसाधनों पर सैकड़ों हजारों token के लिए व्यावहारिक। <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Jamba-89)</sup>

#### सीमाएँ और वर्तमान अभ्यास

- पारिस्थितिकी तंत्र की परिपक्वता। उपकरण और मापनीयता "व्यंजन" (निर्देश, RLHF/DPO) अभी Transformer स्टैक से पीछे हैं। <sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mamba-87)</sup>
- गुणवत्ता और स्थिरता। कुछ कार्यों पर हाइब्रिड (Attention+SSM) "शुद्ध" SSM की तुलना में अधिक स्थिर "गुणवत्ता/गति/मेमोरी" समझौता दर्शाते हैं। <sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Jamba-89)</sup>

#### दृष्टिकोणों की तुलना (सामान्यीकृत)

| विशेषता                       | Transformer                | SSM                     | हाइब्रिड (Attention+SSM) |
|------------------------------|----------------------------|-------------------------|-------------------------|
| लंबाई पर जटिलता               | द्विघात (self‑attention)    | रैखिक (scan/convolution) | रैखिक के निकट             |
| प्रति token मेमोरी (inference) | KV-cache संदर्भ के साथ बढ़ता है | O(1) अवस्था              | मध्यम वृद्धि               |
| लंबे संदर्भ                      | विशेष अनुकूलन आवश्यक           | स्वाभाविक समर्थन          | ~256 K तक व्यावहारिक     |
| पारिस्थितिकी तंत्र परिपक्वता     | उच्च                        | विकासशील                | विकासशील                |

#### व्यावहारिक उपयोग

- बहुत लंबे दस्तावेज़ों का विश्लेषण (पुस्तकें, रिपोर्ट, वैज्ञानिक समीक्षाएँ)।
- मेमोरी बढ़ाए बिना लंबे इतिहास के साथ streaming प्रसंस्करण और chat परिदृश्य।
- सीमित संसाधन वाले वातावरण (मोबाइल/edge उपकरण)।
- समय श्रृंखला और अन्य क्रमिक डेटा।

**प्रतिनिधि मॉडल:** S4, Mamba, RetNet; Attention+SSM हाइब्रिड (Jamba)। <sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Jamba-89)</sup>

## आर्किटेक्चर का विकास

- 2017 — "Attention Is All You Need" शोध पत्र प्रकाशित। Transformer आर्किटेक्चर प्रस्तुत किया गया: बहु-शीर्ष self‑attention और स्थितीय एन्कोडिंग आवर्तिता और convolution के बिना मॉडल प्रशिक्षित करने की अनुमति देते हैं; साथ ही attention की context लंबाई पर द्विघात जटिलता है।<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 — GPT‑1 और BERT प्रस्तुत किए गए। GPT‑1 पीढ़ी और बाद के fine-tuning के लिए कारण-आधारित attention के साथ केवल-decoder स्टैक उपयोग करता है; BERT पाठ समझ कार्यों के लिए द्विदिशीय एन्कोडर और MLM प्री-ट्रेनिंग प्रस्तुत करता है। <sup>[\[90\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-90)[\[91\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-91)</sup>

<!-- -->

- 2019 — लंबी अनुक्रमों के साथ कार्य के तरीके प्रस्तावित और decoder‑only को बड़े पैमाने पर किया गया। Transformer‑XL निश्चित window की सीमा से परे जाने के लिए "मेमोरी" और सापेक्ष स्थितियाँ जोड़ता है; GPT‑2 पैमाने में वृद्धि पर zero‑shot क्षमताओं की वृद्धि दर्शाता है; BART seq2seq के लिए denoising प्री-ट्रेनिंग की दक्षता प्रदर्शित करता है। <sup>[\[92\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-92)[\[93\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-93)[\[94\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-94)</sup>

<!-- -->

- 2020 — "text‑to‑text" प्रारूप एकीकृत और लंबे दस्तावेज़ों के लिए विधियाँ दिखाई गईं। T5 विभिन्न कार्यों के लिए encoder–decoder का एकीकृत दृष्टिकोण प्रस्तुत करता है; Longformer और BigBird लंबे पाठ के लिए विरल/संरचित attention उपयोग करते हैं; GPT‑3 dense decoder‑only की मापनीयता की प्रभावशीलता की पुष्टि करता है। <sup>[\[95\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-95)[\[96\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-96)[\[97\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-97)[\[98\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-98)</sup>

<!-- -->

- 2021 — स्थितीय प्रतिनिधित्व सुधारे गए और पैरामीटर विरलता (MoE) दिखाई गई। RoPE और ALiBi बड़ी लंबाइयों पर सामान्यीकरण सुधारते हैं; Switch Transformer और GLaM प्रति token केवल विशेषज्ञों का हिस्सा सक्रिय करते हैं, अनुमान लागत की आनुपातिक वृद्धि के बिना क्षमता बढ़ाते हैं। <sup>[\[99\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-99)[\[100\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-100)[\[101\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-101)[\[102\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-102)</sup>

<!-- -->

- 2022 — compute‑optimal मोड परिष्कृत और लंबे prompt पर अनुमान गति बढ़ाई गई। Chinchilla मध्यम मॉडल आकार पर अधिक प्रशिक्षण token का लाभ दर्शाता है; Multi‑Query Attention के साथ PaLM KV-cache का आकार घटाता है; FlashAttention GPU पर attention तेज़ करता है। <sup>[\[103\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-103)[\[104\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-104)[\[105\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-105)[\[106\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-106)</sup>

<!-- -->

- 2023 — परतें बदले बिना context window बढ़ाए गए और सर्वर सेवा में सुधार हुआ। LLaMA श्रृंखला प्रथाएँ स्थापित करती है (RMSNorm, SwiGLU, RoPE); Position Interpolation और YaRN संदर्भ बढ़ाते हैं; vLLM/PagedAttention KV-cache अधिक कुशलता से प्रबंधित करता है। <sup>[\[107\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-107)[\[108\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-108)[\[109\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-109)[\[110\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-110)[\[111\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-111)[\[112\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-112)</sup>

<!-- -->

- 2023 — GPT‑4 और Gemini एक मॉडल परिवार के भीतर कई मोडैलिटी में प्रसंस्करण और पीढ़ी दर्शाते हैं। <sup>[\[113\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-113)[\[114\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-114)</sup>

<!-- -->

- 2023 — State Space Models (SSM) प्रस्तावित। Mamba और RetNet KV-cache के बजाय संक्षिप्त अवस्था के साथ क्रमिक प्रसंस्करण वापस लाते हैं और हाइब्रिड आर्किटेक्चर की नींव रखते हैं। <sup>[\[115\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-115)[\[116\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-116)</sup>

<!-- -->

- 2024 — खुले MoE मॉडल और Attention+SSM हाइब्रिड प्रकाशित; नए GPU पर attention त्वरित हुआ। Mixtral 8×7B/8×22B और DBRX MoE की व्यावहारिकता की पुष्टि करते हैं; Jamba बहुत लंबे संदर्भ के लिए Transformer और Mamba को जोड़ता है; FlashAttention‑3 थ्रूपुट बढ़ाता है। <sup>[\[117\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-117)[\[118\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-118)[\[119\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-119)[\[120\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-120)[\[121\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-121)</sup>

## संदर्भ

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — दृश्यात्मक व्याख्या

## साहित्य

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## टिप्पणियाँ

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_LLM_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
