Large language model architectures — LLM आर्किटेक्चर
बड़े भाषा मॉडलों (LLM) की आर्किटेक्चर — ये वे मूलभूत सिद्धांत और संरचनाएँ हैं जो यह निर्धारित करती हैं कि बड़े भाषा मॉडल कैसे बनाए जाते हैं, प्रशिक्षित होते हैं और कार्य करते हैं। आधुनिक LLM, जो मानवीय भाषा को समझने और उत्पन्न करने में सक्षम हैं, लगभग पूर्णतः Transformer आर्किटेक्चर[1] पर आधारित हैं, किंतु इनमें अनेक सुधार और विविध दृष्टिकोण शामिल हैं जो दक्षता, मापनीयता और क्षमताओं को बढ़ाने के उद्देश्य से विकसित किए गए हैं।
LLM आर्किटेक्चर के परिवार (Transformer)
आधुनिक बड़े भाषा मॉडल Transformer आर्किटेक्चर[1] पर आधारित हैं, किंतु उद्देश्य के अनुसार इसका उपयोग भिन्न-भिन्न तरीके से होता है: पाठ को समझना, उसका विस्तार उत्पन्न करना या एक पाठ को दूसरे में रूपांतरित करना। व्यवहार में Transformer के मूलभूत सिद्धांतों को बनाए रखते हुए तीन परिवार प्रतिष्ठित किए जाते हैं[2][3][4]।
1. Encoder‑only (केवल एन्कोडर)
मॉडल केवल एन्कोडर स्टैक का उपयोग करता है और संपूर्ण इनपुट पाठ को द्विदिशीय रूप से देखता है। प्री-ट्रेनिंग सामान्यतः masked‑language modeling (MLM, मास्किंग-सहित भाषा मॉडलिंग) के रूप में निर्मित होती है: कुछ token छिपाए जाते हैं और मॉडल उन्हें आसपास के संदर्भ से पुनर्स्थापित करना सीखता है। द्विदिशीय संदर्भ के कारण ऐसे मॉडल समझ और स्कोरिंग के कार्यों में सशक्त होते हैं: वर्गीकरण, इकाई पहचान, दस्तावेज़ पुनर्क्रमांकन और निष्कर्षणात्मक QA। स्वतः-प्रत्यावर्ती पीढ़ी के लिए ये "शून्य से" नहीं बने हैं।
व्यवहार में encoder‑only परिवार के लिए वैकल्पिक प्री-ट्रेनिंग लक्ष्य भी प्रयुक्त होते हैं: ELECTRA में replaced token detection (RTD) (discriminator मॉडल प्रतिस्थापित token को पहचानता है) और शब्दार्थ खोज/रिट्रीवर के लिए bi-एन्कोडर का contrastive learning (Dense Passage Retrieval की तरह "क्वेरी-दस्तावेज़" युग्मों पर InfoNCE/softmax‑loss)। RAG में उपयोग के दौरान encoder‑only या तो bi-एन्कोडर (त्वरित ANN-खोज के लिए क्वेरी और दस्तावेज़ का पृथक एन्कोडिंग) या cross-एन्कोडर (सटीक पुनर्क्रमांकन के लिए युग्म का संयुक्त एन्कोडिंग) की भूमिका निभाते हैं।
लाभ:
- द्विदिशीय संदर्भ के कारण पाठ समझ की उच्च गुणवत्ता: वर्गीकरण, NER, तथ्य निष्कर्षण, पुनर्क्रमांकन, निष्कर्षणात्मक QA।
- समानांतर प्रसंस्करण और उच्च थ्रूपुट: स्वतः-प्रत्यावर्तन के बिना एकल फॉरवर्ड पास; सामूहिक स्कोरिंग को बैच करना सुविधाजनक।
- खोज और RAG के साथ स्वाभाविक एकीकरण: bi-एन्कोडर की भूमिका में — त्वरित शब्दार्थ खोज; cross-एन्कोडर की भूमिका में — सटीक पुनर्क्रमांकन।
- कुशल अनुकूलन: लक्षित fine-tuning के बाद अपेक्षाकृत संक्षिप्त संस्करण (≈100–300 मिलियन पैरामीटर; BERT‑base ≈110 मिलियन) उच्च गुणवत्ता देते हैं।
- स्थिर विलंबता जो उत्पन्न उत्तर की लंबाई पर निर्भर नहीं (कोई चरण-दर-चरण डिकोडिंग नहीं); बड़े संग्रहों के ऑफलाइन-स्कोरिंग के लिए उपयुक्त।
- सापेक्ष/घूर्णन स्थितियों और/या स्थानीय-विरल attention के माध्यम से एन्कोडर की context window बढ़ाने की संभावना (जैसे Longformer/BigBird), जो लंबे दस्तावेज़ों के लिए उपयोगी है।
कमियाँ:
- अपनी कोई जनरेटिव क्षमता नहीं: संवाद और विस्तृत उत्तरों के लिए decoder या बाहरी जनरेटिव मॉड्यूल आवश्यक।
- इंटरेक्टिव परिदृश्यों में सीमितता: स्थिति-संरक्षण के साथ चरण-दर-चरण पीढ़ी नहीं।
- प्री-ट्रेनिंग लक्ष्य और स्वतंत्र पीढ़ी कार्यों में असंगति: MLM कारण-आधारित मॉडलिंग की तुलना में पीढ़ी के साथ कम संगत।
- ऐतिहासिक रूप से सीमित context window (अक्सर पूर्ण स्थिति के आधार संरचनाओं में 512 token); विस्तार के लिए विशेष स्थिति/attention योजनाओं और/या fine-tuning की आवश्यकता।
- रिट्रीवल कार्यों के लिए bi-एन्कोडर और/या cross-एन्कोडर का अलग contrastive fine-tuning आवश्यक; इसके बिना खोज/पुनर्क्रमांकन की गुणवत्ता विशेष रूप से प्रशिक्षित मॉडलों से सामान्यतः कम होती है।
प्रतिनिधि मॉडल: BERT और इसके व्युत्पन्न, तथा RoBERTa और DeBERTa (encoder‑only के विस्तारित संस्करण); वैकल्पिक प्री-ट्रेनिंग लक्ष्यों में — ELECTRA (RTD)। [5][6][7][8][9][10]
2. Decoder‑only (केवल डिकोडर)
केवल decoder स्टैक का उपयोग होता है जिसमें कारण-आधारित (बाएँ-दिशा) attention होती है: मॉडल पहले से दिए गए prefix के आधार पर अगले token की भविष्यवाणी करता है। यह प्रशिक्षण मोड — causal language modeling (CLM) — इन मॉडलों को पीढ़ी के लिए स्वाभाविक विकल्प बनाता है: संवाद, विस्तृत उत्तर, रचनात्मक पाठ, प्रोग्राम कोड। समझौता — लंबे prompt पर विलंब और KV-cache का आकार बढ़ना। व्यवहार में decoder‑only के लिए इंजीनियरिंग तकनीकें व्यापक रूप से प्रयुक्त होती हैं: MQA और GQA द्वारा KV-cache में कमी, speculative decoding और सर्वर अनुकूलन (PagedAttention/vLLM, continuous batching, chunked prefill) द्वारा अनुमान गति में वृद्धि।[11][12][13][14][15]
लाभ:
- स्वाभाविक पाठ पीढ़ी (CLM): सशक्त zero‑shot और few‑shot क्षमताएँ; अच्छी तरह मापनीय।[16]
- उपयोग की बहुमुखिता: एक मॉडल prompt में निर्देशों और उदाहरणों से अनेक कार्य हल करता है; RAG और tool use के साथ स्वाभाविक संयोजन।
- परिपक्व पारिस्थितिकी तंत्र: instructional fine-tuning और व्यवहार संरेखण की प्रथाएँ (RLHF, DPO); खुले और व्यावसायिक कार्यान्वयन उपलब्ध।[17][18]
- inference अनुकूलन का समृद्ध स्टैक: MQA/GQA KV-cache का आकार घटाते हैं और थ्रूपुट बढ़ाते हैं; speculative decoding वितरण बदले बिना अनुमान गति बढ़ाता है; PagedAttention/vLLM के साथ continuous batching और chunked prefill GPU उपयोग दक्षता बढ़ाते हैं।[19][20][21][22][23]
- कड़े उत्तर प्रारूपों (JSON/SQL/DSL) के लिए structured generation का समर्थन, जो सूचना प्रणालियों और API के साथ एकीकरण को सरल बनाता है।[24][25]
कमियाँ:
- पीढ़ी की बढ़ी हुई विलंबता: क्रमिक अनुमान; नए token की लागत पहले से "पढ़े" संदर्भ की लंबाई (KV-cache) के साथ बढ़ती है।
- "लंबा इनपुट – छोटा आउटपुट" प्रोफ़ाइल (सारांशीकरण, अनुवाद) में encoder–decoder की तुलना में कम लाभदायक, जहाँ इनपुट एक बार एन्कोड होता है।
- एकदिशीय संदर्भ की सीमा: समझ के कार्यों में कभी-कभी द्विदिशीय प्रतिनिधित्व वाले मॉडलों (encoder‑only / encoder–decoder) से पीछे।
- लंबे prompt और बड़े batch पर KV-cache की मेमोरी "बाधक" हो सकती है; [26]
- activation/KV का क्वांटीकरण (INT8/FP8) अनुमान गति बढ़ाता है, किंतु लंबे संदर्भ/कोड पर गुणवत्ता घटा सकता है; सावधान सत्यापन आवश्यक (विशेषतः कड़े SLA के साथ)।
प्रतिनिधि मॉडल: GPT‑3, GPT‑4 (आर्किटेक्चर और dataset विवरण सार्वजनिक रूप से उपलब्ध नहीं), LLaMA और Llama 3 (8B/70B, 2024)।[27][28][29][30]
3. Encoder–decoder (एन्कोडर-डिकोडर)
यह आर्किटेक्चर दोनों घटकों को संयुक्त करती है। एन्कोडर द्विदिशीय मोड में कार्य करता है, और decoder — कारण-आधारित। एन्कोडर एक बार इनपुट का विश्लेषण करता है और उसका प्रतिनिधित्व बनाता है; decoder इस प्रतिनिधित्व को cross‑attention के माध्यम से उपयोग करते हुए आउटपुट उत्पन्न करता है। यह पृथक दृष्टिकोण विशेष रूप से तब उपयोगी होता है जब लंबे इनपुट पाठ को छोटे आउटपुट में रूपांतरित करना हो: मशीन अनुवाद, सारांशीकरण, दस्तावेज़-आधारित प्रश्नोत्तर। यद्यपि विधि को अधिक कुल वैकल्पिक लागत (दो स्टैक और cross-attention) की आवश्यकता होती है, इसका लाभ — पूर्ण स्रोत पाठ विश्लेषण के आधार पर नियंत्रित पीढ़ी; साथ ही एन्कोडिंग एक बार होती है और अनुमान की पूरी प्रक्रिया में पुनः उपयोग होती है।
लाभ:
- सशर्त पीढ़ी: decoder इनपुट के प्रतिनिधित्व को cross‑attention का उपयोग करता है। [31]
- "लंबा इनपुट → छोटा आउटपुट" परिदृश्य में दक्षता: इनपुट एक बार एन्कोड होता है।
- "text‑to‑text" प्रारूप और नियंत्रित अनुमान (कार्य prefix, विशेष निर्देश) के लिए सुविधाजनक। [32]
- लंबे स्रोत के साथ स्थिरता और दक्षता: डिकोडिंग चरण में केवल आउटपुट पर self‑attention बढ़ता है, जबकि cross‑attention एन्कोडर की निश्चित keys/values पुनः उपयोग करता है (प्रत्येक चरण पर इनपुट "पुनः पढ़ा" नहीं जाता)।
कमियाँ:
- दो स्टैक प्रशिक्षण और उपयोग में मेमोरी और गणना की आवश्यकताएँ बढ़ाते हैं।
- अत्यंत लंबी अनुक्रमों पर कुल विलंब decoder‑only से तुलनीय; स्वतः-प्रत्यावर्तन बाधा बना रहता है।
- decoder‑only की तुलना में कम सार्वभौमिक chat मॉडल; अक्सर विशिष्ट कार्यों के लिए उच्च-गुणवत्ता seq2seq इंजन के रूप में उपयोग।
- बहुत लंबे इनपुट पर decoder के प्रत्येक layer में cross‑attention keys/values (पूरे स्रोत पर) की मेमोरी बढ़ती है, जिसके लिए सावधान सर्विंग योजना आवश्यक।
प्रतिनिधि मॉडल: T5 (T5 v1.1 सहित और FLAN‑T5 में instructional fine-tuning की प्रथा) और BART। [33][34][35]
Dense Transformer - प्लॉट (घना) Transformer
LLM की सर्वाधिक प्रचलित क्लासिक आर्किटेक्चर: प्रत्येक token के प्रसंस्करण में मॉडल के लगभग सभी पैरामीटर भाग लेते हैं। विरल दृष्टिकोणों (जैसे Mixture‑of‑Experts) के विपरीत, उपनेटवर्क का चयनात्मक सक्रियण नहीं है — प्रत्येक ब्लॉक प्रत्येक token के लिए कार्य करता है। [1]
कार्य सिद्धांत और आर्किटेक्चर
मूल संरचना। मॉडल — N एकसमान Transformer ब्लॉकों का स्टैक। प्रत्येक ब्लॉक में शामिल हैं:
- बहु-शीर्ष स्व-attention (Multi‑Head Self‑Attention)। प्रत्येक token के लिए तीन वेक्टर गणित किए जाते हैं: Q (query), K (key), V (value); attention परिभाषित होता है के रूप में, जहाँ — mask (कारण-आधारित और/या padding-mask) जो अस्वीकार्य स्थितियों को बाहर करती है। कई "attention शीर्ष" समानांतर में संदर्भ के विभिन्न पहलुओं को ध्यान में रखते हैं (H शीर्ष, सामान्यतः ); उनकी संख्या मॉडल के पैमाने के साथ बढ़ती है। [1]
- पूर्ण-संयोजित नेटवर्क (Feed‑Forward Network, FFN)। दो रैखिक परतें जिनके बीच अरैखिकता है (सामान्यतः GELU/SiLU; कुछ आधुनिक मॉडलों में — SwiGLU)। मध्यवर्ती आयाम सामान्यतः ; SwiGLU उपयोग करते समय तुलनीय पैरामीटर संख्या बनाए रखने के लिए अक्सर लेते हैं। FFN में पैरामीटर का महत्वपूर्ण अनुपात होता है। [1][36]
अतिरिक्त घटक। अवशिष्ट (residual) संयोजन और परत सामान्यीकरण उपयोग होते हैं; आधुनिक LLM में अक्सर Pre‑LN (उप-ब्लॉक से पहले सामान्यीकरण) का उपयोग होता है — यह बड़ी गहराई पर प्रशिक्षण स्थिरता सुधारता है। क्लासिक LayerNorm के अलावा RMSNorm का उपयोग और अधिक हो रहा है (गणना लागत घटाती है और बड़े मॉडलों में अच्छा काम करती है); कुछ परिवारों में attention स्थान में सामान्यीकरण भी प्रयुक्त होता है (जैसे softmax से पहले Q/K का सामान्यीकरण)। स्थितीय प्रतिनिधित्व पूर्ण या सापेक्ष हो सकते हैं; लंबे संदर्भ के लिए RoPE वास्तविक मानक बन गया है।
मॉडल उदाहरण और पैमाना
- BERT‑Large: 24 परतें, आयाम 1024, 16 attention शीर्ष, ≈340 मिलियन पैरामीटर। [37]
- GPT‑3 (175B): 96 परतें, आयाम 12288, 96 attention शीर्ष, ≈175 अरब पैरामीटर। [38]
- LLaMA‑65B: 80 परतें, आयाम 8192, 64 attention शीर्ष, ≈65 अरब पैरामीटर। [39]
- PaLM‑540B: 118 परतें, आयाम लगभग 18432, ≈540 अरब पैरामीटर। [40]
लाभ
- एकसमान ब्लॉक, अच्छी तरह अध्ययन किए गए प्रशिक्षण मोड और पैमाने पर पूर्वानुमेय व्यवहार।
- पैरामीटर और डेटा बढ़ने पर गुणवत्ता घातांकीय रूप से सुधरती है; compute‑optimal मोड मॉडल आकार और प्रशिक्षण token की मात्रा का संयुक्त वृद्धि मानता है। [41][42]
- fine-tuning के बाद एक ही आर्किटेक्चर परत-स्तर परिवर्तन के बिना कार्यों की विस्तृत श्रृंखला कवर करती है।
कमियाँ
- पूर्ण self‑attention की अनुक्रम लंबाई पर द्विघात जटिलता है (), जो context window को सीमित करती है। [1]
- पीढ़ी चरण में पैरामीटर का पूर्ण सक्रियण: MoE के बिना decoder में प्रति token अनुमान लागत लगभग पैरामीटर संख्या के समानुपाती बढ़ती है।
- बाधा — मेमोरी बैंडविड्थ (memory‑bound): HBM से वजन लोडिंग अक्सर inference गति को सीमित करती है।
मापनीयता और संदर्भ की सीमाएँ
- पैरामीटर के लिए मेमोरी मॉडल आकार के साथ रैखिक रूप से बढ़ती है; प्रशिक्षण मेमोरी gradient और optimizer अवस्थाओं के कारण बढ़ती है।
- मूल संरचनाएँ ऐतिहासिक रूप से 2–4 हजार token तक सीमित थीं। आधुनिक स्थितीय योजनाएँ (RoPE) और विस्तार तकनीकें (Position Interpolation, YaRN आदि) window को कई गुना और अधिक बढ़ाने की अनुमति देती हैं, किंतु अतिरिक्त गणना/मेमोरी भार के साथ। [43][44]
आधुनिक अनुकूलन
- FlashAttention। GPU मेमोरी पदानुक्रम को ध्यान में रखते हुए सटीक attention; लंबी अनुक्रमों पर मेमोरी लागत घटाता है और प्रशिक्षण/inference तेज़ करता है। [45]
- KV-cache में कमी और प्रबंधन। Multi‑Query Attention और Grouped‑Query Attention cache का आकार और मेमोरी ट्रैफ़िक घटाते हैं; सर्वर स्तर पर PagedAttention (vLLM) पृष्ठ-आधारित cache प्रबंधन द्वारा थ्रूपुट बढ़ाता है। [46][47][48]
- Speculative decoding। Draft मॉडल विस्तार प्रस्तावित करता है, और मुख्य मॉडल उसे शीघ्र सत्यापित करता है; आउटपुट वितरण बदले बिना गति में वृद्धि होती है। [49]
Sparse Models और Mixture‑of‑Experts (MoE)
MoE — प्रति token गणना के आनुपातिक वृद्धि के बिना मॉडल क्षमता बढ़ाने का एक तरीका। एक बड़े FFN-ब्लॉक के स्थान पर परत में समानांतर "विशेषज्ञों" का समूह (कई स्वतंत्र FFN) उपयोग होता है, और प्रशिक्षण योग्य राउटर (gating network) प्रत्येक token के लिए top‑k सर्वाधिक प्रासंगिक विशेषज्ञों का चयन करता है (सामान्यतः k=1–2; कुछ मॉडलों में k=4)। केवल चुने गए विशेषज्ञ सक्रिय होते हैं; उनके आउटपुट भारित और संकलित होते हैं। इस प्रकार कुल पैरामीटर सैकड़ों अरब और यहाँ तक कि खरबों हो सकते हैं, किंतु प्रत्येक चरण में केवल छोटा अंश सक्रिय होता है। [50][51]
मॉडल उदाहरण और पैमाना
- Switch Transformer (Google): ~1.6T पैरामीटर तक; top‑1 रूटिंग (प्रति token एक विशेषज्ञ)। दर्शाया कि MoE प्रति token तुलनीय लागत पर क्षमता तेज़ी से बढ़ा सकता है। [50]
- GLaM (Google): 1.2T पैरामीटर, परत में 64 विशेषज्ञ, top‑2; प्रत्येक token पर ≈96.6B पैरामीटर सक्रिय (≈8%)। [51]
- Mixtral 8×7B (Mistral AI): कुल ~46.7B पैरामीटर, प्रति token ≈12.9B सक्रिय, top‑2। [52][53]
- Mixtral 8×22B: कुल ~141B पैरामीटर, प्रति token ≈39B सक्रिय, top‑2। [54]
- DBRX (Databricks): कुल 132B पैरामीटर, प्रति token ≈36B सक्रिय; 16 विशेषज्ञ और top‑4 रूटिंग (fine‑grained MoE)। [55]
लाभ
- गणना की लागत सक्रिय विशेषज्ञों की संख्या k से निर्धारित होती है, कुल पैरामीटर से नहीं: अनुमान लागत के साथ खरब पैमाने के मॉडल प्रशिक्षित और उपयोग किए जा सकते हैं जो उल्लेखनीय रूप से छोटे dense मॉडलों से तुलनीय हो। [51]
- विशेषज्ञता: विशेषज्ञ स्वतः भाषाओं/डोमेन/पैटर्न के अनुसार "समायोजित" होते हैं, बहु-डोमेन कार्यों में गुणवत्ता सुधरती है।
- लचीला परिनियोजन: अक्सर उपयोग किए जाने वाले विशेषज्ञों को मेमोरी में रख सकते हैं और दुर्लभ विशेषज्ञों को लोड कर सकते हैं (उपयुक्त अवसंरचना के साथ)।
सीमाएँ
- भार संतुलन: नियमितीकरण के बिना राउटर विशेषज्ञों के एक हिस्से पर "अटक" सकता है (router collapse)। auxiliary losses (load‑balancing) और बेहतर रूटिंग योजनाएँ आवश्यक। [50]
- वितरित गणना की जटिलता: expert parallelism और all‑to‑all आदान-प्रदान आवश्यक; संचार overhead और मेमोरी प्रबंधन बाधक बनते हैं। [56]
- प्रशिक्षण स्थिरता: router और क्षमता (capacity) बाधाओं की सेटिंग महत्वपूर्ण, अन्यथा गुणवत्ता/अभिसरण में गिरावट संभव।
आधुनिक सुधार
- Expert‑Choice routing: विशेषज्ञ token "चुनते" हैं, जो तुलनीय लागत पर संतुलन और अभिसरण सुधारता है। [57]
- Fine‑grained MoE: अधिक संख्या में छोटे विशेषज्ञ (जैसे DBRX में) विशेषज्ञता की बारीक दानेदारी देते हैं। [55]
- Sparse Upcycling: dense मॉडल को उसके checkpoint से MoE में परिवर्तन मध्यम लागत पर गुणवत्ता में उल्लेखनीय वृद्धि की अनुमति देता है। [58]
MoE के उपयोग की उचितता
- सीमित compute बजट पर बड़े बहु-डोमेन सहायक।
- विशाल corpus पर प्रशिक्षण, जहाँ विशेषज्ञता लाभ देती है।
- विकसित वितरित अवसंरचना वाले परिदृश्य (अनेक GPU/TPU और तेज़ नेटवर्क)।
Dense मॉडल कब बेहतर: सीमित अवसंरचना (1–2 GPU), अनुमानित विलंब और सरल परिनियोजन की कड़ी आवश्यकताएँ।
Retrieval‑Augmented Generation (RAG)
RAG — यह LLM के इर्द-गिर्द प्रणाली का आर्किटेक्चरल पैटर्न है, न कि स्वयं मॉडल की आंतरिक आर्किटेक्चर। यह LLM (जनरेटिव घटक) को बाहरी ज्ञान आधार (निष्कर्षण घटक) के साथ जोड़ता है, जो मॉडल की "पैरामीट्रिक मेमोरी" की सीमाओं को क्षतिपूरित करने की अनुमति देता है।
- कार्य सिद्धांत: पीढ़ी से पहले LLM बाहरी स्रोत (विकी, कॉर्पोरेट ज्ञान आधार, वेब) से प्रासंगिक दस्तावेज़ निकालता है और उत्तर बनाते समय उन पर निर्भर करता है। [59]
- लाभ:
- उपयोग: कॉर्पोरेट सहायकों और उन प्रणालियों के लिए वास्तविक मानक जहाँ सत्यापन योग्य तथ्य और निजी/अत्यंत विशिष्ट डेटा के साथ कार्य आवश्यक है। [59]
Attention तंत्र और संदर्भ के साथ कार्य
मूल self‑attention की अनुक्रम लंबाई पर द्विघात जटिलता है (), इसलिए अनुकूलन उत्पन्न हुए।
- Sparse Attention (विरल attention): attention को स्थानीय windows/patterns तक सीमित करना। उदाहरण: Longformer[61], BigBird[62]।
- FlashAttention: GPU मेमोरी पदानुक्रम को ध्यान में रखते हुए गणना क्रम का पुनर्गठन; समय और मेमोरी में महत्वपूर्ण लाभ देता है और लंबे संदर्भ के साथ LLM प्रशिक्षण में वास्तविक मानक बन गया है[63][64][65]।
- MQA/GQA (डिकोडिंग त्वरण): Multi‑Query Attention (सभी शीर्षों के लिए साझा keys/values) KV-cache ट्रैफ़िक घटाता है[66]। Grouped‑Query Attention गुणवत्ता/गति संतुलन बनाता है[67]।
- बेहतर स्थितीय प्रतिनिधित्व:
- ALiBi (Attention with Linear Biases): attention स्कोर में रैखिक विस्थापन बड़ी लंबाइयों पर सामान्यीकरण सुधारते हैं। [68]
- RoPE (Rotary Position Embeddings): Q/K के घुमाव के माध्यम से सापेक्ष स्थितीय जानकारी; आधुनिक मॉडलों में व्यापक रूप से उपयोग (जैसे LLaMA)। [69][70]
- RoPE-मॉडलों के लिए संदर्भ विस्तार: Position Interpolation [71], YaRN [72], तथा NTK-aware संशोधन आर्किटेक्चर बदले बिना context window प्रभावी ढंग से बढ़ाने की अनुमति देते हैं।
- लंबी अनुक्रमों के अन्य दृष्टिकोण:
मॉडल अनुकूलन और प्रशिक्षण अवसंरचना
LLM के प्रशिक्षण और परिनियोजन के लिए विशेष तकनीकें और framework उपयोग होते हैं।
- Quantization (परिमाणीकरण): वजन की बिट-गहराई कम करना मेमोरी घटाता है और inference तेज़ करता है। QLoRA 4-बिट मॉडलों (65B सहित) को पूर्ण-सटीकता के करीब गुणवत्ता के साथ प्रभावी ढंग से fine-tune करने की अनुमति देता है[77]।
- Knowledge Distillation (ज्ञान आसवन): संक्षिप्त मॉडलों के लिए Teacher→Student-प्रशिक्षण[78]; उदाहरण — DistilBERT[79]।
- वितरित प्रशिक्षण:
- पारिस्थितिकी तंत्र और उपकरण: Hugging Face Transformers और Accelerate मॉडलों के मानक कार्यान्वयन और प्रशिक्षण व inference के लिए DeepSpeed/FSDP के साथ एकीकरण प्रदान करते हैं[82][83]।
Scaling Laws और Compute‑Optimal प्रशिक्षण
अनुभवजन्य scaling laws दर्शाते हैं कि cross-entropy त्रुटि पैरामीटर, डेटा और गणना बढ़ने पर घातांकीय नियम से घटती है। [84] Chinchilla कार्य ने compute‑optimal मोड को परिष्कृत किया: इष्टतम दक्षता के लिए मॉडल आकार और प्रशिक्षण token की संख्या संयुक्त रूप से बढ़ाई जानी चाहिए (उदाहरण — 70B मॉडल ~1.4T token पर प्रशिक्षित, बड़े अल्प-प्रशिक्षित मॉडलों से बेहतर)। [85]
State Space Models (SSM) - स्थिति स्थान मॉडल
State Space Models (SSM) — लंबी अनुक्रमों के साथ कार्य के लिए Transformer का वैकल्पिक आर्किटेक्चर। यह नियंत्रण सिद्धांत और डिजिटल सिग्नल प्रसंस्करण से विचार उधार लेता है और self‑attention की मुख्य समस्या हल करता है: पाठ लंबाई बढ़ने पर गणना की द्विघात वृद्धि।
मुख्य समस्या और समाधान
Transformer की समस्या। पारंपरिक Transformer की मुख्य समस्या — attention की द्विघात जटिलता: 10 गुना लंबे पाठ के लिए लगभग 100 गुना अधिक गणना आवश्यक।
SSM का दृष्टिकोण। "सभी शब्दों पर एक साथ attention" के बजाय मॉडल पाठ पर क्रमिक रूप से चलता है और एक संक्षिप्त आंतरिक मेमोरी अवस्था बनाए रखता है जो प्रत्येक चरण पर अद्यतन होती है। परिणामस्वरूप समय और मेमोरी खपत पाठ लंबाई के साथ लगभग रैखिक रूप से बढ़ती है। साथ ही प्रशिक्षण समानांतर रूप से किया जा सकता है — kernel के convolution प्रतिनिधित्व के माध्यम से (लंबी अनुक्रमों पर उच्च थ्रूपुट)। [86]
कार्य सिद्धांत
विवेकी SSM अवस्था और आउटपुट समीकरणों द्वारा वर्णित है:
जहाँ — मेमोरी अवस्था, — इनपुट (token), — आउटपुट। गहरी SSM में मैट्रिक्स को इस प्रकार पैरामीट्रीकृत किया जाता है ताकि लंबी अनुक्रमों पर स्थिरता और कुशल गणना सुनिश्चित हो। उसी परत को माना जा सकता है:
- आवर्ती (चरणों पर स्कैन) — KV-cache के बिना मेमोरी-कुशल inference;
- convolution — पूर्व-गणित kernel के साथ समानांतर प्रशिक्षण। [86]
मुख्य आर्किटेक्चर और हाइब्रिड
- S4 (Structured State Spaces)। अवस्था मैट्रिक्स के स्थिर पैरामीट्रीकरण के साथ SSM baseline; बहुत लंबी अनुक्रमों पर दक्षता दर्शाता है। [86]
- Mamba। चयनात्मक SSM: मेमोरी अद्यतन नियम वर्तमान इनपुट पर निर्भर (मॉडल स्वयं तय करता है कि "मेमोरी में रखना" है और क्या "भूलना")। कार्यान्वयन GPU मेमोरी पदानुक्रम के उन्मुख; लेखकों के अनुसार, रैखिक जटिलता पर inference थ्रूपुट में कई गुना वृद्धि होती है। [87]
- RetNet। तीन मोड के साथ retention तंत्र: समानांतर प्रशिक्षण, आवर्ती और खंड-आवर्ती inference। लक्ष्य — तेज़ प्रशिक्षण (Transformer की तरह) और कुशल inference प्रवाह (प्रति token O(1) मेमोरी) को संयुक्त करना। [88]
- Attention+SSM हाइब्रिड। उदाहरण — Jamba (Transformer और Mamba परतों का चक्रण और MoE): ~256 K token के क्रम के संदर्भ का समर्थन करने की रिपोर्ट करता है, समान वर्ग के विशुद्ध Transformer मॉडलों की तुलना में काफी कम मेमोरी आवश्यकता के साथ। [89]
लाभ
- रैखिक जटिलता और inference पर मेमोरी बचत। कोई वैश्विक self‑attention और KV-cache नहीं; केवल संक्षिप्त अवस्था संग्रहीत। [87][88]
- लंबी अनुक्रमों पर समानांतर प्रशिक्षण। Convolution मोड प्रशिक्षण थ्रूपुट बढ़ाता है। [86]
- हार्डवेयर दक्षता। कार्यान्वयन आधुनिक मेमोरी पदानुक्रम (HBM/SRAM) के उन्मुख। [87]
- लंबे संदर्भ और streaming। SSM+Attention हाइब्रिड मध्यम संसाधनों पर सैकड़ों हजारों token के लिए व्यावहारिक। [89]
सीमाएँ और वर्तमान अभ्यास
- पारिस्थितिकी तंत्र की परिपक्वता। उपकरण और मापनीयता "व्यंजन" (निर्देश, RLHF/DPO) अभी Transformer स्टैक से पीछे हैं। [87]
- गुणवत्ता और स्थिरता। कुछ कार्यों पर हाइब्रिड (Attention+SSM) "शुद्ध" SSM की तुलना में अधिक स्थिर "गुणवत्ता/गति/मेमोरी" समझौता दर्शाते हैं। [89]
दृष्टिकोणों की तुलना (सामान्यीकृत)
| विशेषता | Transformer | SSM | हाइब्रिड (Attention+SSM) |
|---|---|---|---|
| लंबाई पर जटिलता | द्विघात (self‑attention) | रैखिक (scan/convolution) | रैखिक के निकट |
| प्रति token मेमोरी (inference) | KV-cache संदर्भ के साथ बढ़ता है | O(1) अवस्था | मध्यम वृद्धि |
| लंबे संदर्भ | विशेष अनुकूलन आवश्यक | स्वाभाविक समर्थन | ~256 K तक व्यावहारिक |
| पारिस्थितिकी तंत्र परिपक्वता | उच्च | विकासशील | विकासशील |
व्यावहारिक उपयोग
- बहुत लंबे दस्तावेज़ों का विश्लेषण (पुस्तकें, रिपोर्ट, वैज्ञानिक समीक्षाएँ)।
- मेमोरी बढ़ाए बिना लंबे इतिहास के साथ streaming प्रसंस्करण और chat परिदृश्य।
- सीमित संसाधन वाले वातावरण (मोबाइल/edge उपकरण)।
- समय श्रृंखला और अन्य क्रमिक डेटा।
प्रतिनिधि मॉडल: S4, Mamba, RetNet; Attention+SSM हाइब्रिड (Jamba)। [86][87][88][89]
आर्किटेक्चर का विकास
- 2017 — "Attention Is All You Need" शोध पत्र प्रकाशित। Transformer आर्किटेक्चर प्रस्तुत किया गया: बहु-शीर्ष self‑attention और स्थितीय एन्कोडिंग आवर्तिता और convolution के बिना मॉडल प्रशिक्षित करने की अनुमति देते हैं; साथ ही attention की context लंबाई पर द्विघात जटिलता है।[1]
- 2018 — GPT‑1 और BERT प्रस्तुत किए गए। GPT‑1 पीढ़ी और बाद के fine-tuning के लिए कारण-आधारित attention के साथ केवल-decoder स्टैक उपयोग करता है; BERT पाठ समझ कार्यों के लिए द्विदिशीय एन्कोडर और MLM प्री-ट्रेनिंग प्रस्तुत करता है। [90][91]
- 2019 — लंबी अनुक्रमों के साथ कार्य के तरीके प्रस्तावित और decoder‑only को बड़े पैमाने पर किया गया। Transformer‑XL निश्चित window की सीमा से परे जाने के लिए "मेमोरी" और सापेक्ष स्थितियाँ जोड़ता है; GPT‑2 पैमाने में वृद्धि पर zero‑shot क्षमताओं की वृद्धि दर्शाता है; BART seq2seq के लिए denoising प्री-ट्रेनिंग की दक्षता प्रदर्शित करता है। [92][93][94]
- 2020 — "text‑to‑text" प्रारूप एकीकृत और लंबे दस्तावेज़ों के लिए विधियाँ दिखाई गईं। T5 विभिन्न कार्यों के लिए encoder–decoder का एकीकृत दृष्टिकोण प्रस्तुत करता है; Longformer और BigBird लंबे पाठ के लिए विरल/संरचित attention उपयोग करते हैं; GPT‑3 dense decoder‑only की मापनीयता की प्रभावशीलता की पुष्टि करता है। [95][96][97][98]
- 2021 — स्थितीय प्रतिनिधित्व सुधारे गए और पैरामीटर विरलता (MoE) दिखाई गई। RoPE और ALiBi बड़ी लंबाइयों पर सामान्यीकरण सुधारते हैं; Switch Transformer और GLaM प्रति token केवल विशेषज्ञों का हिस्सा सक्रिय करते हैं, अनुमान लागत की आनुपातिक वृद्धि के बिना क्षमता बढ़ाते हैं। [99][100][101][102]
- 2022 — compute‑optimal मोड परिष्कृत और लंबे prompt पर अनुमान गति बढ़ाई गई। Chinchilla मध्यम मॉडल आकार पर अधिक प्रशिक्षण token का लाभ दर्शाता है; Multi‑Query Attention के साथ PaLM KV-cache का आकार घटाता है; FlashAttention GPU पर attention तेज़ करता है। [103][104][105][106]
- 2023 — परतें बदले बिना context window बढ़ाए गए और सर्वर सेवा में सुधार हुआ। LLaMA श्रृंखला प्रथाएँ स्थापित करती है (RMSNorm, SwiGLU, RoPE); Position Interpolation और YaRN संदर्भ बढ़ाते हैं; vLLM/PagedAttention KV-cache अधिक कुशलता से प्रबंधित करता है। [107][108][109][110][111][112]
- 2023 — GPT‑4 और Gemini एक मॉडल परिवार के भीतर कई मोडैलिटी में प्रसंस्करण और पीढ़ी दर्शाते हैं। [113][114]
- 2023 — State Space Models (SSM) प्रस्तावित। Mamba और RetNet KV-cache के बजाय संक्षिप्त अवस्था के साथ क्रमिक प्रसंस्करण वापस लाते हैं और हाइब्रिड आर्किटेक्चर की नींव रखते हैं। [115][116]
- 2024 — खुले MoE मॉडल और Attention+SSM हाइब्रिड प्रकाशित; नए GPU पर attention त्वरित हुआ। Mixtral 8×7B/8×22B और DBRX MoE की व्यावहारिकता की पुष्टि करते हैं; Jamba बहुत लंबे संदर्भ के लिए Transformer और Mamba को जोड़ता है; FlashAttention‑3 थ्रूपुट बढ़ाता है। [117][118][119][120][121]
संदर्भ
- https://jalammar.github.io/illustrated-transformer/ The Illustrated Transformer — दृश्यात्मक व्याख्या
साहित्य
- Vaswani, A. et al. (2017). Attention Is All You Need. NIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT. NAACL. https://arxiv.org/abs/1810.04805
- Brown, T. et al. (2020). Language Models are Few‑Shot Learners. NeurIPS. https://arxiv.org/abs/2005.14165
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
- Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
- Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
- Shazeer, N. (2019). MQA. https://arxiv.org/abs/1911.02150
- Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- Kwon, W. et al. (2023). PagedAttention / vLLM. https://arxiv.org/abs/2309.06180
- Leviathan, Y. et al. (2023). Speculative Decoding. https://arxiv.org/abs/2211.17192
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- Du, N. et al. (2022). GLaM. https://proceedings.mlr.press/v162/du22c/du22c.pdf
- Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
- Zhou, Y. et al. (2022). Expert Choice Routing. https://arxiv.org/abs/2202.09368
- Komatsuzaki, A. et al. (2022). Sparse Upcycling. https://arxiv.org/abs/2212.05055
- Lewis, P. et al. (2020). RAG. https://arxiv.org/abs/2005.11401
- Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
- Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
- Su, J. et al. (2021). RoFormer (RoPE). https://arxiv.org/abs/2104.09864
- Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
- Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
- Dettmers, T. et al. (2023). QLoRA. https://arxiv.org/abs/2305.14314
- Rajbhandari, S. et al. (2020). ZeRO. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
- Shoeybi, M. et al. (2019). Megatron‑LM. https://arxiv.org/abs/1909.08053
- Kaplan, J. et al. (2020). Scaling Laws. https://arxiv.org/abs/2001.08361
- Hoffmann, J. et al. (2022). Chinchilla / Compute‑Optimal. https://arxiv.org/abs/2203.15556
- Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
- Bai, Y. et al. (2022). Constitutional AI. https://arxiv.org/abs/2212.08073
- OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- OpenAI (2023). DevDay: GPT‑4 Turbo 128k. https://openai.com/index/new-models-and-developer-products-announced-at-devday/
- Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
- Shazeer, N. (2020). GLU Variants / SwiGLU. https://arxiv.org/abs/2002.05202
- Gu, A.; Goel, K.; Ré, C. (2021). S4: Structured State Spaces. https://arxiv.org/abs/2111.00396
- Gu, A.; Dao, T. (2023/2024). Mamba: Selective State Spaces. https://arxiv.org/abs/2312.00752
- Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
- Lieber, O. et al. (2024). Jamba: Hybrid Transformer‑Mamba. https://arxiv.org/abs/2403.19887
- Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer. https://arxiv.org/abs/2001.04451
- Choromanski, K. et al. (2021). Performer. https://arxiv.org/abs/2009.14794
- Wang, S. et al. (2020). Linformer. https://arxiv.org/abs/2006.04768
टिप्पणियाँ
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ Devlin, J. et al. (2019). BERT. https://arxiv.org/abs/1810.04805
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Liu, Y. et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach. https://arxiv.org/abs/1907.11692
- ↑ He, P. et al. (2021). DeBERTa: Decoding‑enhanced BERT with Disentangled Attention. https://arxiv.org/abs/2006.03654
- ↑ Clark, K. et al. (2020). ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators. https://arxiv.org/abs/2003.10555
- ↑ Zaheer, M. et al. (2020). Big Bird: Transformers for Longer Sequences. https://arxiv.org/abs/2007.14062
- ↑ Beltagy, I. et al. (2020). Longformer: The Long‑Document Transformer. https://arxiv.org/abs/2004.05150
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (Multi‑Query Attention). https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. https://arxiv.org/abs/2305.13245
- ↑ Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
- ↑ Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). https://arxiv.org/abs/2309.06180
- ↑ vLLM Docs (2024–2025). Continuous batching, Chunked prefill, Structured outputs. https://docs.vllm.ai/
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Ouyang, L. et al. (2022). InstructGPT (RLHF). https://arxiv.org/abs/2203.02155
- ↑ Rafailov, R. et al. (2023). Direct Preference Optimization. https://arxiv.org/abs/2305.18290
- ↑ Shazeer, 2019. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, 2023. https://arxiv.org/abs/2305.13245
- ↑ Leviathan, 2023. https://arxiv.org/abs/2211.17192
- ↑ Kwon, 2023. https://arxiv.org/abs/2309.06180
- ↑ vLLM Docs. https://docs.vllm.ai/
- ↑ OpenAI (2024). Structured Outputs. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ vLLM Docs — Structured outputs. https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html
- ↑ Kwon, 2023. https://arxiv.org/abs/2309.06180
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Achiam, J. et al. (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- ↑ Meta AI (2024). Introducing Meta Llama 3. https://ai.meta.com/blog/meta-llama-3/
- ↑ Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
- ↑ Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension. https://arxiv.org/abs/1910.13461
- ↑ Chung, H. W. et al. (2022). Scaling Instruction‑Finetuned Language Models (FLAN‑T5). https://arxiv.org/abs/2210.11416
- ↑ Shazeer, N. (2020). GLU Variants Improve Transformer. https://arxiv.org/abs/2002.05202
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
- ↑ Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
- ↑ Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
- ↑ Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
- ↑ Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- ↑ Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. https://arxiv.org/abs/2309.06180
- ↑ Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
- ↑ 50.0 50.1 50.2 Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- ↑ 51.0 51.1 51.2 Du, N. et al. (2021). GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts. https://arxiv.org/pdf/2112.06905.pdf
- ↑ Mistral AI (2023). Mixtral of Experts. https://mistral.ai/news/mixtral-of-experts/
- ↑ Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- ↑ Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
- ↑ 55.0 55.1 Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- ↑ NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
- ↑ Zhou, Y. et al. (2022). Mixture‑of‑Experts with Expert Choice Routing. https://arxiv.org/abs/2202.09368
- ↑ Komatsuzaki, A. et al. (2022). Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints. https://arxiv.org/abs/2212.05055
- ↑ 59.0 59.1 59.2 59.3 Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. https://arxiv.org/abs/2005.11401
- ↑ NVIDIA Blog (2025). What is Retrieval‑Augmented Generation (RAG). https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/
- ↑ Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- ↑ Zaheer, M. et al. (2020). Big Bird. https://arxiv.org/abs/2007.14062
- ↑ Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
- ↑ Dao, T. et al. (2023). FlashAttention‑2. https://arxiv.org/abs/2307.08691
- ↑ Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- ↑ Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
- ↑ Su, J. et al. (2021). RoFormer: Rotary Position Embedding. https://arxiv.org/abs/2104.09864
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
- ↑ Dai, Z. et al. (2019). Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context. https://arxiv.org/abs/1901.02860
- ↑ Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer: The Efficient Transformer. https://arxiv.org/abs/2001.04451
- ↑ Choromanski, K. et al. (2021). Rethinking Attention with Performers. https://arxiv.org/abs/2009.14794
- ↑ Wang, S. et al. (2020). Linformer: Self‑Attention with Linear Complexity. https://arxiv.org/abs/2006.04768
- ↑ Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. https://arxiv.org/abs/2305.14314
- ↑ Hinton, G. et al. (2015). Distilling the Knowledge in a Neural Network. https://arxiv.org/abs/1503.02531
- ↑ Sanh, V. et al. (2019). DistilBERT. https://arxiv.org/abs/1910.01108
- ↑ Rajbhandari, S. et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
- ↑ Shoeybi, M. et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. https://arxiv.org/abs/1909.08053
- ↑ Hugging Face. Transformers Documentation. https://huggingface.co/docs/transformers
- ↑ Hugging Face. Accelerate Documentation. https://huggingface.co/docs/accelerate
- ↑ Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
- ↑ Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
- ↑ 86.0 86.1 86.2 86.3 86.4 Gu, A.; Goel, K.; Ré, C. (2021). Efficiently Modeling Long Sequences with Structured State Spaces (S4). https://arxiv.org/abs/2111.00396
- ↑ 87.0 87.1 87.2 87.3 87.4 Gu, A.; Dao, T. (2023/2024). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. https://arxiv.org/abs/2312.00752
- ↑ 88.0 88.1 88.2 Sun, Y. et al. (2023). Retentive Network: A Successor to Transformer for Large Language Models. https://arxiv.org/abs/2307.08621
- ↑ 89.0 89.1 89.2 89.3 Lieber, O. et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. https://arxiv.org/abs/2403.19887
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
- ↑ Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
- ↑ Lewis, M. et al. (2019). BART. https://arxiv.org/abs/1910.13461
- ↑ Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- ↑ Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Su, J. et al. (2021). RoPE. https://arxiv.org/abs/2104.09864
- ↑ Press, O. et al. (2021/2022). ALiBi. https://arxiv.org/abs/2108.12409
- ↑ Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- ↑ Du, N. et al. (2021). GLaM. https://arxiv.org/pdf/2112.06905.pdf
- ↑ Hoffmann, J. et al. (2022). Chinchilla. https://arxiv.org/abs/2203.15556
- ↑ Chowdhery, A. et al. (2022). PaLM. https://arxiv.org/abs/2204.02311
- ↑ Shazeer, N. (2019). Fast Transformer Decoding. https://arxiv.org/abs/1911.02150
- ↑ Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
- ↑ Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
- ↑ Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
- ↑ Shazeer, N. (2020). GLU Variants. https://arxiv.org/abs/2002.05202
- ↑ Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
- ↑ Kwon, W. et al. (2023). vLLM/PagedAttention. https://arxiv.org/abs/2309.06180
- ↑ OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- ↑ Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
- ↑ Gu, A.; Dao, T. (2023). Mamba. https://arxiv.org/abs/2312.00752
- ↑ Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
- ↑ Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- ↑ Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
- ↑ Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- ↑ Lieber, O. et al. (2024). Jamba. https://arxiv.org/abs/2403.19887
- ↑ Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608