Large language model architectures — LLM आर्किटेक्चर

From Systems analysis Wiki
Jump to navigation Jump to search

बड़े भाषा मॉडलों (LLM) की आर्किटेक्चर — ये वे मूलभूत सिद्धांत और संरचनाएँ हैं जो यह निर्धारित करती हैं कि बड़े भाषा मॉडल कैसे बनाए जाते हैं, प्रशिक्षित होते हैं और कार्य करते हैं। आधुनिक LLM, जो मानवीय भाषा को समझने और उत्पन्न करने में सक्षम हैं, लगभग पूर्णतः Transformer आर्किटेक्चर[1] पर आधारित हैं, किंतु इनमें अनेक सुधार और विविध दृष्टिकोण शामिल हैं जो दक्षता, मापनीयता और क्षमताओं को बढ़ाने के उद्देश्य से विकसित किए गए हैं।

LLM आर्किटेक्चर के परिवार (Transformer)

आधुनिक बड़े भाषा मॉडल Transformer आर्किटेक्चर[1] पर आधारित हैं, किंतु उद्देश्य के अनुसार इसका उपयोग भिन्न-भिन्न तरीके से होता है: पाठ को समझना, उसका विस्तार उत्पन्न करना या एक पाठ को दूसरे में रूपांतरित करना। व्यवहार में Transformer के मूलभूत सिद्धांतों को बनाए रखते हुए तीन परिवार प्रतिष्ठित किए जाते हैं[2][3][4]

1. Encoder‑only (केवल एन्कोडर)

मॉडल केवल एन्कोडर स्टैक का उपयोग करता है और संपूर्ण इनपुट पाठ को द्विदिशीय रूप से देखता है। प्री-ट्रेनिंग सामान्यतः masked‑language modeling (MLM, मास्किंग-सहित भाषा मॉडलिंग) के रूप में निर्मित होती है: कुछ token छिपाए जाते हैं और मॉडल उन्हें आसपास के संदर्भ से पुनर्स्थापित करना सीखता है। द्विदिशीय संदर्भ के कारण ऐसे मॉडल समझ और स्कोरिंग के कार्यों में सशक्त होते हैं: वर्गीकरण, इकाई पहचान, दस्तावेज़ पुनर्क्रमांकन और निष्कर्षणात्मक QA। स्वतः-प्रत्यावर्ती पीढ़ी के लिए ये "शून्य से" नहीं बने हैं।

व्यवहार में encoder‑only परिवार के लिए वैकल्पिक प्री-ट्रेनिंग लक्ष्य भी प्रयुक्त होते हैं: ELECTRA में replaced token detection (RTD) (discriminator मॉडल प्रतिस्थापित token को पहचानता है) और शब्दार्थ खोज/रिट्रीवर के लिए bi-एन्कोडर का contrastive learning (Dense Passage Retrieval की तरह "क्वेरी-दस्तावेज़" युग्मों पर InfoNCE/softmax‑loss)। RAG में उपयोग के दौरान encoder‑only या तो bi-एन्कोडर (त्वरित ANN-खोज के लिए क्वेरी और दस्तावेज़ का पृथक एन्कोडिंग) या cross-एन्कोडर (सटीक पुनर्क्रमांकन के लिए युग्म का संयुक्त एन्कोडिंग) की भूमिका निभाते हैं।

लाभ:

  • द्विदिशीय संदर्भ के कारण पाठ समझ की उच्च गुणवत्ता: वर्गीकरण, NER, तथ्य निष्कर्षण, पुनर्क्रमांकन, निष्कर्षणात्मक QA।
  • समानांतर प्रसंस्करण और उच्च थ्रूपुट: स्वतः-प्रत्यावर्तन के बिना एकल फॉरवर्ड पास; सामूहिक स्कोरिंग को बैच करना सुविधाजनक।
  • खोज और RAG के साथ स्वाभाविक एकीकरण: bi-एन्कोडर की भूमिका में — त्वरित शब्दार्थ खोज; cross-एन्कोडर की भूमिका में — सटीक पुनर्क्रमांकन।
  • कुशल अनुकूलन: लक्षित fine-tuning के बाद अपेक्षाकृत संक्षिप्त संस्करण (≈100–300 मिलियन पैरामीटर; BERT‑base ≈110 मिलियन) उच्च गुणवत्ता देते हैं।
  • स्थिर विलंबता जो उत्पन्न उत्तर की लंबाई पर निर्भर नहीं (कोई चरण-दर-चरण डिकोडिंग नहीं); बड़े संग्रहों के ऑफलाइन-स्कोरिंग के लिए उपयुक्त।
  • सापेक्ष/घूर्णन स्थितियों और/या स्थानीय-विरल attention के माध्यम से एन्कोडर की context window बढ़ाने की संभावना (जैसे Longformer/BigBird), जो लंबे दस्तावेज़ों के लिए उपयोगी है।

कमियाँ:

  • अपनी कोई जनरेटिव क्षमता नहीं: संवाद और विस्तृत उत्तरों के लिए decoder या बाहरी जनरेटिव मॉड्यूल आवश्यक।
  • इंटरेक्टिव परिदृश्यों में सीमितता: स्थिति-संरक्षण के साथ चरण-दर-चरण पीढ़ी नहीं।
  • प्री-ट्रेनिंग लक्ष्य और स्वतंत्र पीढ़ी कार्यों में असंगति: MLM कारण-आधारित मॉडलिंग की तुलना में पीढ़ी के साथ कम संगत।
  • ऐतिहासिक रूप से सीमित context window (अक्सर पूर्ण स्थिति के आधार संरचनाओं में 512 token); विस्तार के लिए विशेष स्थिति/attention योजनाओं और/या fine-tuning की आवश्यकता।
  • रिट्रीवल कार्यों के लिए bi-एन्कोडर और/या cross-एन्कोडर का अलग contrastive fine-tuning आवश्यक; इसके बिना खोज/पुनर्क्रमांकन की गुणवत्ता विशेष रूप से प्रशिक्षित मॉडलों से सामान्यतः कम होती है।

प्रतिनिधि मॉडल: BERT और इसके व्युत्पन्न, तथा RoBERTa और DeBERTa (encoder‑only के विस्तारित संस्करण); वैकल्पिक प्री-ट्रेनिंग लक्ष्यों में — ELECTRA (RTD)। [5][6][7][8][9][10]

2. Decoder‑only (केवल डिकोडर)

केवल decoder स्टैक का उपयोग होता है जिसमें कारण-आधारित (बाएँ-दिशा) attention होती है: मॉडल पहले से दिए गए prefix के आधार पर अगले token की भविष्यवाणी करता है। यह प्रशिक्षण मोड — causal language modeling (CLM) — इन मॉडलों को पीढ़ी के लिए स्वाभाविक विकल्प बनाता है: संवाद, विस्तृत उत्तर, रचनात्मक पाठ, प्रोग्राम कोड। समझौता — लंबे prompt पर विलंब और KV-cache का आकार बढ़ना। व्यवहार में decoder‑only के लिए इंजीनियरिंग तकनीकें व्यापक रूप से प्रयुक्त होती हैं: MQA और GQA द्वारा KV-cache में कमी, speculative decoding और सर्वर अनुकूलन (PagedAttention/vLLM, continuous batching, chunked prefill) द्वारा अनुमान गति में वृद्धि।[11][12][13][14][15]

लाभ:

  • स्वाभाविक पाठ पीढ़ी (CLM): सशक्त zero‑shot और few‑shot क्षमताएँ; अच्छी तरह मापनीय।[16]
  • उपयोग की बहुमुखिता: एक मॉडल prompt में निर्देशों और उदाहरणों से अनेक कार्य हल करता है; RAG और tool use के साथ स्वाभाविक संयोजन।
  • परिपक्व पारिस्थितिकी तंत्र: instructional fine-tuning और व्यवहार संरेखण की प्रथाएँ (RLHF, DPO); खुले और व्यावसायिक कार्यान्वयन उपलब्ध।[17][18]
  • inference अनुकूलन का समृद्ध स्टैक: MQA/GQA KV-cache का आकार घटाते हैं और थ्रूपुट बढ़ाते हैं; speculative decoding वितरण बदले बिना अनुमान गति बढ़ाता है; PagedAttention/vLLM के साथ continuous batching और chunked prefill GPU उपयोग दक्षता बढ़ाते हैं।[19][20][21][22][23]
  • कड़े उत्तर प्रारूपों (JSON/SQL/DSL) के लिए structured generation का समर्थन, जो सूचना प्रणालियों और API के साथ एकीकरण को सरल बनाता है।[24][25]

कमियाँ:

  • पीढ़ी की बढ़ी हुई विलंबता: क्रमिक अनुमान; नए token की लागत पहले से "पढ़े" संदर्भ की लंबाई (KV-cache) के साथ बढ़ती है।
  • "लंबा इनपुट – छोटा आउटपुट" प्रोफ़ाइल (सारांशीकरण, अनुवाद) में encoder–decoder की तुलना में कम लाभदायक, जहाँ इनपुट एक बार एन्कोड होता है।
  • एकदिशीय संदर्भ की सीमा: समझ के कार्यों में कभी-कभी द्विदिशीय प्रतिनिधित्व वाले मॉडलों (encoder‑only / encoder–decoder) से पीछे।
  • लंबे prompt और बड़े batch पर KV-cache की मेमोरी "बाधक" हो सकती है; [26]
  • activation/KV का क्वांटीकरण (INT8/FP8) अनुमान गति बढ़ाता है, किंतु लंबे संदर्भ/कोड पर गुणवत्ता घटा सकता है; सावधान सत्यापन आवश्यक (विशेषतः कड़े SLA के साथ)।

प्रतिनिधि मॉडल: GPT‑3, GPT‑4 (आर्किटेक्चर और dataset विवरण सार्वजनिक रूप से उपलब्ध नहीं), LLaMA और Llama 3 (8B/70B, 2024)।[27][28][29][30]

3. Encoder–decoder (एन्कोडर-डिकोडर)

यह आर्किटेक्चर दोनों घटकों को संयुक्त करती है। एन्कोडर द्विदिशीय मोड में कार्य करता है, और decoder — कारण-आधारित। एन्कोडर एक बार इनपुट का विश्लेषण करता है और उसका प्रतिनिधित्व बनाता है; decoder इस प्रतिनिधित्व को cross‑attention के माध्यम से उपयोग करते हुए आउटपुट उत्पन्न करता है। यह पृथक दृष्टिकोण विशेष रूप से तब उपयोगी होता है जब लंबे इनपुट पाठ को छोटे आउटपुट में रूपांतरित करना हो: मशीन अनुवाद, सारांशीकरण, दस्तावेज़-आधारित प्रश्नोत्तर। यद्यपि विधि को अधिक कुल वैकल्पिक लागत (दो स्टैक और cross-attention) की आवश्यकता होती है, इसका लाभ — पूर्ण स्रोत पाठ विश्लेषण के आधार पर नियंत्रित पीढ़ी; साथ ही एन्कोडिंग एक बार होती है और अनुमान की पूरी प्रक्रिया में पुनः उपयोग होती है।

लाभ:

  • सशर्त पीढ़ी: decoder इनपुट के प्रतिनिधित्व को cross‑attention का उपयोग करता है। [31]
  • "लंबा इनपुट → छोटा आउटपुट" परिदृश्य में दक्षता: इनपुट एक बार एन्कोड होता है।
  • "text‑to‑text" प्रारूप और नियंत्रित अनुमान (कार्य prefix, विशेष निर्देश) के लिए सुविधाजनक। [32]
  • लंबे स्रोत के साथ स्थिरता और दक्षता: डिकोडिंग चरण में केवल आउटपुट पर self‑attention बढ़ता है, जबकि cross‑attention एन्कोडर की निश्चित keys/values पुनः उपयोग करता है (प्रत्येक चरण पर इनपुट "पुनः पढ़ा" नहीं जाता)।

कमियाँ:

  • दो स्टैक प्रशिक्षण और उपयोग में मेमोरी और गणना की आवश्यकताएँ बढ़ाते हैं।
  • अत्यंत लंबी अनुक्रमों पर कुल विलंब decoder‑only से तुलनीय; स्वतः-प्रत्यावर्तन बाधा बना रहता है।
  • decoder‑only की तुलना में कम सार्वभौमिक chat मॉडल; अक्सर विशिष्ट कार्यों के लिए उच्च-गुणवत्ता seq2seq इंजन के रूप में उपयोग।
  • बहुत लंबे इनपुट पर decoder के प्रत्येक layer में cross‑attention keys/values (पूरे स्रोत पर) की मेमोरी बढ़ती है, जिसके लिए सावधान सर्विंग योजना आवश्यक।

प्रतिनिधि मॉडल: T5 (T5 v1.1 सहित और FLAN‑T5 में instructional fine-tuning की प्रथा) और BART। [33][34][35]

Dense Transformer - प्लॉट (घना) Transformer

LLM की सर्वाधिक प्रचलित क्लासिक आर्किटेक्चर: प्रत्येक token के प्रसंस्करण में मॉडल के लगभग सभी पैरामीटर भाग लेते हैं। विरल दृष्टिकोणों (जैसे Mixture‑of‑Experts) के विपरीत, उपनेटवर्क का चयनात्मक सक्रियण नहीं है — प्रत्येक ब्लॉक प्रत्येक token के लिए कार्य करता है। [1]

कार्य सिद्धांत और आर्किटेक्चर

मूल संरचना। मॉडल — N एकसमान Transformer ब्लॉकों का स्टैक। प्रत्येक ब्लॉक में शामिल हैं:

  1. बहु-शीर्ष स्व-attention (Multi‑Head Self‑Attention)। प्रत्येक token के लिए तीन वेक्टर गणित किए जाते हैं: Q (query), K (key), V (value); attention परिभाषित होता है softmax(QK+Mdk)V के रूप में, जहाँ M — mask (कारण-आधारित और/या padding-mask) जो अस्वीकार्य स्थितियों को बाहर करती है। कई "attention शीर्ष" समानांतर में संदर्भ के विभिन्न पहलुओं को ध्यान में रखते हैं (H शीर्ष, सामान्यतः dhead=dmodelH); उनकी संख्या मॉडल के पैमाने के साथ बढ़ती है। [1]
  2. पूर्ण-संयोजित नेटवर्क (Feed‑Forward Network, FFN)। दो रैखिक परतें जिनके बीच अरैखिकता है (सामान्यतः GELU/SiLU; कुछ आधुनिक मॉडलों में — SwiGLU)। मध्यवर्ती आयाम सामान्यतः 4dmodel; SwiGLU उपयोग करते समय तुलनीय पैरामीटर संख्या बनाए रखने के लिए अक्सर 83dmodel लेते हैं। FFN में पैरामीटर का महत्वपूर्ण अनुपात होता है। [1][36]

अतिरिक्त घटक। अवशिष्ट (residual) संयोजन और परत सामान्यीकरण उपयोग होते हैं; आधुनिक LLM में अक्सर Pre‑LN (उप-ब्लॉक से पहले सामान्यीकरण) का उपयोग होता है — यह बड़ी गहराई पर प्रशिक्षण स्थिरता सुधारता है। क्लासिक LayerNorm के अलावा RMSNorm का उपयोग और अधिक हो रहा है (गणना लागत घटाती है और बड़े मॉडलों में अच्छा काम करती है); कुछ परिवारों में attention स्थान में सामान्यीकरण भी प्रयुक्त होता है (जैसे softmax से पहले Q/K का सामान्यीकरण)। स्थितीय प्रतिनिधित्व पूर्ण या सापेक्ष हो सकते हैं; लंबे संदर्भ के लिए RoPE वास्तविक मानक बन गया है।

मॉडल उदाहरण और पैमाना
  • BERT‑Large: 24 परतें, आयाम 1024, 16 attention शीर्ष, ≈340 मिलियन पैरामीटर। [37]
  • GPT‑3 (175B): 96 परतें, आयाम 12288, 96 attention शीर्ष, ≈175 अरब पैरामीटर। [38]
  • LLaMA‑65B: 80 परतें, आयाम 8192, 64 attention शीर्ष, ≈65 अरब पैरामीटर। [39]
  • PaLM‑540B: 118 परतें, आयाम लगभग 18432, ≈540 अरब पैरामीटर। [40]
लाभ
  • एकसमान ब्लॉक, अच्छी तरह अध्ययन किए गए प्रशिक्षण मोड और पैमाने पर पूर्वानुमेय व्यवहार।
  • पैरामीटर और डेटा बढ़ने पर गुणवत्ता घातांकीय रूप से सुधरती है; compute‑optimal मोड मॉडल आकार और प्रशिक्षण token की मात्रा का संयुक्त वृद्धि मानता है। [41][42]
  • fine-tuning के बाद एक ही आर्किटेक्चर परत-स्तर परिवर्तन के बिना कार्यों की विस्तृत श्रृंखला कवर करती है।
कमियाँ
  • पूर्ण self‑attention की अनुक्रम लंबाई पर द्विघात जटिलता है (O(n2)), जो context window को सीमित करती है। [1]
  • पीढ़ी चरण में पैरामीटर का पूर्ण सक्रियण: MoE के बिना decoder में प्रति token अनुमान लागत लगभग पैरामीटर संख्या के समानुपाती बढ़ती है।
  • बाधा — मेमोरी बैंडविड्थ (memory‑bound): HBM से वजन लोडिंग अक्सर inference गति को सीमित करती है।
मापनीयता और संदर्भ की सीमाएँ
  • पैरामीटर के लिए मेमोरी मॉडल आकार के साथ रैखिक रूप से बढ़ती है; प्रशिक्षण मेमोरी gradient और optimizer अवस्थाओं के कारण बढ़ती है।
  • मूल संरचनाएँ ऐतिहासिक रूप से 2–4 हजार token तक सीमित थीं। आधुनिक स्थितीय योजनाएँ (RoPE) और विस्तार तकनीकें (Position Interpolation, YaRN आदि) window को कई गुना और अधिक बढ़ाने की अनुमति देती हैं, किंतु अतिरिक्त गणना/मेमोरी भार के साथ। [43][44]

आधुनिक अनुकूलन

  • FlashAttention। GPU मेमोरी पदानुक्रम को ध्यान में रखते हुए सटीक attention; लंबी अनुक्रमों पर मेमोरी लागत घटाता है और प्रशिक्षण/inference तेज़ करता है। [45]
  • KV-cache में कमी और प्रबंधन। Multi‑Query Attention और Grouped‑Query Attention cache का आकार और मेमोरी ट्रैफ़िक घटाते हैं; सर्वर स्तर पर PagedAttention (vLLM) पृष्ठ-आधारित cache प्रबंधन द्वारा थ्रूपुट बढ़ाता है। [46][47][48]
  • Speculative decoding। Draft मॉडल विस्तार प्रस्तावित करता है, और मुख्य मॉडल उसे शीघ्र सत्यापित करता है; आउटपुट वितरण बदले बिना गति में वृद्धि होती है। [49]

Sparse Models और Mixture‑of‑Experts (MoE)

MoE — प्रति token गणना के आनुपातिक वृद्धि के बिना मॉडल क्षमता बढ़ाने का एक तरीका। एक बड़े FFN-ब्लॉक के स्थान पर परत में समानांतर "विशेषज्ञों" का समूह (कई स्वतंत्र FFN) उपयोग होता है, और प्रशिक्षण योग्य राउटर (gating network) प्रत्येक token के लिए top‑k सर्वाधिक प्रासंगिक विशेषज्ञों का चयन करता है (सामान्यतः k=1–2; कुछ मॉडलों में k=4)। केवल चुने गए विशेषज्ञ सक्रिय होते हैं; उनके आउटपुट भारित और संकलित होते हैं। इस प्रकार कुल पैरामीटर सैकड़ों अरब और यहाँ तक कि खरबों हो सकते हैं, किंतु प्रत्येक चरण में केवल छोटा अंश सक्रिय होता है। [50][51]

मॉडल उदाहरण और पैमाना

  • Switch Transformer (Google): ~1.6T पैरामीटर तक; top‑1 रूटिंग (प्रति token एक विशेषज्ञ)। दर्शाया कि MoE प्रति token तुलनीय लागत पर क्षमता तेज़ी से बढ़ा सकता है। [50]
  • GLaM (Google): 1.2T पैरामीटर, परत में 64 विशेषज्ञ, top‑2; प्रत्येक token पर ≈96.6B पैरामीटर सक्रिय (≈8%)। [51]
  • Mixtral 8×7B (Mistral AI): कुल ~46.7B पैरामीटर, प्रति token ≈12.9B सक्रिय, top‑2। [52][53]
  • Mixtral 8×22B: कुल ~141B पैरामीटर, प्रति token ≈39B सक्रिय, top‑2। [54]
  • DBRX (Databricks): कुल 132B पैरामीटर, प्रति token ≈36B सक्रिय; 16 विशेषज्ञ और top‑4 रूटिंग (fine‑grained MoE)। [55]
लाभ
  • गणना की लागत सक्रिय विशेषज्ञों की संख्या k से निर्धारित होती है, कुल पैरामीटर से नहीं: अनुमान लागत के साथ खरब पैमाने के मॉडल प्रशिक्षित और उपयोग किए जा सकते हैं जो उल्लेखनीय रूप से छोटे dense मॉडलों से तुलनीय हो। [51]
  • विशेषज्ञता: विशेषज्ञ स्वतः भाषाओं/डोमेन/पैटर्न के अनुसार "समायोजित" होते हैं, बहु-डोमेन कार्यों में गुणवत्ता सुधरती है।
  • लचीला परिनियोजन: अक्सर उपयोग किए जाने वाले विशेषज्ञों को मेमोरी में रख सकते हैं और दुर्लभ विशेषज्ञों को लोड कर सकते हैं (उपयुक्त अवसंरचना के साथ)।
सीमाएँ
  • भार संतुलन: नियमितीकरण के बिना राउटर विशेषज्ञों के एक हिस्से पर "अटक" सकता है (router collapse)। auxiliary losses (load‑balancing) और बेहतर रूटिंग योजनाएँ आवश्यक। [50]
  • वितरित गणना की जटिलता: expert parallelism और all‑to‑all आदान-प्रदान आवश्यक; संचार overhead और मेमोरी प्रबंधन बाधक बनते हैं। [56]
  • प्रशिक्षण स्थिरता: router और क्षमता (capacity) बाधाओं की सेटिंग महत्वपूर्ण, अन्यथा गुणवत्ता/अभिसरण में गिरावट संभव।

आधुनिक सुधार

  • Expert‑Choice routing: विशेषज्ञ token "चुनते" हैं, जो तुलनीय लागत पर संतुलन और अभिसरण सुधारता है। [57]
  • Fine‑grained MoE: अधिक संख्या में छोटे विशेषज्ञ (जैसे DBRX में) विशेषज्ञता की बारीक दानेदारी देते हैं। [55]
  • Sparse Upcycling: dense मॉडल को उसके checkpoint से MoE में परिवर्तन मध्यम लागत पर गुणवत्ता में उल्लेखनीय वृद्धि की अनुमति देता है। [58]

MoE के उपयोग की उचितता

  • सीमित compute बजट पर बड़े बहु-डोमेन सहायक।
  • विशाल corpus पर प्रशिक्षण, जहाँ विशेषज्ञता लाभ देती है।
  • विकसित वितरित अवसंरचना वाले परिदृश्य (अनेक GPU/TPU और तेज़ नेटवर्क)।

Dense मॉडल कब बेहतर: सीमित अवसंरचना (1–2 GPU), अनुमानित विलंब और सरल परिनियोजन की कड़ी आवश्यकताएँ।

Retrieval‑Augmented Generation (RAG)

RAG — यह LLM के इर्द-गिर्द प्रणाली का आर्किटेक्चरल पैटर्न है, न कि स्वयं मॉडल की आंतरिक आर्किटेक्चर। यह LLM (जनरेटिव घटक) को बाहरी ज्ञान आधार (निष्कर्षण घटक) के साथ जोड़ता है, जो मॉडल की "पैरामीट्रिक मेमोरी" की सीमाओं को क्षतिपूरित करने की अनुमति देता है।

  • कार्य सिद्धांत: पीढ़ी से पहले LLM बाहरी स्रोत (विकी, कॉर्पोरेट ज्ञान आधार, वेब) से प्रासंगिक दस्तावेज़ निकालता है और उत्तर बनाते समय उन पर निर्भर करता है। [59]
  • लाभ:
    • भ्रम (hallucination) में कमी और तथ्यात्मक सटीकता में सुधार। [59][60]
    • मॉडल के पूर्ण पुनः-प्रशिक्षण के बिना अद्यतनता। [59]
    • उत्तरों की उद्धरण-योग्यता और पता लगाने योग्यता।
  • उपयोग: कॉर्पोरेट सहायकों और उन प्रणालियों के लिए वास्तविक मानक जहाँ सत्यापन योग्य तथ्य और निजी/अत्यंत विशिष्ट डेटा के साथ कार्य आवश्यक है। [59]

Attention तंत्र और संदर्भ के साथ कार्य

मूल self‑attention की अनुक्रम लंबाई पर द्विघात जटिलता है (O(n2)), इसलिए अनुकूलन उत्पन्न हुए।

  • Sparse Attention (विरल attention): attention को स्थानीय windows/patterns तक सीमित करना। उदाहरण: Longformer[61], BigBird[62]
  • FlashAttention: GPU मेमोरी पदानुक्रम को ध्यान में रखते हुए गणना क्रम का पुनर्गठन; समय और मेमोरी में महत्वपूर्ण लाभ देता है और लंबे संदर्भ के साथ LLM प्रशिक्षण में वास्तविक मानक बन गया है[63][64][65]
  • MQA/GQA (डिकोडिंग त्वरण): Multi‑Query Attention (सभी शीर्षों के लिए साझा keys/values) KV-cache ट्रैफ़िक घटाता है[66]Grouped‑Query Attention गुणवत्ता/गति संतुलन बनाता है[67]
  • बेहतर स्थितीय प्रतिनिधित्व:
    • ALiBi (Attention with Linear Biases): attention स्कोर में रैखिक विस्थापन बड़ी लंबाइयों पर सामान्यीकरण सुधारते हैं। [68]
    • RoPE (Rotary Position Embeddings): Q/K के घुमाव के माध्यम से सापेक्ष स्थितीय जानकारी; आधुनिक मॉडलों में व्यापक रूप से उपयोग (जैसे LLaMA)। [69][70]
    • RoPE-मॉडलों के लिए संदर्भ विस्तार: Position Interpolation [71], YaRN [72], तथा NTK-aware संशोधन आर्किटेक्चर बदले बिना context window प्रभावी ढंग से बढ़ाने की अनुमति देते हैं।
  • लंबी अनुक्रमों के अन्य दृष्टिकोण:
    • Transformer‑XL: दूरस्थ निर्भरताओं के मॉडलिंग के लिए खंडों के बीच आवर्ती मेमोरी। [73]
    • Reformer: मेमोरी बचाने के लिए LSH‑attention और उत्क्रमणीय residual ब्लॉक। [74]
    • Performer: softmax‑attention का रैखिक सन्निकटन (FAVOR+)। [75]
    • Linformer: attention मैट्रिक्स का निम्न-रैंक सन्निकटन। [76]

मॉडल अनुकूलन और प्रशिक्षण अवसंरचना

LLM के प्रशिक्षण और परिनियोजन के लिए विशेष तकनीकें और framework उपयोग होते हैं।

  • Quantization (परिमाणीकरण): वजन की बिट-गहराई कम करना मेमोरी घटाता है और inference तेज़ करता है। QLoRA 4-बिट मॉडलों (65B सहित) को पूर्ण-सटीकता के करीब गुणवत्ता के साथ प्रभावी ढंग से fine-tune करने की अनुमति देता है[77]
  • Knowledge Distillation (ज्ञान आसवन): संक्षिप्त मॉडलों के लिए Teacher→Student-प्रशिक्षण[78]; उदाहरण — DistilBERT[79]
  • वितरित प्रशिक्षण:
    • DeepSpeed और ZeRO — खरब मॉडलों के प्रशिक्षण के लिए पैरामीटर/gradient/optimizer अवस्थाओं का वितरण[80]
    • Megatron‑LM — बहुत बड़े Transformer के लिए tensor और pipeline parallelism[81]
  • पारिस्थितिकी तंत्र और उपकरण: Hugging Face Transformers और Accelerate मॉडलों के मानक कार्यान्वयन और प्रशिक्षण व inference के लिए DeepSpeed/FSDP के साथ एकीकरण प्रदान करते हैं[82][83]

Scaling Laws और Compute‑Optimal प्रशिक्षण

अनुभवजन्य scaling laws दर्शाते हैं कि cross-entropy त्रुटि पैरामीटर, डेटा और गणना बढ़ने पर घातांकीय नियम से घटती है। [84] Chinchilla कार्य ने compute‑optimal मोड को परिष्कृत किया: इष्टतम दक्षता के लिए मॉडल आकार और प्रशिक्षण token की संख्या संयुक्त रूप से बढ़ाई जानी चाहिए (उदाहरण — 70B मॉडल ~1.4T token पर प्रशिक्षित, बड़े अल्प-प्रशिक्षित मॉडलों से बेहतर)। [85]

State Space Models (SSM) - स्थिति स्थान मॉडल

State Space Models (SSM) — लंबी अनुक्रमों के साथ कार्य के लिए Transformer का वैकल्पिक आर्किटेक्चर। यह नियंत्रण सिद्धांत और डिजिटल सिग्नल प्रसंस्करण से विचार उधार लेता है और self‑attention की मुख्य समस्या हल करता है: पाठ लंबाई बढ़ने पर गणना की द्विघात वृद्धि।

मुख्य समस्या और समाधान

Transformer की समस्या। पारंपरिक Transformer की मुख्य समस्या — attention की द्विघात जटिलता: 10 गुना लंबे पाठ के लिए लगभग 100 गुना अधिक गणना आवश्यक।

SSM का दृष्टिकोण। "सभी शब्दों पर एक साथ attention" के बजाय मॉडल पाठ पर क्रमिक रूप से चलता है और एक संक्षिप्त आंतरिक मेमोरी अवस्था बनाए रखता है जो प्रत्येक चरण पर अद्यतन होती है। परिणामस्वरूप समय और मेमोरी खपत पाठ लंबाई के साथ लगभग रैखिक रूप से बढ़ती है। साथ ही प्रशिक्षण समानांतर रूप से किया जा सकता है — kernel के convolution प्रतिनिधित्व के माध्यम से (लंबी अनुक्रमों पर उच्च थ्रूपुट)। [86]

कार्य सिद्धांत

विवेकी SSM अवस्था और आउटपुट समीकरणों द्वारा वर्णित है:

xt=Axt1+But,yt=Cxt+Dut

जहाँ xt — मेमोरी अवस्था, ut — इनपुट (token), yt — आउटपुट। गहरी SSM में मैट्रिक्स A,B,C,D को इस प्रकार पैरामीट्रीकृत किया जाता है ताकि लंबी अनुक्रमों पर स्थिरता और कुशल गणना सुनिश्चित हो। उसी परत को माना जा सकता है:

  • आवर्ती (चरणों पर स्कैन) — KV-cache के बिना मेमोरी-कुशल inference;
  • convolution — पूर्व-गणित kernel के साथ समानांतर प्रशिक्षण। [86]

मुख्य आर्किटेक्चर और हाइब्रिड

  • S4 (Structured State Spaces)। अवस्था मैट्रिक्स के स्थिर पैरामीट्रीकरण के साथ SSM baseline; बहुत लंबी अनुक्रमों पर दक्षता दर्शाता है। [86]
  • Mamba। चयनात्मक SSM: मेमोरी अद्यतन नियम वर्तमान इनपुट पर निर्भर (मॉडल स्वयं तय करता है कि "मेमोरी में रखना" है और क्या "भूलना")। कार्यान्वयन GPU मेमोरी पदानुक्रम के उन्मुख; लेखकों के अनुसार, रैखिक जटिलता पर inference थ्रूपुट में कई गुना वृद्धि होती है। [87]
  • RetNet। तीन मोड के साथ retention तंत्र: समानांतर प्रशिक्षण, आवर्ती और खंड-आवर्ती inference। लक्ष्य — तेज़ प्रशिक्षण (Transformer की तरह) और कुशल inference प्रवाह (प्रति token O(1) मेमोरी) को संयुक्त करना। [88]
  • Attention+SSM हाइब्रिड। उदाहरण — Jamba (Transformer और Mamba परतों का चक्रण और MoE): ~256 K token के क्रम के संदर्भ का समर्थन करने की रिपोर्ट करता है, समान वर्ग के विशुद्ध Transformer मॉडलों की तुलना में काफी कम मेमोरी आवश्यकता के साथ। [89]

लाभ

  • रैखिक जटिलता और inference पर मेमोरी बचत। कोई वैश्विक self‑attention और KV-cache नहीं; केवल संक्षिप्त अवस्था संग्रहीत। [87][88]
  • लंबी अनुक्रमों पर समानांतर प्रशिक्षण। Convolution मोड प्रशिक्षण थ्रूपुट बढ़ाता है। [86]
  • हार्डवेयर दक्षता। कार्यान्वयन आधुनिक मेमोरी पदानुक्रम (HBM/SRAM) के उन्मुख। [87]
  • लंबे संदर्भ और streaming। SSM+Attention हाइब्रिड मध्यम संसाधनों पर सैकड़ों हजारों token के लिए व्यावहारिक। [89]

सीमाएँ और वर्तमान अभ्यास

  • पारिस्थितिकी तंत्र की परिपक्वता। उपकरण और मापनीयता "व्यंजन" (निर्देश, RLHF/DPO) अभी Transformer स्टैक से पीछे हैं। [87]
  • गुणवत्ता और स्थिरता। कुछ कार्यों पर हाइब्रिड (Attention+SSM) "शुद्ध" SSM की तुलना में अधिक स्थिर "गुणवत्ता/गति/मेमोरी" समझौता दर्शाते हैं। [89]

दृष्टिकोणों की तुलना (सामान्यीकृत)

विशेषता Transformer SSM हाइब्रिड (Attention+SSM)
लंबाई पर जटिलता द्विघात (self‑attention) रैखिक (scan/convolution) रैखिक के निकट
प्रति token मेमोरी (inference) KV-cache संदर्भ के साथ बढ़ता है O(1) अवस्था मध्यम वृद्धि
लंबे संदर्भ विशेष अनुकूलन आवश्यक स्वाभाविक समर्थन ~256 K तक व्यावहारिक
पारिस्थितिकी तंत्र परिपक्वता उच्च विकासशील विकासशील

व्यावहारिक उपयोग

  • बहुत लंबे दस्तावेज़ों का विश्लेषण (पुस्तकें, रिपोर्ट, वैज्ञानिक समीक्षाएँ)।
  • मेमोरी बढ़ाए बिना लंबे इतिहास के साथ streaming प्रसंस्करण और chat परिदृश्य।
  • सीमित संसाधन वाले वातावरण (मोबाइल/edge उपकरण)।
  • समय श्रृंखला और अन्य क्रमिक डेटा।

प्रतिनिधि मॉडल: S4, Mamba, RetNet; Attention+SSM हाइब्रिड (Jamba)। [86][87][88][89]

आर्किटेक्चर का विकास

  • 2017 — "Attention Is All You Need" शोध पत्र प्रकाशित। Transformer आर्किटेक्चर प्रस्तुत किया गया: बहु-शीर्ष self‑attention और स्थितीय एन्कोडिंग आवर्तिता और convolution के बिना मॉडल प्रशिक्षित करने की अनुमति देते हैं; साथ ही attention की context लंबाई पर द्विघात जटिलता है।[1]
  • 2018 — GPT‑1 और BERT प्रस्तुत किए गए। GPT‑1 पीढ़ी और बाद के fine-tuning के लिए कारण-आधारित attention के साथ केवल-decoder स्टैक उपयोग करता है; BERT पाठ समझ कार्यों के लिए द्विदिशीय एन्कोडर और MLM प्री-ट्रेनिंग प्रस्तुत करता है। [90][91]
  • 2019 — लंबी अनुक्रमों के साथ कार्य के तरीके प्रस्तावित और decoder‑only को बड़े पैमाने पर किया गया। Transformer‑XL निश्चित window की सीमा से परे जाने के लिए "मेमोरी" और सापेक्ष स्थितियाँ जोड़ता है; GPT‑2 पैमाने में वृद्धि पर zero‑shot क्षमताओं की वृद्धि दर्शाता है; BART seq2seq के लिए denoising प्री-ट्रेनिंग की दक्षता प्रदर्शित करता है। [92][93][94]
  • 2020 — "text‑to‑text" प्रारूप एकीकृत और लंबे दस्तावेज़ों के लिए विधियाँ दिखाई गईं। T5 विभिन्न कार्यों के लिए encoder–decoder का एकीकृत दृष्टिकोण प्रस्तुत करता है; Longformer और BigBird लंबे पाठ के लिए विरल/संरचित attention उपयोग करते हैं; GPT‑3 dense decoder‑only की मापनीयता की प्रभावशीलता की पुष्टि करता है। [95][96][97][98]
  • 2021 — स्थितीय प्रतिनिधित्व सुधारे गए और पैरामीटर विरलता (MoE) दिखाई गई। RoPE और ALiBi बड़ी लंबाइयों पर सामान्यीकरण सुधारते हैं; Switch Transformer और GLaM प्रति token केवल विशेषज्ञों का हिस्सा सक्रिय करते हैं, अनुमान लागत की आनुपातिक वृद्धि के बिना क्षमता बढ़ाते हैं। [99][100][101][102]
  • 2022 — compute‑optimal मोड परिष्कृत और लंबे prompt पर अनुमान गति बढ़ाई गई। Chinchilla मध्यम मॉडल आकार पर अधिक प्रशिक्षण token का लाभ दर्शाता है; Multi‑Query Attention के साथ PaLM KV-cache का आकार घटाता है; FlashAttention GPU पर attention तेज़ करता है। [103][104][105][106]
  • 2023 — परतें बदले बिना context window बढ़ाए गए और सर्वर सेवा में सुधार हुआ। LLaMA श्रृंखला प्रथाएँ स्थापित करती है (RMSNorm, SwiGLU, RoPE); Position Interpolation और YaRN संदर्भ बढ़ाते हैं; vLLM/PagedAttention KV-cache अधिक कुशलता से प्रबंधित करता है। [107][108][109][110][111][112]
  • 2023 — GPT‑4 और Gemini एक मॉडल परिवार के भीतर कई मोडैलिटी में प्रसंस्करण और पीढ़ी दर्शाते हैं। [113][114]
  • 2023 — State Space Models (SSM) प्रस्तावित। Mamba और RetNet KV-cache के बजाय संक्षिप्त अवस्था के साथ क्रमिक प्रसंस्करण वापस लाते हैं और हाइब्रिड आर्किटेक्चर की नींव रखते हैं। [115][116]
  • 2024 — खुले MoE मॉडल और Attention+SSM हाइब्रिड प्रकाशित; नए GPU पर attention त्वरित हुआ। Mixtral 8×7B/8×22B और DBRX MoE की व्यावहारिकता की पुष्टि करते हैं; Jamba बहुत लंबे संदर्भ के लिए Transformer और Mamba को जोड़ता है; FlashAttention‑3 थ्रूपुट बढ़ाता है। [117][118][119][120][121]

संदर्भ

साहित्य

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  2. Devlin, J. et al. (2019). BERT. https://arxiv.org/abs/1810.04805
  3. Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
  4. Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
  5. Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
  6. Liu, Y. et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach. https://arxiv.org/abs/1907.11692
  7. He, P. et al. (2021). DeBERTa: Decoding‑enhanced BERT with Disentangled Attention. https://arxiv.org/abs/2006.03654
  8. Clark, K. et al. (2020). ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators. https://arxiv.org/abs/2003.10555
  9. Zaheer, M. et al. (2020). Big Bird: Transformers for Longer Sequences. https://arxiv.org/abs/2007.14062
  10. Beltagy, I. et al. (2020). Longformer: The Long‑Document Transformer. https://arxiv.org/abs/2004.05150
  11. Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (Multi‑Query Attention). https://arxiv.org/abs/1911.02150
  12. Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. https://arxiv.org/abs/2305.13245
  13. Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
  14. Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). https://arxiv.org/abs/2309.06180
  15. vLLM Docs (2024–2025). Continuous batching, Chunked prefill, Structured outputs. https://docs.vllm.ai/
  16. Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
  17. Ouyang, L. et al. (2022). InstructGPT (RLHF). https://arxiv.org/abs/2203.02155
  18. Rafailov, R. et al. (2023). Direct Preference Optimization. https://arxiv.org/abs/2305.18290
  19. Shazeer, 2019. https://arxiv.org/abs/1911.02150
  20. Ainslie, 2023. https://arxiv.org/abs/2305.13245
  21. Leviathan, 2023. https://arxiv.org/abs/2211.17192
  22. Kwon, 2023. https://arxiv.org/abs/2309.06180
  23. vLLM Docs. https://docs.vllm.ai/
  24. OpenAI (2024). Structured Outputs. https://openai.com/index/introducing-structured-outputs-in-the-api/
  25. vLLM Docs — Structured outputs. https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html
  26. Kwon, 2023. https://arxiv.org/abs/2309.06180
  27. Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
  28. Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
  29. Achiam, J. et al. (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
  30. Meta AI (2024). Introducing Meta Llama 3. https://ai.meta.com/blog/meta-llama-3/
  31. Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
  32. Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
  33. Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
  34. Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension. https://arxiv.org/abs/1910.13461
  35. Chung, H. W. et al. (2022). Scaling Instruction‑Finetuned Language Models (FLAN‑T5). https://arxiv.org/abs/2210.11416
  36. Shazeer, N. (2020). GLU Variants Improve Transformer. https://arxiv.org/abs/2002.05202
  37. Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
  38. Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
  39. Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
  40. Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
  41. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
  42. Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
  43. Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
  44. Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
  45. Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
  46. Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
  47. Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
  48. Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. https://arxiv.org/abs/2309.06180
  49. Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
  50. 50.0 50.1 50.2 Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
  51. 51.0 51.1 51.2 Du, N. et al. (2021). GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts. https://arxiv.org/pdf/2112.06905.pdf
  52. Mistral AI (2023). Mixtral of Experts. https://mistral.ai/news/mixtral-of-experts/
  53. Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
  54. Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
  55. 55.0 55.1 Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
  56. NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
  57. Zhou, Y. et al. (2022). Mixture‑of‑Experts with Expert Choice Routing. https://arxiv.org/abs/2202.09368
  58. Komatsuzaki, A. et al. (2022). Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints. https://arxiv.org/abs/2212.05055
  59. 59.0 59.1 59.2 59.3 Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. https://arxiv.org/abs/2005.11401
  60. NVIDIA Blog (2025). What is Retrieval‑Augmented Generation (RAG). https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/
  61. Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
  62. Zaheer, M. et al. (2020). Big Bird. https://arxiv.org/abs/2007.14062
  63. Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
  64. Dao, T. et al. (2023). FlashAttention‑2. https://arxiv.org/abs/2307.08691
  65. Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608
  66. Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
  67. Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
  68. Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
  69. Su, J. et al. (2021). RoFormer: Rotary Position Embedding. https://arxiv.org/abs/2104.09864
  70. Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
  71. Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
  72. Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
  73. Dai, Z. et al. (2019). Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context. https://arxiv.org/abs/1901.02860
  74. Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer: The Efficient Transformer. https://arxiv.org/abs/2001.04451
  75. Choromanski, K. et al. (2021). Rethinking Attention with Performers. https://arxiv.org/abs/2009.14794
  76. Wang, S. et al. (2020). Linformer: Self‑Attention with Linear Complexity. https://arxiv.org/abs/2006.04768
  77. Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. https://arxiv.org/abs/2305.14314
  78. Hinton, G. et al. (2015). Distilling the Knowledge in a Neural Network. https://arxiv.org/abs/1503.02531
  79. Sanh, V. et al. (2019). DistilBERT. https://arxiv.org/abs/1910.01108
  80. Rajbhandari, S. et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
  81. Shoeybi, M. et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. https://arxiv.org/abs/1909.08053
  82. Hugging Face. Transformers Documentation. https://huggingface.co/docs/transformers
  83. Hugging Face. Accelerate Documentation. https://huggingface.co/docs/accelerate
  84. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
  85. Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
  86. 86.0 86.1 86.2 86.3 86.4 Gu, A.; Goel, K.; Ré, C. (2021). Efficiently Modeling Long Sequences with Structured State Spaces (S4). https://arxiv.org/abs/2111.00396
  87. 87.0 87.1 87.2 87.3 87.4 Gu, A.; Dao, T. (2023/2024). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. https://arxiv.org/abs/2312.00752
  88. 88.0 88.1 88.2 Sun, Y. et al. (2023). Retentive Network: A Successor to Transformer for Large Language Models. https://arxiv.org/abs/2307.08621
  89. 89.0 89.1 89.2 89.3 Lieber, O. et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. https://arxiv.org/abs/2403.19887
  90. Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
  91. Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
  92. Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
  93. Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
  94. Lewis, M. et al. (2019). BART. https://arxiv.org/abs/1910.13461
  95. Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
  96. Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
  97. Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
  98. Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
  99. Su, J. et al. (2021). RoPE. https://arxiv.org/abs/2104.09864
  100. Press, O. et al. (2021/2022). ALiBi. https://arxiv.org/abs/2108.12409
  101. Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
  102. Du, N. et al. (2021). GLaM. https://arxiv.org/pdf/2112.06905.pdf
  103. Hoffmann, J. et al. (2022). Chinchilla. https://arxiv.org/abs/2203.15556
  104. Chowdhery, A. et al. (2022). PaLM. https://arxiv.org/abs/2204.02311
  105. Shazeer, N. (2019). Fast Transformer Decoding. https://arxiv.org/abs/1911.02150
  106. Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
  107. Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
  108. Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
  109. Shazeer, N. (2020). GLU Variants. https://arxiv.org/abs/2002.05202
  110. Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
  111. Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
  112. Kwon, W. et al. (2023). vLLM/PagedAttention. https://arxiv.org/abs/2309.06180
  113. OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
  114. Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
  115. Gu, A.; Dao, T. (2023). Mamba. https://arxiv.org/abs/2312.00752
  116. Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
  117. Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
  118. Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
  119. Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
  120. Lieber, O. et al. (2024). Jamba. https://arxiv.org/abs/2403.19887
  121. Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608