Large language model architectures — معماريات LLM
معماريات النماذج اللغوية الكبيرة (LLM) هي المبادئ والهياكل الأساسية التي تحدد كيفية بناء النماذج اللغوية الكبيرة وتدريبها وعملها. تعتمد النماذج اللغوية الكبيرة الحديثة، القادرة على فهم وتوليد اللغة البشرية، بشكل شبه كامل على معمارية المحوِّل (Transformer)[1]، لكنها تتضمن العديد من التحسينات والنهج المختلفة التي تهدف إلى زيادة الكفاءة والقابلية للتوسع والقدرات.
عائلات معماريات LLM (المحوِّلات)
تعتمد النماذج اللغوية الكبيرة الحديثة على معمارية المحوِّل[1]، لكنها تستخدمها بطرق مختلفة حسب الهدف: فهم النص، أو توليد تكملة له، أو تحويل نص إلى آخر. من الناحية العملية، يمكن تمييز ثلاث عائلات مع الحفاظ على المبادئ الأساسية للمحوِّل[2][3][4].
1. Encoder-only - المُشفِّر فقط
يستخدم النموذج مكدسًا من المُشفِّرات فقط ويعالج النص المدخل بأكمله بشكل ثنائي الاتجاه. عادةً ما يعتمد التدريب المسبق على نمذجة اللغة المقنَّعة (masked-language modeling, MLM)، حيث يتم إخفاء بعض التوكنات ويتعلم النموذج استعادتها بناءً على سياقها. بفضل السياق ثنائي الاتجاه، تتفوق هذه النماذج في مهام الفهم والتصنيف: مثل تصنيف النصوص، والتعرف على الكيانات، وإعادة ترتيب المستندات، والإجابة على الأسئلة الاستخراجية (extractive QA). وهي غير مصممة للتوليد التلقائي الانحداري (autoregressive generation) "من الصفر".
بالإضافة إلى ذلك، تُستخدم أهداف تدريب مسبق بديلة لعائلة المُشفِّر فقط عمليًا: اكتشاف التوكنات المستبدلة (RTD) في ELECTRA (حيث يتعرف نموذج مميِّز على التوكنات المستبدلة) والتعلم التبايني للمُشفِّرات المزدوجة (bi-encoders) للبحث الدلالي/الاسترجاع (InfoNCE/softmax-loss على أزواج "استعلام-مستند"، كما في Dense Passage Retrieval). عند استخدامها في RAG، تعمل نماذج المُشفِّر فقط إما كمُشفِّر مزدوج (تشفير منفصل للاستعلام والمستند للبحث السريع باستخدام ANN)، أو كمُشفِّر متقاطع (تشفير مشترك للزوج لإعادة الترتيب الدقيقة).
المزايا:
- جودة عالية في فهم النصوص بفضل السياق ثنائي الاتجاه: التصنيف، NER، استخراج الحقائق، إعادة الترتيب، والإجابة على الأسئلة الاستخراجية.
- معالجة متوازية وإنتاجية عالية: تمريرة أمامية واحدة بدون انحدار ذاتي؛ ملائمة للمعالجة الدفعية لتقييم كميات كبيرة من البيانات.
- تكامل طبيعي مع البحث وRAG: كـ bi-encoder للبحث الدلالي السريع؛ وكـ cross-encoder لإعادة الترتيب الدقيقة.
- تكييف فعال: النماذج المدمجة نسبيًا (≈100–300 مليون معامل؛ BERT-base ≈110 مليون) تحقق جودة عالية بعد الضبط الدقيق الموجه.
- زمن استجابة مستقر لا يعتمد على طول الإجابة المولَّدة (لا يوجد فك تشفير تدريجي)؛ مناسبة لتقييم المجموعات الكبيرة في وضع عدم الاتصال.
- إمكانية زيادة نافذة السياق في المُشفِّرات باستخدام المواضع النسبية/الدورانية و/أو الانتباه المتفرق المحلي (مثل Longformer/BigBird)، وهو أمر مفيد للمستندات الطويلة.
العيوب:
- لا تمتلك قدرات توليدية خاصة بها: تتطلب مُفكِّكًا أو وحدة توليد خارجية للحوارات والإجابات المطولة.
- محدودة في السيناريوهات التفاعلية: لا تدعم التوليد التدريجي مع الحفاظ على الحالة.
- عدم تطابق هدف التدريب المسبق مع مهام التوليد الحر: يتوافق MLM بشكل أسوأ مع التوليد مقارنة بالنمذجة السببية.
- نافذة سياق محدودة تاريخيًا (غالبًا 512 توكن في التكوينات الأساسية للمواضع المطلقة)؛ يتطلب توسيعها مخططات مواضع/انتباه خاصة و/أو ضبطًا دقيقًا.
- لمهام الاسترجاع، يتطلب الأمر ضبطًا دقيقًا تباينيًا منفصلاً لـ bi-encoder و/أو cross-encoder؛ بدون ذلك، تكون جودة البحث/إعادة الترتيب عادةً أقل من النماذج المدربة خصيصًا.
النماذج الممثِّلة: BERT ومشتقاته، وكذلك RoBERTa وDeBERTa (إصدارات محسنة من المُشفِّر فقط)؛ ومن أهداف التدريب المسبق البديلة — ELECTRA (RTD). [5][6][7][8][9][10]
2. Decoder-only - المُفكِّك فقط
يستخدم هذا النوع مكدس المُفكِّكات فقط مع انتباه سببي (causal attention) أحادي الاتجاه (من اليسار لليمين): يتنبأ النموذج بالتوكن التالي بناءً على البادئة المتوفرة بالفعل. هذا النمط من التدريب — نمذجة اللغة السببية (CLM) — يجعل هذه النماذج الخيار الطبيعي لمهام التوليد: الحوارات، الإجابات المطولة، النصوص الإبداعية، وكتابة الشيفرة البرمجية. المقايضة هي زيادة زمن الاستجابة وحجم ذاكرة التخزين المؤقت للمفاتيح والقيم (KV-cache) مع المُوجِّهات الطويلة. عمليًا، تُستخدم تقنيات هندسية على نطاق واسع لنماذج المُفكِّك فقط: تقليل KV-cache باستخدام MQA وGQA، تسريع الاستدلال عبر فك التشفير التكهني (speculative decoding) وتحسينات الخادم (PagedAttention/vLLM, continuous batching, chunked prefill).[11][12][13][14][15]
المزايا:
- توليد طبيعي للنصوص (CLM): قدرات قوية في مهام التعلم بدون أمثلة (zero-shot) والقليل من الأمثلة (few-shot)؛ قابلة للتوسع بشكل جيد.[16]
- تعددية الاستخدام: نموذج واحد يحل العديد من المهام عبر التعليمات والأمثلة في المُوجِّه؛ يتكامل بشكل طبيعي مع RAG واستدعاء الأدوات (tool use).
- بيئة عمل ناضجة: ممارسات راسخة للضبط الدقيق التوجيهي ومواءمة السلوك (RLHF، DPO)؛ تتوفر تطبيقات مفتوحة المصدر وتجارية.[17][18]
- مجموعة غنية من تحسينات الاستدلال: MQA/GQA تقلل حجم KV-cache وتزيد الإنتاجية؛ فك التشفير التكهني يسرع الاستدلال دون تغيير توزيع المخرجات؛ PagedAttention/vLLM مع continuous batching وchunked prefill تزيد من الاستفادة الشاملة من وحدات معالجة الرسوميات (GPU).[19][20][21][22][23]
- دعم التوليد المنظم لتنسيقات الإجابات الصارمة (JSON/SQL/DSL)، مما يبسط التكامل مع نظم المعلومات وواجهات برمجة التطبيقات (API).[24][25]
العيوب:
- زيادة زمن استجابة التوليد: إخراج تسلسلي؛ تزداد تكلفة كل توكن جديد مع طول السياق المقروء بالفعل (KV-cache).
- أقل كفاءة في سيناريوهات "مدخل طويل - مخرج قصير" (مثل التلخيص والترجمة) مقارنة بمعمارية المُشفِّر-المُفكِّك، حيث يتم تشفير المدخل مرة واحدة فقط.
- محدودية السياق أحادي الاتجاه: في مهام الفهم، قد يكون أداؤه أحيانًا أقل من النماذج ذات التمثيل ثنائي الاتجاه (المُشفِّر فقط / المُشفِّر-المُفكِّك).
- يمكن أن تكون الذاكرة المخصصة لـ KV-cache عنق زجاجة عند التعامل مع المُوجِّهات الطويلة والدفعات الكبيرة. [26]
- تكميم التفعيلات/KV (INT8/FP8) يسرع الاستدلال، لكنه قد يقلل من جودة الأداء مع السياقات الطويلة أو الشيفرات البرمجية؛ يتطلب التحقق الدقيق (خاصة مع اتفاقيات مستوى الخدمة (SLA) الصارمة).
النماذج الممثِّلة: GPT‑3، GPT‑4 (تفاصيل المعمارية ومجموعة البيانات غير معلنة)، LLaMA وLlama 3 (8B/70B, 2024).[27][28][29][30]
3. Encoder–decoder - المُشفِّر-المُفكِّك
تجمع هذه المعمارية بين كلا المكونين. يعمل المُشفِّر في وضع ثنائي الاتجاه، بينما يعمل المُفكِّك في وضع سببي. يقوم المُشفِّر بتحليل المدخل مرة واحدة ويشكل تمثيلاً له؛ ثم يقوم المُفكِّك بتوليد المخرج، بالاعتماد على هذا التمثيل عبر الانتباه المتقاطع (cross-attention). هذا النهج المنفصل مفيد بشكل خاص في الحالات التي تتطلب تحويل نص مدخل طويل إلى مخرج قصير: الترجمة الآلية، التلخيص، والإجابة على الأسئلة بناءً على المستندات. على الرغم من أن هذه الطريقة تتطلب تكاليف حسابية إجمالية أكبر (مكدسان وانتباه متقاطع)، إلا أن ميزتها تكمن في التوليد المتحكم فيه بناءً على تحليل كامل للنص الأصلي؛ بالإضافة إلى ذلك، يتم التشفير مرة واحدة فقط ويعاد استخدامه طوال عملية الاستدلال.
المزايا:
- التوليد الشرطي: يستخدم المُفكِّك الانتباه المتقاطع (cross-attention) لتمثيل المدخل. [31]
- فعال في سيناريو "مدخل طويل ← مخرج قصير": يتم تشفير المدخل مرة واحدة فقط.
- مناسب لتنسيق "نص-إلى-نص" (text-to-text) والمخرجات المتحكم فيها (بادئات المهام، تعليمات خاصة). [32]
- استقرار وكفاءة مع المصادر الطويلة: خلال مرحلة فك التشفير، يزداد الانتباه الذاتي (self-attention) للمخرجات فقط، بينما يعيد الانتباه المتقاطع استخدام المفاتيح/القيم الثابتة من المُشفِّر (لا تتم "إعادة قراءة" المدخل في كل خطوة).
العيوب:
- وجود مكدسين يزيد من متطلبات الذاكرة والحوسبة أثناء التدريب والاستخدام.
- في التسلسلات الطويلة جدًا، يكون زمن الاستجابة الإجمالي مشابهًا لنماذج المُفكِّك فقط؛ ويظل الانحدار الذاتي هو عنق الزجاجة.
- عدد نماذج المحادثة العامة أقل مقارنة بنماذج المُفكِّك فقط؛ غالبًا ما تستخدم كمحركات seq2seq عالية الجودة لمهام محددة.
- مع المدخلات الطويلة جدًا، تزداد الذاكرة المطلوبة لمفاتيح/قيم الانتباه المتقاطع في كل طبقة من المُفكِّك (لكامل المصدر)، مما يتطلب تخطيطًا دقيقًا لخدمة النموذج.
النماذج الممثِّلة: T5 (بما في ذلك T5 v1.1 وممارسة الضبط الدقيق التوجيهي في FLAN-T5) وBART. [33][34][35]
المحوِّلات الكثيفة (Dense)
هي المعمارية الكلاسيكية والأكثر شيوعًا للنماذج اللغوية الكبيرة: عند معالجة كل توكن، تشارك مجموعة المعاملات بأكملها تقريبًا في النموذج. على عكس الأساليب المتفرقة (مثل Mixture-of-Experts)، لا يوجد تنشيط انتقائي للشبكات الفرعية — فكل كتلة تعمل لكل توكن. [1]
مبدأ العمل والمعمارية
الهيكل الأساسي. النموذج عبارة عن مكدس من N من كتل المحوِّل المتماثلة. تتضمن كل كتلة ما يلي:
- انتباه ذاتي متعدد الرؤوس (Multi-Head Self-Attention). لكل توكن، يتم حساب ثلاثة متجهات: Q (الاستعلام)، K (المفتاح)، V (القيمة)؛ يتم تعريف الانتباه كـ ، حيث هو قناع (سببي و/أو قناع حشو)، يستبعد المواضع غير المسموح بها. تقوم عدة "رؤوس" انتباه بمعالجة جوانب مختلفة من السياق بالتوازي (H رؤوس، عادةً )؛ ويزداد عددها مع حجم النموذج. [1]
- شبكة التمرير الأمامي (Feed-Forward Network, FFN). طبقتان خطيتان مع دالة غير خطية بينهما (عادةً GELU/SiLU؛ وفي عدد من النماذج الحديثة — SwiGLU). عادة ما يكون البعد الوسيط ؛ عند استخدام SwiGLU، غالبًا ما يؤخذ للحفاظ على عدد مماثل من المعاملات. تحتوي FFN على نسبة كبيرة من المعاملات. [1][36]
المكونات الإضافية. تُستخدم الوصلات المتبقية (residual) وتطبيع الطبقات (layer normalization)؛ في النماذج اللغوية الكبيرة الحديثة، يُستخدم Pre-LN (التطبيع قبل الكتل الفرعية) بشكل أكثر شيوعًا — وهذا يحسن استقرار التدريب في الأعماق الكبيرة. بالإضافة إلى LayerNorm الكلاسيكي، يُستخدم RMSNorm بشكل متزايد (يقلل من التكاليف الحسابية ويعمل بشكل جيد في النماذج الكبيرة)؛ كما يُستخدم في بعض العائلات التطبيع في فضاء الانتباه (مثل تطبيع Q/K قبل softmax). يمكن أن تكون التمثيلات الموضعية مطلقة أو نسبية؛ للسياق الطويل، أصبح RoPE هو المعيار الفعلي.
أمثلة على النماذج وحجمها
- BERT-Large: 24 طبقة، بُعد 1024، 16 رأس انتباه، ≈340 مليون معامل. [37]
- GPT-3 (175B): 96 طبقة، بُعد 12288، 96 رأس انتباه، ≈175 مليار معامل. [38]
- LLaMA-65B: 80 طبقة، بُعد 8192، 64 رأس انتباه، ≈65 مليار معامل. [39]
- PaLM-540B: 118 طبقة، بُعد حوالي 18432، ≈540 مليار معامل. [40]
المزايا
- كتل موحدة، وأنماط تدريب مدروسة جيدًا، وسلوك يمكن التنبؤ به عند التوسع.
- تتحسن الجودة بشكل أسي مع زيادة المعاملات والبيانات؛ يفترض وضع التدريب الأمثل حسابيًا (compute-optimal) زيادة حجم النموذج وحجم بيانات التدريب معًا. [41][42]
- نفس المعمارية تغطي مجموعة واسعة من المهام بعد الضبط الدقيق دون تغييرات على مستوى الطبقات.
العيوب
- الانتباه الذاتي الكامل له تعقيد تربيعي بالنسبة لطول التسلسل ()، مما يحد من نافذة السياق. [1]
- تنشيط كامل للمعاملات في خطوة التوليد: في المُفكِّك بدون MoE، تزداد تكلفة الاستدلال لكل توكن بشكل متناسب تقريبًا مع عدد المعاملات.
- عنق الزجاجة هو عرض النطاق الترددي للذاكرة (memory-bound): غالبًا ما يحد تحميل الأوزان من HBM من سرعة الاستدلال.
قيود التوسع والسياق
- تزداد الذاكرة المطلوبة للمعاملات خطيًا مع حجم النموذج؛ تزداد ذاكرة التدريب بسبب التدرجات وحالات المحسِّن (optimizer).
- كانت التكوينات الأساسية محدودة تاريخيًا بـ 2-4 آلاف توكن. تسمح مخططات المواضع الحديثة (RoPE) وتقنيات التوسيع (Position Interpolation, YaRN، وغيرها) بزيادة النافذة بأضعاف، ولكن على حساب عبء حسابي/ذاكرة إضافي. [43][44]
التحسينات الحديثة
- FlashAttention. انتباه دقيق يأخذ في الاعتبار التسلسل الهرمي لذاكرة GPU؛ يقلل من استهلاك الذاكرة ويسرع التدريب/الاستدلال مع التسلسلات الطويلة. [45]
- تقليل وإدارة KV-cache. تقلل Multi-Query Attention وGrouped-Query Attention من حجم ذاكرة التخزين المؤقت وحركة البيانات في الذاكرة؛ على مستوى الخادم، تزيد PagedAttention (vLLM) من الإنتاجية من خلال إدارة الذاكرة المؤقتة بنظام الصفحات. [46][47][48]
- فك التشفير التكهني (Speculative Decoding). يقترح نموذج مسودة (draft) تكملة للنص، ويقوم النموذج الرئيسي بالتحقق منها بسرعة؛ يتم تحقيق تسريع دون تغيير توزيع المخرجات. [49]
Sparse Models and Mixture-of-Experts (MoE) - النماذج المتفرقة وخليط الخبراء
MoE هي طريقة لزيادة سعة النموذج دون زيادة متناسبة في الحسابات لكل توكن. بدلاً من كتلة FFN كبيرة واحدة في الطبقة، يتم استخدام مجموعة من "الخبراء" المتوازيين (عدة شبكات FFN مستقلة)، وتقوم شبكة توجيه قابلة للتدريب (gating network) باختيار أفضل k من الخبراء الأكثر صلة لكل توكن (عادة k=1–2؛ في بعض النماذج k=4). يتم تنشيط الخبراء المختارين فقط؛ ثم يتم ترجيح مخرجاتهم وجمعها. بهذه الطريقة، يمكن أن يصل إجمالي عدد المعاملات إلى مئات المليارات أو حتى تريليونات، ولكن في كل خطوة يتم استخدام جزء صغير فقط. [50][51]
أمثلة على النماذج وحجمها
- Switch Transformer (Google): يصل إلى ~1.6 تريليون معامل؛ توجيه top-1 (خبير واحد لكل توكن). أظهر أن MoE يسمح بزيادة السعة بشكل كبير بتكاليف مماثلة لكل توكن. [50]
- GLaM (Google): 1.2 تريليون معامل، 64 خبيرًا في الطبقة، top-2؛ لكل توكن يتم تنشيط ≈96.6 مليار معامل (≈8%). [51]
- Mixtral 8×7B (Mistral AI): إجمالي ≈46.7 مليار معامل، ≈12.9 مليار معامل نشط لكل توكن، top-2. [52][53]
- Mixtral 8×22B: إجمالي ≈141 مليار معامل، ≈39 مليار معامل نشط لكل توكن، top-2. [54]
- DBRX (Databricks): إجمالي 132 مليار معامل، ≈36 مليار معامل نشط لكل توكن؛ 16 خبيرًا وتوجيه top-4 (fine-grained MoE). [55]
المزايا
- تكلفة الحسابات تحددها عدد الخبراء النشطين k، وليس العدد الإجمالي للمعاملات: يمكن تدريب واستخدام نماذج بحجم تريليوني بتكاليف مماثلة لنماذج كثيفة أصغر بكثير. [51]
- التخصص: يتكيف الخبراء تلقائيًا مع اللغات/المجالات/الأنماط، مما يحسن الجودة في المهام متعددة المجالات.
- مرونة النشر: يمكن الاحتفاظ بالخبراء المستخدمين بشكل متكرر في الذاكرة وتحميل النادرين عند الحاجة (مع بنية تحتية مناسبة).
القيود
- موازنة الحمل: بدون تنظيم، قد "يلتصق" الموجِّه بجزء من الخبراء (router collapse). يتطلب الأمر خسائر مساعدة (load-balancing) ومخططات توجيه محسنة. [50]
- تعقيد الحوسبة الموزعة: يتطلب توازي الخبراء (expert parallelism) وتبادل all-to-all؛ تصبح تكاليف الاتصال وإدارة الذاكرة عنق الزجاجة. [56]
- استقرار التدريب: إعدادات الموجِّه وقيود السعة (capacity) مهمة، وإلا قد يحدث تدهور في الجودة/التقارب.
التحسينات الحديثة
- توجيه Expert-Choice: يختار الخبراء التوكنات، مما يحسن موازنة الحمل والتقارب بتكاليف مماثلة. [57]
- Fine-grained MoE: عدد أكبر من الخبراء الأصغر حجمًا (كما في DBRX) يوفر تخصصًا دقيقًا. [55]
- Sparse Upcycling: تحويل نموذج كثيف إلى MoE من نقطة حفظه (checkpoint) يسمح بزيادة الجودة بشكل كبير بتكاليف معتدلة. [58]
جدوى تطبيق MoE
- المساعدون الكبار متعددو المجالات بميزانية حوسبة محدودة.
- التدريب على مجموعات بيانات ضخمة حيث يوفر التخصص ميزة.
- السيناريوهات ذات البنية التحتية الموزعة المتقدمة (العديد من وحدات GPU/TPU والشبكات السريعة).
متى تكون النماذج الكثيفة أفضل: بنية تحتية محدودة (1-2 GPU)، متطلبات صارمة لزمن استجابة يمكن التنبؤ به وبساطة في النشر.
Retrieval-Augmented Generation (RAG) - التوليد المعزز بالاسترجاع
RAG هو نمط معماري لنظام يُبنى حول LLM، وليس معمارية داخلية للنموذج نفسه. يجمع بين LLM (المكون التوليدي) وقاعدة معرفة خارجية (مكون الاسترجاع)، مما يسمح بالتعويض عن محدودية "الذاكرة البارامترية" للنموذج.
- مبدأ العمل: قبل التوليد، يسترجع LLM المستندات ذات الصلة من مصدر خارجي (ويكي، قاعدة معرفة للشركة، الويب) ويعتمد عليها عند صياغة الإجابة. [59]
- المزايا:
- التطبيق: المعيار الفعلي للمساعدين في الشركات والأنظمة التي تتطلب حقائق يمكن التحقق منها والعمل مع بيانات خاصة/متخصصة للغاية. [59]
آليات الانتباه والتعامل مع السياق
الانتباه الذاتي الأساسي له تعقيد تربيعي بالنسبة لطول التسلسل ()، ولهذا السبب ظهرت تحسينات.
- الانتباه المتفرق (Sparse Attention): تقييد الانتباه بنوافذ/أنماط محلية. أمثلة: Longformer[61]، BigBird[62].
- FlashAttention: إعادة ترتيب ترتيب العمليات الحسابية مع مراعاة التسلسل الهرمي لذاكرة GPU؛ يحقق مكاسب كبيرة في الوقت والذاكرة وأصبح المعيار الفعلي عند تدريب LLM بسياق طويل[63][64][65].
- MQA/GQA (تسريع فك التشفير): Multi-Query Attention (مفاتيح/قيم مشتركة لجميع الرؤوس) تقلل من حركة بيانات KV-cache[66]. Grouped-Query Attention توازن بين الجودة والسرعة[67].
- تمثيلات موضعية محسنة:
- ALiBi (Attention with Linear Biases): انحيازات خطية لدرجات الانتباه تحسن التعميم على الأطوال الكبيرة. [68]
- RoPE (Rotary Position Embeddings): معلومات موضعية نسبية من خلال دوران Q/K؛ تُستخدم على نطاق واسع في النماذج الحديثة (مثل LLaMA). [69][70]
- توسيع السياق لنماذج RoPE: تقنيات مثل Position Interpolation [71]، YaRN [72]، بالإضافة إلى تعديلات NTK-aware تسمح بزيادة نافذة السياق بكفاءة دون تغيير المعمارية.
- أساليب أخرى للتسلسلات الطويلة:
تحسينات النماذج والبنية التحتية للتدريب
لتدريب ونشر النماذج اللغوية الكبيرة، تُستخدم تقنيات وأطر عمل متخصصة.
- التكميم (Quantization): تقليل دقة الأوزان يقلل من استهلاك الذاكرة ويسرع الاستدلال. تسمح QLoRA بالضبط الدقيق الفعال لنماذج 4 بت (بما في ذلك 65B) بجودة قريبة من الدقة الكاملة[77].
- تقطير المعرفة (Knowledge Distillation): تدريب المعلم ← الطالب للنماذج المدمجة[78]؛ مثال — DistilBERT[79].
- التدريب الموزع:
- البيئة والأدوات: يوفر Hugging Face Transformers وAccelerate تطبيقات قياسية للنماذج وتكاملًا مع DeepSpeed/FSDP للتدريب والاستدلال[82][83].
قوانين التوسع والتدريب الأمثل حسابيًا (compute-optimal)
تُظهر قوانين التوسع التجريبية أن خطأ الانتروبيا المتقاطعة يتناقص بشكل أسي مع زيادة المعاملات والبيانات والحسابات. [84] أوضحت ورقة Chinchilla أنماط التدريب الأمثل حسابيًا (compute-optimal): لتحقيق الكفاءة المثلى، يجب توسيع حجم النموذج وعدد توكنات التدريب معًا (مثال — نموذج 70B مدرب على ~1.4 تريليون توكن يتفوق على نماذج أكبر غير مدربة بشكل كافٍ). [85]
State Space Models (SSM) - نماذج فضاء الحالة
نماذج فضاء الحالة (SSM) هي معمارية بديلة للمحوِّلات للتعامل مع التسلسلات الطويلة. تستعير أفكارًا من نظرية التحكم ومعالجة الإشارات الرقمية وتحل المشكلة الرئيسية للانتباه الذاتي: النمو التربيعي للحسابات مع زيادة طول النص.
المشكلة الأساسية والحل
مشكلة المحوِّلات. المشكلة الرئيسية للمحوِّلات التقليدية هي التعقيد التربيعي للانتباه: نص أطول بـ 10 مرات يتطلب حسابات أكثر بـ 100 مرة تقريبًا.
نهج SSM. بدلاً من "الانتباه المتزامن لجميع الكلمات"، يمر النموذج عبر النص بشكل تسلسلي ويحافظ على حالة ذاكرة داخلية مدمجة يتم تحديثها في كل خطوة. نتيجة لذلك، ينمو الوقت واستهلاك الذاكرة بشكل خطي تقريبًا مع طول النص. في الوقت نفسه، يمكن إجراء التدريب بالتوازي — من خلال تمثيل نواة التفافية (convolutional kernel) (إنتاجية عالية على التسلسلات الطويلة). [86]
مبدأ العمل
يتم وصف SSM المتقطع بمعادلات الحالة والمخرج:
حيث هي حالة الذاكرة، هو المدخل (التوكن)، هو المخرج. في SSM العميقة، يتم تحديد معاملات المصفوفات لضمان الاستقرار والحسابات الفعالة على التسلسلات الطويلة. يمكن اعتبار نفس الطبقة:
- متكررة (مسح خطوة بخطوة) — استدلال موفر للذاكرة بدون KV-cache؛
- التفافية (convolutional) — تدريب متوازٍ مع نواة محسوبة مسبقًا. [86]
المعماريات الأساسية والهجينة
- S4 (Structured State Spaces). الخط الأساسي لـ SSM مع تحديد مستقر لمعاملات مصفوفة الحالة؛ يظهر كفاءة على التسلسلات الطويلة جدًا. [86]
- Mamba. SSM انتقائية: تعتمد قواعد تحديث الذاكرة على المدخل الحالي (يقرر النموذج بنفسه ما يجب "الاحتفاظ به في الذاكرة" وما يجب "نسيانه"). التنفيذ موجه نحو التسلسل الهرمي لذاكرة GPU؛ وفقًا للمؤلفين، يتم تحقيق زيادة مضاعفة في إنتاجية الاستدلال بتعقيد خطي بالنسبة للطول. [87]
- RetNet. آلية الاحتفاظ (retention) بثلاثة أوضاع: تدريب متوازٍ، استدلال متكرر، واستدلال متكرر بالكتل. الهدف هو الجمع بين التدريب السريع (مثل المحوِّلات) والاستدلال الاقتصادي (ذاكرة O(1) لكل توكن). [88]
- الهجينة Attention+SSM. مثال — Jamba (طبقات متناوبة من Transformer وMamba بالإضافة إلى MoE): يُقال إنه يدعم سياقات تصل إلى ~256 ألف توكن بمتطلبات ذاكرة أقل بكثير مقارنة بنماذج المحوِّلات البحتة من نفس الفئة. [89]
المزايا
- تعقيد خطي وتوفير في الذاكرة عند الاستدلال. لا يوجد انتباه ذاتي عالمي وKV-cache؛ يتم تخزين حالة مدمجة فقط. [87][88]
- تدريب متوازٍ على التسلسلات الطويلة. يزيد الوضع الالتفافي من إنتاجية التدريب. [86]
- كفاءة على مستوى العتاد. التنفيذات موجهة نحو التسلسل الهرمي الحديث للذاكرة (HBM/SRAM). [87]
- سياقات طويلة وبث مستمر. نماذج SSM+Attention الهجينة عملية لمئات الآلاف من التوكنات بموارد معتدلة. [89]
القيود والممارسات الحالية
- نضج البيئة. الأدوات و"الوصفات" للتوسع (التعليمات، RLHF/DPO) لا تزال أقل تطورًا من مكدس المحوِّلات. [87]
- الجودة والاستقرار. في بعض المهام، تُظهر النماذج الهجينة (Attention+SSM) توازنًا أكثر استقرارًا بين "الجودة/السرعة/الذاكرة" من نماذج SSM "النقية". [89]
مقارنة بين الأساليب (بشكل عام)
| الخاصية | المحوِّلات | SSM | الهجينة (Attention+SSM) |
|---|---|---|---|
| التعقيد بالنسبة للطول | تربيعي (self-attention) | خطي (مسح/التفاف) | قريب من الخطي |
| الذاكرة لكل توكن (استدلال) | ينمو KV-cache مع السياق | حالة O(1) | نمو معتدل |
| السياقات الطويلة | تتطلب تحسينات خاصة | دعم طبيعي | عملية حتى ~256 ألف |
| نضج البيئة | عالية | قيد التطوير | قيد التطوير |
التطبيقات العملية
- تحليل المستندات الطويلة جدًا (الكتب، التقارير، المراجعات العلمية).
- المعالجة المتدفقة وسيناريوهات المحادثة بتاريخ طويل دون زيادة تكلفة الذاكرة.
- البيئات ذات الموارد المحدودة (الأجهزة المحمولة/الطرفية).
- السلاسل الزمنية والبيانات التسلسلية الأخرى.
النماذج الممثِّلة: S4, Mamba, RetNet؛ الهجينة Attention+SSM (Jamba). [86][87][88][89]
تطور المعماريات
- 2017 — نُشرت ورقة «Attention Is All You Need». قُدمت معمارية المحوِّل: الانتباه الذاتي متعدد الرؤوس والتضمينات الموضعية تسمح بتدريب النماذج بدون تكرار أو التفاف؛ ومع ذلك، فإن للانتباه تعقيدًا تربيعيًا بالنسبة لطول السياق.[1]
- 2018 — قُدمت GPT-1 وBERT. يستخدم GPT-1 مكدسًا من المُفكِّكات فقط مع انتباه سببي للتوليد ثم الضبط الدقيق؛ يقدم BERT مُشفِّرًا ثنائي الاتجاه وتدريبًا مسبقًا بأسلوب MLM لمهام فهم النص. [90][91]
- 2019 — اقتُرحت طرق للتعامل مع التسلسلات الطويلة وتم توسيع نطاق نماذج المُفكِّك فقط. يضيف Transformer-XL "ذاكرة" ومواضع نسبية لتجاوز النافذة الثابتة؛ يُظهر GPT-2 زيادة في قدرات التعلم بدون أمثلة (zero-shot) مع زيادة الحجم؛ يُظهر BART فعالية التدريب المسبق بإزالة التشويش (denoising) لمهام seq2seq. [92][93][94]
- 2020 — تم توحيد تنسيق "text-to-text" وعرض أساليب للمستندات الطويلة. يصيغ T5 نهجًا موحدًا للمُشفِّر-المُفكِّك لمهام مختلفة؛ يستخدم Longformer وBigBird انتباهًا متفرقًا/منظمًا للنصوص الطويلة؛ يؤكد GPT-3 فعالية توسيع نطاق نماذج المُفكِّك فقط الكثيفة. [95][96][97][98]
- 2021 — تم تحسين التمثيلات الموضعية وإظهار تفريق المعاملات (MoE). تحسن RoPE وALiBi التعميم على الأطوال الكبيرة؛ ينشط Switch Transformer وGLaM جزءًا فقط من الخبراء لكل توكن، مما يزيد من السعة دون زيادة كبيرة في تكلفة الاستدلال. [99][100][101][102]
- 2022 — تم توضيح وضع التدريب الأمثل حسابيًا (compute-optimal) وتسريع الاستدلال على المُوجِّهات الطويلة. يُظهر Chinchilla فائدة عدد أكبر من توكنات التدريب مع حجم نموذج معتدل؛ يقلل PaLM مع Multi-Query Attention من حجم KV-cache؛ يسرع FlashAttention الانتباه على GPU. [103][104][105][106]
- 2023 — تمت زيادة نوافذ السياق دون تغيير الطبقات وتحسين خدمة الخادم. ترسخ سلسلة LLaMA الممارسات (RMSNorm, SwiGLU, RoPE)؛ توسع Position Interpolation وYaRN السياق؛ يدير vLLM/PagedAttention ذاكرة KV-cache بكفاءة أكبر. [107][108][109][110][111][112]
- 2023 — اقتُرحت نماذج فضاء الحالة (SSM). تعيد Mamba وRetNet المعالجة التسلسلية مع حالة مدمجة بدلاً من KV-cache وتضع الأساس للمعماريات الهجينة. [115][116]
- 2024 — نُشرت نماذج MoE مفتوحة المصدر ونماذج هجينة من Attention+SSM؛ تم تسريع الانتباه على وحدات GPU الجديدة. يؤكد Mixtral 8×7B/8×22B وDBRX على التطبيق العملي لـ MoE؛ يجمع Jamba بين Transformer وMamba للسياقات الطويلة جدًا؛ يزيد FlashAttention-3 من الإنتاجية. [117][118][119][120][121]
روابط خارجية
- https://jalammar.github.io/illustrated-transformer/ The Illustrated Transformer — شرح مرئي
المراجع
- Vaswani, A. et al. (2017). Attention Is All You Need. NIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT. NAACL. https://arxiv.org/abs/1810.04805
- Brown, T. et al. (2020). Language Models are Few‑Shot Learners. NeurIPS. https://arxiv.org/abs/2005.14165
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
- Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
- Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
- Shazeer, N. (2019). MQA. https://arxiv.org/abs/1911.02150
- Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- Kwon, W. et al. (2023). PagedAttention / vLLM. https://arxiv.org/abs/2309.06180
- Leviathan, Y. et al. (2023). Speculative Decoding. https://arxiv.org/abs/2211.17192
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- Du, N. et al. (2022). GLaM. https://proceedings.mlr.press/v162/du22c/du22c.pdf
- Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
- Zhou, Y. et al. (2022). Expert Choice Routing. https://arxiv.org/abs/2202.09368
- Komatsuzaki, A. et al. (2022). Sparse Upcycling. https://arxiv.org/abs/2212.05055
- Lewis, P. et al. (2020). RAG. https://arxiv.org/abs/2005.11401
- Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
- Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
- Su, J. et al. (2021). RoFormer (RoPE). https://arxiv.org/abs/2104.09864
- Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
- Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
- Dettmers, T. et al. (2023). QLoRA. https://arxiv.org/abs/2305.14314
- Rajbhandari, S. et al. (2020). ZeRO. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
- Shoeybi, M. et al. (2019). Megatron‑LM. https://arxiv.org/abs/1909.08053
- Kaplan, J. et al. (2020). Scaling Laws. https://arxiv.org/abs/2001.08361
- Hoffmann, J. et al. (2022). Chinchilla / Compute‑Optimal. https://arxiv.org/abs/2203.15556
- Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
- Bai, Y. et al. (2022). Constitutional AI. https://arxiv.org/abs/2212.08073
- OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- OpenAI (2023). DevDay: GPT‑4 Turbo 128k. https://openai.com/index/new-models-and-developer-products-announced-at-devday/
- Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
- Shazeer, N. (2020). GLU Variants / SwiGLU. https://arxiv.org/abs/2002.05202
- Gu, A.; Goel, K.; Ré, C. (2021). S4: Structured State Spaces. https://arxiv.org/abs/2111.00396
- Gu, A.; Dao, T. (2023/2024). Mamba: Selective State Spaces. https://arxiv.org/abs/2312.00752
- Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
- Lieber, O. et al. (2024). Jamba: Hybrid Transformer‑Mamba. https://arxiv.org/abs/2403.19887
- Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer. https://arxiv.org/abs/2001.04451
- Choromanski, K. et al. (2021). Performer. https://arxiv.org/abs/2009.14794
- Wang, S. et al. (2020). Linformer. https://arxiv.org/abs/2006.04768
ملاحظات
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ Devlin, J. et al. (2019). BERT. https://arxiv.org/abs/1810.04805
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Liu, Y. et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach. https://arxiv.org/abs/1907.11692
- ↑ He, P. et al. (2021). DeBERTa: Decoding‑enhanced BERT with Disentangled Attention. https://arxiv.org/abs/2006.03654
- ↑ Clark, K. et al. (2020). ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators. https://arxiv.org/abs/2003.10555
- ↑ Zaheer, M. et al. (2020). Big Bird: Transformers for Longer Sequences. https://arxiv.org/abs/2007.14062
- ↑ Beltagy, I. et al. (2020). Longformer: The Long‑Document Transformer. https://arxiv.org/abs/2004.05150
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (Multi‑Query Attention). https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. https://arxiv.org/abs/2305.13245
- ↑ Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
- ↑ Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). https://arxiv.org/abs/2309.06180
- ↑ vLLM Docs (2024–2025). Continuous batching, Chunked prefill, Structured outputs. https://docs.vllm.ai/
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Ouyang, L. et al. (2022). InstructGPT (RLHF). https://arxiv.org/abs/2203.02155
- ↑ Rafailov, R. et al. (2023). Direct Preference Optimization. https://arxiv.org/abs/2305.18290
- ↑ Shazeer, 2019. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, 2023. https://arxiv.org/abs/2305.13245
- ↑ Leviathan, 2023. https://arxiv.org/abs/2211.17192
- ↑ Kwon, 2023. https://arxiv.org/abs/2309.06180
- ↑ vLLM Docs. https://docs.vllm.ai/
- ↑ OpenAI (2024). Structured Outputs. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ vLLM Docs — Structured outputs. https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html
- ↑ Kwon, 2023. https://arxiv.org/abs/2309.06180
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Achiam, J. et al. (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- ↑ Meta AI (2024). Introducing Meta Llama 3. https://ai.meta.com/blog/meta-llama-3/
- ↑ Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
- ↑ Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension. https://arxiv.org/abs/1910.13461
- ↑ Chung, H. W. et al. (2022). Scaling Instruction‑Finetuned Language Models (FLAN‑T5). https://arxiv.org/abs/2210.11416
- ↑ Shazeer, N. (2020). GLU Variants Improve Transformer. https://arxiv.org/abs/2002.05202
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
- ↑ Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
- ↑ Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
- ↑ Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
- ↑ Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- ↑ Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. https://arxiv.org/abs/2309.06180
- ↑ Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
- ↑ 50.0 50.1 50.2 Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- ↑ 51.0 51.1 51.2 Du, N. et al. (2021). GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts. https://arxiv.org/pdf/2112.06905.pdf
- ↑ Mistral AI (2023). Mixtral of Experts. https://mistral.ai/news/mixtral-of-experts/
- ↑ Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- ↑ Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
- ↑ 55.0 55.1 Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- ↑ NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
- ↑ Zhou, Y. et al. (2022). Mixture‑of‑Experts with Expert Choice Routing. https://arxiv.org/abs/2202.09368
- ↑ Komatsuzaki, A. et al. (2022). Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints. https://arxiv.org/abs/2212.05055
- ↑ 59.0 59.1 59.2 59.3 Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. https://arxiv.org/abs/2005.11401
- ↑ NVIDIA Blog (2025). What is Retrieval‑Augmented Generation (RAG). https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/
- ↑ Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- ↑ Zaheer, M. et al. (2020). Big Bird. https://arxiv.org/abs/2007.14062
- ↑ Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
- ↑ Dao, T. et al. (2023). FlashAttention‑2. https://arxiv.org/abs/2307.08691
- ↑ Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- ↑ Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
- ↑ Su, J. et al. (2021). RoFormer: Rotary Position Embedding. https://arxiv.org/abs/2104.09864
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
- ↑ Dai, Z. et al. (2019). Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context. https://arxiv.org/abs/1901.02860
- ↑ Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer: The Efficient Transformer. https://arxiv.org/abs/2001.04451
- ↑ Choromanski, K. et al. (2021). Rethinking Attention with Performers. https://arxiv.org/abs/2009.14794
- ↑ Wang, S. et al. (2020). Linformer: Self‑Attention with Linear Complexity. https://arxiv.org/abs/2006.04768
- ↑ Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. https://arxiv.org/abs/2305.14314
- ↑ Hinton, G. et al. (2015). Distilling the Knowledge in a Neural Network. https://arxiv.org/abs/1503.02531
- ↑ Sanh, V. et al. (2019). DistilBERT. https://arxiv.org/abs/1910.01108
- ↑ Rajbhandari, S. et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
- ↑ Shoeybi, M. et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. https://arxiv.org/abs/1909.08053
- ↑ Hugging Face. Transformers Documentation. https://huggingface.co/docs/transformers
- ↑ Hugging Face. Accelerate Documentation. https://huggingface.co/docs/accelerate
- ↑ Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
- ↑ Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
- ↑ 86.0 86.1 86.2 86.3 86.4 Gu, A.; Goel, K.; Ré, C. (2021). Efficiently Modeling Long Sequences with Structured State Spaces (S4). https://arxiv.org/abs/2111.00396
- ↑ 87.0 87.1 87.2 87.3 87.4 Gu, A.; Dao, T. (2023/2024). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. https://arxiv.org/abs/2312.00752
- ↑ 88.0 88.1 88.2 Sun, Y. et al. (2023). Retentive Network: A Successor to Transformer for Large Language Models. https://arxiv.org/abs/2307.08621
- ↑ 89.0 89.1 89.2 89.3 Lieber, O. et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. https://arxiv.org/abs/2403.19887
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
- ↑ Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
- ↑ Lewis, M. et al. (2019). BART. https://arxiv.org/abs/1910.13461
- ↑ Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- ↑ Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Su, J. et al. (2021). RoPE. https://arxiv.org/abs/2104.09864
- ↑ Press, O. et al. (2021/2022). ALiBi. https://arxiv.org/abs/2108.12409
- ↑ Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- ↑ Du, N. et al. (2021). GLaM. https://arxiv.org/pdf/2112.06905.pdf
- ↑ Hoffmann, J. et al. (2022). Chinchilla. https://arxiv.org/abs/2203.15556
- ↑ Chowdhery, A. et al. (2022). PaLM. https://arxiv.org/abs/2204.02311
- ↑ Shazeer, N. (2019). Fast Transformer Decoding. https://arxiv.org/abs/1911.02150
- ↑ Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
- ↑ Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
- ↑ Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
- ↑ Shazeer, N. (2020). GLU Variants. https://arxiv.org/abs/2002.05202
- ↑ Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
- ↑ Kwon, W. et al. (2023). vLLM/PagedAttention. https://arxiv.org/abs/2309.06180
- ↑ OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- ↑ Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
- ↑ Gu, A.; Dao, T. (2023). Mamba. https://arxiv.org/abs/2312.00752
- ↑ Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
- ↑ Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- ↑ Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
- ↑ Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- ↑ Lieber, O. et al. (2024). Jamba. https://arxiv.org/abs/2403.19887
- ↑ Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608