Large language model architectures — معماریهای مدلهای زبانی بزرگ
معماریهای مدلهای زبانی بزرگ (LLM) — اصول و ساختارهای بنیادیای هستند که تعیین میکنند مدلهای زبانی بزرگ چگونه ساخته، آموزش داده و اجرا میشوند. LLMهای مدرن که قادر به درک و تولید زبان انسانی هستند، تقریباً بهطور کامل بر معماری Transformer[1] مبتنیاند، اما شامل بهبودها و رویکردهای گوناگونی برای افزایش کارایی، مقیاسپذیری و قابلیتها میشوند.
خانوادههای معماری LLM (ترانسفورمرها)
مدلهای زبانی بزرگ مدرن بر معماری transformer[1] استوارند، اما بسته به هدف — درک متن، تولید ادامه یا تبدیل یک متن به متن دیگر — از آن به شیوههای متفاوتی استفاده میکنند. در عمل، با حفظ اصول پایه transformer، سه خانواده متمایز شناسایی میشود[2][3][4].
۱. Encoder‑only (فقط کدگذار)
مدل تنها از پشته کدگذار استفاده میکند و کل متن ورودی را به صورت دوطرفه پردازش میکند. پیشآموزش معمولاً به صورت masked‑language modeling (MLM، مدلسازی زبانی با پنهانسازی) انجام میشود: بخشی از tokenها پنهان میشوند و مدل یاد میگیرد آنها را از روی محیط اطراف بازیابی کند. به دلیل زمینه دوطرفه، این مدلها در وظایف درک و امتیازدهی قوی عمل میکنند: طبقهبندی، شناسایی موجودیتها، بازرتبهبندی اسناد و QA استخراجی. برای تولید خودبازگشتی «از صفر» مناسب نیستند.
علاوه بر این، در عمل اهداف پیشآموزش جایگزینی نیز برای خانواده encoder‑only به کار میروند: replaced token detection (RTD) در ELECTRA (مدل تبعیضدهنده tokenهای جایگزینشده را تشخیص میدهد) و یادگیری تضادی bi-encoderها برای جستجوی معنایی/بازیابی (InfoNCE/softmax‑loss روی جفتهای «پرسش-سند»، مانند Dense Passage Retrieval). هنگام استفاده در RAG، encoder‑only یا به عنوان bi-encoder (کدگذاری جداگانه پرسش و سند برای جستجوی سریع ANN) یا به عنوان cross-encoder (کدگذاری مشترک جفت برای بازرتبهبندی دقیق) عمل میکند.
مزایا:
- کیفیت بالای درک متن به دلیل زمینه دوطرفه: طبقهبندی، NER، استخراج حقایق، بازرتبهبندی، QA استخراجی.
- پردازش موازی و توان عملیاتی بالا: یک پاس رو به جلو بدون خودبازگشت؛ batchبندی امتیازدهی انبوه راحت است.
- یکپارچهسازی طبیعی با جستجو و RAG: در نقش bi-encoder — جستجوی معنایی سریع؛ در نقش cross-encoder — بازرتبهبندی دقیق.
- انطباق کارآمد: نسخههای نسبتاً فشرده (≈۱۰۰–۳۰۰ میلیون پارامتر؛ BERT‑base ≈۱۱۰ میلیون) پس از fine-tuning هدفمند کیفیت بالایی ارائه میدهند.
- تأخیر پایدار مستقل از طول پاسخ تولیدی (فاقد رمزگشایی گامبهگام)؛ برای امتیازدهی آفلاین مجموعههای بزرگ مناسب است.
- امکان افزایش پنجره زمینه در کدگذارها از طریق موقعیتهای نسبی/دورانی و/یا توجه محلی-پراکنده (مثلاً Longformer/BigBird)، که برای اسناد طولانی مفید است.
معایب:
- فاقد قابلیتهای تولیدی ذاتی: برای گفتگو و پاسخهای مفصل به یک decoder یا ماژول تولیدی خارجی نیاز است.
- محدودیت در سناریوهای تعاملی: فاقد تولید مرحلهبهمرحله با حفظ وضعیت.
- عدم تطابق هدف پیشآموزش با وظایف تولید آزاد: MLM نسبت به مدلسازی علّی همراستایی کمتری با تولید دارد.
- پنجره زمینه تاریخاً محدود (اغلب ۵۱۲ token در پیکربندیهای پایه موقعیت مطلق)؛ گسترش نیازمند طرحهای موقعیت/توجه خاص و/یا fine-tuning است.
- برای وظایف بازیابی، fine-tuning تضادی جداگانه bi-encoder و/یا cross-encoder لازم است؛ بدون آن کیفیت جستجو/بازرتبهبندی معمولاً از مدلهای آموزشدیده تخصصی پایینتر است.
مدلهای نمونه: BERT و مشتقات آن، همچنین RoBERTa و DeBERTa (نسخههای پیشرفته encoder‑only)؛ از اهداف پیشآموزش جایگزین — ELECTRA (RTD). [5][6][7][8][9][10]
۲. Decoder‑only (فقط رمزگشا)
تنها پشته decoder با توجه علّی (چپبهراست) فعال است: مدل token بعدی را بر اساس پیشوند دادهشده پیشبینی میکند. این رژیم آموزشی — causal language modeling (CLM) — این مدلها را به انتخاب طبیعی برای تولید تبدیل میکند: گفتگو، پاسخهای مفصل، متن خلاقانه، کد برنامه. مصالحه آن افزایش تأخیر و حجم KV‑cache با promptهای طولانی است. در عمل برای decoder‑only تکنیکهای مهندسی گستردهای به کار میروند: کاهش KV‑cache از طریق MQA و GQA، تسریع استنتاج از طریق رمزگشایی انتزاعی و بهینهسازیهای سرور (PagedAttention/vLLM، continuous batching، chunked prefill).[11][12][13][14][15]
مزایا:
- تولید طبیعی متن (CLM): قابلیتهای قوی zero‑shot و few‑shot؛ به خوبی مقیاس میشود.[16]
- تطبیقپذیری کاربردی: یک مدل وظایف متعدد را از طریق دستورالعملها و مثالها در prompt حل میکند؛ به طور طبیعی با RAG و فراخوانی ابزار (tool use) ترکیب میشود.
- اکوسیستم بالغ: روشهای fine-tuning دستوری و همسوسازی رفتار (RLHF، DPO)؛ پیادهسازیهای متنباز و تجاری در دسترس هستند.[17][18]
- پشته غنی از بهینهسازیهای استنتاج: MQA/GQA حجم KV‑cache را کاهش و توان عملیاتی را افزایش میدهند؛ رمزگشایی انتزاعی بدون تغییر توزیع استنتاج را تسریع میکند؛ PagedAttention/vLLM با continuous batching و chunked prefill بهرهوری کلی GPU را افزایش میدهند.[19][20][21][22][23]
- پشتیبانی از تولید ساختاریافته برای فرمتهای پاسخ دقیق (JSON/SQL/DSL)، که یکپارچهسازی با سیستمهای اطلاعاتی و API را سادهتر میکند.[24][25]
معایب:
- تأخیر تولید بالا: استنتاج متوالی؛ هزینه token جدید با طول زمینه «خواندهشده» (KV‑cache) افزایش مییابد.
- در پروفایل «ورودی طولانی – خروجی کوتاه» (خلاصهسازی، ترجمه) نسبت به encoder–decoder که ورودی را یکبار کدگذاری میکند، کمتر مقرونبهصرفه است.
- محدودیت زمینه یکطرفه: در وظایف درک گاهی از مدلهای با بازنمایی دوطرفه (encoder‑only / encoder–decoder) ضعیفتر عمل میکند.
- حافظه زیر KV‑cache میتواند در promptهای طولانی و batchهای بزرگ «گلوگاه» باشد؛ [26]
- کوانتیزاسیون activation/KV (INT8/FP8) استنتاج را تسریع میکند اما ممکن است کیفیت را در زمینههای طولانی/کد کاهش دهد؛ نیازمند اعتبارسنجی دقیق است (بهویژه با SLA سختگیرانه).
مدلهای نمونه: GPT‑3، GPT‑4 (جزئیات معماری و مجموعه داده به صورت عمومی منتشر نشده)، LLaMA و Llama 3 (8B/70B، 2024).[27][28][29][30]
۳. Encoder–decoder (کدگذار–رمزگشا)
این معماری هر دو مؤلفه را ترکیب میکند. کدگذار در حالت دوطرفه عمل میکند و decoder به صورت علّی. کدگذار ورودی را یکبار تحلیل کرده و بازنمایی آن را شکل میدهد؛ decoder خروجی را تولید میکند و از طریق cross‑attention به این بازنمایی دسترسی دارد. این رویکرد جداگانه بهویژه در جایی که تبدیل یک متن ورودی طولانی به خروجی کوتاه نیاز است مفید است: ترجمه ماشینی، خلاصهسازی، پاسخدهی بر اساس اسناد. اگرچه این روش به هزینه محاسباتی کلی بیشتری نیاز دارد (دو پشته و cross-attention)، مزیت آن تولید کنترلشده بر اساس تحلیل کامل متن منبع است؛ در عین حال کدگذاری یکبار انجام شده و در طول فرآیند استنتاج مجدداً استفاده میشود.
مزایا:
- تولید شرطی: decoder از cross‑attention به بازنمایی ورودی استفاده میکند. [31]
- در سناریوی «ورودی طولانی → خروجی کوتاه» کارآمد است: ورودی یکبار کدگذاری میشود.
- برای فرمت «text‑to‑text» و استنتاج کنترلشده مناسب است (پیشوندهای وظیفه، دستورالعملهای ویژه). [32]
- پایداری و کارایی با منبع طولانی: در فاز رمزگشایی تنها self‑attention روی خروجی رشد میکند، در حالی که cross‑attention از کلیدها/مقادیر ثابت کدگذار مجدداً استفاده میکند (ورودی در هر گام «بازخوانی» نمیشود).
معایب:
- دو پشته نیازمندیهای حافظه و محاسبات را در آموزش و استفاده افزایش میدهند.
- برای دنبالههای بسیار طولانی، تأخیر کلی با decoder‑only قابل مقایسه است؛ خودبازگشت همچنان گلوگاه باقی میماند.
- مدلهای چت جهانی کمتری نسبت به decoder‑only وجود دارد؛ اغلب به عنوان موتور seq2seq با کیفیت بالا برای وظایف خاص استفاده میشود.
- با ورودی بسیار طولانی، حافظه زیر کلیدها/مقادیر cross‑attention در هر لایه decoder (برای کل منبع) افزایش مییابد که نیازمند برنامهریزی دقیق سرویسدهی است.
مدلهای نمونه: T5 (شامل T5 v1.1 و رویه fine-tuning دستوری در FLAN‑T5) و BART. [33][34][35]
ترانسفورمرهای چگال (Dense)
معماری کلاسیک و رایجترین نوع LLM: هنگام پردازش هر token، تقریباً تمام پارامترهای مدل شرکت میکنند. برخلاف رویکردهای پراکنده (مثلاً Mixture‑of‑Experts)، فعالسازی انتخابی زیرشبکهها وجود ندارد — هر بلوک برای هر token کار میکند. [1]
اصل کار و معماری
ساختار پایه. مدل یک پشته از N بلوک transformer همسان است. هر بلوک شامل:
- توجه چندسر خودانتساب (Multi‑Head Self‑Attention). برای هر token سه بردار محاسبه میشود: Q (query)، K (key)، V (value)؛ توجه به صورت تعریف میشود، که در آن ماسکی (علّی و/یا padding-ماسک) است که موقعیتهای غیرمجاز را حذف میکند. چند «سر» توجه به طور موازی جنبههای مختلف زمینه را در نظر میگیرند (H سر، معمولاً )؛ تعداد آنها با مقیاس مدل رشد میکند. [1]
- شبکه تماممتصل (Feed‑Forward Network, FFN). دو لایه خطی با غیرخطی بودن بین آنها (معمولاً GELU/SiLU؛ در برخی مدلهای مدرن — SwiGLU). بعد میانی معمولاً است؛ هنگام استفاده از SwiGLU اغلب برای حفظ تعداد مشابه پارامتر انتخاب میشود. FFN سهم قابل توجهی از پارامترها را در خود دارد. [1][36]
اجزای اضافی. اتصالات residual و نرمالسازی لایهها استفاده میشوند؛ در LLMهای مدرن Pre‑LN (نرمالسازی قبل از زیربلوکها) بیشتر به کار میرود — این پایداری آموزش را در عمقهای بزرگ بهبود میبخشد. علاوه بر LayerNorm کلاسیک، RMSNorm به طور فزایندهای استفاده میشود (هزینه محاسباتی را کاهش داده و در مدلهای بزرگ به خوبی عمل میکند)؛ همچنین در برخی خانوادهها نرمالسازی در فضای توجه به کار میرود (مثلاً نرمالسازی Q/K قبل از softmax). بازنماییهای موقعیتی میتوانند مطلق یا نسبی باشند؛ برای زمینه طولانی RoPE به استاندارد de facto تبدیل شده است.
نمونههای مدل و مقیاس
- BERT‑Large: 24 لایه، بعد 1024، 16 سر توجه، ≈340 میلیون پارامتر. [37]
- GPT‑3 (175B): 96 لایه، بعد 12288، 96 سر توجه، ≈175 میلیارد پارامتر. [38]
- LLaMA‑65B: 80 لایه، بعد 8192، 64 سر توجه، ≈65 میلیارد پارامتر. [39]
- PaLM‑540B: 118 لایه، بعد حدود 18432، ≈540 میلیارد پارامتر. [40]
مزایا
- بلوکهای یکنواخت، رژیمهای آموزشی کاملاً شناختهشده و رفتار قابل پیشبینی هنگام مقیاسبندی.
- کیفیت با رشد توانی با افزایش پارامترها و دادهها بهبود مییابد؛ رژیم compute‑optimal افزایش توأمان اندازه مدل و حجم tokenهای آموزشی را پیشبینی میکند. [41][42]
- همان معماری پس از fine-tuning طیف گستردهای از وظایف را بدون تغییر در سطح لایهها پوشش میدهد.
معایب
- توجه کامل خودانتساب پیچیدگی درجه دوم نسبت به طول دنباله دارد ()، که پنجره زمینه را محدود میکند. [1]
- فعالسازی کامل پارامترها در گام تولید: در decoder بدون MoE هزینه استنتاج به ازای هر token تقریباً به تعداد پارامترها متناسب است.
- گلوگاه پهنای باند حافظه (memory‑bound): بارگذاری وزنها از HBM اغلب سرعت استنتاج را محدود میکند.
محدودیتهای مقیاسبندی و زمینه
- حافظه زیر پارامترها با اندازه مدل به صورت خطی رشد میکند؛ حافظه آموزشی به دلیل گرادیانها و حالتهای بهینهساز افزایش مییابد.
- پیکربندیهای پایه تاریخاً به ۲–۴ هزار token محدود بودند. طرحهای موقعیتی مدرن (RoPE) و تکنیکهای گسترش (Position Interpolation، YaRN و غیره) امکان افزایش پنجره را یک مرتبه بزرگی یا بیشتر فراهم میکنند، اما با هزینه محاسباتی/حافظهای بیشتر. [43][44]
بهینهسازیهای مدرن
- FlashAttention. توجه دقیق با در نظر گرفتن سلسلهمراتب حافظه GPU؛ مصرف حافظه را کاهش داده و آموزش/استنتاج را برای دنبالههای طولانی تسریع میکند. [45]
- کاهش و مدیریت KV‑cache. Multi‑Query Attention و Grouped‑Query Attention حجم cache و ترافیک حافظه را کاهش میدهند؛ در سطح سرور، PagedAttention (vLLM) با مدیریت صفحهای cache توان عملیاتی را افزایش میدهد. [46][47][48]
- رمزگشایی انتزاعی (Speculative Decoding). مدل پیشنویس (draft) ادامه را پیشنهاد میدهد و مدل اصلی آن را سریعاً تأیید میکند؛ تسریع بدون تغییر توزیع خروجی حاصل میشود. [49]
مدلهای پراکنده (Sparse Models) و Mixture‑of‑Experts (MoE)
MoE روشی است برای افزایش ظرفیت مدل بدون رشد متناسب محاسبات به ازای هر token. به جای یک بلوک FFN بزرگ در یک لایه، مجموعهای از «متخصصان» موازی (چند FFN مستقل) استفاده میشود، و یک شبکه مسیریاب قابلیادگیری (gating network) برای هر token متخصصان top‑k مرتبطتر را انتخاب میکند (معمولاً k=1–2؛ در برخی مدلها k=4). تنها متخصصان انتخابشده فعال میشوند؛ خروجیهای آنها وزندهی و جمع میشوند. بدین ترتیب تعداد کل پارامترها میتواند صدها میلیارد تا تریلیون باشد، اما در هر گام تنها بخش کوچکی فعال میشود. [50][51]
نمونههای مدل و مقیاس
- Switch Transformer (Google): تا ~1.6T پارامتر؛ مسیریابی top‑1 (یک متخصص به ازای هر token). نشان داد که MoE امکان افزایش شدید ظرفیت با هزینه مشابه به ازای هر token را فراهم میکند. [50]
- GLaM (Google): 1.2T پارامتر، 64 متخصص در لایه، top‑2؛ برای هر token ≈96.6B پارامتر (~8%) فعال میشود. [51]
- Mixtral 8×7B (Mistral AI): ~46.7B پارامتر کل، ≈12.9B پارامتر فعال به ازای هر token، top‑2. [52][53]
- Mixtral 8×22B: ~141B پارامتر کل، ≈39B پارامتر فعال به ازای هر token، top‑2. [54]
- DBRX (Databricks): 132B پارامتر کل، ≈36B پارامتر فعال به ازای هر token؛ 16 متخصص و مسیریابی top‑4 (fine‑grained MoE). [55]
مزایا
- هزینه محاسبات توسط تعداد متخصصان فعال k تعیین میشود نه تعداد کل پارامترها: میتوان مدلهایی در مقیاس تریلیونی را با هزینهای قابل مقایسه با مدلهای چگال به مراتب کوچکتر آموزش داد و استفاده کرد. [51]
- تخصصگرایی: متخصصان به طور خودکار برای زبانها/حوزهها/الگوها «تنظیم میشوند» و کیفیت را در وظایف چندحوزهای بهبود میبخشند.
- استقرار انعطافپذیر: میتوان متخصصان پرکاربرد را در حافظه نگه داشت و موارد نادر را در صورت نیاز بارگذاری کرد (با زیرساخت مناسب).
محدودیتها
- تعادل بار: بدون تنظیمسازی، مسیریاب ممکن است روی برخی متخصصان «قفل کند» (router collapse). نیاز به auxiliary losses (load‑balancing) و طرحهای بهتر مسیریابی است. [50]
- پیچیدگی محاسبات توزیعشده: نیازمند expert parallelism و تبادل all‑to‑all است؛ هزینههای ارتباطی و مدیریت حافظه به گلوگاه تبدیل میشوند. [56]
- پایداری آموزش: تنظیمات router و محدودیتهای ظرفیت (capacity) مهم هستند، وگرنه افت کیفیت/همگرایی ممکن است رخ دهد.
بهبودهای مدرن
- Expert‑Choice routing: متخصصان tokenها را «انتخاب میکنند»، که تعادل بار و همگرایی را با هزینه مشابه بهبود میدهد. [57]
- Fine‑grained MoE: تعداد بیشتری از متخصصان ریزتر (مانند DBRX) گرانولاریتی ظریفتری از تخصصگرایی ارائه میدهند. [55]
- Sparse Upcycling: تبدیل یک مدل چگال به MoE از نقطه بازرسی آن امکان بهبود قابل توجه کیفیت با هزینه متوسط را فراهم میکند. [58]
مناسب بودن استفاده از MoE
- دستیارهای چندحوزهای بزرگ با بودجه محاسباتی محدود.
- آموزش روی corpusهای گسترده که تخصصگرایی مزیت ایجاد میکند.
- سناریوهایی با زیرساخت توزیعشده پیشرفته (GPU/TPU زیاد و شبکههای سریع).
زمانی که مدلهای چگال بهترند: زیرساخت محدود (۱–۲ GPU)، نیازمندیهای سختگیرانه به تأخیر قابل پیشبینی و سادگی استقرار.
Retrieval‑Augmented Generation (RAG)
RAG یک الگوی سیستمی پیرامون LLM است، نه معماری داخلی خود مدل. این الگو LLM (مؤلفه تولیدی) را با یک پایگاه دانش خارجی (مؤلفه بازیابی) ترکیب میکند، که به جبران محدودیت «حافظه پارامتری» مدل کمک میکند.
- اصل کار: قبل از تولید، LLM اسناد مرتبط را از یک منبع خارجی (ویکی، پایگاه دانش سازمانی، وب) بازیابی کرده و هنگام شکلدادن پاسخ به آنها متکی میشود. [59]
- مزایا:
- کاربرد: استاندارد de facto برای دستیارهای سازمانی و سیستمهایی که نیاز به حقایق قابل تأیید و کار با دادههای خصوصی/تخصصی دارند. [59]
مکانیزمهای توجه و کار با زمینه
توجه خودانتساب پایه پیچیدگی درجه دوم نسبت به طول دنباله دارد ()، بنابراین بهینهسازیهایی ظهور کردهاند.
- توجه پراکنده (Sparse Attention): محدود کردن توجه به پنجرههای محلی/الگوها. نمونهها: Longformer[61]، BigBird[62].
- FlashAttention: بازسازی ترتیب محاسبات با در نظر گرفتن سلسلهمراتب حافظه GPU؛ بهرهوری قابل توجهی در زمان و حافظه ارائه میدهد و به استاندارد de facto در آموزش LLM با زمینه طولانی تبدیل شده است[63][64][65].
- MQA/GQA (تسریع رمزگشایی): Multi‑Query Attention (کلیدها/مقادیر مشترک برای همه سرها) ترافیک KV‑cache را کاهش میدهد[66]. Grouped‑Query Attention تعادل کیفیت/سرعت را فراهم میکند[67].
- بازنماییهای موقعیتی بهبودیافته:
- ALiBi (Attention with Linear Biases): انحرافات خطی به امتیازات توجه برای بهبود تعمیم به طولهای بزرگتر. [68]
- RoPE (Rotary Position Embeddings): اطلاعات موقعیت نسبی از طریق چرخش Q/K؛ به طور گسترده در مدلهای مدرن استفاده میشود (مثلاً LLaMA). [69][70]
- گسترش زمینه برای مدلهای RoPE: Position Interpolation [71]، YaRN [72] و تغییرات NTK-aware امکان افزایش کارآمد پنجره زمینه بدون تغییر معماری را فراهم میکنند.
- رویکردهای دیگر برای دنبالههای طولانی:
بهینهسازی مدلها و زیرساخت آموزش
برای آموزش و استقرار LLM از تکنیکها و فریمورکهای تخصصی استفاده میشود.
- کوانتیزاسیون (Quantization): کاهش دقت وزنها حافظه را کاهش داده و استنتاج را تسریع میکند. QLoRA امکان fine-tuning کارآمد مدلهای ۴ بیتی (از جمله 65B) را با کیفیت نزدیک به دقت کامل فراهم میکند[77].
- تقطیر دانش (Knowledge Distillation): آموزش Teacher→Student برای مدلهای فشرده[78]؛ نمونه — DistilBERT[79].
- آموزش توزیعشده:
- اکوسیستم و ابزارها: Hugging Face Transformers و Accelerate پیادهسازیهای استاندارد مدل و یکپارچهسازی با DeepSpeed/FSDP برای آموزش و استنتاج را فراهم میکنند[82][83].
قوانین مقیاسبندی و آموزش compute‑optimal
قوانین مقیاسبندی تجربی نشان میدهند که خطای کراسآنتروپی با رشد پارامترها، دادهها و محاسبات به صورت قانون توانی کاهش مییابد. [84] کار Chinchilla رژیمهای compute‑optimal را دقیقتر کرد: برای بهترین کارایی، اندازه مدل و تعداد tokenهای آموزشی باید به طور مشترک مقیاس شوند (نمونه — مدل 70B آموزشدیده روی ~1.4T token، که از مدلهای بزرگتر کمآموزشدیده بهتر است). [85]
مدلهای فضای حالت (State Space Models, SSM)
State Space Models (SSM) — معماری جایگزین نسبت به transformerها برای کار با دنبالههای طولانی. این معماری ایدههایی از نظریه کنترل و پردازش سیگنال دیجیتال را به کار میگیرد و مشکل اصلی self‑attention را حل میکند: رشد درجه دوم محاسبات با افزایش طول متن.
مشکل اصلی و راهحل
مشکل transformerها. مشکل اصلی transformerهای سنتی پیچیدگی درجه دوم توجه است: متنی ۱۰ برابر طولانیتر به تقریباً ۱۰۰ برابر محاسبات بیشتر نیاز دارد.
رویکرد SSM. به جای «توجه همزمان به همه کلمات»، مدل به صورت متوالی روی متن حرکت میکند و یک حالت حافظه داخلی فشرده را حفظ میکند که در هر گام بهروزرسانی میشود. در نتیجه زمان و مصرف حافظه تقریباً به صورت خطی با طول متن رشد میکنند. در عین حال آموزش میتواند به صورت موازی انجام شود — از طریق بازنمایی کانولوشنی هسته (توان عملیاتی بالا روی دنبالههای طولانی). [86]
اصل کار
SSM گسسته توسط معادلات حالت و خروجی توصیف میشود:
که در آن — حالت حافظه، — ورودی (token)، — خروجی. در SSMهای عمیق ماتریسهای به گونهای پارامتریزه میشوند که پایداری و محاسبات کارآمد روی دنبالههای طولانی را تضمین کنند. همان لایه را میتوان به صورت:
- بازگشتی (پویش گامبهگام) — استنتاج کارآمد از نظر حافظه بدون KV‑cache؛
- کانولوشنی — آموزش موازی با هسته پیشمحاسبهشده در نظر گرفت. [86]
معماریهای اصلی و ترکیبی
- S4 (Structured State Spaces). خط پایه SSM با پارامتریزاسیون پایدار ماتریس حالت؛ کارایی روی دنبالههای بسیار طولانی را نشان میدهد. [86]
- Mamba. SSMهای انتخابی: قوانین بهروزرسانی حافظه به ورودی جاری وابسته است (مدل خودش تصمیم میگیرد چه چیزی را «در حافظه نگه دارد» و چه چیزی را «فراموش کند»). پیادهسازی بر اساس سلسلهمراتب حافظه GPU بهینه شده؛ بر اساس گزارش نویسندگان، افزایش چندبرابری در توان عملیاتی استنتاج با پیچیدگی خطی نسبت به طول حاصل میشود. [87]
- RetNet. مکانیزم retention با سه حالت: آموزش موازی، استنتاج بازگشتی و بازگشتی-بلوکی. هدف — ترکیب آموزش سریع (مانند transformerها) با جریان کارآمد در استنتاج (حافظه O(1) به ازای هر token). [88]
- ترکیبی Attention+SSM. نمونه — Jamba (تناوب لایههای Transformer و Mamba به علاوه MoE): از پشتیبانی زمینههایی در حدود ~256 K token با نیاز حافظه به مراتب کمتر نسبت به مدلهای کاملاً transformer از همان رده گزارش میدهد. [89]
مزایا
- پیچیدگی خطی و صرفهجویی در حافظه در استنتاج. فاقد self‑attention و KV‑cache جهانی است؛ تنها حالت فشردهای ذخیره میشود. [87][88]
- آموزش موازی روی دنبالههای طولانی. حالت کانولوشنی توان عملیاتی آموزش را افزایش میدهد. [86]
- کارایی سختافزاری. پیادهسازیها برای سلسلهمراتب حافظه مدرن (HBM/SRAM) بهینه شدهاند. [87]
- زمینههای طولانی و پردازش جریانی. ترکیبیهای SSM+Attention برای صدها هزار token با منابع متعادل عملی هستند. [89]
محدودیتها و رویه جاری
- بلوغ اکوسیستم. ابزارها و «دستورالعملهای» مقیاسبندی (دستورالعملها، RLHF/DPO) هنوز از پشته transformer عقب هستند. [87]
- کیفیت و پایداری. در برخی وظایف، ترکیبیها (Attention+SSM) مصالحه پایدارتری از «کیفیت/سرعت/حافظه» نسبت به SSMهای «خالص» نشان میدهند. [89]
مقایسه رویکردها (به صورت کلی)
| ویژگی | Transformerها | SSM | ترکیبی (Attention+SSM) |
|---|---|---|---|
| پیچیدگی نسبت به طول | درجه دوم (self‑attention) | خطی (پویش/کانولوشن) | نزدیک به خطی |
| حافظه به ازای هر token (استنتاج) | KV‑cache با زمینه رشد میکند | حالت O(1) | رشد متعادل |
| زمینههای طولانی | نیازمند بهینهسازیهای خاص | پشتیبانی طبیعی | تا ~256 K عملی |
| بلوغ اکوسیستم | بالا | در حال توسعه | در حال توسعه |
کاربردهای عملی
- تحلیل اسناد بسیار طولانی (کتابها، گزارشها، مرورهای علمی).
- پردازش جریانی و سناریوهای چت با تاریخچه طولانی بدون افزایش هزینه حافظه.
- محیطهایی با منابع محدود (دستگاههای موبایل/edge).
- سریهای زمانی و سایر دادههای متوالی.
مدلهای نمونه: S4، Mamba، RetNet؛ ترکیبیهای Attention+SSM (Jamba). [86][87][88][89]
تکامل معماریها
- 2017 — مقاله «Attention Is All You Need» منتشر شد. معماری transformer معرفی شد: توجه چندسر خودانتساب و کدگذاریهای موقعیتی امکان آموزش مدلها بدون بازگشت و کانولوشن را فراهم کردند؛ با این حال توجه پیچیدگی درجه دوم نسبت به طول زمینه دارد.[1]
- 2018 — GPT‑1 و BERT معرفی شدند. GPT‑1 از پشته فقط decoder با توجه علّی برای تولید و fine-tuning بعدی استفاده میکند؛ BERT کدگذار دوطرفه و پیشآموزش MLM را برای وظایف درک متن معرفی میکند. [90][91]
- 2019 — روشهایی برای کار با دنبالههای طولانی پیشنهاد شد و decoder‑only مقیاسبندی شد. Transformer‑XL «حافظه» و موقعیتهای نسبی را برای خروج از پنجره ثابت اضافه میکند؛ GPT‑2 رشد قابلیتهای zero-shot با افزایش مقیاس را نشان میدهد؛ BART اثربخشی پیشآموزش denoising برای seq2seq را نشان میدهد. [92][93][94]
- 2020 — فرمت «text‑to‑text» یکپارچه شد و روشهایی برای اسناد طولانی نشان داده شد. T5 رویکرد یکپارچه encoder–decoder را برای وظایف مختلف فرموله میکند؛ Longformer و BigBird از توجه پراکنده/ساختاریافته برای متون طولانی استفاده میکنند؛ GPT‑3 اثربخشی مقیاسبندی decoder‑only چگال را تأیید میکند. [95][96][97][98]
- 2021 — بازنماییهای موقعیتی بهبود یافتند و پراکندگی پارامتری (MoE) نشان داده شد. RoPE و ALiBi تعمیمپذیری را در طولهای بزرگتر بهبود میبخشند؛ Switch Transformer و GLaM تنها بخشی از متخصصان را به ازای هر token فعال میکنند و ظرفیت را بدون افزایش متناسب هزینه استنتاج بالا میبرند. [99][100][101][102]
- 2022 — رژیم compute‑optimal دقیقتر شد و استنتاج روی promptهای طولانی تسریع شد. Chinchilla مزیت تعداد بیشتر tokenهای آموزشی با اندازه متعادل مدل را نشان میدهد؛ PaLM با Multi‑Query Attention حجم KV‑cache را کاهش میدهد؛ FlashAttention توجه را روی GPU تسریع میکند. [103][104][105][106]
- 2023 — پنجرههای زمینه بدون تغییر لایهها افزایش یافتند و ارائه سرور بهبود یافت. خانواده LLaMA رویهها را (RMSNorm، SwiGLU، RoPE) تثبیت کرد؛ Position Interpolation و YaRN زمینه را گسترش دادند؛ vLLM/PagedAttention مدیریت KV‑cache را کارآمدتر کرد. [107][108][109][110][111][112]
- 2023 — مدلهای فضای حالت (SSM) پیشنهاد شدند. Mamba و RetNet پردازش متوالی با حالت فشرده به جای KV‑cache را بازگرداندند و پایهای برای معماریهای ترکیبی گذاشتند. [115][116]
- 2024 — مدلهای MoE متنباز و ترکیبیهای Attention+SSM منتشر شدند؛ توجه روی GPUهای جدید تسریع یافت. Mixtral 8×7B/8×22B و DBRX عملیبودن MoE را تأیید کردند؛ Jamba Transformer و Mamba را برای زمینههای بسیار طولانی ترکیب کرد؛ FlashAttention‑3 توان عملیاتی را افزایش داد. [117][118][119][120][121]
منابع
- https://jalammar.github.io/illustrated-transformer/ The Illustrated Transformer — توضیح تصویری
منابع
- Vaswani, A. et al. (2017). Attention Is All You Need. NIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT. NAACL. https://arxiv.org/abs/1810.04805
- Brown, T. et al. (2020). Language Models are Few‑Shot Learners. NeurIPS. https://arxiv.org/abs/2005.14165
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
- Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
- Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
- Shazeer, N. (2019). MQA. https://arxiv.org/abs/1911.02150
- Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- Kwon, W. et al. (2023). PagedAttention / vLLM. https://arxiv.org/abs/2309.06180
- Leviathan, Y. et al. (2023). Speculative Decoding. https://arxiv.org/abs/2211.17192
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- Du, N. et al. (2022). GLaM. https://proceedings.mlr.press/v162/du22c/du22c.pdf
- Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
- Zhou, Y. et al. (2022). Expert Choice Routing. https://arxiv.org/abs/2202.09368
- Komatsuzaki, A. et al. (2022). Sparse Upcycling. https://arxiv.org/abs/2212.05055
- Lewis, P. et al. (2020). RAG. https://arxiv.org/abs/2005.11401
- Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
- Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
- Su, J. et al. (2021). RoFormer (RoPE). https://arxiv.org/abs/2104.09864
- Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
- Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
- Dettmers, T. et al. (2023). QLoRA. https://arxiv.org/abs/2305.14314
- Rajbhandari, S. et al. (2020). ZeRO. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
- Shoeybi, M. et al. (2019). Megatron‑LM. https://arxiv.org/abs/1909.08053
- Kaplan, J. et al. (2020). Scaling Laws. https://arxiv.org/abs/2001.08361
- Hoffmann, J. et al. (2022). Chinchilla / Compute‑Optimal. https://arxiv.org/abs/2203.15556
- Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
- Bai, Y. et al. (2022). Constitutional AI. https://arxiv.org/abs/2212.08073
- OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- OpenAI (2023). DevDay: GPT‑4 Turbo 128k. https://openai.com/index/new-models-and-developer-products-announced-at-devday/
- Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
- Shazeer, N. (2020). GLU Variants / SwiGLU. https://arxiv.org/abs/2002.05202
- Gu, A.; Goel, K.; Ré, C. (2021). S4: Structured State Spaces. https://arxiv.org/abs/2111.00396
- Gu, A.; Dao, T. (2023/2024). Mamba: Selective State Spaces. https://arxiv.org/abs/2312.00752
- Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
- Lieber, O. et al. (2024). Jamba: Hybrid Transformer‑Mamba. https://arxiv.org/abs/2403.19887
- Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer. https://arxiv.org/abs/2001.04451
- Choromanski, K. et al. (2021). Performer. https://arxiv.org/abs/2009.14794
- Wang, S. et al. (2020). Linformer. https://arxiv.org/abs/2006.04768
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ Devlin, J. et al. (2019). BERT. https://arxiv.org/abs/1810.04805
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Liu, Y. et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach. https://arxiv.org/abs/1907.11692
- ↑ He, P. et al. (2021). DeBERTa: Decoding‑enhanced BERT with Disentangled Attention. https://arxiv.org/abs/2006.03654
- ↑ Clark, K. et al. (2020). ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators. https://arxiv.org/abs/2003.10555
- ↑ Zaheer, M. et al. (2020). Big Bird: Transformers for Longer Sequences. https://arxiv.org/abs/2007.14062
- ↑ Beltagy, I. et al. (2020). Longformer: The Long‑Document Transformer. https://arxiv.org/abs/2004.05150
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (Multi‑Query Attention). https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. https://arxiv.org/abs/2305.13245
- ↑ Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
- ↑ Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). https://arxiv.org/abs/2309.06180
- ↑ vLLM Docs (2024–2025). Continuous batching, Chunked prefill, Structured outputs. https://docs.vllm.ai/
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Ouyang, L. et al. (2022). InstructGPT (RLHF). https://arxiv.org/abs/2203.02155
- ↑ Rafailov, R. et al. (2023). Direct Preference Optimization. https://arxiv.org/abs/2305.18290
- ↑ Shazeer, 2019. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, 2023. https://arxiv.org/abs/2305.13245
- ↑ Leviathan, 2023. https://arxiv.org/abs/2211.17192
- ↑ Kwon, 2023. https://arxiv.org/abs/2309.06180
- ↑ vLLM Docs. https://docs.vllm.ai/
- ↑ OpenAI (2024). Structured Outputs. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ vLLM Docs — Structured outputs. https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html
- ↑ Kwon, 2023. https://arxiv.org/abs/2309.06180
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Achiam, J. et al. (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- ↑ Meta AI (2024). Introducing Meta Llama 3. https://ai.meta.com/blog/meta-llama-3/
- ↑ Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training. https://arxiv.org/abs/1910.13461
- ↑ Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Lewis, M. et al. (2019). BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension. https://arxiv.org/abs/1910.13461
- ↑ Chung, H. W. et al. (2022). Scaling Instruction‑Finetuned Language Models (FLAN‑T5). https://arxiv.org/abs/2210.11416
- ↑ Shazeer, N. (2020). GLU Variants Improve Transformer. https://arxiv.org/abs/2002.05202
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. https://arxiv.org/abs/2204.02311
- ↑ Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
- ↑ Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
- ↑ Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
- ↑ Dao, T. et al. (2022–2024). FlashAttention (1/2/3). https://arxiv.org/abs/2205.14135 ; https://arxiv.org/abs/2307.08691 ; https://arxiv.org/abs/2407.08608
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- ↑ Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. https://arxiv.org/abs/2309.06180
- ↑ Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. https://arxiv.org/abs/2211.17192
- ↑ 50.0 50.1 50.2 Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- ↑ 51.0 51.1 51.2 Du, N. et al. (2021). GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts. https://arxiv.org/pdf/2112.06905.pdf
- ↑ Mistral AI (2023). Mixtral of Experts. https://mistral.ai/news/mixtral-of-experts/
- ↑ Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- ↑ Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
- ↑ 55.0 55.1 Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- ↑ NVIDIA (2024). Applying Mixture of Experts in LLM Architectures. https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/
- ↑ Zhou, Y. et al. (2022). Mixture‑of‑Experts with Expert Choice Routing. https://arxiv.org/abs/2202.09368
- ↑ Komatsuzaki, A. et al. (2022). Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints. https://arxiv.org/abs/2212.05055
- ↑ 59.0 59.1 59.2 59.3 Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. https://arxiv.org/abs/2005.11401
- ↑ NVIDIA Blog (2025). What is Retrieval‑Augmented Generation (RAG). https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/
- ↑ Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- ↑ Zaheer, M. et al. (2020). Big Bird. https://arxiv.org/abs/2007.14062
- ↑ Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
- ↑ Dao, T. et al. (2023). FlashAttention‑2. https://arxiv.org/abs/2307.08691
- ↑ Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. https://arxiv.org/abs/1911.02150
- ↑ Ainslie, J. et al. (2023). GQA. https://arxiv.org/abs/2305.13245
- ↑ Press, O. et al. (2022). ALiBi. https://arxiv.org/abs/2108.12409
- ↑ Su, J. et al. (2021). RoFormer: Rotary Position Embedding. https://arxiv.org/abs/2104.09864
- ↑ Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. https://arxiv.org/abs/2302.13971
- ↑ Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. https://arxiv.org/abs/2309.00071
- ↑ Dai, Z. et al. (2019). Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context. https://arxiv.org/abs/1901.02860
- ↑ Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). Reformer: The Efficient Transformer. https://arxiv.org/abs/2001.04451
- ↑ Choromanski, K. et al. (2021). Rethinking Attention with Performers. https://arxiv.org/abs/2009.14794
- ↑ Wang, S. et al. (2020). Linformer: Self‑Attention with Linear Complexity. https://arxiv.org/abs/2006.04768
- ↑ Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. https://arxiv.org/abs/2305.14314
- ↑ Hinton, G. et al. (2015). Distilling the Knowledge in a Neural Network. https://arxiv.org/abs/1503.02531
- ↑ Sanh, V. et al. (2019). DistilBERT. https://arxiv.org/abs/1910.01108
- ↑ Rajbhandari, S. et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models. https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/
- ↑ Shoeybi, M. et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. https://arxiv.org/abs/1909.08053
- ↑ Hugging Face. Transformers Documentation. https://huggingface.co/docs/transformers
- ↑ Hugging Face. Accelerate Documentation. https://huggingface.co/docs/accelerate
- ↑ Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. https://arxiv.org/abs/2001.08361
- ↑ Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. https://arxiv.org/abs/2203.15556
- ↑ 86.0 86.1 86.2 86.3 86.4 Gu, A.; Goel, K.; Ré, C. (2021). Efficiently Modeling Long Sequences with Structured State Spaces (S4). https://arxiv.org/abs/2111.00396
- ↑ 87.0 87.1 87.2 87.3 87.4 Gu, A.; Dao, T. (2023/2024). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. https://arxiv.org/abs/2312.00752
- ↑ 88.0 88.1 88.2 Sun, Y. et al. (2023). Retentive Network: A Successor to Transformer for Large Language Models. https://arxiv.org/abs/2307.08621
- ↑ 89.0 89.1 89.2 89.3 Lieber, O. et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. https://arxiv.org/abs/2403.19887
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. https://arxiv.org/abs/1810.04805
- ↑ Dai, Z. et al. (2019). Transformer‑XL. https://arxiv.org/abs/1901.02860
- ↑ Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
- ↑ Lewis, M. et al. (2019). BART. https://arxiv.org/abs/1910.13461
- ↑ Raffel, C. et al. (2020). T5. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- ↑ Beltagy, I. et al. (2020). Longformer. https://arxiv.org/abs/2004.05150
- ↑ Zaheer, M. et al. (2020). BigBird. https://arxiv.org/abs/2007.14062
- ↑ Brown, T. et al. (2020). Language Models are Few‑Shot Learners. https://arxiv.org/abs/2005.14165
- ↑ Su, J. et al. (2021). RoPE. https://arxiv.org/abs/2104.09864
- ↑ Press, O. et al. (2021/2022). ALiBi. https://arxiv.org/abs/2108.12409
- ↑ Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. https://arxiv.org/abs/2101.03961
- ↑ Du, N. et al. (2021). GLaM. https://arxiv.org/pdf/2112.06905.pdf
- ↑ Hoffmann, J. et al. (2022). Chinchilla. https://arxiv.org/abs/2203.15556
- ↑ Chowdhery, A. et al. (2022). PaLM. https://arxiv.org/abs/2204.02311
- ↑ Shazeer, N. (2019). Fast Transformer Decoding. https://arxiv.org/abs/1911.02150
- ↑ Dao, T. et al. (2022). FlashAttention. https://arxiv.org/abs/2205.14135
- ↑ Touvron, H. et al. (2023). LLaMA. https://arxiv.org/abs/2302.13971
- ↑ Zhang, B.; Sennrich, R. (2019). RMSNorm. https://arxiv.org/abs/1910.07467
- ↑ Shazeer, N. (2020). GLU Variants. https://arxiv.org/abs/2002.05202
- ↑ Chen, S. et al. (2023). Position Interpolation. https://arxiv.org/abs/2306.15595
- ↑ Peng, B. et al. (2023). YaRN. https://arxiv.org/abs/2309.00071
- ↑ Kwon, W. et al. (2023). vLLM/PagedAttention. https://arxiv.org/abs/2309.06180
- ↑ OpenAI (2023). GPT‑4 Technical Report. https://arxiv.org/abs/2303.08774
- ↑ Gemini Team (2023). Gemini. https://arxiv.org/abs/2312.11805
- ↑ Gu, A.; Dao, T. (2023). Mamba. https://arxiv.org/abs/2312.00752
- ↑ Sun, Y. et al. (2023). RetNet. https://arxiv.org/abs/2307.08621
- ↑ Jiang, A.Q. et al. (2024). Mixtral of Experts. https://arxiv.org/abs/2401.04088
- ↑ Mistral AI (2024). Mixtral 8x22B. https://mistral.ai/news/mixtral-8x22b
- ↑ Databricks (2024). Introducing DBRX. https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm
- ↑ Lieber, O. et al. (2024). Jamba. https://arxiv.org/abs/2403.19887
- ↑ Shah, M. et al. (2024). FlashAttention‑3. https://arxiv.org/abs/2407.08608