---
title: "Large language model architectures — বৃহৎ ভাষা মডেলের আর্কিটেকচার"
source: "https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0"
wiki: "systems-analysis.info/int"
article: "Large_language_model_architectures_—_বৃহৎ_ভাষা_মডেলের_আর্কিটেকচার"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3790
wiki_created_at: 2026-09-06T23:26:10Z
wiki_modified_at: 2026-09-06T23:26:10Z
downloaded_at: 2026-09-07T22:59:04Z
---

# Large language model architectures — বৃহৎ ভাষা মডেলের আর্কিটেকচার

**বৃহৎ ভাষা মডেলের (LLM) আর্কিটেকচার** — এগুলো হলো মৌলিক নীতি ও কাঠামো যা নির্ধারণ করে কীভাবে বৃহৎ ভাষা মডেল তৈরি, প্রশিক্ষিত এবং পরিচালিত হয়। আধুনিক LLM, যা মানবীয় ভাষা বুঝতে ও তৈরি করতে সক্ষম, প্রায় সম্পূর্ণরূপে **Transformer**<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)</sup> আর্কিটেকচারের উপর ভিত্তি করে গড়ে উঠেছে, তবে এতে দক্ষতা, স্কেলেবিলিটি এবং সামর্থ্য বৃদ্ধির লক্ষ্যে অনেক উন্নতি ও বিভিন্ন পদ্ধতি অন্তর্ভুক্ত করা হয়েছে।

## LLM আর্কিটেকচার পরিবার (ট্রান্সফর্মার)

আধুনিক বৃহৎ ভাষা মডেলগুলো transformer<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)</sup> আর্কিটেকচারের উপর ভিত্তি করে গড়ে উঠেছে, কিন্তু লক্ষ্য অনুযায়ী এটি ভিন্নভাবে ব্যবহার করা হয়: টেক্সট বোঝা, ধারাবাহিকতা তৈরি করা বা একটি টেক্সটকে অন্যটিতে রূপান্তর করা। বাস্তব ক্ষেত্রে transformer-এর মূল নীতিগুলো বজায় রেখে তিনটি পরিবার চিহ্নিত করা হয়<sup>[\[2\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-2)[\[3\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-3)[\[4\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-4)</sup>।

### ১. Encoder‑only (শুধুমাত্র এনকোডার)

মডেলটি শুধুমাত্র এনকোডার স্ট্যাক ব্যবহার করে এবং সমগ্র ইনপুট টেক্সটকে দ্বিমুখীভাবে বিবেচনা করে। প্রি-ট্রেনিং সাধারণত masked‑language modeling (MLM) হিসাবে গড়ে ওঠে: কিছু token লুকানো হয় এবং মডেল তার পারিপার্শ্বিকতা থেকে সেগুলো পুনরুদ্ধার করতে শেখে। দ্বিমুখী প্রসঙ্গের কারণে এই মডেলগুলো বোঝাপড়া ও স্কোরিং কাজে শক্তিশালী: শ্রেণীবিভাগ, entity নিষ্কাশন, নথি পুনর্বিন্যাস এবং extractive QA। শূন্য থেকে autoregressive generation-এর জন্য এগুলো উপযুক্ত নয়।

বাস্তবে encoder‑only পরিবারের জন্য বিকল্প প্রি-ট্রেনিং লক্ষ্যমাত্রাও প্রয়োগ করা হয়: *ELECTRA-তে replaced token detection (RTD)* (discriminator মডেল প্রতিস্থাপিত token শনাক্ত করে) এবং semantic অনুসন্ধান/retriever-এর জন্য bi-encoder-এর *contrastive learning* (Dense Passage Retrieval-এর মতো 'query-document' জোড়ায় InfoNCE/softmax‑loss)। RAG-এ ব্যবহার করার সময় encoder‑only হয় *bi‑encoder* হিসেবে কাজ করে (দ্রুত ANN অনুসন্ধানের জন্য query ও document আলাদাভাবে encode করা), অথবা *cross‑encoder* হিসেবে (সঠিক পুনর্বিন্যাসের জন্য জোড়াটি একসাথে encode করা)।

**সুবিধাসমূহ:**

- দ্বিমুখী প্রসঙ্গের কারণে টেক্সট বোঝার উচ্চমান: শ্রেণীবিভাগ, NER, তথ্য নিষ্কাশন, পুনর্বিন্যাস, extractive QA।
- সমান্তরাল প্রক্রিয়াকরণ এবং উচ্চ থ্রুপুট: auto‑regression ছাড়াই একটি forward pass; বড় আকারের স্কোরিং batch করা সুবিধাজনক।
- অনুসন্ধান ও RAG-এর সাথে স্বাভাবিক একীভূতকরণ: bi‑encoder হিসেবে — দ্রুত semantic অনুসন্ধান; cross‑encoder হিসেবে — সঠিক পুনর্বিন্যাস।
- কার্যকর অভিযোজন: তুলনামূলকভাবে কম্প্যাক্ট ভেরিয়েন্ট (≈১০০–৩০০ মিলিয়ন প্যারামিটার; BERT‑base ≈১১০ মিলিয়ন) লক্ষ্য-নির্দিষ্ট fine-tuning-এর পরে উচ্চমান দেয়।
- স্থিতিশীল latency যা উৎপন্ন উত্তরের দৈর্ঘ্যের উপর নির্ভর করে না (ধাপে ধাপে decoding নেই); বড় সংগ্রহের offline স্কোরিং-এর জন্য উপযুক্ত।
- আপেক্ষিক/rotational অবস্থান এবং/অথবা locally sparse attention-এর মাধ্যমে encoder-এর context window বড় করার সম্ভাবনা (যেমন Longformer/BigBird), যা দীর্ঘ নথির জন্য দরকারী।

**অসুবিধাসমূহ:**

- নিজস্ব generative ক্ষমতা নেই: সংলাপ ও বিস্তারিত উত্তরের জন্য decoder বা বাহ্যিক generative মডিউল প্রয়োজন।
- ইন্টারেক্টিভ পরিস্থিতিতে সীমাবদ্ধতা: state সংরক্ষণ সহ ধাপে ধাপে generation নেই।
- প্রি-ট্রেনিং লক্ষ্যমাত্রার সাথে মুক্ত generation কাজের অমিল: MLM causal modeling-এর তুলনায় generation-এর সাথে কম সামঞ্জস্যপূর্ণ।
- ঐতিহাসিকভাবে সীমিত context window (প্রায়ই absolute position-এর বেসিক কনফিগারেশনে ৫১২ token); বিস্তার করার জন্য বিশেষ position/attention স্কিম এবং/অথবা fine-tuning প্রয়োজন।
- Retrieval কাজের জন্য bi‑encoder এবং/অথবা cross‑encoder-এর আলাদা contrastive fine-tuning প্রয়োজন; এটি ছাড়া অনুসন্ধান/পুনর্বিন্যাসের মান সাধারণত বিশেষভাবে প্রশিক্ষিত মডেলের চেয়ে কম।

**প্রতিনিধিত্বকারী মডেল:** BERT এবং এর ডেরিভেটিভ, পাশাপাশি RoBERTa ও DeBERTa (encoder‑only-এর বর্ধিত ভেরিয়েন্ট); বিকল্প প্রি-ট্রেনিং লক্ষ্যমাত্রা থেকে — ELECTRA (RTD)। <sup>[\[5\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-5)[\[6\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-6)[\[7\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-7)[\[8\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-8)[\[9\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-9)[\[10\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-10)</sup>

### ২. Decoder‑only (শুধুমাত্র ডিকোডার)

শুধুমাত্র causal (বাম-দিকমুখী) attention সহ decoder স্ট্যাক ব্যবহার করা হয়: মডেল ইতিমধ্যে দেওয়া prefix থেকে পরবর্তী token পূর্বানুমান করে। এই প্রশিক্ষণ পদ্ধতি — causal language modeling (CLM) — এই মডেলগুলোকে generation-এর স্বাভাবিক পছন্দ করে তোলে: সংলাপ, বিস্তারিত উত্তর, সৃজনশীল টেক্সট, প্রোগ্রাম কোড। আপোষ হলো দীর্ঘ prompt-এ বিলম্ব ও KV‑cache-এর আকার বৃদ্ধি। বাস্তবে decoder‑only-এর জন্য বিভিন্ন প্রকৌশলগত কৌশল ব্যাপকভাবে প্রয়োগ করা হয়: MQA ও GQA-র মাধ্যমে KV‑cache হ্রাস, speculative decoding ও সার্ভার অপ্টিমাইজেশনের মাধ্যমে inference ত্বরান্বিত করা (PagedAttention/vLLM, continuous batching, chunked prefill)।<sup>[\[11\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-11)[\[12\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-12)[\[13\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-13)[\[14\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-14)[\[15\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-15)</sup>

**সুবিধাসমূহ:**

- স্বাভাবিক টেক্সট generation (CLM): শক্তিশালী zero‑shot ও few‑shot ক্ষমতা; ভালোভাবে স্কেল হয়।<sup>[\[16\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-16)</sup>
- প্রয়োগের বহুমুখিতা: একটি মডেল prompt-এ নির্দেশ ও উদাহরণের মাধ্যমে অনেক কাজ সমাধান করে; স্বাভাবিকভাবে RAG ও tool use-এর সাথে মিলিত হয়।
- পরিপক্ক ecosystem: instruction fine-tuning ও আচরণ alignment (RLHF, DPO)-এর অনুশীলন; উন্মুক্ত ও বাণিজ্যিক বাস্তবায়ন উপলব্ধ।<sup>[\[17\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-17)[\[18\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-18)</sup>
- সমৃদ্ধ inference অপ্টিমাইজেশন স্ট্যাক: MQA/GQA KV‑cache-এর আকার কমায় এবং থ্রুপুট বাড়ায়; speculative decoding বিতরণ পরিবর্তন না করে inference ত্বরান্বিত করে; PagedAttention/vLLM সহ continuous batching ও chunked prefill GPU-এর সামগ্রিক ব্যবহার বাড়ায়।<sup>[\[19\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-19)[\[20\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-20)[\[21\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-21)[\[22\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-22)[\[23\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-23)</sup>
- কঠোর উত্তর ফরম্যাটের জন্য structured generation-এর সমর্থন (JSON/SQL/DSL), যা তথ্য সিস্টেম ও API-এর সাথে একীভূতকরণ সহজ করে।<sup>[\[24\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-24)[\[25\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-25)</sup>

**অসুবিধাসমূহ:**

- Generation-এ বর্ধিত বিলম্ব: ক্রমানুসারে inference; নতুন token-এর খরচ ইতিমধ্যে 'পঠিত' প্রসঙ্গের দৈর্ঘ্যের সাথে বাড়ে (KV‑cache)।
- 'দীর্ঘ ইনপুট – সংক্ষিপ্ত আউটপুট' প্রোফাইলে (সারসংক্ষেপ, অনুবাদ) encoder–decoder-এর তুলনায় কম সুবিধাজনক, যেখানে ইনপুট একবারই encode করা হয়।
- একমুখী প্রসঙ্গের সীমাবদ্ধতা: বোঝার কাজে কখনো কখনো দ্বিমুখী representation-এর মডেলের (encoder‑only / encoder–decoder) চেয়ে কম কার্যকর।
- দীর্ঘ prompt ও বড় batch-এ KV‑cache-এর মেমরি 'bottleneck' হতে পারে;<sup>[\[26\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-26)</sup>
- activation/KV-এর quantization (INT8/FP8) inference ত্বরান্বিত করে, কিন্তু দীর্ঘ প্রসঙ্গ/কোডে মান কমাতে পারে; সাবধানী validation প্রয়োজন (বিশেষত কঠোর SLA-র ক্ষেত্রে)।

**প্রতিনিধিত্বকারী মডেল:** GPT‑3, GPT‑4 (আর্কিটেকচার ও ডেটাসেটের বিবরণ প্রকাশ্যে উন্মোচিত নয়), LLaMA এবং *Llama 3* (8B/70B, ২০২৪)।<sup>[\[27\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-27)[\[28\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-28)[\[29\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-29)[\[30\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-30)</sup>

### ৩. Encoder–decoder (এনকোডার-ডিকোডার)

আর্কিটেকচার উভয় উপাদান একত্রিত করে। Encoder দ্বিমুখী মোডে কাজ করে, আর decoder — causally। Encoder একবার ইনপুট বিশ্লেষণ করে তার representation তৈরি করে; decoder cross‑attention-এর মাধ্যমে এই representation-এ প্রবেশ করে আউটপুট তৈরি করে। এই আলাদা পদ্ধতি বিশেষভাবে উপকারী যেখানে দীর্ঘ ইনপুট টেক্সটকে সংক্ষিপ্ত আউটপুটে রূপান্তর করতে হয়: মেশিন অনুবাদ, সারসংক্ষেপ, নথির উপর ভিত্তি করে উত্তর। যদিও পদ্ধতিটিতে বৃহত্তর মোট গণনামূলক খরচ প্রয়োজন (দুটি স্ট্যাক ও cross‑attention), এর সুবিধা হলো মূল টেক্সটের সম্পূর্ণ বিশ্লেষণের ভিত্তিতে নিয়ন্ত্রিত generation; এক্ষেত্রে encoding একবার সম্পন্ন হয় এবং সমগ্র inference প্রক্রিয়া জুড়ে পুনরায় ব্যবহার করা হয়।

**সুবিধাসমূহ:**

- শর্তাধীন generation: decoder ইনপুটের representation-এ cross‑attention ব্যবহার করে।<sup>[\[31\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-31)</sup>
- 'দীর্ঘ ইনপুট → সংক্ষিপ্ত আউটপুট' পরিস্থিতিতে কার্যকর: ইনপুট একবারই encode করা হয়।
- 'text‑to‑text' ফরম্যাট ও নিয়ন্ত্রিত inference-এর জন্য সুবিধাজনক (কাজ-নির্দিষ্ট prefix, বিশেষ নির্দেশ)।<sup>[\[32\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-32)</sup>
- দীর্ঘ উৎসে স্থিতিশীলতা ও দক্ষতা: decoding পর্যায়ে শুধুমাত্র আউটপুটের self‑attention বাড়ে, আর cross‑attention encoder থেকে স্থির key/value পুনরায় ব্যবহার করে (প্রতিটি ধাপে ইনপুট 'পুনরায় পঠিত' হয় না)।

**অসুবিধাসমূহ:**

- দুটি স্ট্যাক প্রশিক্ষণ ও প্রয়োগে মেমরি ও গণনার প্রয়োজনীয়তা বাড়ায়।
- অত্যন্ত দীর্ঘ sequence-এ চূড়ান্ত বিলম্ব decoder‑only-এর সমতুল্য; auto‑regression সংকীর্ণ পথ হিসেবে থাকে।
- decoder‑only-এর মধ্যে যতটা সার্বজনীন chat মডেল রয়েছে তার চেয়ে কম; প্রায়ই নির্দিষ্ট কাজের জন্য উচ্চমানের seq2seq ইঞ্জিন হিসেবে ব্যবহৃত হয়।
- অত্যন্ত দীর্ঘ ইনপুটে decoder-এর প্রতিটি স্তরে cross‑attention-এর key/value-এর মেমরি বাড়ে (পুরো উৎস জুড়ে), যা সতর্কতার সাথে serving পরিকল্পনা প্রয়োজন।

**প্রতিনিধিত্বকারী মডেল:** T5 (T5 v1.1 এবং *FLAN‑T5*-এ instruction fine-tuning অনুশীলন সহ) ও BART।<sup>[\[33\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-33)[\[34\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-34)[\[35\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-35)</sup>

## ঘন (Dense) ট্রান্সফর্মার

LLM-এর ক্লাসিক ও সর্বাধিক প্রচলিত আর্কিটেকচার: প্রতিটি token প্রক্রিয়া করার সময় মডেলের প্রায় সমস্ত প্যারামিটার অংশগ্রহণ করে। Sparse পদ্ধতির (যেমন Mixture‑of‑Experts) বিপরীতে, sub-network-এর নির্বাচনী সক্রিয়করণ নেই — প্রতিটি ব্লক প্রতিটি token-এর জন্য কাজ করে।<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)</sup>

### কার্যপ্রণালী ও আর্কিটেকচার

**মৌলিক কাঠামো।** মডেল হলো N একই ধরনের transformer block-এর একটি স্ট্যাক। প্রতিটি ব্লকে রয়েছে:

1.  **Multi‑Head Self‑Attention (বহু-মাথাবিশিষ্ট স্ব-মনোযোগ)।** প্রতিটি token-এর জন্য তিনটি ভেক্টর গণনা করা হয়: Q (query), K (key), V (value); attention নির্ধারিত হয় $\operatorname{softmax}\!\left( \frac{QK^{\top} + M}{\sqrt{d_{k}}} \right) \cdot V$ হিসাবে, যেখানে $M$ হলো mask (causal এবং/অথবা padding mask) যা অগ্রহণযোগ্য অবস্থান বাদ দেয়। কয়েকটি attention 'head' সমান্তরালভাবে প্রসঙ্গের বিভিন্ন দিক বিবেচনা করে (H head, সাধারণত $d_{head} = \frac{d_{model}}{H}$); মডেলের স্কেলের সাথে তাদের সংখ্যা বাড়ে।<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)</sup>
2.  **Feed‑Forward Network (FFN)।** দুটি linear layer-এর মাঝে nonlinearity সহ (সাধারণত GELU/SiLU; কিছু আধুনিক মডেলে — SwiGLU)। মধ্যবর্তী মাত্রা সাধারণত $\approx 4\, d_{model}$; SwiGLU ব্যবহার করলে তুলনামূলক প্যারামিটার সংখ্যা বজায় রাখতে প্রায়ই $\approx \frac{8}{3}\, d_{model}$ নেওয়া হয়। FFN-এ প্যারামিটারের উল্লেখযোগ্য অংশ রয়েছে।<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-36)</sup>

**অতিরিক্ত উপাদান।** Residual সংযোগ ও layer normalization ব্যবহার করা হয়; আধুনিক LLM-এ প্রায়ই Pre‑LN (sub-block-এর আগে normalization) প্রয়োগ করা হয় — এটি বড় গভীরতায় প্রশিক্ষণের স্থিতিশীলতা উন্নত করে। ক্লাসিক LayerNorm-এর পাশাপাশি **RMSNorm** ক্রমবর্ধমানভাবে ব্যবহৃত হচ্ছে (গণনামূলক খরচ কমায় এবং বড় মডেলে ভালো কাজ করে); কিছু পরিবারে attention স্থানে normalization প্রয়োগ করা হয় (যেমন softmax-এর আগে Q/K normalization)। Positional representation পরম বা আপেক্ষিক হতে পারে; দীর্ঘ প্রসঙ্গের জন্য RoPE কার্যত মানদণ্ড হয়ে উঠেছে।

##### মডেলের উদাহরণ ও স্কেল

- BERT‑Large: ২৪ স্তর, মাত্রা ১০২৪, ১৬টি attention head, ≈৩৪০ মিলিয়ন প্যারামিটার।<sup>[\[37\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-37)</sup>
- GPT‑3 (175B): ৯৬ স্তর, মাত্রা ১২২৮৮, ৯৬টি attention head, ≈১৭৫ বিলিয়ন প্যারামিটার।<sup>[\[38\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-38)</sup>
- LLaMA‑65B: ৮০ স্তর, মাত্রা ৮১৯২, ৬৪টি attention head, ≈৬৫ বিলিয়ন প্যারামিটার।<sup>[\[39\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-39)</sup>
- PaLM‑540B: ১১৮ স্তর, মাত্রা প্রায় ১৮৪৩২, ≈৫৪০ বিলিয়ন প্যারামিটার।<sup>[\[40\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-40)</sup>

##### সুবিধাসমূহ

- একসমান block, ভালোভাবে অধ্যয়িত প্রশিক্ষণ পদ্ধতি এবং স্কেলিংয়ে পূর্বানুমানযোগ্য আচরণ।
- প্যারামিটার ও ডেটা বৃদ্ধির সাথে মান power-law অনুযায়ী উন্নত হয়; compute‑optimal পদ্ধতি মডেলের আকার ও প্রশিক্ষণ token-এর পরিমাণ একসাথে বাড়ানো নির্দেশ করে।<sup>[\[41\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-41)[\[42\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-42)</sup>
- একই আর্কিটেকচার fine-tuning-এর পরে স্তর পরিবর্তন ছাড়াই বিভিন্ন কাজ কভার করে।

##### অসুবিধাসমূহ

- সম্পূর্ণ self‑attention-এর sequence দৈর্ঘ্যের উপর দ্বিঘাত জটিলতা রয়েছে ($O(n^{2})$), যা context window সীমিত করে।<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)</sup>
- Generation ধাপে প্যারামিটারের সম্পূর্ণ সক্রিয়করণ: MoE ছাড়া decoder-এ token প্রতি inference খরচ প্যারামিটারের সংখ্যার সাথে প্রায় সমানুপাতিকভাবে বাড়ে।
- সংকীর্ণ পথ — মেমরি ব্যান্ডউইথ (memory‑bound): HBM থেকে weight লোড করা প্রায়ই inference গতি সীমিত করে।

##### স্কেলিং ও প্রসঙ্গের সীমাবদ্ধতা

- প্যারামিটারের মেমরি মডেলের আকারের সাথে রৈখিকভাবে বাড়ে; gradient ও optimizer state-এর কারণে প্রশিক্ষণ মেমরি বাড়ে।
- বেসিক কনফিগারেশন ঐতিহাসিকভাবে ২–৪ হাজার token-এ সীমাবদ্ধ ছিল। আধুনিক positional scheme (RoPE) ও বিস্তার কৌশল (Position Interpolation, YaRN ও অন্যান্য) context window এক মাত্রা বা তার বেশি বাড়াতে দেয়, তবে অতিরিক্ত গণনামূলক/মেমরি চাপের বিনিময়ে।<sup>[\[43\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-43)[\[44\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-44)</sup>

### আধুনিক অপ্টিমাইজেশন

- **FlashAttention।** GPU মেমরি hierarchy বিবেচনায় নিখুঁত attention; মেমরি খরচ কমায় এবং দীর্ঘ sequence-এ প্রশিক্ষণ/inference ত্বরান্বিত করে।<sup>[\[45\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-45)</sup>
- **KV‑cache হ্রাস ও ব্যবস্থাপনা।** Multi‑Query Attention ও Grouped‑Query Attention cache আকার ও মেমরি ট্র্যাফিক কমায়; সার্ভার স্তরে PagedAttention (vLLM) cache-এর paged management-এর মাধ্যমে থ্রুপুট বাড়ায়।<sup>[\[46\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-46)[\[47\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-47)[\[48\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-48)</sup>
- **Speculative Decoding।** Draft মডেল ধারাবাহিকতা প্রস্তাব করে, এবং মূল মডেল দ্রুত তা যাচাই করে; output বিতরণ পরিবর্তন না করে ত্বরান্বিত করা হয়।<sup>[\[49\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-49)</sup>

## Sparse Models এবং Mixture‑of‑Experts (MoE)

MoE হলো token প্রতি গণনার সমানুপাতিক বৃদ্ধি ছাড়াই মডেলের ক্ষমতা বাড়ানোর একটি উপায়। একটি বড় FFN ব্লকের পরিবর্তে, স্তরে সমান্তরাল 'expert'-এর একটি সেট (কয়েকটি স্বাধীন FFN) ব্যবহার করা হয়, এবং একটি প্রশিক্ষণযোগ্য router (gating network) প্রতিটি token-এর জন্য top‑k সবচেয়ে প্রাসঙ্গিক expert নির্বাচন করে (সাধারণত k=১–২; কিছু মডেলে k=৪)। শুধুমাত্র নির্বাচিত expert সক্রিয় হয়; তাদের আউটপুট ওজন করে যোগ করা হয়। এভাবে মোট প্যারামিটার শত শত বিলিয়ন এমনকি ট্রিলিয়নে হতে পারে, কিন্তু প্রতিটি ধাপে শুধুমাত্র একটি ক্ষুদ্র অংশ ব্যবহার করা হয়।<sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-GLAM-51)</sup>

#### মডেলের উদাহরণ ও স্কেল

- **Switch Transformer (Google)**: ~১.৬T প্যারামিটার পর্যন্ত; top‑1 routing (token প্রতি একজন expert)। দেখিয়েছে যে MoE token প্রতি তুলনামূলক খরচে ক্ষমতা উল্লেখযোগ্যভাবে বাড়াতে পারে।<sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Switch-50)</sup>
- **GLaM (Google)**: ১.২T প্যারামিটার, স্তরে ৬৪ expert, top‑2; প্রতিটি token-এ ≈৯৬.৬B প্যারামিটার সক্রিয় (≈৮%)।<sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: মোট ~৪৬.৭B প্যারামিটার, token প্রতি ≈১২.৯B সক্রিয়, top‑2।<sup>[\[52\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: মোট ~১৪১B প্যারামিটার, token প্রতি ≈৩৯B সক্রিয়, top‑2।<sup>[\[54\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: মোট ১৩২B প্যারামিটার, token প্রতি ≈৩৬B সক্রিয়; ১৬ expert ও top‑4 routing (fine‑grained MoE)।<sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-DBRX-55)</sup>

##### সুবিধাসমূহ

- গণনার খরচ মোট প্যারামিটার সংখ্যার পরিবর্তে সক্রিয় expert k-এর সংখ্যা দ্বারা নির্ধারিত হয়: উল্লেখযোগ্যভাবে ছোট ঘন মডেলের সমতুল্য খরচে trillion মাত্রার মডেল প্রশিক্ষণ ও ব্যবহার করা সম্ভব।<sup>[\[51\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-GLAM-51)</sup>
- বিশেষায়ন: expert স্বয়ংক্রিয়ভাবে ভাষা/domain/pattern-এর সাথে 'মানিয়ে নেয়', বহু-domain কাজে মান উন্নত করে।
- নমনীয় deployment: অবকাঠামো সহ ঘন ঘন ব্যবহৃত expert মেমরিতে রাখা এবং বিরল expert লোড করা সম্ভব।

##### সীমাবদ্ধতাসমূহ

- Load balancing: regularization ছাড়া router কিছু expert-এ 'আটকে' যেতে পারে (router collapse)। Auxiliary losses (load‑balancing) ও উন্নত routing scheme প্রয়োজন।<sup>[\[50\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Switch-50)</sup>
- বিতরণকৃত গণনার জটিলতা: expert parallelism ও all‑to‑all exchange প্রয়োজন; যোগাযোগ খরচ ও মেমরি ব্যবস্থাপনা সংকীর্ণ পথ হয়ে যায়।<sup>[\[56\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-NVIDIA_MoE-56)</sup>
- প্রশিক্ষণের স্থিতিশীলতা: router ও capacity সীমার সেটিং গুরুত্বপূর্ণ, অন্যথায় মান/convergence অবনতি সম্ভব।

#### আধুনিক উন্নতিসমূহ

- **Expert‑Choice routing**: expert token 'নির্বাচন' করে, যা তুলনামূলক খরচে load balancing ও convergence উন্নত করে।<sup>[\[57\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-ExpertChoice-57)</sup>
- **Fine‑grained MoE**: বড় সংখ্যক ক্ষুদ্র expert (যেমন DBRX-এ) সূক্ষ্ম বিশেষায়নের granularity দেয়।<sup>[\[55\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: checkpoint থেকে ঘন মডেলকে MoE-তে রূপান্তর মাঝারি খরচে মান উল্লেখযোগ্যভাবে বাড়াতে পারে।<sup>[\[58\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-SparseUpcycling-58)</sup>

#### MoE প্রয়োগের যৌক্তিকতা

- সীমিত compute বাজেটে বড় বহু-domain সহায়ক।
- বিস্তৃত corpus-এ প্রশিক্ষণ যেখানে বিশেষায়ন সুবিধা দেয়।
- উন্নত বিতরণকৃত অবকাঠামো সহ পরিস্থিতি (অনেক GPU/TPU ও দ্রুত নেটওয়ার্ক)।

**কখন ঘন মডেল ভালো**: সীমিত অবকাঠামো (১–২ GPU), পূর্বানুমানযোগ্য latency ও deployment সহজতার কঠোর প্রয়োজনীয়তা।

## Retrieval‑Augmented Generation (RAG)

RAG হলো LLM-এর চারপাশে একটি আর্কিটেকচারাল **সিস্টেম প্যাটার্ন**, মডেলটির অভ্যন্তরীণ আর্কিটেকচার নয়। এটি LLM (generative উপাদান)-কে বাহ্যিক জ্ঞানভাণ্ডার (extraction উপাদান)-এর সাথে একত্রিত করে, যা মডেলের 'parametric memory'-এর সীমাবদ্ধতা পূরণ করতে দেয়।

- **কার্যপ্রণালী:** Generation-এর আগে LLM বাহ্যিক উৎস (wiki, কর্পোরেট knowledge base, ওয়েব) থেকে প্রাসঙ্গিক নথি নিষ্কাশন করে এবং উত্তর তৈরি করতে এগুলোর উপর নির্ভর করে।<sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RAG-59)</sup>
- **সুবিধাসমূহ:**
  - Hallucination হ্রাস ও তথ্যগত নির্ভুলতা উন্নতি।<sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-60)</sup>
  - মডেলের সম্পূর্ণ পুনরায় প্রশিক্ষণ ছাড়াই হালনাগাদতা।<sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RAG-59)</sup>
  - উত্তরের উদ্ধৃতিযোগ্যতা ও ট্রেসযোগ্যতা।
- **প্রয়োগ:** কর্পোরেট সহায়ক ও সিস্টেমের জন্য de facto মানদণ্ড যেখানে যাচাইযোগ্য তথ্য এবং ব্যক্তিগত/সংকীর্ণ-বিশেষায়িত ডেটার সাথে কাজ করা প্রয়োজন।<sup>[\[59\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RAG-59)</sup>

## মনোযোগ প্রক্রিয়া ও প্রসঙ্গ নিয়ে কাজ

মূল self‑attention-এর sequence দৈর্ঘ্যের উপর দ্বিঘাত জটিলতা রয়েছে ($O(n^{2})$), তাই অপ্টিমাইজেশন তৈরি হয়েছে।

- **Sparse Attention (বিক্ষিপ্ত মনোযোগ):** স্থানীয় window/pattern-এ attention সীমাবদ্ধ করা। উদাহরণ: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-61)</sup>, **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-62)</sup>।
- **FlashAttention:** GPU মেমরি hierarchy বিবেচনায় গণনার ক্রম পুনর্বিন্যাস; সময় ও মেমরিতে উল্লেখযোগ্য সুবিধা দেয় এবং দীর্ঘ প্রসঙ্গ সহ LLM প্রশিক্ষণে de facto মানদণ্ড হয়ে উঠেছে<sup>[\[63\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-63)[\[64\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-64)[\[65\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-65)</sup>।
- **MQA/GQA (decoding ত্বরান্বিতকরণ):** *Multi‑Query Attention* (সব head-এর জন্য সাধারণ key/value) KV‑cache ট্র্যাফিক কমায়<sup>[\[66\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-66)</sup>। *Grouped‑Query Attention* মান/গতির ভারসাম্য রক্ষা করে<sup>[\[67\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-67)</sup>।
- **উন্নত positional representation:**
  - **ALiBi (Attention with Linear Biases):** Attention score-এ linear offset বৃহত্তর দৈর্ঘ্যে generalization উন্নত করে।<sup>[\[68\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** Q/K rotation-এর মাধ্যমে আপেক্ষিক positional তথ্য; আধুনিক মডেলে ব্যাপকভাবে ব্যবহৃত হয় (যেমন LLaMA)।<sup>[\[69\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-69)[\[70\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-70)</sup>
  - **RoPE মডেলের জন্য context বিস্তার:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-71)</sup>, *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-72)</sup>, এবং NTK‑aware পরিবর্তনগুলো আর্কিটেকচার পরিবর্তন ছাড়াই context window কার্যকরভাবে বাড়াতে দেয়।

<!-- -->

- **দীর্ঘ sequence-এর অন্যান্য পদ্ধতি:**
  - **Transformer‑XL:** দূরবর্তী নির্ভরতা মডেলিংয়ের জন্য segment-এর মধ্যে recurrent memory।<sup>[\[73\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-73)</sup>
  - **Reformer:** মেমরি সাশ্রয়ের জন্য LSH‑attention ও reversible residual block।<sup>[\[74\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-74)</sup>
  - **Performer:** softmax‑attention-এর linear approximation (FAVOR+)।<sup>[\[75\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-75)</sup>
  - **Linformer:** attention matrix-এর low-rank approximation।<sup>[\[76\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-76)</sup>

## মডেল অপ্টিমাইজেশন ও প্রশিক্ষণ অবকাঠামো

LLM প্রশিক্ষণ ও deployment-এর জন্য বিশেষ কৌশল ও framework ব্যবহার করা হয়।

- **Quantization (কোয়ান্টাইজেশন):** Weight-এর bit সংখ্যা হ্রাস মেমরি কমায় ও inference ত্বরান্বিত করে। **QLoRA** কাছাকাছি পূর্ণ-নির্ভুলতার মানে 4‑bit মডেল (৬৫B সহ) কার্যকরভাবে fine-tune করতে দেয়<sup>[\[77\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-77)</sup>।
- **Knowledge Distillation (জ্ঞান পাতন):** কম্প্যাক্ট মডেলের জন্য *Teacher→Student* প্রশিক্ষণ<sup>[\[78\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-78)</sup>; উদাহরণ — **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-79)</sup>।
- **বিতরণকৃত প্রশিক্ষণ:**
  - **DeepSpeed** ও **ZeRO** — trillion মডেল প্রশিক্ষণের জন্য প্যারামিটার/gradient/optimizer state বিতরণ<sup>[\[80\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-80)</sup>।
  - **Megatron‑LM** — অত্যন্ত বড় transformer-এর জন্য tensor ও pipeline parallelism<sup>[\[81\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-81)</sup>।
- **Ecosystem ও টুলস:** **Hugging Face Transformers** ও **Accelerate** প্রশিক্ষণ ও inference-এর জন্য মানক মডেল বাস্তবায়ন ও DeepSpeed/FSDP-এর সাথে একীভূতকরণ প্রদান করে<sup>[\[82\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-82)[\[83\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-83)</sup>।

## স্কেলিং আইন ও Compute‑Optimal প্রশিক্ষণ

আনুভবিক **স্কেলিং আইন** দেখায় যে ক্রস-এন্ট্রপি ত্রুটি প্যারামিটার, ডেটা ও গণনার বৃদ্ধির সাথে power law অনুযায়ী হ্রাস পায়।<sup>[\[84\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-84)</sup> **Chinchilla** কাজটি **compute‑optimal** পদ্ধতি পরিমার্জন করেছে: সর্বোত্তম দক্ষতার জন্য মডেলের আকার ও প্রশিক্ষণ token-এর সংখ্যা একসাথে স্কেল করতে হবে (উদাহরণ — ~১.৪T token-এ প্রশিক্ষিত ৭০B মডেল, যা বড় কিন্তু কম প্রশিক্ষিত মডেলকে ছাড়িয়ে যায়)।<sup>[\[85\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-85)</sup>

## State Space Models (SSM) - স্থিতি স্থান মডেল

**State Space Models (SSM)** — দীর্ঘ sequence নিয়ে কাজের জন্য transformer-এর বিকল্প আর্কিটেকচার। এটি নিয়ন্ত্রণ তত্ত্ব ও ডিজিটাল সিগন্যাল প্রক্রিয়াকরণ থেকে ধারণা ধার করে এবং self‑attention-এর প্রধান সমস্যা সমাধান করে: টেক্সটের দৈর্ঘ্য বৃদ্ধির সাথে গণনার দ্বিঘাত বৃদ্ধি।

### মূল সমস্যা ও সমাধান

**Transformer-এর সমস্যা।** ঐতিহ্যবাহী transformer-এর প্রধান সমস্যা হলো attention-এর দ্বিঘাত জটিলতা: ১০ গুণ দীর্ঘ টেক্সটের জন্য প্রায় ১০০ গুণ বেশি গণনা প্রয়োজন।

**SSM পদ্ধতি।** 'সব শব্দে একসাথে মনোযোগ' দেওয়ার পরিবর্তে, মডেল ক্রমানুসারে টেক্সটের মধ্য দিয়ে যায় এবং একটি কম্প্যাক্ট অভ্যন্তরীণ **মেমরি অবস্থা** বজায় রাখে যা প্রতিটি ধাপে আপডেট হয়। ফলে সময় ও মেমরি ব্যবহার টেক্সটের দৈর্ঘ্যের সাথে প্রায় রৈখিকভাবে বাড়ে। এক্ষেত্রে প্রশিক্ষণ সমান্তরালভাবে সম্পন্ন হতে পারে — kernel-এর convolutional representation-এর মাধ্যমে (দীর্ঘ sequence-এ উচ্চ থ্রুপুট)।<sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-S4-86)</sup>

### কার্যপ্রণালী

বিচ্ছিন্ন SSM অবস্থা ও আউটপুটের সমীকরণ দ্বারা বর্ণিত হয়:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

যেখানে $x_{t}$ — মেমরি অবস্থা, $u_{t}$ — ইনপুট (token), $y_{t}$ — আউটপুট। গভীর SSM-এ ম্যাট্রিক্স $A,B,C,D$ এমনভাবে parametrize করা হয় যাতে দীর্ঘ sequence-এ স্থিতিশীলতা ও কার্যকর গণনা নিশ্চিত হয়। একই স্তর গণনা করা যেতে পারে:

- recurrent (ধাপে ধাপে স্ক্যান) — KV‑cache ছাড়া মেমরি-সাশ্রয়ী inference;
- convolutional — পূর্ব-গণনাকৃত kernel সহ সমান্তরাল প্রশিক্ষণ।<sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-S4-86)</sup>

### মূল আর্কিটেকচার ও হাইব্রিড

- **S4 (Structured State Spaces)।** স্থিতি matrix-এর স্থায়িত্বশীল parametrization সহ SSM-এর baseline; অত্যন্ত দীর্ঘ sequence-এ কার্যকারিতা প্রদর্শন করে।<sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-S4-86)</sup>
- **Mamba।** *Selective* SSM: মেমরি আপডেটের নিয়ম বর্তমান ইনপুটের উপর নির্ভর করে (মডেল নিজেই সিদ্ধান্ত নেয় কী 'মেমরিতে রাখবে' আর কী 'ভুলবে')। বাস্তবায়ন GPU মেমরি hierarchy-এর উপর মনোযোগ দেয়; লেখকদের মতে, linear জটিলতায় inference থ্রুপুটে উল্লেখযোগ্য বৃদ্ধি অর্জিত হয়।<sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mamba-87)</sup>
- **RetNet।** তিনটি মোড সহ *retention* প্রক্রিয়া: সমান্তরাল প্রশিক্ষণ, recurrent ও block‑recurrent inference। লক্ষ্য — দ্রুত প্রশিক্ষণ (transformer-এর মতো) ও inference-এ সাশ্রয়ী ফ্লো (token প্রতি O(1) মেমরি) একত্রিত করা।<sup>[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RetNet-88)</sup>
- **Attention+SSM হাইব্রিড।** উদাহরণ — **Jamba** (Transformer ও Mamba স্তরের পর্যায়ক্রম এবং MoE): একই শ্রেণীর বিশুদ্ধ transformer মডেলের তুলনায় উল্লেখযোগ্যভাবে কম মেমরি প্রয়োজনীয়তায় ~২৫৬K token-এর ক্রম প্রসঙ্গ সমর্থন করার কথা জানায়।<sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Jamba-89)</sup>

#### সুবিধাসমূহ

- Inference-এ linear জটিলতা ও মেমরি সাশ্রয়। কোনো global self‑attention ও KV‑cache নেই; শুধুমাত্র কম্প্যাক্ট অবস্থা সংরক্ষণ করা হয়।<sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RetNet-88)</sup>
- দীর্ঘ sequence-এ সমান্তরাল প্রশিক্ষণ। Convolutional মোড প্রশিক্ষণ থ্রুপুট বাড়ায়।<sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-S4-86)</sup>
- হার্ডওয়্যার দক্ষতা। বাস্তবায়ন আধুনিক মেমরি hierarchy (HBM/SRAM)-এর উপর মনোযোগ দেয়।<sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mamba-87)</sup>
- দীর্ঘ প্রসঙ্গ ও streaming। SSM+Attention হাইব্রিড মাঝারি সম্পদে শত শত হাজার token-এর জন্য বাস্তবসম্মত।<sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Jamba-89)</sup>

#### সীমাবদ্ধতা ও বর্তমান অনুশীলন

- Ecosystem পরিপক্কতা। স্কেলিং টুলস ও 'রেসিপি' (নির্দেশ, RLHF/DPO) এখনো transformer স্ট্যাকের চেয়ে পিছিয়ে।<sup>[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mamba-87)</sup>
- মান ও স্থিতিশীলতা। কিছু কাজে হাইব্রিড (Attention+SSM) 'বিশুদ্ধ' SSM-এর চেয়ে 'মান/গতি/মেমরি'-এর আরও স্থিতিশীল আপোষ দেখায়।<sup>[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Jamba-89)</sup>

#### পদ্ধতির তুলনা (সংক্ষিপ্ত)

| বৈশিষ্ট্য                      | Transformer                | SSM                       | হাইব্রিড (Attention+SSM) |
|------------------------------|----------------------------|---------------------------|-------------------------|
| দৈর্ঘ্যের উপর জটিলতা           | দ্বিঘাত (self‑attention)    | রৈখিক (স্ক্যান/convolution) | প্রায় রৈখিক              |
| token প্রতি মেমরি (inference) | KV‑cache প্রসঙ্গের সাথে বাড়ে | O(1) অবস্থা                | মাঝারি বৃদ্ধি             |
| দীর্ঘ প্রসঙ্গ                   | বিশেষ অপ্টিমাইজেশন প্রয়োজন   | স্বাভাবিক সমর্থন            | ~২৫৬K পর্যন্ত বাস্তবসম্মত   |
| Ecosystem পরিপক্কতা           | উচ্চ                        | বিকাশমান                  | বিকাশমান                |

#### বাস্তব প্রয়োগ

- অত্যন্ত দীর্ঘ নথি বিশ্লেষণ (বই, প্রতিবেদন, বৈজ্ঞানিক পর্যালোচনা)।
- মেমরি খরচ ছাড়া দীর্ঘ ইতিহাস সহ streaming প্রক্রিয়াকরণ ও chat পরিস্থিতি।
- সীমিত সম্পদের পরিবেশ (মোবাইল/edge ডিভাইস)।
- সময় সিরিজ ও অন্যান্য ক্রমিক ডেটা।

**প্রতিনিধিত্বকারী মডেল:** S4, Mamba, RetNet; Attention+SSM হাইব্রিড (Jamba)।<sup>[\[86\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Jamba-89)</sup>

## আর্কিটেকচারের বিবর্তন

- ২০১৭ — 'Attention Is All You Need' প্রবন্ধ প্রকাশিত। Transformer আর্কিটেকচার উপস্থাপিত: multi-head self‑attention ও positional encoding recurrence ও convolution ছাড়াই মডেল প্রশিক্ষণ করতে দেয়; তবে attention-এর context দৈর্ঘ্যের উপর দ্বিঘাত জটিলতা রয়েছে।<sup>[\[1\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-Vaswani2017-1)</sup>

<!-- -->

- ২০১৮ — GPT‑1 ও BERT উপস্থাপিত। GPT‑1 generation ও পরবর্তী fine-tuning-এর জন্য causal attention সহ শুধুমাত্র decoder স্ট্যাক ব্যবহার করে; BERT টেক্সট বোঝার কাজের জন্য দ্বিমুখী encoder ও MLM প্রি-ট্রেনিং প্রবর্তন করে।<sup>[\[90\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-90)[\[91\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-91)</sup>

<!-- -->

- ২০১৯ — দীর্ঘ sequence নিয়ে কাজের পদ্ধতি প্রস্তাব করা হয় এবং decoder‑only স্কেল করা হয়। Transformer‑XL নির্দিষ্ট window-এর বাইরে যাওয়ার জন্য 'memory' ও আপেক্ষিক অবস্থান যোগ করে; GPT‑2 স্কেল বৃদ্ধিতে zero‑shot ক্ষমতার বৃদ্ধি দেখায়; BART seq2seq-এর জন্য denoising প্রি-ট্রেনিং-এর কার্যকারিতা প্রদর্শন করে।<sup>[\[92\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-92)[\[93\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-93)[\[94\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-94)</sup>

<!-- -->

- ২০২০ — 'text‑to‑text' ফরম্যাট একীভূত করা হয় এবং দীর্ঘ নথির পদ্ধতি প্রদর্শিত হয়। T5 বিভিন্ন কাজের জন্য একীভূত encoder–decoder পদ্ধতি তৈরি করে; Longformer ও BigBird দীর্ঘ টেক্সটের জন্য sparse/structured attention ব্যবহার করে; GPT‑3 ঘন decoder‑only স্কেলিং-এর কার্যকারিতা নিশ্চিত করে।<sup>[\[95\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-95)[\[96\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-96)[\[97\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-97)[\[98\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-98)</sup>

<!-- -->

- ২০২১ — positional representation উন্নত করা হয় এবং প্যারামিটার sparsity (MoE) প্রদর্শিত হয়। RoPE ও ALiBi বৃহত্তর দৈর্ঘ্যে generalization উন্নত করে; Switch Transformer ও GLaM inference খরচের আনুপাতিক বৃদ্ধি ছাড়াই ক্ষমতা বাড়াতে token প্রতি শুধুমাত্র কিছু expert সক্রিয় করে।<sup>[\[99\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-99)[\[100\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-100)[\[101\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-101)[\[102\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-102)</sup>

<!-- -->

- ২০২২ — compute‑optimal পদ্ধতি পরিমার্জন করা হয় এবং দীর্ঘ prompt-এ inference ত্বরান্বিত করা হয়। Chinchilla মাঝারি মডেল আকারে বেশি প্রশিক্ষণ token-এর সুবিধা দেখায়; Multi‑Query Attention সহ PaLM KV‑cache আকার কমায়; FlashAttention GPU-তে attention ত্বরান্বিত করে।<sup>[\[103\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-103)[\[104\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-104)[\[105\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-105)[\[106\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-106)</sup>

<!-- -->

- ২০২৩ — স্তর পরিবর্তন ছাড়াই context window বড় করা হয় এবং সার্ভার-সাইড inference উন্নত করা হয়। LLaMA সিরিজ অনুশীলন সংহত করে (RMSNorm, SwiGLU, RoPE); Position Interpolation ও YaRN প্রসঙ্গ বাড়ায়; vLLM/PagedAttention আরও কার্যকরভাবে KV‑cache পরিচালনা করে।<sup>[\[107\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-107)[\[108\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-108)[\[109\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-109)[\[110\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-110)[\[111\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-111)[\[112\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-112)</sup>

<!-- -->

- ২০২৩ — GPT‑4 ও Gemini একটি মডেল পরিবারের মধ্যে একাধিক modality প্রক্রিয়াকরণ ও generation প্রদর্শন করে।<sup>[\[113\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-113)[\[114\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-114)</sup>

<!-- -->

- ২০২৩ — State Space Models (SSM) প্রস্তাব করা হয়। Mamba ও RetNet KV‑cache-এর পরিবর্তে কম্প্যাক্ট অবস্থা সহ ক্রমিক প্রক্রিয়াকরণে ফিরে আসে এবং হাইব্রিড আর্কিটেকচারের ভিত্তি স্থাপন করে।<sup>[\[115\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-115)[\[116\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-116)</sup>

<!-- -->

- ২০২৪ — উন্মুক্ত MoE মডেল ও Attention+SSM হাইব্রিড প্রকাশিত হয়; নতুন GPU-তে attention ত্বরান্বিত করা হয়। Mixtral 8×7B/8×22B ও DBRX MoE-এর বাস্তবতা নিশ্চিত করে; Jamba অত্যন্ত দীর্ঘ প্রসঙ্গের জন্য Transformer ও Mamba একত্রিত করে; FlashAttention‑3 থ্রুপুট বাড়ায়।<sup>[\[117\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-117)[\[118\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-118)[\[119\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-119)[\[120\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-120)[\[121\]](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_note-121)</sup>

## তথ্যসূত্র

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — ভিজ্যুয়াল ব্যাখ্যা

## সাহিত্য

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## টীকাসমূহ

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/Large_language_model_architectures_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
