---
title: "LLM-architektúrák"
source: "https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k"
wiki: "systems-analysis.info/int"
article: "LLM-architektúrák"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3542
wiki_created_at: 2026-09-06T23:22:22Z
wiki_modified_at: 2026-09-06T23:22:22Z
downloaded_at: 2026-09-07T22:57:30Z
---

# LLM-architektúrák

**A nagy nyelvi modellek (LLM) architektúrái** olyan alapvető elvek és struktúrák, amelyek meghatározzák, hogyan épülnek fel, hogyan tanulnak és hogyan működnek a nagy nyelvi modellek. A modern LLM-ek, amelyek képesek megérteni és generálni az emberi nyelvet, szinte teljes egészében a **Transformer**<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)</sup> architektúrán alapulnak, de számos fejlesztést és különböző megközelítést tartalmaznak a hatékonyság, a skálázhatóság és a képességek növelése érdekében.

## Az LLM architektúracsaládok (transformerek)

A modern nagy nyelvi modellek a transformer architektúrán<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)</sup> alapulnak, de különböző módon alkalmazzák azt a céltól függően: szöveg megértése, folytatás generálása vagy egyik szöveg másikká alakítása. A gyakorlatban három architektúracsaládot különböztetünk meg, miközben a transformer alapelvei megmaradnak<sup>[\[2\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-2)[\[3\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-3)[\[4\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-4)</sup>.

### 1. Encoder‑only (csak kódoló, csak enkóder)

A modell csak a kódolók halmazát használja, és kétirányúan vizsgálja az egész bemeneti szöveget. Az előtanítás általában masked‑language modeling (MLM, maszkolással végzett nyelvmodellezés) formájában történik: a tokenek egy részét elrejtik, a modell pedig megtanulja azokat a környezetük alapján visszaállítani. A kétirányú kontextusnak köszönhetően ezek a modellek erősek a megértési és pontozási feladatokban: osztályozás, entitáskiemelés, dokumentumok rangsorolása és extraktív QA. Autoregresszív, „nulláról" való generálásra nem alkalmasak.

A gyakorlatban az encoder‑only családnál alternatív előtanítási célokat is alkalmaznak: *replaced token detection (RTD) az ELECTRA‑ban* (a diszkriminátor modell felismeri a felcserélt tokeneket), valamint *kontrasztív tanítás* a bi-enkóderek számára szemantikus keresés/retriever célokra (InfoNCE/softmax-loss „lekérdezés–dokumentum" párokat alkalmazva, mint a Dense Passage Retrieval esetén). RAG-ban alkalmazva az encoder‑only modellek vagy *bi-enkóderként* (a lekérdezés és a dokumentum külön kódolása a gyors ANN-kereséshez), vagy *kereszt-enkóderként* (a pár együttes kódolása pontos újrarangsoroláshoz) működnek.

**Előnyök:**

- Magas szintű szövegmegértés a kétirányú kontextusnak köszönhetően: osztályozás, NER, tényerek kinyerése, újrarangsorolás, extraktív QA.
- Párhuzamos feldolgozás és nagy áteresztőképesség: egyetlen előreterjesztési lépés autoregresszió nélkül; a tömeges pontozás kényelmesen kötegelhető.
- Természetes integráció a kereséssel és a RAG-gal: bi-enkóderként gyors szemantikus keresés; kereszt-enkóderként pontos újrarangsorolás.
- Hatékony alkalmazkodás: viszonylag kompakt változatok (≈100–300 millió paraméter; BERT‑base ≈110 millió) célzott finomhangolás után magas minőséget nyújtanak.
- Stabil késleltetés, amely független a generált válasz hosszától (nincs lépésenkénti dekódolás); jól alkalmazható nagy gyűjtemények offline pontozásához.
- Az enkóderek kontextusablaka relatív/rotációs pozíciókkal és/vagy lokálisan ritka figyelemmel bővíthető (pl. Longformer/BigBird), ami hasznos hosszú dokumentumok esetén.

**Hátrányok:**

- Nincs saját generatív képesség: párbeszédekhez és részletes válaszokhoz dekóder vagy külső generatív modul szükséges.
- Korlátozottság interaktív forgatókönyvekben: nincs állapotmegőrzéssel járó lépésenkénti generálás.
- Az előtanítási cél és a szabad generálás feladatai közötti eltérés: az MLM rosszabbul illeszkedik a generáláshoz, mint a kauzális modellezés.
- Történelmileg korlátozott kontextusablak (az abszolút pozíciójú alapkonfigurációkban gyakran 512 token); a bővítés speciális pozíció-/figyelemkonfigurációkat és/vagy finomhangolást igényel.
- A retrieval feladatokhoz külön kontrasztív finomhangolás szükséges a bi-enkóder és/vagy a kereszt-enkóder számára; enélkül a keresés/újrarangsorolás minősége általában alacsonyabb a speciálisan tanított modellekéhez képest.

**Reprezentatív modellek:** BERT és változatai, valamint RoBERTa és DeBERTa (kibővített encoder‑only változatok); az alternatív előtanítási célok közül az ELECTRA (RTD). <sup>[\[5\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-5)[\[6\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-6)[\[7\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-7)[\[8\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-8)[\[9\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-9)[\[10\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-10)</sup>

### 2. Decoder‑only (csak dekódoló, csak dekóder)

Csak a dekóderek halmaza van jelen, kauzális (balról jobbra irányuló) figyelemmel: a modell az adott prefix alapján jósolja meg a következő tokent. Ez a tanítási mód – causal language modeling (CLM) – ezeket a modelleket a generálás természetes választásává teszi: párbeszédek, részletes válaszok, kreatív szöveg, programkód. A kompromisszum a késleltetés növekedése és a KV-gyorsítótár mérete hosszú promptok esetén. A gyakorlatban a decoder‑only modelleknél széles körben alkalmaznak mérnöki megoldásokat: a KV-gyorsítótár csökkentése MQA és GQA segítségével, a következtetés gyorsítása spekulatív dekódolással és szerveres optimalizációkkal (PagedAttention/vLLM, continuous batching, chunked prefill).<sup>[\[11\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-11)[\[12\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-12)[\[13\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-13)[\[14\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-14)[\[15\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-15)</sup>

**Előnyök:**

- Természetes szöveggenerálás (CLM): erős zero‑shot és few‑shot képességek; jól skálázható.<sup>[\[16\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-16)</sup>
- Sokoldalú alkalmazhatóság: egyetlen modell sokféle feladatot old meg a promptban lévő utasítások és példák segítségével; természetesen kombinálható RAG-gal és eszközhívással (tool use).
- Érett ökoszisztéma: utasításos finomhangolás és viselkedési igazítás bevált módszerei (RLHF, DPO); nyílt forráskódú és kereskedelmi megvalósítások érhetők el.<sup>[\[17\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-17)[\[18\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-18)</sup>
- Gazdag következtetés-optimalizálási készlet: az MQA/GQA csökkenti a KV-gyorsítótár méretét és növeli az áteresztőképességet; a spekulatív dekódolás gyorsítja a következtetést az eloszlás megváltoztatása nélkül; a PagedAttention/vLLM a continuous batching és a chunked prefill segítségével növeli a GPU teljes kihasználtságát.<sup>[\[19\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-19)[\[20\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-20)[\[21\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-21)[\[22\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-22)[\[23\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-23)</sup>
- Strukturált generálás támogatása szigorú válaszformátumokhoz (JSON/SQL/DSL), ami egyszerűsíti az integrációt információs rendszerekkel és API-kkal.<sup>[\[24\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-24)[\[25\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-25)</sup>

**Hátrányok:**

- Megnövekedett generálási késleltetés: szekvenciális következtetés; az új token költsége nő az „olvasott" kontextus hosszával (KV-gyorsítótár).
- Kevésbé előnyös a „hosszú bemenet – rövid kimenet" profilú feladatoknál (összefoglalás, fordítás) az encoder–decoder megközelítéssel szemben, ahol a bemenetet egyszer kódolják.
- Az egyirányú kontextus korlátja: megértési feladatoknál néha elmarad a kétirányú reprezentációjú modellektől (encoder‑only / encoder–decoder).
- A KV-gyorsítótárhoz szükséges memória „szűk keresztmetszet" lehet hosszú promptoknál és nagy kötegméretknél;<sup>[\[26\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-26)</sup>
- Az aktivációk/KV kvantálása (INT8/FP8) gyorsítja a következtetést, de ronthatja a minőséget hosszú kontextusoknál/kódnál; gondos validálást igényel (különösen szigorú SLA esetén).

**Reprezentatív modellek:** GPT‑3, GPT‑4 (az architektúra és az adatkészlet részletei nem nyilvánosak), LLaMA és *Llama 3* (8B/70B, 2024).<sup>[\[27\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-27)[\[28\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-28)[\[29\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-29)[\[30\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-30)</sup>

### 3. Encoder–decoder (kódoló–dekódoló, enkóder-dekóder)

Az architektúra mindkét komponenst ötvözi. Az enkóder kétirányú módban működik, a dekóder pedig kauzálisan. Az enkóder egyszer elemzi a bemenetet és kialakítja annak reprezentációját; a dekóder kimenetet generál, kereszt-figyelmen (cross‑attention) keresztül hozzáférve ehhez a reprezentációhoz. Ez a szétválasztott megközelítés különösen hasznos ott, ahol hosszú bemeneti szöveget kell rövid kimenetté alakítani: gépi fordítás, összefoglalás, dokumentum alapú válaszadás. Bár a módszer nagyobb összesített számítási költséggel jár (két halmaz és kereszt-figyelem), előnye a teljes forráselemzésen alapuló irányított generálás; a kódolás egyszer történik és a teljes következtetési folyamat során újrafelhasználható.

**Előnyök:**

- Feltételes generálás: a dekóder kereszt-figyelmet alkalmaz a bemenet reprezentációjára.<sup>[\[31\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-31)</sup>
- Hatékony a „hosszú bemenet → rövid kimenet" forgatókönyvben: a bemenetet egyszer kódolják.
- Alkalmas a „text‑to‑text" formátumhoz és az irányított kimenethez (feladatspecifikus prefixek, speciális utasítások).<sup>[\[32\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-32)</sup>
- Stabilitás és hatékonyság hosszú forrásnál: a dekódolási fázisban csak a kimenet önfigyelme nő, a kereszt-figyelem pedig az enkóder rögzített kulcsait/értékeit használja újra (a bemenetet nem „olvassa újra" minden lépésnél).

**Hátrányok:**

- A két halmaz növeli a memória- és számítási igényeket tanítás és alkalmazás során.
- Nagyon hosszú szekvenciáknál a teljes késleltetés összehasonlítható a decoder‑only megközelítéssel; az autoregresszió továbbra is szűk keresztmetszet.
- Kevesebb általános célú chat-modell létezik, mint a decoder‑only körben; általában magas minőségű seq2seq-motorként alkalmazzák specifikus feladatokra.
- Nagyon hosszú bemenetnél megnő a dekóder minden rétegében a kereszt-figyelem kulcsaihoz/értékeihez szükséges memória (a teljes forrásra vonatkozóan), ami gondos kiszolgálástervezést igényel.

**Reprezentatív modellek:** T5 (beleértve a T5 v1.1-et és az utasításos finomhangolási gyakorlatot a *FLAN‑T5*-ben) és BART.<sup>[\[33\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-33)[\[34\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-34)[\[35\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-35)</sup>

## Sűrű (dense) transformerek

Az LLM klasszikus és legelterjedtebb architektúrája: minden token feldolgozásakor a modell paramétereinek gyakorlatilag teljes készlete részt vesz. A ritka megközelítésekkel (pl. Mixture‑of‑Experts) ellentétben nincs szelektív részháló-aktiválás — minden blokk minden tokennél működik.<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)</sup>

### Működési elv és architektúra

**Alapszerkezet.** A modell N egyforma transformer-blokkból álló verem. Minden blokk tartalmaz:

1.  **Többfejű önfigyelmet (Multi‑Head Self‑Attention).** Minden tokenhez három vektort számítanak: Q (query), K (key), V (value); a figyelmet $\operatorname{softmax}\!\left( \frac{QK^{o}p + M}{\sqrt{d_{k}}} \right) \cdot V$ formájában definiálják, ahol $M$ egy maszk (kauzális és/vagy padding-maszk), amely kizárja az érvénytelen pozíciókat. Több „figyelemfej\\ párhuzamosan veszi figyelembe a kontextus különböző aspektusait (H fej, általában $d_{head} = \frac{d_{model}}{H}$); számuk a modell méretével együtt nő.<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)</sup>
2.  **Teljesen összekötött hálózatot (Feed‑Forward Network, FFN).** Két lineáris réteg nemlinearitással köztük (általában GELU/SiLU; egyes modern modellekben SwiGLU). A közbülső dimenzió általában $\approx 4\, d_{model}$; SwiGLU használatakor gyakran $\approx frac83\, d_{model}$ értéket alkalmaznak a hasonló paraméterszám megőrzése érdekében. Az FFN a paraméterek jelentős hányadát tartalmazza.<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-36)</sup>

**Kiegészítő komponensek.** Reziduális (residual) kapcsolatokat és rétegnormalizációt alkalmaznak; a modern LLM-ekben gyakrabban használják a Pre-LN-t (normalizálás az alblokkok előtt) — ez javítja a tanítás stabilitását nagy mélységeknél. A klasszikus LayerNorm mellett egyre elterjedtebb az **RMSNorm** (csökkenti a számítási költséget és jól működik nagy modellekben); egyes modellcsaládokban figyelmi térben is alkalmaznak normalizálást (pl. Q/K normalizálása softmax előtt). A pozíciós reprezentációk lehetnek abszolútak vagy relatívak; hosszú kontextus esetén de facto szabvánnyá vált a RoPE.

##### Modellpéldák és méretarány

- BERT‑Large: 24 réteg, 1024-es dimenzió, 16 figyelemfej, ≈340 millió paraméter.<sup>[\[37\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-37)</sup>
- GPT‑3 (175B): 96 réteg, 12 288-as dimenzió, 96 figyelemfej, ≈175 milliárd paraméter.<sup>[\[38\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-38)</sup>
- LLaMA‑65B: 80 réteg, 8192-es dimenzió, 64 figyelemfej, ≈65 milliárd paraméter.<sup>[\[39\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-39)</sup>
- PaLM‑540B: 118 réteg, kb. 18 432-es dimenzió, ≈540 milliárd paraméter.<sup>[\[40\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-40)</sup>

##### Előnyök

- Egységes blokkok, jól ismert tanítási módok és kiszámítható skálázási viselkedés.
- A minőség hatványfüggvény szerint javul a paraméterek és adatok növekedésével; a compute‑optimal mód a modellméret és a tanító tokenek számának együttes növelését feltételezi.<sup>[\[41\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-41)[\[42\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-42)</sup>
- Ugyanaz az architektúra finomhangolás után a feladatok széles körét lefedi rétegszintű módosítások nélkül.

##### Hátrányok

- A teljes önfigyelem kvadratikus komplexitású a szekvenciahosszra nézve ($O(n^{2})$), ami korlátozza a kontextusablakot.<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)</sup>
- Teljes paraméteraktiválás a generálás lépésénél: MoE nélküli dekóderben a tokenenkénti következtetési költség nagyjából arányosan nő a paraméterek számával.
- Szűk keresztmetszet a memória-sávszélességnél (memory‑bound): a súlyok HBM-ből való betöltése gyakran korlátozza a következtetés sebességét.

##### Skálázási és kontextusbeli korlátok

- A paraméterekhez szükséges memória lineárisan nő a modell méretével; a tanítási memória a gradiensek és az optimalizáló állapotai miatt tovább növekszik.
- Az alapkonfigurációk történelmileg 2–4 ezer tokenre korlátozódtak. A modern pozíciókezelési módszerek (RoPE) és a bővítési technikák (Position Interpolation, YaRN stb.) lehetővé teszik az ablak nagyságrendnyi növelését, de ez további számítási/memória-terheléssel jár.<sup>[\[43\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-43)[\[44\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-44)</sup>

### Modern optimalizálások

- **FlashAttention.** Pontos figyelem a GPU memóriahierarchiájának figyelembevételével; csökkenti a memóriaigényt és gyorsítja a tanítást/következtetést hosszú szekvenciáknál.<sup>[\[45\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-45)</sup>
- **KV-gyorsítótár csökkentése és kezelése.** A Multi‑Query Attention és a Grouped‑Query Attention csökkenti a gyorsítótár méretét és a memória-forgalmat; szerver szintjén a PagedAttention (vLLM) lapozásos gyorsítótár-kezeléssel növeli az áteresztőképességet.<sup>[\[46\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-46)[\[47\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-47)[\[48\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-48)</sup>
- **Spekulatív dekódolás.** Egy vázlat (draft) modell javasol egy folytatást, amelyet a fő modell gyorsan ellenőriz; gyorsítás érhető el a kimeneti eloszlás megváltoztatása nélkül.<sup>[\[49\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-49)</sup>

## Ritka modellek (Sparse Models) és Mixture‑of‑Experts (MoE)

A MoE olyan módszer, amellyel a modell kapacitása a tokenenkénti számítások arányos növelése nélkül növelhető. Egy nagy FFN-blokk helyett a rétegben párhuzamos „szakértők" (több független FFN) halmaza van jelen, és egy tanítható router (gating network) minden tokenhez kiválasztja a top‑k legrelevansabb szakértőt (általában k=1–2; egyes modellekben k=4). Csak a kiválasztott szakértők aktiválódnak; kimeneteiket súlyozzák és összeadják. Így az összes paraméter száma elérheti a százmilliárdokat, sőt a billiókat, de minden lépésnél csak kis hányaduk kerül felhasználásra.<sup>[\[50\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-GLAM-51)</sup>

#### Modellpéldák és méretarány

- **Switch Transformer (Google)**: akár ~1,6T paraméter; top‑1 útválasztás (egy szakértő tokenenként). Megmutatta, hogy a MoE lehetővé teszi a kapacitás drasztikus növelését hasonló tokenenkénti költségek mellett.<sup>[\[50\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1,2T paraméter, rétegenkénti 64 szakértő, top‑2; minden tokennél ≈96,6 milliárd paraméter aktiválódik (≈8%).<sup>[\[51\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: összesen ~46,7 milliárd paraméter, tokenenkénti ≈12,9 milliárd aktív paraméter, top‑2.<sup>[\[52\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: összesen ~141 milliárd paraméter, tokenenkénti ≈39 milliárd aktív paraméter, top‑2.<sup>[\[54\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: összesen 132 milliárd paraméter, tokenenkénti ≈36 milliárd aktív paraméter; 16 szakértő és top‑4 útválasztás (fine‑grained MoE).<sup>[\[55\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-DBRX-55)</sup>

##### Előnyök

- A számítási költséget az aktív szakértők k száma határozza meg, nem a paraméterek teljes száma: billió méretű modellek taníthatók és alkalmazhatók a lényegesen kisebb sűrű modellekkel összehasonlítható költségek mellett.<sup>[\[51\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-GLAM-51)</sup>
- Specializáció: a szakértők automatikusan „igazodnak\\ nyelvekhez/doménekhez/mintákhoz, javítva a minőséget multidomain feladatokban.
- Rugalmas telepítés: a gyakran használt szakértők memóriában tarthatók, a ritkák betölthetők (megfelelő infrastruktúra esetén).

##### Korlátok

- Terheléselosztás: szabályozás nélkül a router a szakértők egy részére „ragadhat" (router collapse). Segéd-veszteségek (load‑balancing) és fejlettebb útválasztási sémák szükségesek.<sup>[\[50\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Switch-50)</sup>
- Elosztott számítás összetettsége: expert parallelism és all‑to‑all kommunikáció szükséges; a kommunikációs overhead és a memóriakezelés szűk keresztmetszet lesz.<sup>[\[56\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-NVIDIA_MoE-56)</sup>
- Tanítási stabilitás: fontos a router és a kapacitási korlátok beállítása, különben minőség/konvergencia-romlás következhet be.

#### Modern fejlesztések

- **Expert‑Choice routing**: a szakértők „választják\\ a tokeneket, ami javítja az elosztást és a konvergenciát hasonló költségek mellett.<sup>[\[57\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-ExpertChoice-57)</sup>
- **Fine‑grained MoE**: nagyobb számú, kisebb szakértő (mint a DBRX-ben) finomabb specializációs szemcsézettséget eredményez.<sup>[\[55\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: egy sűrű modell MoE-vé alakítása a checkpoint-jából lehetővé teszi a minőség jelentős javítását mérsékelt költségek mellett.<sup>[\[58\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-SparseUpcycling-58)</sup>

#### A MoE alkalmazásának indokoltsága

- Nagy multidomain asszisztensek korlátozott számítási kerettel.
- Széles korpuszon való tanítás, ahol a specializáció előnyt jelent.
- Fejlett elosztott infrastruktúrával rendelkező forgatókönyvek (sok GPU/TPU és gyors hálózatok).

**Mikor jobbak a sűrű modellek**: korlátozott infrastruktúra esetén (1–2 GPU), szigorú kiszámítható késleltetési és egyszerű telepítési követelmények esetén.

## Retrieval‑Augmented Generation (RAG)

A RAG az LLM körüli **rendszerszintű architektúra-minta**, nem pedig maga a modell belső architektúrája. Ötvözi az LLM-et (generatív komponens) egy külső tudásbázissal (kinyerési komponens), ami lehetővé teszi a modell korlátozott „parametrikus memóriájának\\ kompenzálását.

- **Működési elv:** A generálás előtt az LLM releváns dokumentumokat keres ki egy külső forrásból (wiki, vállalati tudásbázis, web), és ezekre támaszkodik a válasz összeállításakor.<sup>[\[59\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RAG-59)</sup>
- **Előnyök:**
  - Hallucinációk csökkentése és faktikus pontosság javítása.<sup>[\[59\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-60)</sup>
  - Naprakészség a modell teljes újratanítása nélkül.<sup>[\[59\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RAG-59)</sup>
  - Válaszok idézhetősége és nyomon követhetősége.
- **Alkalmazás:** De facto szabvány vállalati asszisztensek és olyan rendszerek esetén, ahol ellenőrizhető tények, valamint magán- vagy szűk szakterületi adatokkal való munka szükséges.<sup>[\[59\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RAG-59)</sup>

## Figyelmi mechanizmusok és kontextuskezelés

Az alapvető önfigyelem kvadratikus komplexitású a szekvenciahosszra nézve ($O(n^{2})$), ezért különböző optimalizálások jelentek meg.

- **Ritka figyelem (Sparse Attention):** A figyelem korlátozása lokális ablakokra/mintákra. Példák: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-61)</sup>, **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-62)</sup>.
- **FlashAttention:** A számítási sorrend átrendezése a GPU memóriahierarchiájának figyelembevételével; jelentős időbeli és memóriabeli előnyt nyújt, és de facto szabvánnyá vált az LLM-ek hosszú kontextusú tanításakor<sup>[\[63\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-63)[\[64\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-64)[\[65\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-65)</sup>.
- **MQA/GQA (dekódolás gyorsítása):** A *Multi‑Query Attention* (megosztott kulcsok/értékek minden fejhez) csökkenti a KV-gyorsítótár forgalmát<sup>[\[66\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-66)</sup>. A *Grouped‑Query Attention* egyensúlyt teremt a minőség és a sebesség között<sup>[\[67\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-67)</sup>.
- **Fejlett pozíciós reprezentációk:**
  - **ALiBi (Attention with Linear Biases):** Lineáris eltolások a figyelmi pontszámokhoz, amelyek javítják az általánosítást nagy hosszakra.<sup>[\[68\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** Relatív pozíciós információ Q/K forgatásán keresztül; széles körben alkalmazott a modern modellekben (pl. LLaMA).<sup>[\[69\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-69)[\[70\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-70)</sup>
  - **RoPE-modellek kontextusablakának bővítése:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-71)</sup>, *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-72)</sup>, valamint NTK-aware módosítások lehetővé teszik a kontextusablak hatékony növelését az architektúra megváltoztatása nélkül.

<!-- -->

- **Egyéb megközelítések hosszú szekvenciákhoz:**
  - **Transformer‑XL:** Rekurrens memória szegmensek között a távolsági függőségek modellezéséhez.<sup>[\[73\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-73)</sup>
  - **Reformer:** LSH-attention és visszafordítható reziduális blokkok a memória megtakarításához.<sup>[\[74\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-74)</sup>
  - **Performer:** A softmax-attention lineáris közelítése (FAVOR+).<sup>[\[75\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-75)</sup>
  - **Linformer:** A figyelemmátrix alacsony rangú közelítése.<sup>[\[76\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-76)</sup>

## Modelloptimalizálások és tanítási infrastruktúra

Az LLM-ek tanításához és telepítéséhez speciális technikákat és keretrendszereket alkalmaznak.

- **Kvantálás (Quantization):** A súlyok bitmélységének csökkentése csökkenti a memóriaigényt és gyorsítja a következtetést. A **QLoRA** lehetővé teszi a 4 bites modellek (beleértve a 65B-t is) hatékony finomhangolását, közel teljes pontosságú minőséggel<sup>[\[77\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-77)</sup>.
- **Tudásdesztilláció (Knowledge Distillation):** *Teacher→Student* tanítás kompakt modellekhez<sup>[\[78\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-78)</sup>; példa: **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-79)</sup>.
- **Elosztott tanítás:**
  - **DeepSpeed** és **ZeRO** — paraméterek/gradiensek/optimalizáló állapotok elosztása billió paraméteres modellek tanításához<sup>[\[80\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-80)</sup>.
  - **Megatron‑LM** — tenzoriális és csővezeték-párhuzamosság nagyon nagy transformerekhez<sup>[\[81\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-81)</sup>.
- **Ökoszisztéma és eszközök:** A **Hugging Face Transformers** és az **Accelerate** szabványos modellmegvalósításokat és DeepSpeed/FSDP-integrációt biztosítanak tanításhoz és következtetéshez<sup>[\[82\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-82)[\[83\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-83)</sup>.

## Skálázási törvények és compute‑optimal tanítás

Az empirikus **skálázási törvények** megmutatják, hogy a kereszt-entrópia hiba hatványfüggvény szerint csökken a paraméterek, az adatok és a számítások növekedésével.<sup>[\[84\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-84)</sup> A **Chinchilla** munka pontosította a **compute‑optimal** módokat: az optimális hatékonysághoz a modell méretét és a tanító tokenek számát együttesen kell skálázni (példa: egy 70B-es modell, amelyet ~1,4T tokenen tanítottak, felülmúlja a nagyobb, alultanított modelleket).<sup>[\[85\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-85)</sup>

## Állapottér-modellek (State Space Models, SSM)

Az **State Space Models (SSM)** a transformerekkel szemben alternatív architektúrát kínálnak hosszú szekvenciák feldolgozásához. A vezérléselméletből és a digitális jelfeldolgozásból merítve megoldják az önfigyelem fő problémáját: a számítások kvadratikus növekedését a szöveg hosszával.

### Az alapvető probléma és a megoldás

**A transformerek problémája.** A hagyományos transformerek fő problémája a figyelem kvadratikus komplexitása: 10-szer hosszabb szöveg körülbelül 100-szor több számítást igényel.

**Az SSM megközelítése.** Az összes szóra való egyidejű figyelem helyett a modell szekvenciálisan halad a szövegen, és kompakt belső **memóriaállapotot** tart fenn, amelyet minden lépésnél frissít. Ennek eredményeként az idő- és memóriaigény körülbelül lineárisan nő a szöveg hosszával. Eközben a tanítás párhuzamosan végezhető — az összevonási kernel-reprezentáción keresztül (nagy áteresztőképesség hosszú szekvenciáknál).<sup>[\[86\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-S4-86)</sup>

### Működési elv

A diszkrét SSM-et állapot- és kimeneti egyenletek írják le:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

ahol $x_{t}$ a memóriaállapot, $u_{t}$ a bemenet (token), $y_{t}$ a kimenet. Mély SSM-ekben a $A,B,C,D$ mátrixokat úgy paraméterezik, hogy stabilitást és hatékony számítást biztosítsanak hosszú szekvenciákon. Ugyanaz a réteg tekinthető:

- rekurrensnek (lépésenkénti pásztázás) — memóriahatékony következtetés KV-gyorsítótár nélkül;
- konvolúciósnak — párhuzamos tanítás előre számított kernellel.<sup>[\[86\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-S4-86)</sup>

### Fő architektúrák és hibridek

- **S4 (Structured State Spaces).** Az SSM alapmodellje stabil állapotmátrix-paraméterezéssel; hatékonyságot mutat nagyon hosszú szekvenciákon.<sup>[\[86\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-S4-86)</sup>
- **Mamba.** *Szelektív* SSM-ek: a memória frissítési szabályai a pillanatnyi bemenettől függnek (a modell maga dönti el, mit „tartson meg" és mit „felejtsen el"). A megvalósítás a GPU memóriahierarchiájára van optimalizálva; a szerzők szerint többszörös áteresztőképesség-növekedés érhető el lineáris komplexitás mellett.<sup>[\[87\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mamba-87)</sup>
- **RetNet.** A *retention\\ mechanizmus három móddal: párhuzamos tanítás, rekurrens és blokk-rekurrens következtetés. A cél a gyors tanítás (mint a transformereknél) és a hatékony kimeneti folyam (O(1) memória tokenenkénti) kombinálása.<sup>[\[88\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RetNet-88)</sup>*
- **Attention+SSM hibridek.** Példa: **Jamba** (Transformer és Mamba rétegek váltakozása plusz MoE): állítólag ~256 K tokenes kontextust támogat lényegesen kisebb memóriaigénnyel, mint a hasonló osztályú tisztán transformer-alapú modellek.<sup>[\[89\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Jamba-89)</sup>

#### Előnyök

- Lineáris komplexitás és memóriatakarékosság következtetéskor. Nincs globális önfigyelem és KV-gyorsítótár; csak kompakt állapot tárolódik.<sup>[\[87\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RetNet-88)</sup>
- Párhuzamos tanítás hosszú szekvenciákon. A konvolúciós mód növeli a tanítás áteresztőképességét.<sup>[\[86\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-S4-86)</sup>
- Hardveres hatékonyság. A megvalósítások a modern memóriahierarchiára (HBM/SRAM) vannak optimalizálva.<sup>[\[87\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mamba-87)</sup>
- Hosszú kontextusok és streaming. Az SSM+Attention hibridek praktikusak több százezer tokenig mérsékelt erőforrásokkal.<sup>[\[89\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Jamba-89)</sup>

#### Korlátok és jelenlegi gyakorlat

- Ökoszisztéma érettsége. Az eszközök és a skálázási „receptek\\ (utasítások, RLHF/DPO) egyelőre elmaradnak a transformer-alapú készlettől.<sup>[\[87\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mamba-87)</sup>
- Minőség és stabilitás. Egyes feladatokon a hibridek (Attention+SSM) stabilabb „minőség/sebesség/memória\\ kompromisszumot mutatnak, mint a „tiszta" SSM-ek.<sup>[\[89\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Jamba-89)</sup>

#### Megközelítések összehasonlítása (általánosan)

| Jellemző                            | Transformerek                         | SSM                             | Hibridek (Attention+SSM) |
|-------------------------------------|---------------------------------------|---------------------------------|--------------------------|
| Hossz szerinti komplexitás          | Kvadratikus (önfigyelem)              | Lineáris (pásztázás/konvolúció) | Közel lineáris           |
| Memória tokenenként (következtetés) | KV-gyorsítótár nő a kontextussal      | O(1) állapot                    | Mérsékelt növekedés      |
| Hosszú kontextusok                  | Speciális optimalizálások szükségesek | Természetes támogatás           | Praktikus ~256 K-ig      |
| Ökoszisztéma érettsége              | Magas                                 | Fejlődőben                      | Fejlődőben               |

#### Gyakorlati alkalmazások

- Nagyon hosszú dokumentumok elemzése (könyvek, jelentések, tudományos áttekintések).
- Folyamatos feldolgozás és chat-forgatókönyvek hosszú előzménnyel memóriaterhelés növelése nélkül.
- Korlátozott erőforrással rendelkező környezetek (mobil/edge eszközök).
- Idősorok és egyéb szekvenciális adatok.

**Reprezentatív modellek:** S4, Mamba, RetNet; Attention+SSM hibridek (Jamba).<sup>[\[86\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Jamba-89)</sup>

## Az architektúrák fejlődése

- 2017 — megjelenik az „Attention Is All You Need\\ cikk. Bemutatják a transformer architektúrát: a többfejű önfigyelem és a pozíciós kódolások lehetővé teszik a modellek rekurrencia és konvolúció nélküli tanítását; ugyanakkor a figyelem kvadratikus komplexitású a kontextushossz szerint.<sup>[\[1\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 — bemutatják a GPT‑1-et és a BERT-et. A GPT‑1 csak dekódereket tartalmazó veremet használ kauzális figyelemmel a generáláshoz és az azt követő finomhangoláshoz; a BERT kétirányú enkódert és MLM előtanítást vezet be a szövegmegértési feladatokhoz.<sup>[\[90\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-90)[\[91\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-91)</sup>

<!-- -->

- 2019 — megjelennek a hosszú szekvenciákkal való munkavégzés módjai és a decoder‑only méretezése. A Transformer‑XL „memóriát\\ és relatív pozíciókat ad hozzá a rögzített ablak túllépéséhez; a GPT‑2 megmutatja a zero‑shot képességek növekedését skálázáskor; a BART hatékonyságát bizonyítja a denoising előtanítás seq2seq feladatokhoz.<sup>[\[92\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-92)[\[93\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-93)[\[94\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-94)</sup>

<!-- -->

- 2020 — egységesítik a „text‑to‑text\\ formátumot és bemutatják a hosszú dokumentumok kezelésének módszereit. A T5 egységes encoder–decoder megközelítést fogalmaz meg különböző feladatokhoz; a Longformer és a BigBird ritka/strukturált figyelmet alkalmaz hosszú szövegekhez; a GPT‑3 megerősíti a sűrű decoder‑only skálázásának hatékonyságát.<sup>[\[95\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-95)[\[96\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-96)[\[97\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-97)[\[98\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-98)</sup>

<!-- -->

- 2021 — javítják a pozíciós reprezentációkat és megmutatják a paraméter-ritkaságot (MoE). A RoPE és az ALiBi javítja az általánosítást nagy hosszakon; a Switch Transformer és a GLaM tokenenkénti csak néhány szakértőt aktivál, növelve a kapacitást a kimeneti költség arányos növelése nélkül.<sup>[\[99\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-99)[\[100\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-100)[\[101\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-101)[\[102\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-102)</sup>

<!-- -->

- 2022 — pontosítják a compute‑optimal módot és gyorsítják a következtetést hosszú promptokon. A Chinchilla megmutatja a több tanító token előnyét mérsékelt modellméret esetén; a PaLM Multi‑Query Attention segítségével csökkenti a KV-gyorsítótár méretét; a FlashAttention gyorsítja a figyelmet GPU-n.<sup>[\[103\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-103)[\[104\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-104)[\[105\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-105)[\[106\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-106)</sup>

<!-- -->

- 2023 — megnövelik a kontextusablakokat a rétegek módosítása nélkül és javítják a kiszolgálást. A LLaMA modellcsalád megszilárdítja a bevált gyakorlatokat (RMSNorm, SwiGLU, RoPE); a Position Interpolation és a YaRN bővíti a kontextust; a vLLM/PagedAttention hatékonyabban kezeli a KV-gyorsítótárat.<sup>[\[107\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-107)[\[108\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-108)[\[109\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-109)[\[110\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-110)[\[111\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-111)[\[112\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-112)</sup>

<!-- -->

- 2023 — a GPT‑4 és a Gemini egyetlen modellcsaládon belül megmutatja a többmodális feldolgozást és generálást.<sup>[\[113\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-113)[\[114\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-114)</sup>

<!-- -->

- 2023 — megjelennek az állapottér-modellek (SSM). A Mamba és a RetNet visszatér a kompakt állapottal rendelkező szekvenciális feldolgozáshoz KV-gyorsítótár helyett, és megalapozzák a hibrid architektúrákat.<sup>[\[115\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-115)[\[116\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-116)</sup>

<!-- -->

- 2024 — megjelennek a nyílt MoE-modellek és Attention+SSM hibridek; gyorsítják a figyelmet az új GPU-kon. A Mixtral 8×7B/8×22B és a DBRX megerősíti a MoE gyakorlati alkalmazhatóságát; a Jamba ötvözi a Transformer és a Mamba modelleket nagyon hosszú kontextusokhoz; a FlashAttention‑3 növeli az áteresztőképességet.<sup>[\[117\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-117)[\[118\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-118)[\[119\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-119)[\[120\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-120)[\[121\]](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_note-121)</sup>

## Hivatkozások

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — vizuális magyarázat

## Irodalom

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## Jegyzetek

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/LLM-architekt%C3%BAr%C3%A1k#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
