PaLM (Pathways Language Model) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — nagy nyelvi modellek (LLM) egy családja, amelyet a Google fejlesztett ki. A modell első verziója, amelyet 2022 áprilisában mutattak be, 540 milliárd paramétert tartalmazott, és az akkori világ egyik legnagyobb nyelvi modelljévé vált, áttörő képességeket demonstrálva, amelyek a masszív skálázás eredményeként jöttek létre[1].

A PaLM legfontosabb technológiai alapja a Pathways — a Google egy új gépi tanulási rendszerarchitektúrája, amely lehetővé teszi az elosztott számítások hatékony koordinálását több ezer gyorsítóchipen[2]. A PaLM volt ennek a rendszernek az első nagyszabású bemutatója, példátlan tanítási hatékonyságot mutatva hatalmas méretekben.

Pathways rendszer: A skálázás alapja

A Pathways koncepciója, amelyet a Google 2021-ben mutatott be, egyetlen neurális hálózat létrehozását irányozta elő, amely képes hatékonyan általánosítani a különböző domének ismereteit, és egyszerre több ezer feladatot végrehajtani. A PaLM volt ennek a rendszernek az első nagyszabású alkalmazása: tanítása 6144 darab speciális TPU v4 processzorra lett párhuzamosítva, amelyek két felhőalapú klaszterbe (TPU v4 Pods) voltak összekötve[1].

Létrehozásakor ez volt a valaha egyetlen modell tanításához használt legnagyobb TPU-konfiguráció. A rendszer rekordszintű hardverkapacitás-kihasználtságot ért el (57,8% FLOPs), ami lehetővé tette a korábbi projektek méretének jelentős meghaladását, és egy több mint fél billió paraméterrel rendelkező modell sikeres betanítását[3].

Architektúra és tanítási adatok

A modell architektúrája

A PaLM egy sűrű (nem ritka) nyelvi modell „csak dekóder" (decoder-only) architektúrával, amely hasonló a GPT modellsorozathoz. Ez az architektúra a következő token előrejelzésének feladataira összpontosít, és jól alkalmazható szöveggenerálásra. A standard transformer architektúrától eltérően a PaLM számos kulcsfontosságú módosítást alkalmaz a hatékonyság növelése érdekében[1]:

  • Párhuzamos rétegek: A figyelmi mechanizmusok és a teljesen összekötött rétegek párhuzamosan kerülnek kiszámításra, ami körülbelül 15%-kal gyorsította a tanítást.
  • SwiGLU aktiváció: A SwiGLU aktivációs függvény használata a standard ReLU helyett, ami jelentősen javította a modell minőségét.

Tanítási adatok

A PaLM-t egy 780 milliárd tokenből álló, magas minőségű adatkorpuszon tanították. Az adatkészlet többnyelvű és változatos volt, beleértve[1]:

  • Magas minőségű weboldalakat és könyveket.
  • Wikipédia-cikkeket.
  • Közösségi médiából származó párbeszédeket (a korpusz 50%-a).
  • GitHub-ról származó forráskódot (a korpusz 5%-a).

Az adatok körülbelül 78%-a angol nyelvű volt, a fennmaradó 22% többnyelvű készletet alkotott. A tokenizáláshoz egy speciális „veszteségmentes" módszert alkalmaztak, amely megőrizte az összes szóközt (kód esetén kritikus), és a felismeretlen Unicode-karaktereket bájtokra bontotta fel.

Képességek és eredmények

Emergens képességek és few-shot tanulás

A PaLM demonstrálta, hogy a modell méretének, az adatmennyiségnek és a számítási kapacitásnak a növelése emergens (váratlanul megjelenő) képességekhez vezethet. Számos feladatban a modell teljesítménye csak a maximális méret elérésekor ugrott meg hirtelen és nemlineárisan, ami korábban nem megfigyelt, új képességek megjelenésére utalt[3].

A modellt few-shot tanulás módban értékelték (finomhangolás nélkül, néhány példával a promptban), és felülmúlta a korábbi nagy modelleket (mint például a GPT-3 és a LaMDA) 29 népszerű NLP-benchmark közül 28-on. A komplex BIG-bench feladatkészleten a PaLM volt az első modell, amelynek eredményei meghaladták az emberi tesztelők által elért átlagos szintet[1].

Gondolatláncok szerinti következtetés (Chain-of-Thought)

A PaLM egyik legkiemelkedőbb eredménye a többlépéses logikai következtetés képessége volt a „gondolatlánc" (chain-of-thought prompting) technika alkalmazásakor[1]. Ez a módszer abból áll, hogy a modell számára olyan példákat adnak meg, amelyekben a feladat megoldása lépésről lépésre van leírva. Az ilyen példákon tanulva a PaLM képes volt saját „gondolatláncot" generálni új, összetett feladatok megoldásához, mint például:

  • Matematikai feladatok: A GSM8K teszten (általános iskolai szintű feladatok) a PaLM a feladatok 58%-át oldotta meg, felülmúlva a korábban finomhangolt modellel elért state-of-the-art eredményt.
  • Józan ész feladatok: A modell képes volt részletes magyarázatokat generálni nem triviális feladatokhoz, például korábban nem látott viccek értelmezésére.

Ez a képesség a modell „gondolkodási" folyamatát átláthatóbbá és az emberéhez hasonlóbbá tette.

Kódgenerálás és többnyelvűség

Annak ellenére, hogy a forráskód az összes tanítási adat mindössze 5%-át tette ki, a PaLM az OpenAI Codex specializált modellhez hasonló szintet ért el kódgenerálási és kódtranszformációs feladatokban. A modell emellett erős képességeket mutatott többnyelvű feladatokban, beleértve a fordítást is[3].

Evolúció és utódok: A PaLM-család

A PaLM egy egész modellfamília alapjává vált, amelyet a Google fejlesztett ki.

PaLM 2

A 2023 májusában bemutatott PaLM 2 hatékonyabb és többnyelvűbb utóddá vált. A paraméterek számának hajszolása helyett a hangsúlyt a tanítási adatok minőségére és az architektúra hatékonyságára helyezték. A PaLM 2-t több mint 100 nyelven írt szövegeken tanították, és fejlettebb képességeket mutat a logikai következtetés, a programozás és a fordítás terén[4]. A modell négy méretben érhető el (a legkisebbtől a legnagyobb felé): Gecko, Otter, Bison és Unicorn. A legkompaktabb változat (Gecko) elég könnyű ahhoz, hogy mobileszközökön is működjön offline módban.

Specializált változatok

A PaLM és a PaLM 2 alapján specifikus domének számára változatok készültek:

  • Med-PaLM 2: Orvostudományra specializált modell. Ez volt az első MI-rendszer, amely szakértői szintet ért el az amerikai orvosi licencvizsga (USMLE) kérdéseiben[4].
  • Sec-PaLM 2: Kiberbiztonságra összpontosító modell, amelyet sebezhetőségek azonosítására és rosszindulatú kódok elemzésére tanítottak[5].

PaLM-E: Multimodális változat

A PaLM-E (Pathways Language Model Embodied) egy multimodális modell, amely a PaLM nyelvi modellt a Vision Transformer (ViT) vizuális adataival ötvözi. Ez lehetővé teszi a modell számára, hogy szöveget és képeket egyaránt feldolgozzon, és a fizikai világgal kapcsolatos feladatokat oldjon meg, például robotok irányítása céljából[6].

Etikai szempontok és korlátok

A PaLM alkotói hangsúlyozzák a felelős megközelítés szükségességét a nagy nyelvi modellek fejlesztésében. A hivatalos tudományos cikkben elemzést végeztek a modellezett szövegben előforduló lehetséges elfogultságokról és toxicitásról. Az átláthatóság biztosítása érdekében a Google közzétette a PaLM modellkártyáját (Model Card) és adatlapját (Datasheet), amelyek dokumentálják az adatkészlet jellemzőit, a tesztelési eredményeket és az azonosított korlátokat[1]. Ezek az intézkedések megfelelnek a felelős MI modern gyakorlatainak, és céljuk az elfogultságokkal és a káros tartalom generálásával kapcsolatos kockázatok csökkentése.

Hivatkozások

  • A Google hivatalos blogja a PaLM-ről
  • PaLM API fejlesztőknek

Irodalom

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

Megjegyzések

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]