PaLM (Pathways Language Model) (HU)
PaLM (Pathways Language Model) — nagy nyelvi modellek (LLM) egy családja, amelyet a Google fejlesztett ki. A modell első verziója, amelyet 2022 áprilisában mutattak be, 540 milliárd paramétert tartalmazott, és az akkori világ egyik legnagyobb nyelvi modelljévé vált, áttörő képességeket demonstrálva, amelyek a masszív skálázás eredményeként jöttek létre[1].
A PaLM legfontosabb technológiai alapja a Pathways — a Google egy új gépi tanulási rendszerarchitektúrája, amely lehetővé teszi az elosztott számítások hatékony koordinálását több ezer gyorsítóchipen[2]. A PaLM volt ennek a rendszernek az első nagyszabású bemutatója, példátlan tanítási hatékonyságot mutatva hatalmas méretekben.
Pathways rendszer: A skálázás alapja
A Pathways koncepciója, amelyet a Google 2021-ben mutatott be, egyetlen neurális hálózat létrehozását irányozta elő, amely képes hatékonyan általánosítani a különböző domének ismereteit, és egyszerre több ezer feladatot végrehajtani. A PaLM volt ennek a rendszernek az első nagyszabású alkalmazása: tanítása 6144 darab speciális TPU v4 processzorra lett párhuzamosítva, amelyek két felhőalapú klaszterbe (TPU v4 Pods) voltak összekötve[1].
Létrehozásakor ez volt a valaha egyetlen modell tanításához használt legnagyobb TPU-konfiguráció. A rendszer rekordszintű hardverkapacitás-kihasználtságot ért el (57,8% FLOPs), ami lehetővé tette a korábbi projektek méretének jelentős meghaladását, és egy több mint fél billió paraméterrel rendelkező modell sikeres betanítását[3].
Architektúra és tanítási adatok
A modell architektúrája
A PaLM egy sűrű (nem ritka) nyelvi modell „csak dekóder" (decoder-only) architektúrával, amely hasonló a GPT modellsorozathoz. Ez az architektúra a következő token előrejelzésének feladataira összpontosít, és jól alkalmazható szöveggenerálásra. A standard transformer architektúrától eltérően a PaLM számos kulcsfontosságú módosítást alkalmaz a hatékonyság növelése érdekében[1]:
- Párhuzamos rétegek: A figyelmi mechanizmusok és a teljesen összekötött rétegek párhuzamosan kerülnek kiszámításra, ami körülbelül 15%-kal gyorsította a tanítást.
- SwiGLU aktiváció: A SwiGLU aktivációs függvény használata a standard ReLU helyett, ami jelentősen javította a modell minőségét.
Tanítási adatok
A PaLM-t egy 780 milliárd tokenből álló, magas minőségű adatkorpuszon tanították. Az adatkészlet többnyelvű és változatos volt, beleértve[1]:
- Magas minőségű weboldalakat és könyveket.
- Wikipédia-cikkeket.
- Közösségi médiából származó párbeszédeket (a korpusz 50%-a).
- GitHub-ról származó forráskódot (a korpusz 5%-a).
Az adatok körülbelül 78%-a angol nyelvű volt, a fennmaradó 22% többnyelvű készletet alkotott. A tokenizáláshoz egy speciális „veszteségmentes" módszert alkalmaztak, amely megőrizte az összes szóközt (kód esetén kritikus), és a felismeretlen Unicode-karaktereket bájtokra bontotta fel.
Képességek és eredmények
Emergens képességek és few-shot tanulás
A PaLM demonstrálta, hogy a modell méretének, az adatmennyiségnek és a számítási kapacitásnak a növelése emergens (váratlanul megjelenő) képességekhez vezethet. Számos feladatban a modell teljesítménye csak a maximális méret elérésekor ugrott meg hirtelen és nemlineárisan, ami korábban nem megfigyelt, új képességek megjelenésére utalt[3].
A modellt few-shot tanulás módban értékelték (finomhangolás nélkül, néhány példával a promptban), és felülmúlta a korábbi nagy modelleket (mint például a GPT-3 és a LaMDA) 29 népszerű NLP-benchmark közül 28-on. A komplex BIG-bench feladatkészleten a PaLM volt az első modell, amelynek eredményei meghaladták az emberi tesztelők által elért átlagos szintet[1].
Gondolatláncok szerinti következtetés (Chain-of-Thought)
A PaLM egyik legkiemelkedőbb eredménye a többlépéses logikai következtetés képessége volt a „gondolatlánc" (chain-of-thought prompting) technika alkalmazásakor[1]. Ez a módszer abból áll, hogy a modell számára olyan példákat adnak meg, amelyekben a feladat megoldása lépésről lépésre van leírva. Az ilyen példákon tanulva a PaLM képes volt saját „gondolatláncot" generálni új, összetett feladatok megoldásához, mint például:
- Matematikai feladatok: A GSM8K teszten (általános iskolai szintű feladatok) a PaLM a feladatok 58%-át oldotta meg, felülmúlva a korábban finomhangolt modellel elért state-of-the-art eredményt.
- Józan ész feladatok: A modell képes volt részletes magyarázatokat generálni nem triviális feladatokhoz, például korábban nem látott viccek értelmezésére.
Ez a képesség a modell „gondolkodási" folyamatát átláthatóbbá és az emberéhez hasonlóbbá tette.
Kódgenerálás és többnyelvűség
Annak ellenére, hogy a forráskód az összes tanítási adat mindössze 5%-át tette ki, a PaLM az OpenAI Codex specializált modellhez hasonló szintet ért el kódgenerálási és kódtranszformációs feladatokban. A modell emellett erős képességeket mutatott többnyelvű feladatokban, beleértve a fordítást is[3].
Evolúció és utódok: A PaLM-család
A PaLM egy egész modellfamília alapjává vált, amelyet a Google fejlesztett ki.
PaLM 2
A 2023 májusában bemutatott PaLM 2 hatékonyabb és többnyelvűbb utóddá vált. A paraméterek számának hajszolása helyett a hangsúlyt a tanítási adatok minőségére és az architektúra hatékonyságára helyezték. A PaLM 2-t több mint 100 nyelven írt szövegeken tanították, és fejlettebb képességeket mutat a logikai következtetés, a programozás és a fordítás terén[4]. A modell négy méretben érhető el (a legkisebbtől a legnagyobb felé): Gecko, Otter, Bison és Unicorn. A legkompaktabb változat (Gecko) elég könnyű ahhoz, hogy mobileszközökön is működjön offline módban.
Specializált változatok
A PaLM és a PaLM 2 alapján specifikus domének számára változatok készültek:
- Med-PaLM 2: Orvostudományra specializált modell. Ez volt az első MI-rendszer, amely szakértői szintet ért el az amerikai orvosi licencvizsga (USMLE) kérdéseiben[4].
- Sec-PaLM 2: Kiberbiztonságra összpontosító modell, amelyet sebezhetőségek azonosítására és rosszindulatú kódok elemzésére tanítottak[5].
PaLM-E: Multimodális változat
A PaLM-E (Pathways Language Model Embodied) egy multimodális modell, amely a PaLM nyelvi modellt a Vision Transformer (ViT) vizuális adataival ötvözi. Ez lehetővé teszi a modell számára, hogy szöveget és képeket egyaránt feldolgozzon, és a fizikai világgal kapcsolatos feladatokat oldjon meg, például robotok irányítása céljából[6].
Etikai szempontok és korlátok
A PaLM alkotói hangsúlyozzák a felelős megközelítés szükségességét a nagy nyelvi modellek fejlesztésében. A hivatalos tudományos cikkben elemzést végeztek a modellezett szövegben előforduló lehetséges elfogultságokról és toxicitásról. Az átláthatóság biztosítása érdekében a Google közzétette a PaLM modellkártyáját (Model Card) és adatlapját (Datasheet), amelyek dokumentálják az adatkészlet jellemzőit, a tesztelési eredményeket és az azonosított korlátokat[1]. Ezek az intézkedések megfelelnek a felelős MI modern gyakorlatainak, és céljuk az elfogultságokkal és a káros tartalom generálásával kapcsolatos kockázatok csökkentése.
Hivatkozások
- A Google hivatalos blogja a PaLM-ről
- PaLM API fejlesztőknek
Irodalom
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Megjegyzések
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]