PaLM (Pathways Language Model) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — je rodina velkých jazykových modelů (LLM), vyvinutá společností Google. První verze modelu, představená v dubnu 2022, obsahovala 540 miliard parametrů a stala se jedním z největších jazykových modelů světa v té době, přičemž demonstrovala průlomové schopnosti, které byly výsledkem masivního škálování[1].

Klíčovým technologickým základem PaLM se stal Pathways — nová architektura systémů Machine Learning od Google, umožňující efektivně koordinovat distribuované výpočty na tisících čipů-akcelerátorů[2]. PaLM se stala první velkoplošnou demonstrací tohoto systému a prokázala bezprecedentní efektivitu trénování v obrovském měřítku.

Systém Pathways: Základ pro škálování

Koncept Pathways, představený společností Google v roce 2021, předpokládal vytvoření jediné neuronové sítě schopné efektivně zobecňovat znalosti pro různé domény a plnit tisíce úkolů současně. PaLM se stala prvním velkoplošným využitím tohoto systému: její trénování bylo paralelizováno na 6144 specializovaných procesorech TPU v4, spojených do dvou cloudových clusterů (TPU v4 Pods)[1].

V době svého vzniku se jednalo o největší konfiguraci TPU, jaká kdy byla použita pro trénování jednoho modelu. Systém dosáhl rekordní efektivity využití hardwarového výkonu (57,8 % FLOPs), což umožnilo výrazně překonat předchozí projekty v měřítku a úspěšně natrénovat model s více než půl bilionem parametrů[3].

Architektura a trénovací data

Architektura modelu

PaLM je hustý (neřídký) jazykový model s architekturou „pouze dekodér" (decoder-only), podobný modelům řady GPT. Tato architektura je zaměřena na úlohy predikce následujícího tokenu a dobře se hodí pro generování textu. Na rozdíl od standardní architektury transformeru používá PaLM několik klíčových modifikací pro zvýšení efektivity[1]:

  • Paralelní vrstvy: Mechanismy attention a plně propojené vrstvy jsou počítány paralelně, což umožnilo zrychlit trénování přibližně o 15 %.
  • SwiGLU aktivace: Použití aktivační funkce SwiGLU místo standardní ReLU, což výrazně zlepšilo kvalitu modelu.

Trénovací data

PaLM byla natrénována na vysoce kvalitním korpusu dat o objemu 780 miliard tokenů. Datová sada byla vícejazyčná a rozmanitá, zahrnovala[1]:

  • Vysoce kvalitní webové dokumenty a knihy.
  • Články z Wikipedie.
  • Dialogy ze sociálních sítí (50 % korpusu).
  • Zdrojový kód z GitHubu (5 % korpusu).

Přibližně 78 % dat bylo v anglickém jazyce a zbývajících 22 % tvořila vícejazyčná sada. Pro tokenizaci byla použita speciální „bezeztrátová" technika, která zachovávala všechny mezery (klíčové pro kód) a rozdělovala nerozpoznané znaky Unicode na bajty.

Schopnosti a výsledky

Emergentní schopnosti a few-shot učení

PaLM prokázala, že zvyšování měřítka modelu, objemu dat a výpočetního výkonu může vést k emergentním (nečekaně vznikajícím) schopnostem. Na mnoha úlohách výkon modelu prudce a nelineárně rostl až při dosažení maximálního měřítka, což naznačovalo vznik nových, dříve nepozorovaných schopností[3].

Model byl hodnocen v režimu few-shot učení (bez doladění, s několika příklady v promptu) a překonal předchozí velké modely (jako GPT-3 a LaMDA) na 28 z 29 populárních NLP benchmarků. Na komplexní sadě úloh BIG-bench se PaLM stala prvním modelem, jehož výsledky překonaly průměrnou úroveň lidských hodnotitelů[1].

Uvažování prostřednictvím řetězu myšlenek (Chain-of-Thought)

Jedním z nejvýznamnějších úspěchů PaLM byla schopnost víceúrovňového logického uvažování při použití techniky „řetěz myšlenek" (chain-of-thought prompting)[1]. Tato metoda spočívá v poskytování modelu příkladů, kde je řešení úlohy rozepsáno po krocích. Po natrénování na takových příkladech byla PaLM schopna generovat vlastní „řetěz myšlenek" pro řešení nových složitých úloh, jako jsou:

  • Matematické úlohy: Na testu GSM8K (úlohy na úrovni základní školy) PaLM vyřešila 58 % úloh, čímž překonala předchozí state-of-the-art výsledek dosažený doladěným modelem.
  • Úlohy zdravého rozumu: Model dokázal generovat podrobná vysvětlení pro netriviální úlohy, například podávat výklad dříve neviděných vtipů.

Tato schopnost učinila proces „myšlení" modelu průhlednějším a podobnějším lidskému.

Generování kódu a vícejazyčnost

Přestože zdrojový kód tvořil pouhých 5 % trénovacích dat, PaLM dosáhla úrovně srovnatelné se specializovaným modelem OpenAI Codex v úlohách generování a transformace kódu. Model také prokázal silné schopnosti ve vícejazyčných úlohách, včetně překladu[3].

Evoluce a nástupci: Rodina PaLM

PaLM se stala základem pro celou rodinu modelů vyvinutých společností Google.

PaLM 2

Představená v květnu 2023 PaLM 2 se stala efektivnějším a vícejazyčnějším nástupcem. Místo honby za počtem parametrů byl důraz přesunut na kvalitu trénovacích dat a efektivitu architektury. PaLM 2 je natrénována na textech ve více než 100 jazycích a vykazuje zlepšené schopnosti v logice, programování a překladu[4]. Model je vydáván ve čtyřech velikostech (od nejmenšího po největší): Gecko, Otter, Bison a Unicorn. Nejkompaktnější varianta (Gecko) je dostatečně lehká pro provoz na mobilních zařízeních v offline režimu.

Specializované verze

Na základě PaLM a PaLM 2 byly vytvořeny verze pro konkrétní domény:

  • Med-PaLM 2: Specializovaný model pro medicínu. Stal se prvním systémem AI, který dosáhl úrovně experta v otázkách licenční zkoušky lékaře v USA (USMLE)[4].
  • Sec-PaLM 2: Model zaměřený na kybernetickou bezpečnost, natrénovaný k odhalování zranitelností a analýze škodlivého kódu[5].

PaLM-E: Multimodální verze

PaLM-E (Pathways Language Model Embodied) — je multimodální model, který spojuje jazykový model PaLM s vizuálními daty z Vision Transformer (ViT). To umožňuje modelu zpracovávat jak text, tak obrázky a řešit úlohy spojené s fyzickým světem, například pro řízení robotů[6].

Etické aspekty a omezení

Tvůrci PaLM zdůrazňují nutnost zodpovědného přístupu k vývoji velkých jazykových modelů. V oficiálním vědeckém článku byla provedena analýza možných zkreslení a toxicity v generovaném textu. Pro zajištění transparentnosti Google zveřejnila kartu modelu (Model Card) a průvodní list dat (Datasheet) pro PaLM, kde jsou zdokumentovány charakteristiky datasetu, výsledky testování a zjištěná omezení[1]. Tato opatření odpovídají současným praktikám zodpovědné AI a mají za cíl snížit rizika spojená s předsudky a generováním škodlivého obsahu.

Odkazy

  • Oficiální blog Google o PaLM
  • PaLM API pro vývojáře

Literatura

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

Poznámky

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]