PaLM (Pathways Language Model) (PL)
PaLM (Pathways Language Model) — to rodzina dużych modeli językowych (LLM), opracowana przez firmę Google. Pierwsza wersja modelu, zaprezentowana w kwietniu 2022 roku, zawierała 540 miliardów parametrów i stała się jednym z największych ówczesnych modeli językowych na świecie, demonstrując przełomowe możliwości będące efektem masowego skalowania[1].
Kluczową podstawą technologiczną PaLM stał się Pathways — nowa architektura systemów Machine Learning od Google, umożliwiająca efektywną koordynację rozproszonych obliczeń na tysiącach chipów-akceleratorów[2]. PaLM stał się pierwszą wielkoskalową demonstracją tego systemu, wykazując bezprecedensową efektywność uczenia na ogromnych skalach.
Pathways: Podstawa skalowania
Koncepcja Pathways, zaprezentowana przez Google w 2021 roku, zakładała stworzenie jednej sieci neuronowej zdolnej do efektywnego uogólniania wiedzy w różnych domenach i wykonywania tysięcy zadań jednocześnie. PaLM stał się pierwszym wielkoskalowym zastosowaniem tego systemu: jego uczenie zostało zrównoleglone na 6144 wyspecjalizowanych procesorach TPU v4, połączonych w dwa klastry chmurowe (TPU v4 Pods)[1].
W momencie swojego powstania była to największa konfiguracja TPU, jaka kiedykolwiek została użyta do uczenia jednego modelu. System osiągnął rekordową efektywność wykorzystania zasobów sprzętowych (57,8% FLOPs), co pozwoliło znacząco przekroczyć skalę poprzednich projektów i skutecznie wytrenować model z ponad pół bilionem parametrów[3].
Architektura i dane uczące
Architektura modelu
PaLM to gęsty (nierozrzedzony) model językowy z architekturą „tylko dekoder" (decoder-only), analogiczną do modeli z serii GPT. Taka architektura jest zorientowana na zadania przewidywania następnego tokenu i dobrze nadaje się do generowania tekstu. W odróżnieniu od standardowej architektury transformer, PaLM wykorzystuje kilka kluczowych modyfikacji zwiększających efektywność[1]:
- Równoległe warstwy: Mechanizmy attention i warstwy w pełni połączone są obliczane równolegle, co pozwoliło przyspieszyć uczenie o około 15%.
- Aktywacja SwiGLU: Użycie funkcji aktywacji SwiGLU zamiast standardowej ReLU, co znacząco poprawiło jakość modelu.
Dane uczące
PaLM został wytrenowany na wysokiej jakości korpusie danych o objętości 780 miliardów tokenów. Zbiór danych był wielojęzyczny i zróżnicowany, obejmując[1]:
- Wysokiej jakości dokumenty internetowe i książki.
- Artykuły z Wikipedii.
- Dialogi z mediów społecznościowych (50% korpusu).
- Kod źródłowy z GitHub (5% korpusu).
Około 78% danych było w języku angielskim, a pozostałe 22% stanowiły dane wielojęzyczne. Do tokenizacji zastosowano specjalną technikę „bezstratną", która zachowywała wszystkie spacje (krytyczne dla kodu) i rozkładała nierozpoznane znaki Unicode na bajty.
Możliwości i wyniki
Zdolności emergentne i uczenie few-shot
PaLM wykazał, że zwiększanie skali modelu, objętości danych i mocy obliczeniowych może prowadzić do emergentnych (niespodziewanie pojawiających się) zdolności. W wielu zadaniach wydajność modelu gwałtownie i nieliniowo wzrastała dopiero po osiągnięciu maksymalnej skali, co wskazywało na pojawienie się nowych, wcześniej nieobserwowanych możliwości[3].
Model był oceniany w trybie few-shot (bez fine-tuningu, z kilkoma przykładami w prompcie) i przewyższył poprzednie duże modele (takie jak GPT-3 i LaMDA) w 28 z 29 popularnych benchmarków NLP. Na złożonym zestawie zadań BIG-bench PaLM stał się pierwszym modelem, którego wyniki przewyższyły średni poziom osiągany przez ludzkich testerów[1].
Rozumowanie według łańcucha myśli (Chain-of-Thought)
Jednym z najbardziej znaczących osiągnięć PaLM była zdolność do wieloetapowego rozumowania logicznego przy użyciu techniki podpowiedzi „łańcuch myśli" (chain-of-thought prompting)[1]. Technika ta polega na dostarczaniu modelowi przykładów, w których rozwiązanie zadania jest rozpisane krok po kroku. Po wytrenowaniu na takich przykładach PaLM był w stanie generować własny „łańcuch myśli" do rozwiązywania nowych, złożonych zadań, takich jak:
- Zadania matematyczne: W teście GSM8K (zadania na poziomie szkoły podstawowej) PaLM rozwiązał 58% zadań, przewyższając poprzedni wynik state-of-the-art osiągnięty przez model po fine-tuningu.
- Zadania na zdrowy rozsądek: Model był w stanie generować rozbudowane wyjaśnienia do niebanalnych zadań, na przykład interpretować wcześniej nieznane żarty.
Ta zdolność sprawiła, że proces „myślenia" modelu stał się bardziej przejrzysty i zbliżony do ludzkiego.
Generowanie kodu i wielojęzyczność
Pomimo że kod źródłowy stanowił zaledwie 5% danych uczących, PaLM osiągnął poziom porównywalny ze specjalistycznym modelem OpenAI Codex w zadaniach generowania i transformacji kodu. Model zademonstrował również silne zdolności w zadaniach wielojęzycznych, w tym w tłumaczeniu[3].
Ewolucja i następcy: Rodzina PaLM
PaLM stał się podstawą dla całej rodziny modeli opracowanych przez Google.
PaLM 2
Zaprezentowany w maju 2023 roku PaLM 2 stał się bardziej efektywnym i wielojęzycznym następcą. Zamiast dążenia do liczby parametrów, nacisk został przesunięty na jakość danych uczących i efektywność architektury. PaLM 2 jest trenowany na tekstach w ponad 100 językach i wykazuje ulepszone zdolności w logice, programowaniu i tłumaczeniu[4]. Model jest dostępny w czterech rozmiarach (od najmniejszego do największego): Gecko, Otter, Bison i Unicorn. Najbardziej kompaktowy wariant (Gecko) jest wystarczająco lekki, aby działać na urządzeniach mobilnych w trybie offline.
Wersje specjalistyczne
Na podstawie PaLM i PaLM 2 powstały wersje dedykowane konkretnym domenom:
- Med-PaLM 2: Specjalistyczny model dla medycyny. Stał się pierwszym systemem AI, który osiągnął poziom eksperta w pytaniach z licencyjnego egzaminu lekarskiego w USA (USMLE)[4].
- Sec-PaLM 2: Model zorientowany na cyberbezpieczeństwo, wytrenowany do wykrywania luk bezpieczeństwa i analizowania złośliwego kodu[5].
PaLM-E: Wersja multimodalna
PaLM-E (Pathways Language Model Embodied) — to multimodalny model, który łączy model językowy PaLM z danymi wizualnymi z Vision Transformer (ViT). Pozwala to modelowi przetwarzać zarówno tekst, jak i obrazy, rozwiązując zadania związane ze światem fizycznym, na przykład do sterowania robotami[6].
Aspekty etyczne i ograniczenia
Twórcy PaLM podkreślają konieczność odpowiedzialnego podejścia do rozwoju dużych modeli językowych. W oficjalnym artykule naukowym przeprowadzono analizę możliwych uprzedzeń i toksyczności w generowanym tekście. Aby zapewnić przejrzystość, Google opublikował kartę modelu (Model Card) i paszport danych (Datasheet) dla PaLM, w których udokumentowano charakterystyki zbioru danych, wyniki testów i zidentyfikowane ograniczenia[1]. Działania te są zgodne ze współczesnymi praktykami odpowiedzialnego AI i mają na celu zmniejszenie ryzyka związanego z uprzedzeniami i generowaniem szkodliwych treści.
Odnośniki
- Oficjalny blog Google o PaLM
- PaLM API dla programistów
Literatura
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Przypisy
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]