PaLM (Pathways Language Model) (BG)
PaLM (Pathways Language Model) — това е семейство от големи езикови модели (LLM), разработено от компанията Google. Първата версия на модела, представена през април 2022 година, съдържаше 540 милиарда параметъра и се превърна в един от най-мащабните езикови модели в света към онзи момент, демонстрирайки пробивни възможности, резултат от масивно мащабиране[1].
Ключовата технологична основа на PaLM беше Pathways — нова архитектура на системи за Machine Learning от Google, позволяваща ефективно координиране на разпределени изчисления върху хиляди чипа-ускорители[2]. PaLM стана първата мащабна демонстрация на тази система, показвайки безпрецедентна ефективност на обучение при огромни мащаби.
Системата Pathways: Основа за мащабиране
Концепцията Pathways, представена от Google през 2021 година, предвиждаше създаването на единна невронна мрежа, способна ефективно да обобщава знания за различни домейни и да изпълнява хиляди задачи едновременно. PaLM стана първото мащабно приложение на тази система: нейното обучение беше разпаралелено върху 6144 специализирани процесора TPU v4, обединени в два облачни клъстера (TPU v4 Pods)[1].
По времето на своето създаване това беше най-голямата конфигурация от TPU, използвана някога за обучение на един модел. Системата постигна рекордна ефективност на използване на хардуерните мощности (57,8% FLOPs), което позволи значително да надмине по мащаб предшестващите проекти и успешно да обучи модел с повече от половин трилион параметъра[3].
Архитектура и обучителни данни
Архитектура на модела
PaLM е плътен (неразреден) езиков модел с архитектура „само декодер" (decoder-only), аналогична на моделите от серията GPT. Тази архитектура е ориентирана към задачи за предсказване на следващия token и е подходяща за генериране на текст. За разлика от стандартната архитектура на transformer, PaLM използва няколко ключови модификации за повишаване на ефективността[1]:
- Паралелни слоеве: Механизмите за attention и напълно свързаните слоеве се изчисляват паралелно, което позволи ускоряване на обучението с около 15%.
- SwiGLU активация: Използване на активационната функция SwiGLU вместо стандартната ReLU, което значително подобри качеството на модела.
Обучителни данни
PaLM беше обучена върху висококачествен корпус от данни с обем 780 милиарда token-а. Наборът от данни беше многоезичен и разнообразен, включващ[1]:
- Висококачествени уеб документи и книги.
- Статии от Уикипедия.
- Диалози от социални мрежи (50% от корпуса).
- Изходен код от GitHub (5% от корпуса).
Около 78% от данните бяха на английски език, а останалите 22% — многоезичен набор. За токенизация беше използвана специална „безпотерна" методика, която запазваше всички интервали (критично за код) и разбиваше неразпознатите Unicode символи на байтове.
Възможности и резултати
Емерджентни способности и few-shot обучение
PaLM демонстрира, че увеличаването на мащаба на модела, обема на данните и изчислителните мощности може да води до емерджентни (неочаквано възникващи) способности. При много задачи производителността на модела нарастваше рязко и нелинейно само при достигане на максимален мащаб, което указваше на появата на нови, непознати досега възможности[3].
Моделът беше оценяван в режим на few-shot обучение (без fine-tuning, с няколко примера в prompt-а) и надмина предишните големи модели (като GPT-3 и LaMDA) на 28 от 29 популярни NLP benchmark-а. При комплексния набор от задачи BIG-bench PaLM стана първият модел, чиито резултати надминаха средното ниво, показано от хора-изпитатели[1].
Разсъждаване по верига от мисли (Chain-of-Thought)
Едно от най-забележителните постижения на PaLM беше способността за многостъпково логическо разсъждаване при използване на техниката „верига от мисли" (chain-of-thought prompting)[1]. Тази методика се състои в предоставяне на модела на примери, в които решението на задачата е разписано стъпка по стъпка. Научавайки се от такива примери, PaLM успя да генерира собствена „верига от мисли" за решаване на нови сложни задачи, като например:
- Математически задачи: При теста GSM8K (задачи от ниво начално училище) PaLM реши 58% от задачите, надминавайки предишния state-of-the-art резултат, постигнат от fine-tuned модел.
- Задачи за здрав разум: Моделът успя да генерира развърнати обяснения за нетривиални задачи, например да тълкува непознати досега шеги.
Тази способност направи процеса на „мислене" на модела по-прозрачен и близък до човешкия.
Генериране на код и многоезичност
Въпреки че изходният код съставляваше само 5% от обучителните данни, PaLM показа ниво, сравнимо със специализирания модел OpenAI Codex при задачи за генериране и трансформация на код. Моделът демонстрира и силни способности при многоезични задачи, включително превод[3].
Еволюция и приемници: Семейството PaLM
PaLM стана основа за цяло семейство от модели, разработени от Google.
PaLM 2
Представеният през май 2023 година PaLM 2 стана по-ефективен и многоезичен приемник. Вместо преследване на количество параметри, акцентът беше изместен към качеството на обучителните данни и ефективността на архитектурата. PaLM 2 е обучен върху текстове на повече от 100 езика и демонстрира подобрени способности в логиката, програмирането и превода[4]. Моделът се предлага в четири размера (от най-малкия към по-големия): Gecko, Otter, Bison и Unicorn. Най-компактният вариант (Gecko) е достатъчно лек за работа на мобилни устройства в офлайн режим.
Специализирани версии
Въз основа на PaLM и PaLM 2 бяха създадени версии за конкретни домейни:
- Med-PaLM 2: Специализиран модел за медицина. Стана първата система с изкуствен интелект, достигнала ниво на експерт при въпроси от лицензионния изпит за лекари в САЩ (USMLE)[4].
- Sec-PaLM 2: Модел, ориентиран към киберсигурността, обучен да открива уязвимости и да анализира зловреден код[5].
PaLM-E: Мултимодална версия
PaLM-E (Pathways Language Model Embodied) — това е мултимодален модел, който обединява езиковия модел PaLM с визуални данни от Vision Transformer (ViT). Това позволява на модела да обработва едновременно текст и изображения, решавайки задачи, свързани с физическия свят, например за управление на роботи[6].
Етични аспекти и ограничения
Създателите на PaLM подчертават необходимостта от отговорен подход към разработването на големи езикови модели. В официалната научна статия беше проведен анализ на възможните отклонения и токсичност в генерирания текст. За осигуряване на прозрачност Google публикува карта на модела (Model Card) и паспорт на данните (Datasheet) за PaLM, в които са документирани характеристиките на dataset-а, резултатите от тестването и установените ограничения[1]. Тези мерки съответстват на съвременните практики за отговорен изкуствен интелект и са насочени към намаляване на рисковете, свързани с предразсъдъци и генериране на вредоносно съдържание.
Препратки
- Официален блог на Google за PaLM
- PaLM API за разработчици
Литература
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Бележки
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]