Големи езикови модели на Google

From Systems analysis Wiki
Jump to navigation Jump to search

Големи езикови модели на Google — това е серия от големи езикови модели (LLM), разработени от различни подразделения на Google, включително Google AI (по-рано Google Brain) и DeepMind. Като един от пионерите в областта на дълбокото обучение и архитектурата Transformer, Google е направил фундаментален принос в развитието на съвременните LLM. Историята на разработката на тези модели отразява пътя от тясноспециализирани системи за разбиране на езика до мащабни мултимодални и агентни системи, които стоят в основата на много продукти на Google и определят вектора на развитие на цялата индустрия за ИИ.

История и еволюция на моделите на Google

Ранни постижения и невронен превод (2011–2016)

Основите за разработката на LLM в Google бяха положени в рамките на проекта Google Brain (2011), посветен на приложението на дълбоки невронни мрежи. Един от първите пробиви беше алгоритъмът Word2Vec (2013), създаден от Томаш Миколов. Той позволи представянето на думи като вектори (embedding-и), отразяващи техния семантичен контекст, което се превърна в базов метод за разбиране на езика в невронните мрежи.

Следващата стъпка беше преходът към модели на последователности като seq2seq (2014), които легнаха в основата на Google Neural Machine Translation (GNMT) (2016). Преминаването на Google Translate към невронна архитектура, базирана на LSTM, значително подобри качеството на машинния превод. Успоредно с това дъщерната компания DeepMind, придобита от Google през 2014 година, демонстрира мощта на дълбокото обучение с победата на системата AlphaGo над световния шампион по го, укрепвайки вярата в потенциала на ИИ.

Революцията Transformer и раждането на BERT (2017–2018)

През 2017 година изследователи от Google Brain представиха архитектурата Transformer в статията „Attention Is All You Need". Тази архитектура, основана на механизма на самовнимание (self-attention), позволи обработката на последователности паралелно, а не последователно, което се превърна в революция в NLP и в основа за всички съвременни LLM.

По вълната на този успех, през 2018 година Google представи модела BERT (Bidirectional Encoder Representations from Transformers). BERT беше първият дълбоко двупосочен модел, който отчиташе контекста на думата едновременно от ляво и от дясно. Това му позволи да постигне рекордни резултати при множество задачи за разбиране на езика (GLUE, SQuAD) и да установи нов индустриален стандарт. BERT беше пуснат в две версии (BASE с 110 млн параметра и LARGE с 340 млн) с отворен код и тегла, което допринесе за масовото му разпространение. От 2019 година BERT започна да се използва в Google Търсене за по-добро разбиране на заявките.

Нарастване на мащаба и ерата на диалоговите модели (2019–2022)

След BERT Google продължи експериментите с мащаб и архитектура:

  • T5 (Text-to-Text Transfer Transformer, 2019): Унифициран модел, който третира всяка NLP-задача като преобразуване „текст-в-текст". Обучен на гигантски корпус C4 (Colossal Clean Crawled Corpus), T5 също беше пуснат в отворен достъп в няколко размера (до 11 млрд параметра).
  • Meena (2020): Първият специализиран диалогов модел на Google с 2,6 млрд параметра, показал високо качество на водене на отворен диалог.
  • LaMDA (Language Model for Dialogue Applications, 2021): Семейство от диалогови модели (до 137 млрд параметра), обучени на огромен корпус от диалози (1,56 трлн думи). LaMDA беше насочена към създаването на по-естествени и смислени разговори и стана известна на широката публика, след като инженер от Google заяви, че тя притежава „разумност".
  • Gopher и Chinchilla (DeepMind, 2021–2022): Успоредно с това DeepMind изследваше законите на мащабиране. Моделът Gopher (280 млрд параметра) показа как мащабът влияе върху качеството. А моделът Chinchilla (70 млрд) демонстрира, че за оптимална производителност е по-важен не максималният брой параметри, а правилният баланс между размера на модела и обема на обучителните данни. Този извод стана известен като „законът на Chinchilla" и повлия на стратегията за обучение на LLM в цялата индустрия.

Епохата на свръхголемите и мултимодалните модели (2022 – до днес)

  • PaLM (Pathways Language Model, 2022): Към момента на обявяването — най-големият плътен (dense) модел на Google с 540 млрд параметра, обучен върху новата разпределена инфраструктура Pathways. PaLM демонстрира пробивни способности за логически разсъждения, особено с използването на техниката Chain-of-Thought (CoT) prompting. На негова основа бяха създадени специализирани версии като Med-PaLM за медицина. През 2023 година беше пусната подобрена версия PaLM 2 (~340 млрд параметра), която легна в основата на обновения чат-бот Bard.
  • Gemini (2023 – до днес): Ново поколение модели, създадено от обединения екип на Google DeepMind. Gemini беше проектирана от самото начало като нативна мултимодална система, способна да обработва текст, код, изображения, аудио и видео. Пусната в няколко версии:
    • Gemini Ultra: Най-мощният модел за сложни задачи.
    • Gemini Pro: Универсален модел за широк кръг задачи.
    • Gemini Nano: Компактен модел за работа на мобилни устройства.

През 2024–2025 година семейството беше разширено с версиите Gemini 1.5 (с контекстен прозорец до 1 млн токена) и Gemini 2.0, получила агентни възможности.

Архитектура и технически особености

Фундамент: Encoder-и, decoder-и и хибриди

Google използва различни варианти на архитектурата Transformer в зависимост от задачата:

  • Encoder-и (Encoder-only): Модели от типа BERT. Те обработват целия текст наведнъж и създават богато контекстуално представяне. Идеални за задачи по анализ и разбиране на текст (класификация, извличане на обекти), но не и за генерация.
  • Decoder-и (Decoder-only): Модели от типа LaMDA и PaLM (аналогично на GPT). Те са авторегресивни, тоест предсказват текст токен по токен. Това са естествени генератори, отлично подходящи за продължаване на текст, диалози и отговори на въпроси.
  • Encoder-Decoder-и (Encoder-Decoder): Модели от типа T5 и GNMT. Те имат и двете части: encoder-ът обработва входната последователност, а decoder-ът генерира изходната. Това е универсална архитектура за задачи по преобразуване, като превод или резюмиране.

Мащаб: Параметри, данни и инфраструктура

Успехът на Google в LLM до голяма степен се дължи на три фактора:

  1. Мащаб на моделите: Систематично увеличаване на броя параметри от милиони (BERT) до стотици милиарди (PaLM, Gemini).
  2. Мащаб на данните: Достъп до един от най-големите в света корпуси от данни (уеб-индексът на Google, YouTube, Google Books), което позволява обучение на модели върху трилиони токена.
  3. Инфраструктура: Използване на собствени специализирани чипове — Tensor Processing Unit (TPU) — и разпределената система Pathways, които позволяват ефективно и стабилно обучение на свръхголеми модели.

Мултимодалност и агентност

Най-новите модели на Google, особено Gemini, се движат в посока на дълбока мултимодалност и агентност.

  • Нативна мултимодалност означава, че един модел от самото начало е обучен да разбира и комбинира различни типове данни (текст, изображения, аудио), а не просто да свързва отделни модули.
  • Агентност (Agentic AI) — това е способността на модела не просто да отговаря на заявки, а самостоятелно да планира и изпълнява последователност от действия за постигане на цел (например да извиква външни инструменти като търсене или калкулатор).

Обобщена таблица на ключовите модели

Сравнение на основните езикови модели на Google
Модел Година на пускане Параметри (оценка) Архитектура Ключови особености
BERT 2018 110–340 млн Encoder Двупосочно разбиране на контекста, SOTA при NLP задачи.
T5 2019 60 млн – 11 млрд Encoder-Decoder Унифициран подход „текст-в-текст" за всички задачи.
LaMDA 2021 137 млрд Decoder Специализация в отворени, смислени диалози.
PaLM 2022 540 млрд Decoder Пробив в логическите разсъждения (Chain-of-Thought), мащабно обучение.
Chinchilla 2022 70 млрд Decoder „Compute-optimal" модел, доказал важността на баланса между данни и параметри.
Gemini 1.0 2023 до ~1 трлн (Ultra) Мултимодален (вероятно MoE) Нативна мултимодалност, SOTA при множество benchmark-и (MMLU).
Gemini 1.5 2024 Не е разкрито Мултимодален (MoE) Контекстен прозорец до 1–2 млн токена, висока ефективност.
Gemini 2.0 2024 Не е разкрито Мултимодален + Tools Вградени агентни възможности, генерация на изображения/аудио.

Приложение в продуктите и екосистемата

Google активно интегрира своите LLM в цялата си продуктова линия:

  • Google Търсене: BERT, MUM и Gemini се използват за по-добро разбиране на сложни заявки и предоставяне на директни отговори във формат AI Overviews (по-рано SGE).
  • Google Assistant и Bard (сега Gemini): Преход от прости гласови команди към пълноценни диалогови асистенти на базата на LaMDA, PaLM 2 и Gemini.
  • Google Workspace: Функциите Duet AI (сега Gemini for Workspace) помагат за писане на писма в Gmail, създаване на текстове в Docs и генериране на презентации в Slides.
  • Android: Gemini Nano осигурява работата на ИИ-функции локално на устройства като Pixel, за повишаване на поверителността и скоростта.
  • Google Cloud AI: Платформата Vertex AI предоставя на предприятията достъп до моделите PaLM и Gemini чрез API за създаване на собствени приложения.

Роля в конкурентната среда

Google е един от ключовите участници в „надпреварата за ИИ", където нейните основни конкуренти са OpenAI (с подкрепата на Microsoft) и Meta.

  • Съперничество с OpenAI: Въпреки че Google беше пионер в много фундаментални технологии (включително Transformer), пускането на ChatGPT в края на 2022 година принуди Google да ускори извеждането на своите продукти на пазара (например Bard). Конкуренцията се разгръща в областта на качеството на моделите (Gemini Ultra срещу GPT-4), размера на контекстния прозорец и удобството на API.
  • Контраст с Meta: Meta залага на отворен изходен код (моделите LLaMA), създавайки мощна алтернатива на затворените модели на Google и OpenAI. В отговор на това Google също започна да пуска отворени модели като Gemma, за да подкрепи общността на разработчиците и да не отстъпи екосистемата на Meta.
  • Стратегически съюзи: Google инвестира в други участници, например в стартъпа Anthropic (създатели на модела Claude), за да диверсифицира подходите и да укрепи позициите си в облачната конкуренция.

Литература

  • Vaswani, A. et al. (2017). Attention Is All You Need. NIPS.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR.
  • Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
  • Hoffmann, R. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. JMLR.
  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.

Връзки

  • Официален портал Google AI
  • Официален сайт Google DeepMind