Falcon

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

Falcon — это семейство больших языковых моделей (LLM) с открытым исходным кодом, разработанное Институтом технологических инноваций (Technology Innovation Institute, TII) в Абу-Даби, ОАЭ[1]. Модели Falcon стали значимым вкладом в развитие доступного искусственного интеллекта, регулярно занимая высокие позиции в рейтингах производительности, таких как Open LLM Leaderboard от Hugging Face[2].

Семейство включает модели различных размеров и специализаций, от компактных версий для запуска на потребительском оборудовании до крупнейших моделей, конкурирующих с разработками ведущих технологических компаний. Ключевыми особенностями Falcon являются передовая архитектура, обучение на высококачественном датасете RefinedWeb и преимущественно открытая лицензия Apache 2.0[3].

История и развитие

Первая версия моделей Falcon была представлена в июне 2023 года. В сентябре 2023 года была выпущена модель Falcon-180B, которая на тот момент стала самой крупной и производительной открытой LLM в мире, превзойдя по количеству параметров Llama 2 70B от Meta[4][5].

Дальнейшее развитие семейства включало выпуск новых поколений и специализированных версий:

  • Falcon 2 (2024 г.): Вторая итерация с улучшенными возможностями, включая мультимодальную версию Falcon 2 11B VLM (Vision Language Model)[6].
  • Falcon 3 (декабрь 2024 г.): Последнее поколение, обученное на 14 трлн токенов, с расширенными мультимодальными функциями и оптимизированное для работы на легковесном оборудовании, включая ноутбуки[7][8].
  • Специализированные модели: Выпущены модели, адаптированные под конкретные задачи, такие как Falcon Arabic и Falcon Mamba.
Основные модели семейства Falcon
Модель Параметры (млрд) Ключевые особенности Лицензия
Falcon-180B 180 Крупнейшая модель первого поколения; обучение на 3.5 трлн токенов; превосходит GPT-3.5[4]. TII Falcon License 1.0 (с ограничениями для коммерции)[5]
Falcon-40B 40 Базовая высокопроизводительная модель; обучение на 1 трлн токенов. Apache 2.0
Falcon-7B 7 Компактная модель, требующая ~15 Гб GPU-памяти; подходит для потребительского оборудования[2]. Apache 2.0
Falcon-1.3B 1.3 Наименьшая модель для устройств с ограниченными ресурсами. Apache 2.0
Falcon 2 11B 11 Второе поколение; конкурирует с Llama 3 8B и Gemma 7B; существует мультимодальная версия (VLM)[6]. Apache 2.0
Falcon 3 Н/Д Обучена на 14 трлн токенов; мультимодальность (текст, изображение, аудио, видео); работает на ноутбуках[7]. Apache 2.0
Falcon Arabic 7 Специализированная модель для арабского языка (стандартный и диалекты); архитектура Falcon 3[9]. Apache 2.0
Falcon Mamba Н/Д Экспериментальная модель на архитектуре Mamba (SSM) вместо трансформера[10]. Apache 2.0

Архитектура и технические особенности

Архитектура Transformer

Большинство моделей Falcon построены на архитектуре трансформера типа "только декодер". Ключевые архитектурные решения включают:

  • Multi-Query Attention (MQA): В отличие от стандартного Multi-Head Attention, где у каждой "головы" есть свой набор ключ-значение (key/value), в MQA все головы внимания совместно используют один набор ключа и значения. Это значительно сокращает потребление памяти и ускоряет инференс без существенной потери качества[2].
  • Rotary Positional Embeddings (RoPE): Для кодирования информации о позиции токенов используется RoPE, как и в других современных LLM.
  • FlashAttention: Используется для оптимизации вычислений механизма внимания.

Архитектура Mamba (State Space Model)

Модель Falcon Mamba является инновационной, поскольку отходит от традиционной архитектуры трансформера в пользу State Space Model (SSM). Архитектура Mamba обрабатывает последовательности данных линейно, что позволяет ей быть значительно эффективнее при работе с очень длинными контекстами и требовать меньше вычислительных ресурсов по сравнению с трансформерами[10].

Обучающие данные

Основой для обучения моделей Falcon служит высококачественный датасет RefinedWeb, созданный TII[5]. Он состоит из триллионов токенов, извлеченных из Common Crawl, с применением строгой фильтрации и дедупликации для повышения качества.

  • Для Falcon-180B использовался расширенный датасет на 3.5 трлн токенов, который на ~85% состоял из RefinedWeb, а также включал отобранные данные из книг, диалогов и кода[4].
  • Falcon Arabic был обучен на высококачественном нативном (не переводном) арабском датасете, охватывающем как современный стандартный арабский, так и региональные диалекты[11].

Специализированные модели

Falcon Arabic

Falcon Arabic — это модель с 7 млрд параметров, специально оптимизированная для работы с арабским языком. Она демонстрирует выдающиеся результаты на арабских бенчмарках (Open Arabic LLM Leaderboard) и способна понимать как Современный стандартный арабский (MSA), так и множество региональных диалектов. Это позволяет модели обеспечивать культурно-осведомленные и точные ответы для арабоязычных пользователей[9]. По производительности она превосходит модели, которые до 10 раз крупнее её по размеру[12].

Мультимодальные возможности

  • Falcon 2 11B VLM стала первой мультимодальной моделью в семействе, способной обрабатывать как текст, так и изображения[6].
  • Falcon 3 значительно расширил эти возможности, добавив поддержку видео и аудио. Планируется, что в январе 2025 года будет доступен полноценный голосовой режим[7].

Производительность и проблемы

Сравнение с конкурентами

Модели Falcon стабильно показывают высокую производительность.

  • Falcon-180B превосходит GPT-3.5 и Llama 2 70B на большинстве академических бенчмарков, таких как MMLU, HellaSwag и LAMBADA, хотя и уступает GPT-4[4].
  • Falcon 2 11B демонстрирует производительность на уровне или выше, чем Meta Llama 3 8B и Google Gemma 7B[6].
  • Falcon 3 на момент выпуска занял первое место в глобальном рейтинге Hugging Face среди моделей своего размера[7].

Ограничения и проблемы

  • Качество на разных языках: Основная часть обучающих данных является англоязычной[13]. Из-за этого качество работы моделей на других языках, включая русский, может быть значительно ниже.[14].
  • Галлюцинации: Как и все LLM, модели Falcon подвержены генерации неточной или выдуманной информации (галлюцинациям), что требует осторожного подхода при использовании в критически важных приложениях[15].
  • Ограничения лицензирования: Хотя большинство моделей распространяются под лицензией Apache 2.0, флагманская модель Falcon-180B имеет собственную лицензию TII Falcon LLM License, которая накладывает обязательства по выплате роялти для коммерческого использования при доходе свыше 1 млн долларов, что ограничивает её применение в бизнесе[5][16].

См. также

Ссылки

Литература

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Almazrouei, E. et al. (2023). The Falcon Series of Open Language Models. arXiv:2311.16867.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Penedo, G. et al. (2023). The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only. arXiv:2306.01116.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.

Примечания

  1. «В ОАЭ представили большую языковую модель Falcon 2». Интерфакс. [1]
  2. 2,0 2,1 2,2 «Falcon: The "T-shirt-sized" 7B and 40B models that are democratizing the LLM landscape». Hugging Face Blog. [2]
  3. «Falcon Model». Hugging Face Transformers documentation. [3]
  4. 4,0 4,1 4,2 4,3 «Falcon 180B open-source language model outperforms GPT-3.5 and Llama 2». The Decoder. [4]
  5. 5,0 5,1 5,2 5,3 «Falcon 180B: крупнейшая в мире открытая языковая модель». Neurohive. [5]
  6. 6,0 6,1 6,2 6,3 «Falcon 2: Институт технологических инноваций ОАЭ выпускает новую серию ИИ-моделей, превосходящую Llama 3 от Meta». AETOSWire. [6]
  7. 7,0 7,1 7,2 7,3 «Falcon 3: Институт технологических инноваций ОАЭ запускает самые мощные в мире малые ИИ-модели». AETOSWire. [7]
  8. «Technology Innovation Institute launches Falcon 3 model to enhance access to AI through light infrastructures». Abu Dhabi Media Office. [8]
  9. 9,0 9,1 «Falcon Arabic». FalconLLM TII. [9]
  10. 10,0 10,1 «Falcon Mamba — новый шаг в развитии языковых моделей без механизма внимания». Pikabu. [10]
  11. «Middle East's Leading AI Powerhouse TII Launches Two New AI Models». TII News. [11]
  12. «Middle East's leading AI powerhouse, TII,launches two new AI models». Falcon Foundation. [12]
  13. Almazrouei, Ebtesam, Hamza Alobeidli, Abdulaziz Alshamsi, Alessandro Cappelli, Ruxandra Cojocaru, Mérouane Debbah, Étienne Goffinet, и др. «The Falcon Series of Open Language Models». arXiv, 29 ноябрь 2023 г. https://doi.org/10.48550/arXiv.2311.16867.[13]
  14. «Ведущий производитель ИИ на Ближнем Востоке, TII, запускает две новые модели ИИ». AETOSWire. [14]
  15. «Falcon-180B: обзор, запуск и первые впечатления». Habr. [15]
  16. «Falcon 180B License Discussion». Hugging Face. [16]