Falcon (familia de modelos de lenguaje)
Falcon es una familia de grandes modelos de lenguaje (LLM) de código abierto, desarrollada por el Instituto de Innovación Tecnológica (Technology Innovation Institute, TII) en Abu Dabi, EAU[1]. Los modelos Falcon se han convertido en una contribución significativa al desarrollo de la inteligencia artificial accesible, ocupando regularmente altas posiciones en clasificaciones de rendimiento como la Open LLM Leaderboard de Hugging Face[2].
La familia incluye modelos de diversos tamaños y especializaciones, desde versiones compactas para ejecutarse en hardware de consumo hasta los modelos más grandes que compiten con los desarrollos de las principales empresas tecnológicas. Las características clave de Falcon son su arquitectura avanzada, el entrenamiento en el conjunto de datos de alta calidad RefinedWeb y una licencia predominantemente abierta, Apache 2.0[3].
Historia y desarrollo
La primera versión de los modelos Falcon fue presentada en junio de 2023. En septiembre de 2023, se lanzó el modelo Falcon-180B, que en ese momento se convirtió en el LLM abierto más grande y potente del mundo, superando en número de parámetros a Llama 2 70B de Meta[4][5].
El desarrollo posterior de la familia incluyó el lanzamiento de nuevas generaciones y versiones especializadas:
- Falcon 2 (2024): La segunda iteración con capacidades mejoradas, incluida una versión multimodal Falcon 2 11B VLM (Vision Language Model)[6].
- Falcon 3 (diciembre de 2024): La última generación, entrenada con 14 billones de tokens, con funciones multimodales ampliadas y optimizada para funcionar en hardware ligero, incluidos portátiles[7][8].
- Modelos especializados: Se han lanzado modelos adaptados para tareas específicas, como Falcon Arabic y Falcon Mamba.
| Modelo | Parámetros (miles de millones) | Características clave | Licencia |
|---|---|---|---|
| Falcon-180B | 180 | El modelo más grande de la primera generación; entrenado con 3,5 billones de tokens; supera a GPT-3.5[4]. | TII Falcon License 1.0 (con restricciones para uso comercial)[5] |
| Falcon-40B | 40 | Modelo base de alto rendimiento; entrenado con 1 billón de tokens. | Apache 2.0 |
| Falcon-7B | 7 | Modelo compacto que requiere ~15 GB de memoria GPU; adecuado para hardware de consumo[2]. | Apache 2.0 |
| Falcon-1.3B | 1.3 | El modelo más pequeño para dispositivos con recursos limitados. | Apache 2.0 |
| Falcon 2 11B | 11 | Segunda generación; compite con Llama 3 8B y Gemma 7B; existe una versión multimodal (VLM)[6]. | Apache 2.0 |
| Falcon 3 | N/D | Entrenado con 14 billones de tokens; multimodalidad (texto, imagen, audio, video); funciona en portátiles[7]. | Apache 2.0 |
| Falcon Arabic | 7 | Modelo especializado para el idioma árabe (estándar y dialectos); arquitectura de Falcon 3[9]. | Apache 2.0 |
| Falcon Mamba | N/D | Modelo experimental basado en la arquitectura Mamba (SSM) en lugar de un transformador[10]. | Apache 2.0 |
Arquitectura y características técnicas
Arquitectura Transformer
La mayoría de los modelos Falcon se basan en una arquitectura de transformador de tipo "solo decodificador". Las decisiones arquitectónicas clave incluyen:
- Multi-Query Attention (MQA): A diferencia del Multi-Head Attention estándar, donde cada "cabeza" tiene su propio conjunto de clave-valor (key/value), en MQA todas las cabezas de atención comparten un único conjunto de clave y valor. Esto reduce significativamente el consumo de memoria y acelera la inferencia sin una pérdida sustancial de calidad[2].
- Rotary Positional Embeddings (RoPE): Para codificar la información sobre la posición de los tokens se utiliza RoPE, al igual que en otros LLM modernos.
- FlashAttention: Se utiliza para optimizar los cálculos del mecanismo de atención.
Arquitectura Mamba (State Space Model)
El modelo Falcon Mamba es innovador, ya que se aleja de la arquitectura de transformador tradicional en favor del State Space Model (SSM). La arquitectura Mamba procesa secuencias de datos de forma lineal, lo que le permite ser significativamente más eficiente al trabajar con contextos muy largos y requerir menos recursos computacionales en comparación con los transformadores[10].
Datos de entrenamiento
La base para el entrenamiento de los modelos Falcon es el conjunto de datos de alta calidad RefinedWeb, creado por TII[5]. Consiste en billones de tokens extraídos de Common Crawl, aplicando una estricta filtración y deduplicación para mejorar la calidad.
- Para Falcon-180B se utilizó un conjunto de datos ampliado de 3,5 billones de tokens, compuesto en un ~85% por RefinedWeb, e incluía también datos seleccionados de libros, diálogos y código[4].
- Falcon Arabic fue entrenado con un conjunto de datos de árabe nativo (no traducido) de alta calidad, que abarca tanto el árabe estándar moderno como dialectos regionales[11].
Modelos especializados
Falcon Arabic
Falcon Arabic es un modelo de 7 mil millones de parámetros, especialmente optimizado para trabajar con el idioma árabe. Demuestra resultados sobresalientes en los benchmarks de árabe (Open Arabic LLM Leaderboard) y es capaz de comprender tanto el árabe estándar moderno (MSA) como numerosos dialectos regionales. Esto permite que el modelo proporcione respuestas culturalmente conscientes y precisas para los usuarios de habla árabe[9]. En términos de rendimiento, supera a modelos hasta 10 veces más grandes en tamaño[12].
Capacidades multimodales
- Falcon 2 11B VLM se convirtió en el primer modelo multimodal de la familia, capaz de procesar tanto texto como imágenes[6].
- Falcon 3 amplió significativamente estas capacidades, añadiendo soporte para video y audio. Se planea que en enero de 2025 esté disponible un modo de voz completo[7].
Rendimiento y problemas
Comparación con la competencia
Los modelos Falcon muestran consistentemente un alto rendimiento.
- Falcon-180B supera a GPT-3.5 y Llama 2 70B en la mayoría de los benchmarks académicos, como MMLU, HellaSwag y LAMBADA, aunque es inferior a GPT-4[4].
- Falcon 2 11B demuestra un rendimiento a la par o superior al de Meta Llama 3 8B y Google Gemma 7B[6].
- Falcon 3, en el momento de su lanzamiento, ocupó el primer lugar en la clasificación global de Hugging Face entre los modelos de su tamaño[7].
Limitaciones y problemas
- Calidad en diferentes idiomas: La mayor parte de los datos de entrenamiento está en inglés[13]. Debido a esto, la calidad del rendimiento de los modelos en otros idiomas, incluido el ruso, puede ser significativamente inferior.[14].
- Alucinaciones: Como todos los LLM, los modelos Falcon son propensos a generar información inexacta o inventada (alucinaciones), lo que requiere un enfoque cauteloso al utilizarlos en aplicaciones de misión crítica[15].
- Restricciones de licencia: Aunque la mayoría de los modelos se distribuyen bajo la licencia Apache 2.0, el modelo insignia Falcon-180B tiene su propia licencia, la TII Falcon LLM License, que impone obligaciones de pago de regalías por uso comercial con ingresos superiores a 1 millón de dólares, lo que limita su aplicación en los negocios[5][16].
Enlaces externos
Bibliografía
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Almazrouei, E. et al. (2023). The Falcon Series of Open Language Models. arXiv:2311.16867.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Penedo, G. et al. (2023). The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only. arXiv:2306.01116.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
Referencias
- ↑ «En los EAU presentaron el gran modelo de lenguaje Falcon 2». Interfax. [1]
- ↑ 2.0 2.1 2.2 «Falcon: The "T-shirt-sized" 7B and 40B models that are democratizing the LLM landscape». Hugging Face Blog. [2]
- ↑ «Falcon Model». Hugging Face Transformers documentation. [3]
- ↑ 4.0 4.1 4.2 4.3 «Falcon 180B open-source language model outperforms GPT-3.5 and Llama 2». The Decoder. [4]
- ↑ 5.0 5.1 5.2 5.3 «Falcon 180B: el modelo de lenguaje abierto más grande del mundo». Neurohive. [5]
- ↑ 6.0 6.1 6.2 6.3 «Falcon 2: El Instituto de Innovación Tecnológica de los EAU lanza una nueva serie de modelos de IA que supera a Llama 3 de Meta». AETOSWire. [6]
- ↑ 7.0 7.1 7.2 7.3 «Falcon 3: El Instituto de Innovación Tecnológica de los EAU lanza los modelos de IA pequeños más potentes del mundo, capaces de funcionar incluso en dispositivos ligeros, incluidos portátiles». AETOSWire. [7]
- ↑ «Technology Innovation Institute launches Falcon 3 model to enhance access to AI through light infrastructures». Abu Dhabi Media Office. [8]
- ↑ 9.0 9.1 «Falcon Arabic». FalconLLM TII. [9]
- ↑ 10.0 10.1 «Falcon Mamba: un nuevo paso en el desarrollo de modelos de lenguaje sin mecanismo de atención». Pikabu. [10]
- ↑ «Middle East's Leading AI Powerhouse TII Launches Two New AI Models». TII News. [11]
- ↑ «Middle East's leading AI powerhouse, TII,launches two new AI models». Falcon Foundation. [12]
- ↑ Almazrouei, Ebtesam, Hamza Alobeidli, Abdulaziz Alshamsi, Alessandro Cappelli, Ruxandra Cojocaru, Mérouane Debbah, Étienne Goffinet, и др. «The Falcon Series of Open Language Models». arXiv, 29 ноябрь 2023 г. https://doi.org/10.48550/arXiv.2311.16867.[13]
- ↑ «El principal productor de IA en Oriente Medio, TII, lanza dos nuevos modelos de IA: Falcon Arabic, el primer modelo en lengua árabe de la serie Falcon, y Falcon H1, un modelo de alto rendimiento que es el mejor de su clase». AETOSWire. [14]
- ↑ «Falcon-180B: reseña, puesta en marcha y primeras impresiones». Habr. [15]
- ↑ «Falcon 180B License Discussion». Hugging Face. [16]