Yi (01.AI) (IT)
Yi — famiglia di Large Language Model (LLM) e modelli visivo-linguistici (Vision-Language Model, VLM), sviluppata dalla società 01.AI (零一万物) sotto la guida di Kai-Fu Lee. I modelli sono stati addestrati da zero su un corpus bilingue di alta qualità (inglese e cinese) di 3,1 trilioni di token e comprendono varianti per la generazione di testo, l'elaborazione di contesti lunghi (fino a 200 mila token), l'input multimodale (testo + immagini), la generazione di codice e l'inferenza efficiente basata sull'architettura Mixture-of-Experts (MoE). Le varianti open sono distribuite con licenza Apache 2.0 con autorizzazione all'uso commerciale; i modelli flagship proprietari (Yi-Large, Yi-Lightning) sono disponibili tramite API.[1][2][3]
Storia e cronologia dello sviluppo
La società 01.AI è stata fondata nel marzo 2023 da Kai-Fu Lee, ex responsabile di Microsoft Research Asia e Google China, con sede a Pechino. L'obiettivo dell'azienda è lo sviluppo di LLM efficienti con enfasi sulla qualità dei dati e sull'ottimizzazione ingegneristica dell'infrastruttura. A novembre 2023, 01.AI ha raggiunto lo status di "unicorno" (valutazione superiore a 1 miliardo di dollari) dopo un round di finanziamento con la partecipazione di Alibaba.[4][5]
Prima generazione (2023–2024)
I primi modelli open Yi-6B e Yi-34B sono stati presentati il 2 novembre 2023. Nelle settimane successive la gamma è stata integrata con varianti a contesto di 200 mila token (5 novembre 2023), varianti chat e modelli quantizzati (23 novembre 2023). Nel gennaio 2024 sono usciti i modelli multimodali Yi-VL-6B e Yi-VL-34B. Nel marzo 2024 è stato presentato il modello Yi-9B, ottenuto tramite depth upscaling da Yi-6B, ed è stato pubblicato il rapporto tecnico arXiv:2403.04652.[1][2]
Yi-1.5 e modelli specializzati (2024)
Il 13 maggio 2024 è stata rilasciata la serie Yi-1.5 (6B/9B/34B) — risultato del pre-addestramento continuo su ulteriori 500 miliardi di token e del fine-tuning su 3 milioni di esempi di istruzioni. Tra maggio e giugno 2024 è stato presentato il modello proprietario chiuso Yi-Large con accesso API, posizionato come SOTA. Nel settembre 2024 è uscita la serie specializzata Yi-Coder (1.5B/9B) per la generazione di codice con un contesto di 128 mila token e supporto a 52 linguaggi di programmazione.[1][6][7]
Yi-Lightning (2024)
Nell'ottobre 2024 è stato presentato il modello flagship Yi-Lightning basato sull'architettura Mixture-of-Experts (MoE), ottimizzato per velocità ed efficienza di inferenza. Yi-Lightning ha conquistato il 6° posto nella classifica generale di LMSYS Chatbot Arena (Elo 1287), il 2° posto per la lingua cinese e il 3°–4° posto per matematica e coding. Il rapporto tecnico è stato pubblicato nel dicembre 2024 (arXiv:2412.01253).[8]
Cambio di strategia (2025)
Nel marzo 2025 la società 01.AI ha annunciato la cessazione del pre-addestramento di nuovi grandi modelli linguistici e si è concentrata su applicazioni enterprise, sistemi multi-agente e sulla piattaforma WorldWise LLM Platform 2.5 basata su modelli di terze parti (incluso DeepSeek).[4]
Cronologia riassuntiva
| Data | Evento |
|---|---|
| Novembre 2023 | Rilascio di Yi-6B e Yi-34B (base, chat, varianti 200K) |
| Gennaio 2024 | Modelli multimodali Yi-VL-6B e Yi-VL-34B |
| Marzo 2024 | Yi-9B (depth-upscaled); pubblicazione del rapporto tecnico arXiv:2403.04652 |
| Maggio 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (chiuso, API) |
| Settembre 2024 | Yi-Coder-1.5B/9B (specializzazione nel codice, contesto 128K) |
| Ottobre 2024 | Yi-Lightning (architettura MoE, modello flagship) |
| Dicembre 2024 | Pubblicazione del rapporto tecnico Yi-Lightning (arXiv:2412.01253) |
| Marzo 2025 | Cessazione del pre-addestramento di nuovi LLM; focus su soluzioni enterprise |
Fondamenti teorici e architettura
Architettura di base
Tutti i modelli della famiglia Yi si basano sull'architettura decoder-only Transformer, descritta nel lavoro di Vaswani et al.[9] I modelli sono addestrati da zero e non derivano da LLaMA, nonostante la somiglianza nell'implementazione.[1]
Il meccanismo di base di Multi-Head Self-Attention è descritto dalla formula:
dove , , sono rispettivamente le matrici delle query, delle chiavi (keys) e dei valori (values), e è la dimensione delle chiavi.[9]
Principali modifiche architetturali di Yi:[1]
- Grouped-Query Attention (GQA) — suddivisione delle query-head in gruppi con key/value-head condivise, che riduce il consumo di memoria mantenendo la qualità.
- Attivazione SwiGLU — sostituzione della ReLU/GELU standard; riduce la dimensione delle attivazioni a 8/3 della dimensione dello strato nascosto (hidden size).
- Rotary Position Embedding (RoPE) con frequenza base adattata (adjusted base frequency, ABF), che consente l'estensione del contesto senza modifiche architetturali.
- Vocabolario (vocabulary): 64.000 token basati su BPE (SentencePiece) con suddivisione dei numeri in cifre e unicode-byte fallback per i caratteri rari.
Configurazioni dei modelli base
Parametri architetturali dal rapporto tecnico arXiv:2403.04652:[1]
| Parametro | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Numero di strati | 32 | 60 |
| Lunghezza pre-addestramento (Pretrain Seq. Len) | 4096 | 4096 |
| Tasso di apprendimento massimo (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Fonte: arXiv:2403.04652, tabella dei parametri.[1]
Architettura Yi-Lightning (MoE)
Yi-Lightning (2024) utilizza un'architettura Mixture-of-Experts (MoE) migliorata con le seguenti caratteristiche:[8]
- Fine-grained expert segmentation — suddivisione a grana fine dei blocchi FFN in esperti per aumentare la specializzazione.
- Bilanciamento del carico multilivello — combinazione di Switch-Transformer (ST), Expert Parallel (EP) e Partitioned EP (PEP) loss per una distribuzione uniforme dei token tra gli esperti.
- Attenzione ibrida — alternanza di 3 strati con sliding window e 1 strato con full attention, con riutilizzo della KV-cache tra gli strati.
- Riduzione della memoria KV-cache dell'82,8% rispetto all'approccio standard nell'elaborazione di sequenze lunghe.
- Finestra di contesto estesa a 64 mila token.
Il numero esatto di esperti e il numero totale di parametri di Yi-Lightning non sono stati divulgati in fonti pubbliche.[8]
Varianti multimodali (Yi-VL)
Nei modelli multimodali Yi-VL, il modello linguistico è collegato all'encoder visivo CLIP ViT-H/14 tramite una proiezione MLP. L'immagine viene trasformata dall'encoder visivo in una sequenza di embedding , che vengono forniti al modello linguistico insieme ai token testuali. L'addestramento avviene in tre fasi con aumento della risoluzione: 224×224 → 448×448 pixel.[1]
Pipeline di addestramento e allineamento
Pre-addestramento (Pre-training)
I modelli base Yi-6B e Yi-34B sono stati pre-addestrati su un corpus bilingue di 3,1 trilioni di token. I dati passano attraverso una pipeline a cascata di filtraggio e deduplicazione: filtri euristici, scorer addestrati (perplexity, quality, coherence, safety), clustering e deduplicazione MinHash. Le fonti includono Common Crawl, libri e articoli scientifici.[1]
Per Yi-1.5 è stato eseguito un pre-addestramento continuo (continued pre-training) su ulteriori 500 miliardi di token di corpus di alta qualità.[7]
Fine-tuning supervisionato (Supervised Fine-Tuning, SFT)
Le varianti chat della prima generazione sono state sottoposte a fine-tuning su un insieme piccolo ma accuratamente curato — meno di 10 mila esempi multi-turn, ciascuno verificato e revisionato manualmente da ingegneri di machine learning. Per Yi-1.5 il volume dei dati SFT è stato aumentato a 3 milioni di esempi.[1][7]
Allineamento tramite Reinforcement Learning
Per Yi-Lightning viene applicato un processo di allineamento multi-fase: SFT seguito da RLHF/DPO. I dati sintetici vengono generati utilizzando Monte Carlo Tree Search (MCTS). Il framework di sicurezza RAISE implementa una protezione a quattro livelli: filtraggio dei dati di pre-addestramento, safety fine-tuning, controllo in ingresso dei prompt e controllo in uscita delle risposte.[8]
Estensione del contesto
L'estensione della finestra di contesto a 200 mila token è realizzata tramite un leggero pre-addestramento continuo su 5 miliardi di token (libri + domande-risposte sintetiche) utilizzando la tecnica RoPE ABF. Dopo la messa a punto, la precisione nel task Needle-in-a-Haystack (ricerca di un frammento target in un testo lungo) raggiunge il 99,8%.[1][2]
Scalabilità in profondità (Depth Upscaling)
Yi-9B è stato ottenuto duplicando gli strati 12–28 del modello base Yi-6B con successivo pre-addestramento su 800 miliardi di token. Il metodo consente di aumentare la capacità del modello senza addestrarlo da zero.[1]
Composizione della famiglia di modelli
Modelli linguistici principali
| Modello | Parametri | Tipo | Contesto | Data di rilascio | Licenza | Note |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 mld / 34 mld | Base / Chat | 4K (est. a 32K) | Novembre 2023 | Apache 2.0 | Modelli base addestrati da zero |
| Yi-6B-200K / Yi-34B-200K | 6 mld / 34 mld | Base | 200K | Novembre 2023 | Apache 2.0 | Pre-addestramento continuo su sequenze lunghe |
| Yi-9B | 9 mld | Base | 4K (est. a 200K) | Marzo 2024 | Apache 2.0 | Depth-upscale da Yi-6B + 800 mld di token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 mld | Base / Chat | 4K / 16K / 32K | Maggio 2024 | Apache 2.0 | +500 mld di token + 3 mln di esempi SFT |
| Yi-Large | ~1 tln (MoE, attivi non divulgati) | LLM | Non divulgato | Maggio 2024 | Chiusa (API) | Posizionato come SOTA |
| Yi-Lightning | MoE (numero di esperti non divulgato) | LLM | 64K | Ottobre 2024 | API | 6° posto LMSYS Chatbot Arena |
Fonti: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Modelli specializzati
| Modello | Parametri | Modalità | Contesto | Data di rilascio | Note |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 mld | Testo + immagini (448×448) | Standard del modello base | Gennaio 2024 | Encoder ViT (CLIP ViT-H/14), addestramento in tre fasi |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 mld | Testo (codice) | 128K | Settembre 2024 | 52 linguaggi di programmazione |
Fonti: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
Identificatori API
Esempi sulla piattaforma 01.AI e presso provider terzi: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Valutazione e benchmark
Risultati dei modelli base
Dati dal rapporto tecnico arXiv:2403.04652 (condizioni: 0-shot / 5-shot, a seconda del benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Fonte: arXiv:2403.04652, tabelle dei risultati.[1]
Yi-34B ha dimostrato risultati superiori a Llama 2-70B (con una dimensione due volte inferiore) sulla maggior parte dei benchmark e risultati leader tra i modelli open su C-Eval e CMMLU al momento del rilascio.[1][12]
Risultati di Yi-Lightning
Dati dal rapporto tecnico arXiv:2412.01253 (condizioni: 0-shot, salvo indicazione contraria):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Fonte: arXiv:2412.01253.[8]
Classifiche utenti
Yi-34B-Chat ha occupato il 2° posto su AlpacaEval (94,08%, dopo GPT-4 Turbo) tra dicembre 2023 e gennaio 2024, con un punteggio Elo di circa 1110 su LMSYS Chatbot Arena. Yi-34B era in testa tra i modelli open su Hugging Face Open LLM Leaderboard e C-Eval al momento del rilascio.[2][1]
Yi-Lightning ha occupato il 6° posto generale su LMSYS Chatbot Arena (punteggio 1287), il 2° posto per la lingua cinese e il 3°–4° posto nelle sottocategorie "matematica", "coding", "hard prompts" e "multi-turn" al momento della pubblicazione del rapporto.[8]
Nota. Il confronto diretto tra modelli di release e configurazioni diverse richiede condizioni di test uniformi (stesse versioni dei benchmark, stessi parametri di generazione). Le valutazioni soggettive sulle piattaforme di crowdsourcing dipendono dalla composizione dei partecipanti e dall'insieme corrente di modelli nel sistema.[12]
Applicazioni
La famiglia Yi viene utilizzata in un'ampia gamma di task di elaborazione del linguaggio naturale e di analisi multimodale:[3][13]
- Assistenti chat e sistemi dialogici — basati sulle varianti chat Yi-34B-Chat e Yi-1.5.
- Generazione e analisi del codice — Yi-Coder supporta 52 linguaggi di programmazione.
- Analisi di documenti lunghi — varianti con contesto 200K per task legali, tecnici e analitici.
- Analisi multimodale — descrizione di immagini e visual question answering tramite Yi-VL.
- Agenti enterprise — sistemi RAG, ricerca di conoscenza e classificazione dei dati tramite la piattaforma 01.AI.
- Distribuzione locale — tramite vLLM, llama.cpp, Hugging Face Transformers; versioni quantizzate (AWQ/GPTQ 4/8-bit) disponibili per la distribuzione su GPU consumer (ad esempio RTX 4090 per Yi-34B-4bit).
Le varianti API (Yi-Large, Yi-Lightning) vengono utilizzate per chatbot, servizi multilingue e inferenza a basso costo. Il costo di inferenza di Yi-Lightning era di 14 centesimi per milione di token a partire dal 2024.[8]
Limitazioni e problemi aperti
- Allucinazioni. I modelli sono soggetti a tipici errori fattuali dei LLM nelle risposte generate, specialmente in ragionamenti complessi e catene di inferenza lunghe.[1]
- Matematica e codice nelle versioni iniziali. I modelli base Yi-34B mostrano risultati più deboli nella codifica complessa e nella matematica rispetto ai modelli frontier specializzati (ad esempio, MATH Yi-34B in 4-shot — 14,4). Questo problema è stato parzialmente risolto in Yi-1.5 e Yi-Lightning.[1][8]
- Contesto lungo. L'estensione a 200K richiede pre-addestramento aggiuntivo e risorse computazionali; è possibile una leggera degradazione delle prestazioni su contesti brevi.[1]
- Modelli chiusi. Yi-Large e Yi-Lightning non forniscono pesi scaricabili, il che limita la verifica indipendente dell'architettura e dei dati.[8]
- Divario tra Arena e benchmark. Yi-Lightning mostra risultati forti nelle valutazioni utente (Chatbot Arena), ma è dietro ad alcuni concorrenti sui benchmark accademici statici — riflesso del problema generale di disallineamento delle metriche.[8]
- Riproducibilità. Non tutti i dettagli di addestramento (composizione esatta del dataset, distribuzione dei domini, iperparametri) sono stati completamente divulgati.[13]
- Sensibilità ai prompt. Come altri LLM, i modelli Yi sono sensibili alla formulazione del prompt, il che influisce sulla stabilità dei risultati.[1]
Non sono state registrate regressioni gravi note dopo i rilasci; la community segnala la stabilità delle versioni quantizzate.[2]
Aspetti etici e regolatori
In Yi-Lightning è stato implementato il framework di sicurezza RAISE, che realizza una protezione a quattro livelli:[8]
- Filtraggio di contenuti tossici, PII e materiali dannosi nella fase di pre-addestramento.
- Safety fine-tuning con esempi di gestione corretta di richieste sensibili.
- Controllo in ingresso (classificazione dei prompt).
- Controllo in uscita (filtraggio delle risposte).
La licenza Apache 2.0 per i modelli open consente l'uso commerciale; singoli provider di hosting possono imporre requisiti aggiuntivi. I modelli sono conformi alle normative regolamentari cinesi in materia di IA (certificazione CAICT per le soluzioni enterprise).[1][3]
Prospettive e direzioni di ricerca
La serie Yi dimostra l'efficacia dell'approccio che privilegia la qualità dei dati rispetto al volume dei parametri, nonché della scalabilità leggera (continual pretraining, depth upscaling, ottimizzazioni MoE).[1]
Dopo il 2025 l'accento di 01.AI si è spostato su soluzioni applicative:[4]
- Sistemi multi-agente e piattaforma enterprise WorldWise LLM Platform 2.5.
- Integrazione di modelli di terze parti (incluso DeepSeek) nei workflow aziendali.
- Ottimizzazione dell'inferenza (quantizzazione, FP8) per ridurre i costi di distribuzione.
I modelli open continuano a essere utilizzati dalla community per ricerca, fine-tuning e distillazione.[6]
Collegamenti esterni
- https://github.com/01-ai/Yi — Repository GitHub ufficiale di Yi
- https://github.com/01-ai/Yi-1.5 — Repository di Yi-1.5
- https://www.01.ai/yi-models — Pagina ufficiale dei modelli Yi
- https://huggingface.co/01-ai — Organizzazione 01-ai su Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Articolo Wikipedia sulla società 01.AI
Bibliografia
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms