Yi (01.AI) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — famiglia di Large Language Model (LLM) e modelli visivo-linguistici (Vision-Language Model, VLM), sviluppata dalla società 01.AI (零一万物) sotto la guida di Kai-Fu Lee. I modelli sono stati addestrati da zero su un corpus bilingue di alta qualità (inglese e cinese) di 3,1 trilioni di token e comprendono varianti per la generazione di testo, l'elaborazione di contesti lunghi (fino a 200 mila token), l'input multimodale (testo + immagini), la generazione di codice e l'inferenza efficiente basata sull'architettura Mixture-of-Experts (MoE). Le varianti open sono distribuite con licenza Apache 2.0 con autorizzazione all'uso commerciale; i modelli flagship proprietari (Yi-Large, Yi-Lightning) sono disponibili tramite API.[1][2][3]

Storia e cronologia dello sviluppo

La società 01.AI è stata fondata nel marzo 2023 da Kai-Fu Lee, ex responsabile di Microsoft Research Asia e Google China, con sede a Pechino. L'obiettivo dell'azienda è lo sviluppo di LLM efficienti con enfasi sulla qualità dei dati e sull'ottimizzazione ingegneristica dell'infrastruttura. A novembre 2023, 01.AI ha raggiunto lo status di "unicorno" (valutazione superiore a 1 miliardo di dollari) dopo un round di finanziamento con la partecipazione di Alibaba.[4][5]

Prima generazione (2023–2024)

I primi modelli open Yi-6B e Yi-34B sono stati presentati il 2 novembre 2023. Nelle settimane successive la gamma è stata integrata con varianti a contesto di 200 mila token (5 novembre 2023), varianti chat e modelli quantizzati (23 novembre 2023). Nel gennaio 2024 sono usciti i modelli multimodali Yi-VL-6B e Yi-VL-34B. Nel marzo 2024 è stato presentato il modello Yi-9B, ottenuto tramite depth upscaling da Yi-6B, ed è stato pubblicato il rapporto tecnico arXiv:2403.04652.[1][2]

Yi-1.5 e modelli specializzati (2024)

Il 13 maggio 2024 è stata rilasciata la serie Yi-1.5 (6B/9B/34B) — risultato del pre-addestramento continuo su ulteriori 500 miliardi di token e del fine-tuning su 3 milioni di esempi di istruzioni. Tra maggio e giugno 2024 è stato presentato il modello proprietario chiuso Yi-Large con accesso API, posizionato come SOTA. Nel settembre 2024 è uscita la serie specializzata Yi-Coder (1.5B/9B) per la generazione di codice con un contesto di 128 mila token e supporto a 52 linguaggi di programmazione.[1][6][7]

Yi-Lightning (2024)

Nell'ottobre 2024 è stato presentato il modello flagship Yi-Lightning basato sull'architettura Mixture-of-Experts (MoE), ottimizzato per velocità ed efficienza di inferenza. Yi-Lightning ha conquistato il 6° posto nella classifica generale di LMSYS Chatbot Arena (Elo 1287), il 2° posto per la lingua cinese e il 3°–4° posto per matematica e coding. Il rapporto tecnico è stato pubblicato nel dicembre 2024 (arXiv:2412.01253).[8]

Cambio di strategia (2025)

Nel marzo 2025 la società 01.AI ha annunciato la cessazione del pre-addestramento di nuovi grandi modelli linguistici e si è concentrata su applicazioni enterprise, sistemi multi-agente e sulla piattaforma WorldWise LLM Platform 2.5 basata su modelli di terze parti (incluso DeepSeek).[4]

Cronologia riassuntiva

Data Evento
Novembre 2023 Rilascio di Yi-6B e Yi-34B (base, chat, varianti 200K)
Gennaio 2024 Modelli multimodali Yi-VL-6B e Yi-VL-34B
Marzo 2024 Yi-9B (depth-upscaled); pubblicazione del rapporto tecnico arXiv:2403.04652
Maggio 2024 Yi-1.5 (6B/9B/34B); Yi-Large (chiuso, API)
Settembre 2024 Yi-Coder-1.5B/9B (specializzazione nel codice, contesto 128K)
Ottobre 2024 Yi-Lightning (architettura MoE, modello flagship)
Dicembre 2024 Pubblicazione del rapporto tecnico Yi-Lightning (arXiv:2412.01253)
Marzo 2025 Cessazione del pre-addestramento di nuovi LLM; focus su soluzioni enterprise

Fondamenti teorici e architettura

Architettura di base

Tutti i modelli della famiglia Yi si basano sull'architettura decoder-only Transformer, descritta nel lavoro di Vaswani et al.[9] I modelli sono addestrati da zero e non derivano da LLaMA, nonostante la somiglianza nell'implementazione.[1]

Il meccanismo di base di Multi-Head Self-Attention è descritto dalla formula:

Attention(Q,K,V)=softmax(QKdk)V

dove Q, K, V sono rispettivamente le matrici delle query, delle chiavi (keys) e dei valori (values), e dk è la dimensione delle chiavi.[9]

Principali modifiche architetturali di Yi:[1]

  • Grouped-Query Attention (GQA) — suddivisione delle query-head in gruppi con key/value-head condivise, che riduce il consumo di memoria mantenendo la qualità.
  • Attivazione SwiGLU — sostituzione della ReLU/GELU standard; riduce la dimensione delle attivazioni a 8/3 della dimensione dello strato nascosto (hidden size).
  • Rotary Position Embedding (RoPE) con frequenza base adattata (adjusted base frequency, ABF), che consente l'estensione del contesto senza modifiche architetturali.
  • Vocabolario (vocabulary): 64.000 token basati su BPE (SentencePiece) con suddivisione dei numeri in cifre e unicode-byte fallback per i caratteri rari.

Configurazioni dei modelli base

Parametri architetturali dal rapporto tecnico arXiv:2403.04652:[1]

Parametro Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Numero di strati 32 60
Lunghezza pre-addestramento (Pretrain Seq. Len) 4096 4096
Tasso di apprendimento massimo (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Fonte: arXiv:2403.04652, tabella dei parametri.[1]

Architettura Yi-Lightning (MoE)

Yi-Lightning (2024) utilizza un'architettura Mixture-of-Experts (MoE) migliorata con le seguenti caratteristiche:[8]

  • Fine-grained expert segmentation — suddivisione a grana fine dei blocchi FFN in esperti per aumentare la specializzazione.
  • Bilanciamento del carico multilivello — combinazione di Switch-Transformer (ST), Expert Parallel (EP) e Partitioned EP (PEP) loss per una distribuzione uniforme dei token tra gli esperti.
  • Attenzione ibrida — alternanza di 3 strati con sliding window e 1 strato con full attention, con riutilizzo della KV-cache tra gli strati.
  • Riduzione della memoria KV-cache dell'82,8% rispetto all'approccio standard nell'elaborazione di sequenze lunghe.
  • Finestra di contesto estesa a 64 mila token.

Il numero esatto di esperti e il numero totale di parametri di Yi-Lightning non sono stati divulgati in fonti pubbliche.[8]

Varianti multimodali (Yi-VL)

Nei modelli multimodali Yi-VL, il modello linguistico è collegato all'encoder visivo CLIP ViT-H/14 tramite una proiezione MLP. L'immagine I viene trasformata dall'encoder visivo in una sequenza di embedding {v1,,vK}, che vengono forniti al modello linguistico insieme ai token testuali. L'addestramento avviene in tre fasi con aumento della risoluzione: 224×224 → 448×448 pixel.[1]

Pipeline di addestramento e allineamento

Pre-addestramento (Pre-training)

I modelli base Yi-6B e Yi-34B sono stati pre-addestrati su un corpus bilingue di 3,1 trilioni di token. I dati passano attraverso una pipeline a cascata di filtraggio e deduplicazione: filtri euristici, scorer addestrati (perplexity, quality, coherence, safety), clustering e deduplicazione MinHash. Le fonti includono Common Crawl, libri e articoli scientifici.[1]

Per Yi-1.5 è stato eseguito un pre-addestramento continuo (continued pre-training) su ulteriori 500 miliardi di token di corpus di alta qualità.[7]

Fine-tuning supervisionato (Supervised Fine-Tuning, SFT)

Le varianti chat della prima generazione sono state sottoposte a fine-tuning su un insieme piccolo ma accuratamente curato — meno di 10 mila esempi multi-turn, ciascuno verificato e revisionato manualmente da ingegneri di machine learning. Per Yi-1.5 il volume dei dati SFT è stato aumentato a 3 milioni di esempi.[1][7]

Allineamento tramite Reinforcement Learning

Per Yi-Lightning viene applicato un processo di allineamento multi-fase: SFT seguito da RLHF/DPO. I dati sintetici vengono generati utilizzando Monte Carlo Tree Search (MCTS). Il framework di sicurezza RAISE implementa una protezione a quattro livelli: filtraggio dei dati di pre-addestramento, safety fine-tuning, controllo in ingresso dei prompt e controllo in uscita delle risposte.[8]

Estensione del contesto

L'estensione della finestra di contesto a 200 mila token è realizzata tramite un leggero pre-addestramento continuo su 5 miliardi di token (libri + domande-risposte sintetiche) utilizzando la tecnica RoPE ABF. Dopo la messa a punto, la precisione nel task Needle-in-a-Haystack (ricerca di un frammento target in un testo lungo) raggiunge il 99,8%.[1][2]

Scalabilità in profondità (Depth Upscaling)

Yi-9B è stato ottenuto duplicando gli strati 12–28 del modello base Yi-6B con successivo pre-addestramento su 800 miliardi di token. Il metodo consente di aumentare la capacità del modello senza addestrarlo da zero.[1]

Composizione della famiglia di modelli

Modelli linguistici principali

Modello Parametri Tipo Contesto Data di rilascio Licenza Note
Yi-6B / Yi-34B 6 mld / 34 mld Base / Chat 4K (est. a 32K) Novembre 2023 Apache 2.0 Modelli base addestrati da zero
Yi-6B-200K / Yi-34B-200K 6 mld / 34 mld Base 200K Novembre 2023 Apache 2.0 Pre-addestramento continuo su sequenze lunghe
Yi-9B 9 mld Base 4K (est. a 200K) Marzo 2024 Apache 2.0 Depth-upscale da Yi-6B + 800 mld di token
Yi-1.5-6B/9B/34B 6 / 9 / 34 mld Base / Chat 4K / 16K / 32K Maggio 2024 Apache 2.0 +500 mld di token + 3 mln di esempi SFT
Yi-Large ~1 tln (MoE, attivi non divulgati) LLM Non divulgato Maggio 2024 Chiusa (API) Posizionato come SOTA
Yi-Lightning MoE (numero di esperti non divulgato) LLM 64K Ottobre 2024 API 6° posto LMSYS Chatbot Arena

Fonti: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Modelli specializzati

Modello Parametri Modalità Contesto Data di rilascio Note
Yi-VL-6B / Yi-VL-34B 6 / 34 mld Testo + immagini (448×448) Standard del modello base Gennaio 2024 Encoder ViT (CLIP ViT-H/14), addestramento in tre fasi
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 mld Testo (codice) 128K Settembre 2024 52 linguaggi di programmazione

Fonti: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Identificatori API

Esempi sulla piattaforma 01.AI e presso provider terzi: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Valutazione e benchmark

Risultati dei modelli base

Dati dal rapporto tecnico arXiv:2403.04652 (condizioni: 0-shot / 5-shot, a seconda del benchmark):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Fonte: arXiv:2403.04652, tabelle dei risultati.[1]

Yi-34B ha dimostrato risultati superiori a Llama 2-70B (con una dimensione due volte inferiore) sulla maggior parte dei benchmark e risultati leader tra i modelli open su C-Eval e CMMLU al momento del rilascio.[1][12]

Risultati di Yi-Lightning

Dati dal rapporto tecnico arXiv:2412.01253 (condizioni: 0-shot, salvo indicazione contraria):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Fonte: arXiv:2412.01253.[8]

Classifiche utenti

Yi-34B-Chat ha occupato il 2° posto su AlpacaEval (94,08%, dopo GPT-4 Turbo) tra dicembre 2023 e gennaio 2024, con un punteggio Elo di circa 1110 su LMSYS Chatbot Arena. Yi-34B era in testa tra i modelli open su Hugging Face Open LLM Leaderboard e C-Eval al momento del rilascio.[2][1]

Yi-Lightning ha occupato il 6° posto generale su LMSYS Chatbot Arena (punteggio 1287), il 2° posto per la lingua cinese e il 3°–4° posto nelle sottocategorie "matematica", "coding", "hard prompts" e "multi-turn" al momento della pubblicazione del rapporto.[8]

Nota. Il confronto diretto tra modelli di release e configurazioni diverse richiede condizioni di test uniformi (stesse versioni dei benchmark, stessi parametri di generazione). Le valutazioni soggettive sulle piattaforme di crowdsourcing dipendono dalla composizione dei partecipanti e dall'insieme corrente di modelli nel sistema.[12]

Applicazioni

La famiglia Yi viene utilizzata in un'ampia gamma di task di elaborazione del linguaggio naturale e di analisi multimodale:[3][13]

  • Assistenti chat e sistemi dialogici — basati sulle varianti chat Yi-34B-Chat e Yi-1.5.
  • Generazione e analisi del codice — Yi-Coder supporta 52 linguaggi di programmazione.
  • Analisi di documenti lunghi — varianti con contesto 200K per task legali, tecnici e analitici.
  • Analisi multimodale — descrizione di immagini e visual question answering tramite Yi-VL.
  • Agenti enterprise — sistemi RAG, ricerca di conoscenza e classificazione dei dati tramite la piattaforma 01.AI.
  • Distribuzione locale — tramite vLLM, llama.cpp, Hugging Face Transformers; versioni quantizzate (AWQ/GPTQ 4/8-bit) disponibili per la distribuzione su GPU consumer (ad esempio RTX 4090 per Yi-34B-4bit).

Le varianti API (Yi-Large, Yi-Lightning) vengono utilizzate per chatbot, servizi multilingue e inferenza a basso costo. Il costo di inferenza di Yi-Lightning era di 14 centesimi per milione di token a partire dal 2024.[8]

Limitazioni e problemi aperti

  • Allucinazioni. I modelli sono soggetti a tipici errori fattuali dei LLM nelle risposte generate, specialmente in ragionamenti complessi e catene di inferenza lunghe.[1]
  • Matematica e codice nelle versioni iniziali. I modelli base Yi-34B mostrano risultati più deboli nella codifica complessa e nella matematica rispetto ai modelli frontier specializzati (ad esempio, MATH Yi-34B in 4-shot — 14,4). Questo problema è stato parzialmente risolto in Yi-1.5 e Yi-Lightning.[1][8]
  • Contesto lungo. L'estensione a 200K richiede pre-addestramento aggiuntivo e risorse computazionali; è possibile una leggera degradazione delle prestazioni su contesti brevi.[1]
  • Modelli chiusi. Yi-Large e Yi-Lightning non forniscono pesi scaricabili, il che limita la verifica indipendente dell'architettura e dei dati.[8]
  • Divario tra Arena e benchmark. Yi-Lightning mostra risultati forti nelle valutazioni utente (Chatbot Arena), ma è dietro ad alcuni concorrenti sui benchmark accademici statici — riflesso del problema generale di disallineamento delle metriche.[8]
  • Riproducibilità. Non tutti i dettagli di addestramento (composizione esatta del dataset, distribuzione dei domini, iperparametri) sono stati completamente divulgati.[13]
  • Sensibilità ai prompt. Come altri LLM, i modelli Yi sono sensibili alla formulazione del prompt, il che influisce sulla stabilità dei risultati.[1]

Non sono state registrate regressioni gravi note dopo i rilasci; la community segnala la stabilità delle versioni quantizzate.[2]

Aspetti etici e regolatori

In Yi-Lightning è stato implementato il framework di sicurezza RAISE, che realizza una protezione a quattro livelli:[8]

  • Filtraggio di contenuti tossici, PII e materiali dannosi nella fase di pre-addestramento.
  • Safety fine-tuning con esempi di gestione corretta di richieste sensibili.
  • Controllo in ingresso (classificazione dei prompt).
  • Controllo in uscita (filtraggio delle risposte).

La licenza Apache 2.0 per i modelli open consente l'uso commerciale; singoli provider di hosting possono imporre requisiti aggiuntivi. I modelli sono conformi alle normative regolamentari cinesi in materia di IA (certificazione CAICT per le soluzioni enterprise).[1][3]

Prospettive e direzioni di ricerca

La serie Yi dimostra l'efficacia dell'approccio che privilegia la qualità dei dati rispetto al volume dei parametri, nonché della scalabilità leggera (continual pretraining, depth upscaling, ottimizzazioni MoE).[1]

Dopo il 2025 l'accento di 01.AI si è spostato su soluzioni applicative:[4]

  • Sistemi multi-agente e piattaforma enterprise WorldWise LLM Platform 2.5.
  • Integrazione di modelli di terze parti (incluso DeepSeek) nei workflow aziendali.
  • Ottimizzazione dell'inferenza (quantizzazione, FP8) per ridurre i costi di distribuzione.

I modelli open continuano a essere utilizzati dalla community per ricerca, fine-tuning e distillazione.[6]

Collegamenti esterni

Bibliografia

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms