Yi (01.AI) (EL)
Yi — μια οικογένεια μεγάλων γλωσσικών μοντέλων (Large Language Model, LLM) και οπτικο-γλωσσικών μοντέλων (Vision-Language Model, VLM), που αναπτύχθηκε από την εταιρεία 01.AI (零一万物) υπό την ηγεσία του Kai-Fu Lee. Τα μοντέλα εκπαιδεύτηκαν από το μηδέν σε ένα υψηλής ποιότητας δίγλωσσο σώμα κειμένων (αγγλικά και κινεζικά) όγκου 3,1 τρισεκατομμυρίων token και περιλαμβάνουν παραλλαγές για παραγωγή κειμένου, επεξεργασία μεγάλου context (έως 200 χιλ. token), πολυτροπική είσοδο (κείμενο + εικόνες), παραγωγή κώδικα και αποδοτική εξαγωγή συμπερασμάτων βάσει αρχιτεκτονικής Mixture-of-Experts (MoE). Οι ανοιχτές παραλλαγές διανέμονται υπό την άδεια Apache 2.0 με επιτρεπόμενη εμπορική χρήση· τα κλειστά flagship μοντέλα (Yi-Large, Yi-Lightning) είναι διαθέσιμα μέσω API.[1][2][3]
Ιστορία και χρονολόγιο ανάπτυξης
Η εταιρεία 01.AI ιδρύθηκε τον Μάρτιο του 2023 από τον Kai-Fu Lee, πρώην επικεφαλής της Microsoft Research Asia και της Google China, με έδρα το Πεκίνο. Η εστίαση της εταιρείας είναι η ανάπτυξη αποδοτικών LLM με έμφαση στην ποιότητα των δεδομένων και στη μηχανική βελτιστοποίηση της υποδομής. Έως τον Νοέμβριο του 2023, η 01.AI απέκτησε το καθεστώς «unicorn» (αποτίμηση άνω του 1 δισ. δολαρίων) μετά από γύρο χρηματοδότησης με συμμετοχή της Alibaba.[4][5]
Πρώτη γενιά (2023–2024)
Τα πρώτα ανοιχτά μοντέλα Yi-6B και Yi-34B παρουσιάστηκαν στις 2 Νοεμβρίου 2023. Κατά τις επόμενες εβδομάδες, η σειρά συμπληρώθηκε με παραλλαγές context 200 χιλ. token (5 Νοεμβρίου 2023), παραλλαγές chat και quantized μοντέλα (23 Νοεμβρίου 2023). Τον Ιανουάριο του 2024 κυκλοφόρησαν τα πολυτροπικά Yi-VL-6B και Yi-VL-34B. Τον Μάρτιο του 2024 παρουσιάστηκε το μοντέλο Yi-9B, που προέκυψε με τη μέθοδο depth upscaling από το Yi-6B, και δημοσιεύτηκε η τεχνική έκθεση arXiv:2403.04652.[1][2]
Yi-1.5 και εξειδικευμένα μοντέλα (2024)
Στις 13 Μαΐου 2024 κυκλοφόρησε η σειρά Yi-1.5 (6B/9B/34B) — αποτέλεσμα συνεχούς προ-εκπαίδευσης σε επιπλέον 500 δισ. token και fine-tuning σε 3 εκατομμύρια παραδείγματα εντολών. Τον Μάιο–Ιούνιο 2024 παρουσιάστηκε το κλειστό ιδιόκτητο μοντέλο Yi-Large με πρόσβαση μέσω API, που τοποθετείται ως SOTA. Τον Σεπτέμβριο του 2024 κυκλοφόρησε η εξειδικευμένη σειρά Yi-Coder (1.5B/9B) για παραγωγή κώδικα με context 128 χιλ. token και υποστήριξη 52 γλωσσών προγραμματισμού.[1][6][7]
Yi-Lightning (2024)
Τον Οκτώβριο του 2024 παρουσιάστηκε το flagship μοντέλο Yi-Lightning βάσει αρχιτεκτονικής Mixture-of-Experts (MoE), βελτιστοποιημένο για ταχύτητα και αποδοτικότητα εξαγωγής συμπερασμάτων. Το Yi-Lightning κατέλαβε την 6η θέση στη γενική κατάταξη του LMSYS Chatbot Arena (Elo 1287), τη 2η θέση για την κινεζική γλώσσα και την 3η–4η θέση σε μαθηματικά και κωδικοποίηση. Η τεχνική έκθεση δημοσιεύτηκε τον Δεκέμβριο του 2024 (arXiv:2412.01253).[8]
Αλλαγή στρατηγικής (2025)
Τον Μάρτιο του 2025, η 01.AI ανακοίνωσε την παύση της προ-εκπαίδευσης νέων μεγάλων γλωσσικών μοντέλων και εστίασε στις εταιρικές εφαρμογές, τα πολυπρακτορικά συστήματα και την πλατφόρμα WorldWise LLM Platform 2.5 βάσει τρίτων μοντέλων (συμπεριλαμβανομένου του DeepSeek).[4]
Συνοπτικό χρονολόγιο
| Ημερομηνία | Γεγονός |
|---|---|
| Νοέμβριος 2023 | Κυκλοφορία των Yi-6B και Yi-34B (base, chat, παραλλαγές 200K) |
| Ιανουάριος 2024 | Πολυτροπικά Yi-VL-6B και Yi-VL-34B |
| Μάρτιος 2024 | Yi-9B (depth-upscaled)· δημοσίευση τεχνικής έκθεσης arXiv:2403.04652 |
| Μάιος 2024 | Yi-1.5 (6B/9B/34B)· Yi-Large (κλειστό, API) |
| Σεπτέμβριος 2024 | Yi-Coder-1.5B/9B (εξειδίκευση στον κώδικα, context 128K) |
| Οκτώβριος 2024 | Yi-Lightning (αρχιτεκτονική MoE, flagship μοντέλο) |
| Δεκέμβριος 2024 | Δημοσίευση τεχνικής έκθεσης Yi-Lightning (arXiv:2412.01253) |
| Μάρτιος 2025 | Παύση προ-εκπαίδευσης νέων LLM· εστίαση σε εταιρικές λύσεις |
Θεωρητικές βάσεις και αρχιτεκτονική
Βασική αρχιτεκτονική
Όλα τα μοντέλα της οικογένειας Yi βασίζονται στην αρχιτεκτονική decoder-only Transformer, που περιγράφηκε στην εργασία Vaswani et al.[9] Τα μοντέλα εκπαιδεύτηκαν από το μηδέν και δεν αποτελούν παράγωγα του LLaMA, παρά τις ομοιότητες υλοποίησης.[1]
Ο βασικός μηχανισμός Multi-Head Self-Attention περιγράφεται από τον τύπο:
όπου , , — οι πίνακες queries, keys και values αντίστοιχα, και — η διάσταση των keys.[9]
Βασικές αρχιτεκτονικές τροποποιήσεις του Yi:[1]
- Grouped-Query Attention (GQA) — διαίρεση των query-κεφαλών σε ομάδες με κοινές key/value-κεφαλές, μειώνοντας την κατανάλωση μνήμης με διατήρηση της ποιότητας.
- Ενεργοποίηση SwiGLU — αντικατάσταση της τυπικής ReLU/GELU· μειώνει το μέγεθος των ενεργοποιήσεων στα 8/3 της hidden size.
- Rotary Position Embedding (RoPE) με προσαρμοσμένη βασική συχνότητα (adjusted base frequency, ABF), που επιτρέπει την επέκταση του context χωρίς αρχιτεκτονικές αλλαγές.
- Λεξιλόγιο (vocabulary): 64.000 token βάσει BPE (SentencePiece) με διαχωρισμό αριθμών σε ψηφία και unicode-byte fallback για σπάνιους χαρακτήρες.
Διαμορφώσεις βασικών μοντέλων
Παράμετροι αρχιτεκτονικής από την τεχνική έκθεση arXiv:2403.04652:[1]
| Παράμετρος | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Αριθμός στρωμάτων | 32 | 60 |
| Μήκος προ-εκπαίδευσης (Pretrain Seq. Len) | 4096 | 4096 |
| Μέγ. ρυθμός εκπαίδευσης (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Πηγή: arXiv:2403.04652, πίνακας παραμέτρων.[1]
Αρχιτεκτονική Yi-Lightning (MoE)
Το Yi-Lightning (2024) χρησιμοποιεί βελτιωμένη αρχιτεκτονική Mixture-of-Experts (MoE) με τα εξής χαρακτηριστικά:[8]
- Fine-grained expert segmentation — λεπτομερής διαίρεση των FFN-μπλοκ σε ειδικούς για αύξηση της εξειδίκευσης.
- Πολυεπίπεδη εξισορρόπηση φόρτου — συνδυασμός Switch-Transformer (ST), Expert Parallel (EP) και Partitioned EP (PEP) losses για ομοιόμορφη κατανομή token μεταξύ ειδικών.
- Υβριδική προσοχή — εναλλαγή 3 στρωμάτων με sliding window και 1 στρώματος με full attention, με επαναχρησιμοποίηση KV-cache μεταξύ στρωμάτων.
- Μείωση μνήμης KV-cache κατά 82,8% σε σύγκριση με την τυπική προσέγγιση κατά την επεξεργασία μεγάλων ακολουθιών.
- Παράθυρο context επεκτάθηκε έως 64 χιλ. token.
Ο ακριβής αριθμός ειδικών και ο συνολικός αριθμός παραμέτρων του Yi-Lightning δεν έχουν αποκαλυφθεί σε δημόσιες πηγές.[8]
Πολυτροπικές παραλλαγές (Yi-VL)
Στα πολυτροπικά μοντέλα Yi-VL, το γλωσσικό μοντέλο συνδέεται με τον οπτικό encoder CLIP ViT-H/14 μέσω προβολής MLP. Η εικόνα μετασχηματίζεται από τον οπτικό encoder σε ακολουθία embeddings , τα οποία τροφοδοτούνται στο γλωσσικό μοντέλο μαζί με τα κειμενικά token. Η εκπαίδευση πραγματοποιείται σε τρία στάδια με αύξηση ανάλυσης: 224×224 → 448×448 pixel.[1]
Pipeline εκπαίδευσης και ευθυγράμμιση
Προ-εκπαίδευση (Pre-training)
Τα βασικά μοντέλα Yi-6B και Yi-34B προ-εκπαιδεύτηκαν σε δίγλωσσο σώμα κειμένων όγκου 3,1 τρισεκατομμυρίων token. Τα δεδομένα διέρχονται από ένα διαδοχικό pipeline φιλτραρίσματος και αφαίρεσης διπλοτύπων: ευρετικά φίλτρα, εκπαιδευμένα scorers (perplexity, quality, coherence, safety), ομαδοποίηση και αφαίρεση διπλοτύπων με MinHash. Πηγές — Common Crawl, βιβλία και επιστημονικά άρθρα.[1]
Για το Yi-1.5 πραγματοποιήθηκε continued pre-training σε επιπλέον 500 δισ. token υψηλής ποιότητας σώματος κειμένων.[7]
Supervised Fine-Tuning (SFT)
Οι παραλλαγές chat της πρώτης γενιάς υποβλήθηκαν σε fine-tuning σε ένα μικρό αλλά προσεκτικά επιλεγμένο σύνολο — λιγότερο από 10 χιλ. παραδείγματα multi-turn, καθένα από τα οποία ελέγχθηκε και επεξεργάστηκε χειροκίνητα από μηχανικούς machine learning. Για το Yi-1.5 ο όγκος των SFT-δεδομένων αυξήθηκε σε 3 εκατομμύρια παραδείγματα.[1][7]
Ευθυγράμμιση με Reinforcement Learning
Για το Yi-Lightning εφαρμόζεται πολυσταδιακή διαδικασία ευθυγράμμισης: SFT με επακόλουθο RLHF/DPO. Τα συνθετικά δεδομένα παράγονται με χρήση Monte Carlo Tree Search (MCTS). Το πλαίσιο ασφάλειας RAISE υλοποιεί τετραεπίπεδη προστασία: φιλτράρισμα δεδομένων προ-εκπαίδευσης, safety fine-tuning, έλεγχος εισερχόμενων prompt και έλεγχος εξερχόμενων απαντήσεων.[8]
Επέκταση context
Η επέκταση του παραθύρου context έως 200 χιλ. token υλοποιείται μέσω ελαφριάς συνεχούς προ-εκπαίδευσης σε 5 δισ. token (βιβλία + συνθετικά ζεύγη ερώτησης-απάντησης) με χρήση της τεχνικής RoPE ABF. Μετά τη βελτιστοποίηση, η ακρίβεια στο έργο Needle-in-a-Haystack (αναζήτηση στοχευμένου τμήματος σε μεγάλο κείμενο) φτάνει το 99,8%.[1][2]
Depth Upscaling
Το Yi-9B προέκυψε μέσω αντιγραφής των στρωμάτων 12–28 του βασικού μοντέλου Yi-6B με επακόλουθη προ-εκπαίδευση σε 800 δισ. token. Η μέθοδος επιτρέπει την αύξηση της χωρητικότητας του μοντέλου χωρίς εκπαίδευση από το μηδέν.[1]
Σύνθεση της οικογένειας μοντέλων
Κύρια γλωσσικά μοντέλα
| Μοντέλο | Παράμετροι | Τύπος | Context | Ημερομηνία κυκλοφορίας | Άδεια | Σημείωση |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 δισ. / 34 δισ. | Base / Chat | 4K (επεκτ. σε 32K) | Νοέμβριος 2023 | Apache 2.0 | Βασικά μοντέλα εκπαιδευμένα από το μηδέν |
| Yi-6B-200K / Yi-34B-200K | 6 δισ. / 34 δισ. | Base | 200K | Νοέμβριος 2023 | Apache 2.0 | Συνεχής προ-εκπαίδευση σε μεγάλες ακολουθίες |
| Yi-9B | 9 δισ. | Base | 4K (επεκτ. σε 200K) | Μάρτιος 2024 | Apache 2.0 | Depth-upscale από το Yi-6B + 800 δισ. token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 δισ. | Base / Chat | 4K / 16K / 32K | Μάιος 2024 | Apache 2.0 | +500 δισ. token + 3 εκατ. παραδείγματα SFT |
| Yi-Large | ~1 τρισ. (MoE, αριθμός ενεργών δεν αποκαλύπτεται) | LLM | Δεν αποκαλύπτεται | Μάιος 2024 | Κλειστό (API) | Τοποθετείται ως SOTA |
| Yi-Lightning | MoE (αριθμός ειδικών δεν αποκαλύπτεται) | LLM | 64K | Οκτώβριος 2024 | API | 6η θέση LMSYS Chatbot Arena |
Πηγές: arXiv:2403.04652· arXiv:2412.01253· GitHub 01-ai/Yi.[1][8][2]
Εξειδικευμένα μοντέλα
| Μοντέλο | Παράμετροι | Τροπικότητες | Context | Ημερομηνία κυκλοφορίας | Σημείωση |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 δισ. | Κείμενο + εικόνες (448×448) | Τυπικό του βασικού μοντέλου | Ιανουάριος 2024 | ViT-encoder (CLIP ViT-H/14), τριστάδιακή εκπαίδευση |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 δισ. | Κείμενο (κώδικας) | 128K | Σεπτέμβριος 2024 | 52 γλώσσες προγραμματισμού |
Πηγές: arXiv:2403.04652· GitHub 01-ai/Yi.[1][2]
Αναγνωριστικά API
Παραδείγματα στην πλατφόρμα 01.AI και σε τρίτους παρόχους: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Αξιολόγηση και benchmark
Αποτελέσματα βασικών μοντέλων
Δεδομένα από την τεχνική έκθεση arXiv:2403.04652 (συνθήκες: 0-shot / 5-shot, ανάλογα με το benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Πηγή: arXiv:2403.04652, πίνακες αποτελεσμάτων.[1]
Το Yi-34B επέδειξε αποτελέσματα που υπερβαίνουν το Llama 2-70B (με διπλάσιο αριθμό παραμέτρων) στα περισσότερα benchmark και ηγήθηκε μεταξύ των ανοιχτών μοντέλων στα C-Eval και CMMLU κατά τη στιγμή της κυκλοφορίας.[1][12]
Αποτελέσματα Yi-Lightning
Δεδομένα από την τεχνική έκθεση arXiv:2412.01253 (συνθήκες: 0-shot, όπου δεν ορίζεται διαφορετικά):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Πηγή: arXiv:2412.01253.[8]
Αξιολογήσεις χρηστών
Το Yi-34B-Chat κατείχε την 2η θέση στο AlpacaEval (94,08%, μετά το GPT-4 Turbo) τον Δεκέμβριο 2023 – Ιανουάριο 2024, με βαθμολογία Elo ~1110 στο LMSYS Chatbot Arena. Το Yi-34B ηγήθηκε μεταξύ των ανοιχτών μοντέλων στο Hugging Face Open LLM Leaderboard και στο C-Eval κατά τη στιγμή της κυκλοφορίας.[2][1]
Το Yi-Lightning κατέλαβε την 6η γενική θέση στο LMSYS Chatbot Arena (βαθμολογία 1287), τη 2η θέση για την κινεζική γλώσσα και τις θέσεις 3–4 στις υποκατηγορίες «μαθηματικά», «κωδικοποίηση», «hard prompts» και «multi-turn» κατά τη στιγμή δημοσίευσης της έκθεσης.[8]
Σημείωση. Η άμεση σύγκριση μοντέλων από διαφορετικές εκδόσεις και διαμορφώσεις απαιτεί ομοιόμορφες συνθήκες δοκιμής (ίδιες εκδόσεις benchmark, ίδιες παράμετροι παραγωγής). Οι υποκειμενικές αξιολογήσεις σε πλατφόρμες crowdsourcing εξαρτώνται από τη σύνθεση των συμμετεχόντων και το τρέχον σύνολο μοντέλων στο σύστημα.[12]
Εφαρμογές
Η οικογένεια Yi εφαρμόζεται σε ένα ευρύ φάσμα εργασιών επεξεργασίας φυσικής γλώσσας και πολυτροπικής ανάλυσης:[3][13]
- Βοηθοί chat και διαλογικά συστήματα — βάσει των παραλλαγών chat Yi-34B-Chat και Yi-1.5.
- Παραγωγή και ανάλυση κώδικα — το Yi-Coder υποστηρίζει 52 γλώσσες προγραμματισμού.
- Ανάλυση μεγάλων εγγράφων — παραλλαγές με context 200K για νομικές, τεχνικές και αναλυτικές εργασίες.
- Πολυτροπική ανάλυση — περιγραφή εικόνων και οπτική ερώτηση-απάντηση μέσω Yi-VL.
- Εταιρικοί πράκτορες — συστήματα RAG, αναζήτηση γνώσης και ταξινόμηση δεδομένων μέσω της πλατφόρμας 01.AI.
- Τοπική ανάπτυξη — μέσω vLLM, llama.cpp, Hugging Face Transformers· οι quantized εκδόσεις (AWQ/GPTQ 4/8-bit) είναι διαθέσιμες για ανάπτυξη σε GPU καταναλωτικής κατηγορίας (π.χ. RTX 4090 για Yi-34B-4bit).
Οι παραλλαγές API (Yi-Large, Yi-Lightning) χρησιμοποιούνται για chatbot, πολύγλωσσες υπηρεσίες και low-cost inference. Το κόστος inference του Yi-Lightning ανερχόταν σε 14 σεντ ανά εκατομμύριο token το 2024.[8]
Περιορισμοί και ανοιχτά ζητήματα
- Ψευδαισθήσεις (Hallucinations). Τα μοντέλα υπόκεινται στα τυπικά για LLM πραγματικά σφάλματα στις παραγόμενες απαντήσεις, ιδιαίτερα σε σύνθετες συλλογιστικές αλυσίδες και μεγάλες αλυσίδες εξαγωγής συμπερασμάτων.[1]
- Μαθηματικά και κώδικας στις πρώιμες εκδόσεις. Τα βασικά μοντέλα Yi-34B εμφανίζουν ασθενέστερα αποτελέσματα στη σύνθετη κωδικοποίηση και τα μαθηματικά σε σύγκριση με εξειδικευμένα frontier μοντέλα (π.χ. MATH Yi-34B σε 4-shot — 14,4). Το πρόβλημα αυτό επιλύθηκε εν μέρει στα Yi-1.5 και Yi-Lightning.[1][8]
- Μεγάλο context. Η επέκταση σε 200K απαιτεί επιπλέον προ-εκπαίδευση και υπολογιστικούς πόρους· ενδέχεται να παρατηρηθεί ελαφρά υποβάθμιση απόδοσης σε μικρό context.[1]
- Κλειστά μοντέλα. Τα Yi-Large και Yi-Lightning δεν παρέχουν βάρη για λήψη, γεγονός που περιορίζει την ανεξάρτητη επαλήθευση αρχιτεκτονικής και δεδομένων.[8]
- Απόκλιση μεταξύ Arena και benchmark. Το Yi-Lightning επιδεικνύει ισχυρά αποτελέσματα σε αξιολογήσεις χρηστών (Chatbot Arena), αλλά υστερεί ορισμένων ανταγωνιστών σε στατικά ακαδημαϊκά benchmark — αντανάκλαση του γενικού προβλήματος ασυμφωνίας μετρικών.[8]
- Αναπαραγωγιμότητα. Δεν έχουν αποκαλυφθεί πλήρως όλες οι λεπτομέρειες εκπαίδευσης (ακριβής σύνθεση dataset, κατανομή τομέων, υπερπαράμετροι).[13]
- Ευαισθησία σε prompt. Όπως και άλλα LLM, τα μοντέλα Yi είναι ευαίσθητα στη διατύπωση του prompt, γεγονός που επηρεάζει τη σταθερότητα των εξαγόμενων συμπερασμάτων.[1]
Δεν έχουν καταγραφεί γνωστές σοβαρές παλινδρομήσεις μετά από εκδόσεις· η κοινότητα σημειώνει σταθερότητα των quantized εκδόσεων.[2]
Ηθικές και ρυθμιστικές πτυχές
Στο Yi-Lightning έχει ενσωματωθεί το πλαίσιο ασφάλειας RAISE, που υλοποιεί τετραεπίπεδη προστασία:[8]
- Φιλτράρισμα τοξικού περιεχομένου, PII και κακόβουλου υλικού κατά το στάδιο προ-εκπαίδευσης.
- Safety fine-tuning με παραδείγματα ορθής διαχείρισης ευαίσθητων ερωτημάτων.
- Έλεγχος εισόδου (ταξινόμηση prompt).
- Έλεγχος εξόδου (φιλτράρισμα απαντήσεων).
Η άδεια Apache 2.0 για τα ανοιχτά μοντέλα επιτρέπει εμπορική χρήση· επιμέρους hosting ενδέχεται να επιβάλλουν πρόσθετες απαιτήσεις. Τα μοντέλα συμμορφώνονται με τους κινεζικούς ρυθμιστικούς κανόνες στον τομέα της τεχνητής νοημοσύνης (πιστοποίηση CAICT για εταιρικές λύσεις).[1][3]
Προοπτικές και ερευνητικές κατευθύνσεις
Η σειρά Yi αποδεικνύει την αποτελεσματικότητα της προσέγγισης που δίνει προτεραιότητα στην ποιότητα δεδομένων έναντι του όγκου παραμέτρων, καθώς και της ελαφριάς κλιμάκωσης (continual pretraining, depth upscaling, βελτιστοποιήσεις MoE).[1]
Μετά το 2025, η έμφαση της 01.AI μετατοπίστηκε σε εφαρμοσμένες λύσεις:[4]
- Πολυπρακτορικά συστήματα και enterprise πλατφόρμα WorldWise LLM Platform 2.5.
- Ενσωμάτωση τρίτων μοντέλων (συμπεριλαμβανομένου του DeepSeek) σε εταιρικές ροές εργασίας.
- Βελτιστοποίηση inference (quantization, FP8) για μείωση του κόστους ανάπτυξης.
Τα ανοιχτά μοντέλα συνεχίζουν να χρησιμοποιούνται από την κοινότητα για έρευνα, fine-tuning και απόσταξη γνώσης.[6]
Βιβλιογραφία
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Σύνδεσμοι
- https://github.com/01-ai/Yi — Επίσημο αποθετήριο Yi στο GitHub
- https://github.com/01-ai/Yi-1.5 — Αποθετήριο Yi-1.5
- https://www.01.ai/yi-models — Επίσημη σελίδα μοντέλων Yi
- https://huggingface.co/01-ai — Οργανισμός 01-ai στο Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Άρθρο Wikipedia για την εταιρεία 01.AI
Παραπομπές
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms