Yi (01.AI) (TH)
Yi — ตระกูลโมเดลภาษาขนาดใหญ่ (Large Language Model, LLM) และโมเดลภาษา-ภาพ (Vision-Language Model, VLM) ที่พัฒนาโดยบริษัท 01.AI (零一万物) ภายใต้การนำของ Kai-Fu Lee โมเดลเหล่านี้ได้รับการฝึกจากศูนย์บนคลังข้อมูลสองภาษาคุณภาพสูง (ภาษาอังกฤษและภาษาจีน) ขนาด 3.1 ล้านล้าน token และมีตัวแปรสำหรับการสร้างข้อความ การประมวลผล context ขนาดยาว (สูงสุด 200,000 token) การรับข้อมูลหลายรูปแบบ (ข้อความ + ภาพ) การสร้างโค้ด และการประมวลผลอย่างมีประสิทธิภาพบนสถาปัตยกรรม Mixture-of-Experts (MoE) ตัวแปรแบบเปิดเผยเผยแพร่ภายใต้ลิขสิทธิ์ Apache 2.0 โดยอนุญาตให้ใช้งานเชิงพาณิชย์ ส่วนโมเดลเรือธงแบบปิด (Yi-Large, Yi-Lightning) เข้าถึงได้ผ่าน API[1][2][3]
ประวัติและลำดับเวลาการพัฒนา
บริษัท 01.AI ก่อตั้งขึ้นในเดือนมีนาคม 2023 โดย Kai-Fu Lee อดีตหัวหน้า Microsoft Research Asia และ Google China โดยมีสำนักงานใหญ่อยู่ที่กรุงปักกิ่ง จุดมุ่งเน้นของบริษัทคือการพัฒนา LLM ที่มีประสิทธิภาพโดยเน้นที่คุณภาพของข้อมูลและการปรับแต่งโครงสร้างพื้นฐานทางวิศวกรรม ภายในเดือนพฤศจิกายน 2023 บริษัท 01.AI ได้รับสถานะ "ยูนิคอร์น" (มูลค่าประเมินเกิน 1 พันล้านดอลลาร์) หลังจากรอบการระดมทุนที่มี Alibaba เข้าร่วม[4][5]
รุ่นแรก (2023–2024)
โมเดลแบบเปิดรุ่นแรก Yi-6B และ Yi-34B เปิดตัวเมื่อวันที่ 2 พฤศจิกายน 2023 ในช่วงหลายสัปดาห์ถัดมา ได้มีการเพิ่มตัวแปรที่รองรับ context 200,000 token (5 พฤศจิกายน 2023) ตัวแปรแบบแชทและโมเดลที่ผ่านการ quantize (23 พฤศจิกายน 2023) ในเดือนมกราคม 2024 มีการเปิดตัวโมเดลหลายรูปแบบ Yi-VL-6B และ Yi-VL-34B ในเดือนมีนาคม 2024 มีการนำเสนอโมเดล Yi-9B ซึ่งได้มาจากวิธี depth upscaling จาก Yi-6B และมีการเผยแพร่รายงานทางเทคนิค arXiv:2403.04652[1][2]
Yi-1.5 และโมเดลเฉพาะทาง (2024)
เมื่อวันที่ 13 พฤษภาคม 2024 มีการเปิดตัวซีรีส์ Yi-1.5 (6B/9B/34B) ซึ่งเป็นผลจากการ pre-training ต่อเนื่องบน token เพิ่มเติม 500 พันล้านรายการและการ fine-tuning บนตัวอย่างคำสั่ง 3 ล้านรายการ ในเดือนพฤษภาคม–มิถุนายน 2024 มีการนำเสนอโมเดล proprietary แบบปิด Yi-Large ที่เข้าถึงผ่าน API โดยวางตำแหน่งเป็น SOTA ในเดือนกันยายน 2024 มีการเปิดตัวซีรีส์เฉพาะทาง Yi-Coder (1.5B/9B) สำหรับการสร้างโค้ด ที่รองรับ context 128,000 token และภาษาโปรแกรม 52 ภาษา[1][6][7]
Yi-Lightning (2024)
ในเดือนตุลาคม 2024 มีการเปิดตัวโมเดลเรือธง Yi-Lightning บนสถาปัตยกรรม Mixture-of-Experts (MoE) ที่ได้รับการปรับแต่งเพื่อความเร็วและประสิทธิภาพในการประมวลผล Yi-Lightning ขึ้นอันดับที่ 6 ในการจัดอันดับรวมของ LMSYS Chatbot Arena (Elo 1287) อันดับที่ 2 ในภาษาจีน และอันดับที่ 3–4 ในด้านคณิตศาสตร์และการเขียนโค้ด รายงานทางเทคนิคเผยแพร่ในเดือนธันวาคม 2024 (arXiv:2412.01253)[8]
การเปลี่ยนแปลงกลยุทธ์ (2025)
ในเดือนมีนาคม 2025 บริษัท 01.AI ประกาศยุติการ pre-training โมเดลภาษาขนาดใหญ่รายการใหม่ และหันมามุ่งเน้นที่แอปพลิเคชันองค์กร ระบบหลายตัวแทน และแพลตฟอร์ม WorldWise LLM Platform 2.5 ที่ใช้โมเดลจากภายนอก (รวมถึง DeepSeek)[4]
ลำดับเวลาโดยสรุป
| วันที่ | เหตุการณ์ |
|---|---|
| พฤศจิกายน 2023 | เปิดตัว Yi-6B และ Yi-34B (base, chat, ตัวแปร 200K) |
| มกราคม 2024 | Yi-VL-6B และ Yi-VL-34B แบบหลายรูปแบบ |
| มีนาคม 2024 | Yi-9B (depth-upscaled); เผยแพร่รายงานทางเทคนิค arXiv:2403.04652 |
| พฤษภาคม 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (ปิด, API) |
| กันยายน 2024 | Yi-Coder-1.5B/9B (เชี่ยวชาญด้านโค้ด, context 128K) |
| ตุลาคม 2024 | Yi-Lightning (สถาปัตยกรรม MoE, โมเดลเรือธง) |
| ธันวาคม 2024 | เผยแพร่รายงานทางเทคนิค Yi-Lightning (arXiv:2412.01253) |
| มีนาคม 2025 | ยุติการ pre-training LLM ใหม่; มุ่งเน้นโซลูชันองค์กร |
รากฐานทางทฤษฎีและสถาปัตยกรรม
สถาปัตยกรรมพื้นฐาน
โมเดลทั้งหมดในตระกูล Yi อิงบนสถาปัตยกรรม decoder-only Transformer ตามที่อธิบายในงานของ Vaswani et al.[9] โมเดลได้รับการฝึกจากศูนย์และไม่ได้เป็นอนุพันธ์จาก LLaMA แม้จะมีความคล้ายคลึงในการนำไปใช้งาน[1]
กลไก Multi-Head Self-Attention พื้นฐานอธิบายด้วยสูตร:
โดยที่ , , คือเมทริกซ์ queries, keys และ values ตามลำดับ และ คือมิติของ keys[9]
การปรับแต่งสถาปัตยกรรมหลักของ Yi:[1]
- Grouped-Query Attention (GQA) — การแบ่ง query-heads ออกเป็นกลุ่มที่ใช้ key/value-heads ร่วมกัน ซึ่งช่วยลดการใช้หน่วยความจำโดยไม่สูญเสียคุณภาพ
- การกระตุ้น SwiGLU — แทนที่ ReLU/GELU มาตรฐาน ช่วยลดขนาดของ activation เหลือ 8/3 ของ hidden size
- Rotary Position Embedding (RoPE) ที่มีการปรับความถี่ฐาน (adjusted base frequency, ABF) เพื่อขยาย context โดยไม่ต้องเปลี่ยนสถาปัตยกรรม
- พจนานุกรม (vocabulary): 64,000 token บน BPE (SentencePiece) พร้อมการแยกตัวเลขเป็นหลักและ unicode-byte fallback สำหรับอักขระที่หายาก
การกำหนดค่าของโมเดลพื้นฐาน
พารามิเตอร์สถาปัตยกรรมจากรายงานทางเทคนิค arXiv:2403.04652:[1]
| พารามิเตอร์ | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| จำนวนชั้น | 32 | 60 |
| ความยาว pre-training (Pretrain Seq. Len) | 4096 | 4096 |
| อัตราการเรียนรู้สูงสุด (Max LR) | 3×10⁻⁴ | 1.5×10⁻⁴ |
แหล่งที่มา: arXiv:2403.04652, ตารางพารามิเตอร์[1]
สถาปัตยกรรม Yi-Lightning (MoE)
Yi-Lightning (2024) ใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ที่ได้รับการปรับปรุงพร้อมคุณลักษณะดังต่อไปนี้:[8]
- Fine-grained expert segmentation — การแบ่ง FFN-blocks ออกเป็น expert อย่างละเอียดเพื่อเพิ่มความเชี่ยวชาญ
- การปรับสมดุลโหลดหลายระดับ — ผสมผสาน Switch-Transformer (ST), Expert Parallel (EP) และ Partitioned EP (PEP) losses เพื่อกระจาย token ระหว่าง expert อย่างสม่ำเสมอ
- Hybrid attention — สลับกัน 3 ชั้นที่มี sliding window และ 1 ชั้นที่มี full attention พร้อมการนำ KV-cache กลับมาใช้ซ้ำระหว่างชั้น
- การลดหน่วยความจำ KV-cache ลง 82.8% เมื่อเทียบกับแนวทางมาตรฐานในการประมวลผลลำดับยาว
- หน้าต่าง context ขยายเป็น 64,000 token
จำนวน expert ที่แน่นอนและพารามิเตอร์รวมทั้งหมดของ Yi-Lightning ยังไม่ได้รับการเปิดเผยในแหล่งข้อมูลสาธารณะ[8]
ตัวแปรหลายรูปแบบ (Yi-VL)
ในโมเดลหลายรูปแบบ Yi-VL โมเดลภาษาจะเชื่อมต่อกับตัวเข้ารหัสภาพ CLIP ViT-H/14 ผ่าน MLP projection ภาพ ถูกแปลงโดยตัวเข้ารหัสภาพเป็นลำดับ embedding ซึ่งป้อนเข้าสู่โมเดลภาษาร่วมกับ token ข้อความ การฝึกดำเนินการในสามขั้นตอนพร้อมการเพิ่มความละเอียด: 224×224 → 448×448 พิกเซล[1]
Pipeline การฝึกและการปรับแนว
การฝึกเบื้องต้น (Pre-training)
โมเดลพื้นฐาน Yi-6B และ Yi-34B ได้รับการ pre-train บนคลังข้อมูลสองภาษาขนาด 3.1 ล้านล้าน token ข้อมูลผ่าน pipeline การกรองและการลบซ้ำแบบต่อเนื่อง ได้แก่ ตัวกรองแบบ heuristic, scorer ที่ผ่านการฝึก (perplexity, quality, coherence, safety), การจัดกลุ่ม และการลบซ้ำด้วย MinHash แหล่งข้อมูล ได้แก่ Common Crawl, หนังสือ และบทความวิทยาศาสตร์[1]
สำหรับ Yi-1.5 มีการดำเนินการ pre-training ต่อเนื่อง (continued pre-training) บน token คุณภาพสูงเพิ่มเติม 500 พันล้านรายการ[7]
การ fine-tuning แบบมีผู้ดูแล (Supervised Fine-Tuning, SFT)
ตัวแปรแชทของรุ่นแรกได้รับการ fine-tune บนชุดข้อมูลขนาดเล็กแต่ผ่านการตรวจสอบอย่างละเอียด — น้อยกว่า 10,000 ตัวอย่างแบบหลายรอบ (multi-turn) โดยแต่ละรายการได้รับการตรวจสอบและแก้ไขด้วยตนเองโดยวิศวกร ML สำหรับ Yi-1.5 ปริมาณข้อมูล SFT เพิ่มขึ้นเป็น 3 ล้านตัวอย่าง[1][7]
การปรับแนวด้วย Reinforcement Learning
สำหรับ Yi-Lightning มีการใช้กระบวนการปรับแนวหลายขั้นตอน: SFT ตามด้วย RLHF/DPO ข้อมูลสังเคราะห์สร้างขึ้นโดยใช้ Monte Carlo Tree Search (MCTS) กรอบความปลอดภัย RAISE ใช้การป้องกันสี่ระดับ: การกรองข้อมูล pre-training, safety fine-tuning, การควบคุม prompt ขาเข้า และการควบคุมการตอบสนองขาออก[8]
การขยาย context
การขยายหน้าต่าง context เป็น 200,000 token ดำเนินการผ่าน pre-training ต่อเนื่องแบบเบาบางบน 5 พันล้าน token (หนังสือ + คำถาม-คำตอบสังเคราะห์) โดยใช้เทคนิค RoPE ABF หลังการปรับแต่ง ความแม่นยำในงาน Needle-in-a-Haystack (การค้นหาส่วนข้อความเป้าหมายในข้อความยาว) ถึง 99.8%[1][2]
Depth Upscaling
Yi-9B ได้มาจากการทำซ้ำชั้นที่ 12–28 ของโมเดลพื้นฐาน Yi-6B แล้วดำเนินการ pre-train บน 800 พันล้าน token วิธีนี้ช่วยเพิ่มความจุของโมเดลโดยไม่ต้องฝึกจากศูนย์[1]
ส่วนประกอบของตระกูลโมเดล
โมเดลภาษาหลัก
| โมเดล | พารามิเตอร์ | ประเภท | Context | วันที่เปิดตัว | ลิขสิทธิ์ | หมายเหตุ |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 พันล้าน / 34 พันล้าน | Base / Chat | 4K (ขยายเป็น 32K) | พฤศจิกายน 2023 | Apache 2.0 | โมเดลพื้นฐานที่ฝึกจากศูนย์ |
| Yi-6B-200K / Yi-34B-200K | 6 พันล้าน / 34 พันล้าน | Base | 200K | พฤศจิกายน 2023 | Apache 2.0 | Pre-training ต่อเนื่องบนลำดับยาว |
| Yi-9B | 9 พันล้าน | Base | 4K (ขยายเป็น 200K) | มีนาคม 2024 | Apache 2.0 | Depth-upscale จาก Yi-6B + 800 พันล้าน token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 พันล้าน | Base / Chat | 4K / 16K / 32K | พฤษภาคม 2024 | Apache 2.0 | +500 พันล้าน token + ตัวอย่าง SFT 3 ล้านรายการ |
| Yi-Large | ~1 ล้านล้าน (MoE, จำนวน active ไม่ได้เปิดเผย) | LLM | ไม่ได้เปิดเผย | พฤษภาคม 2024 | ปิด (API) | วางตำแหน่งเป็น SOTA |
| Yi-Lightning | MoE (จำนวน expert ไม่ได้เปิดเผย) | LLM | 64K | ตุลาคม 2024 | API | อันดับที่ 6 ของ LMSYS Chatbot Arena |
แหล่งที่มา: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi[1][8][2]
โมเดลเฉพาะทาง
| โมเดล | พารามิเตอร์ | รูปแบบข้อมูล | Context | วันที่เปิดตัว | หมายเหตุ |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 พันล้าน | ข้อความ + ภาพ (448×448) | ตามโมเดลพื้นฐาน | มกราคม 2024 | ตัวเข้ารหัส ViT (CLIP ViT-H/14), การฝึกสามขั้นตอน |
| Yi-Coder-1.5B / Yi-Coder-9B | 1.5 / 9 พันล้าน | ข้อความ (โค้ด) | 128K | กันยายน 2024 | รองรับ 52 ภาษาโปรแกรม |
แหล่งที่มา: arXiv:2403.04652; GitHub 01-ai/Yi[1][2]
ตัวระบุ API
ตัวอย่างบนแพลตฟอร์ม 01.AI และผู้ให้บริการภายนอก: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate)[6][10][11]
การประเมินและ benchmark
ผลลัพธ์ของโมเดลพื้นฐาน
ข้อมูลจากรายงานทางเทคนิค arXiv:2403.04652 (เงื่อนไข: 0-shot / 5-shot ขึ้นอยู่กับ benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63.2 | 76.3 | 62.6 | 69.7 | 66.7 | — |
| BBH | 42.8 | 54.3 | 44.1 | — | 53.4 | — |
| C-Eval | 72.0 | 81.4 | — | 50.1 | 72.1 | 70.1 |
| CMMLU | 75.5 | 83.7 | — | 53.3 | 71.0 | 52.5 |
| GSM8K | 32.5 | 67.2 | 42.2 | 56.8 | 61.3 | 57.1 |
| HumanEval | 15.9 | 23.2 | 22.6 | 31.7 | 32.3 | 48.1 |
แหล่งที่มา: arXiv:2403.04652, ตารางผลลัพธ์[1]
Yi-34B แสดงผลลัพธ์ที่เหนือกว่า Llama 2-70B (ขณะที่มีขนาดเล็กกว่าสองเท่า) ในส่วนใหญ่ของ benchmark และเป็นผู้นำในกลุ่มโมเดลแบบเปิดบน C-Eval และ CMMLU ณ เวลาที่เปิดตัว[1][12]
ผลลัพธ์ของ Yi-Lightning
ข้อมูลจากรายงานทางเทคนิค arXiv:2412.01253 (เงื่อนไข: 0-shot เว้นแต่จะระบุไว้เป็นอย่างอื่น):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50.9 | 49.1 | 45.1 |
| MATH | 76.4 | 82.7 | 67.1 |
| HumanEval | 83.5 | 86.0 | 76.2 |
| WildBench | 65.1 | 59.9 | 49.0 |
| Arena-Hard | 91.8 | 90.5 | 74.0 |
แหล่งที่มา: arXiv:2412.01253[8]
การจัดอันดับโดยผู้ใช้
Yi-34B-Chat ครองอันดับที่ 2 บน AlpacaEval (94.08% รองจาก GPT-4 Turbo) ในช่วงเดือนธันวาคม 2023 – มกราคม 2024 โดยมีคะแนน Elo ~1110 บน LMSYS Chatbot Arena Yi-34B เป็นผู้นำในกลุ่มโมเดลแบบเปิดบน Hugging Face Open LLM Leaderboard และ C-Eval ณ เวลาที่เปิดตัว[2][1]
Yi-Lightning ครองอันดับที่ 6 โดยรวมบน LMSYS Chatbot Arena (คะแนน 1287) อันดับที่ 2 ในภาษาจีน และอันดับที่ 3–4 ในหมวดย่อย "คณิตศาสตร์", "การเขียนโค้ด", "hard prompts" และ "multi-turn" ณ เวลาที่เผยแพร่รายงาน[8]
หมายเหตุ: การเปรียบเทียบโดยตรงระหว่างโมเดลจากการเปิดตัวและการกำหนดค่าที่แตกต่างกันต้องการเงื่อนไขการทดสอบที่สอดคล้องกัน (เวอร์ชัน benchmark เดียวกัน, พารามิเตอร์การสร้างที่เหมือนกัน) การประเมินแบบอัตวิสัยบนแพลตฟอร์ม crowdsourcing ขึ้นอยู่กับองค์ประกอบของผู้เข้าร่วมและชุดโมเดลปัจจุบันในระบบ[12]
การประยุกต์ใช้งาน
ตระกูล Yi ถูกนำไปใช้งานในงานประมวลผลภาษาธรรมชาติและการวิเคราะห์หลายรูปแบบที่หลากหลาย:[3][13]
- ผู้ช่วยแชทและระบบสนทนา — บนพื้นฐานของตัวแปรแชท Yi-34B-Chat และ Yi-1.5
- การสร้างและวิเคราะห์โค้ด — Yi-Coder รองรับ 52 ภาษาโปรแกรม
- การวิเคราะห์เอกสารยาว — ตัวแปรที่มี context 200K สำหรับงานด้านกฎหมาย เทคนิค และการวิเคราะห์
- การวิเคราะห์หลายรูปแบบ — การอธิบายภาพและการตอบคำถามด้วยภาพผ่าน Yi-VL
- ตัวแทนองค์กร — ระบบ RAG, การค้นหาความรู้ และการจำแนกข้อมูลผ่านแพลตฟอร์ม 01.AI
- การนำไปใช้งานในเครื่อง — ผ่าน vLLM, llama.cpp, Hugging Face Transformers; เวอร์ชัน quantize (AWQ/GPTQ 4/8-bit) พร้อมใช้งานสำหรับการนำไปใช้บน GPU สำหรับผู้บริโภค (เช่น RTX 4090 สำหรับ Yi-34B-4bit)
ตัวแปร API (Yi-Large, Yi-Lightning) ใช้สำหรับ chatbot, บริการหลายภาษา และ low-cost inference ต้นทุน inference ของ Yi-Lightning อยู่ที่ 14 เซนต์ต่อล้าน token ณ ปี 2024[8]
ข้อจำกัดและปัญหาที่ยังเปิดอยู่
- การสร้างข้อมูลเท็จ (Hallucination) โมเดลมีแนวโน้มเกิดข้อผิดพลาดทางข้อเท็จจริงในการตอบสนองที่สร้างขึ้น ซึ่งเป็นลักษณะทั่วไปของ LLM โดยเฉพาะในการให้เหตุผลที่ซับซ้อนและห่วงโซ่การอนุมานยาว[1]
- คณิตศาสตร์และโค้ดในเวอร์ชันแรก โมเดลพื้นฐาน Yi-34B แสดงผลลัพธ์ที่อ่อนแอกว่าในด้านการเขียนโค้ดที่ซับซ้อนและคณิตศาสตร์เมื่อเทียบกับโมเดล frontier เฉพาะทาง (เช่น MATH Yi-34B แบบ 4-shot — 14.4) ปัญหานี้ได้รับการแก้ไขบางส่วนใน Yi-1.5 และ Yi-Lightning[1][8]
- Context ยาว การขยายเป็น 200K ต้องการ pre-training เพิ่มเติมและทรัพยากรการคำนวณ อาจเกิดการลดประสิทธิภาพเล็กน้อยบน context สั้น[1]
- โมเดลแบบปิด Yi-Large และ Yi-Lightning ไม่ให้น้ำหนักสำหรับดาวน์โหลด ซึ่งจำกัดการตรวจสอบสถาปัตยกรรมและข้อมูลโดยอิสระ[8]
- ช่องว่างระหว่าง Arena และ benchmark Yi-Lightning แสดงผลลัพธ์ที่แข็งแกร่งในการประเมินโดยผู้ใช้ (Chatbot Arena) แต่ล้าหลังคู่แข่งบางรายใน benchmark วิชาการแบบคงที่ — สะท้อนปัญหาทั่วไปของความไม่สอดคล้องของเมตริก[8]
- ความสามารถในการทำซ้ำ รายละเอียดการฝึกทั้งหมด (องค์ประกอบ dataset ที่แน่นอน, การกระจายโดเมน, hyperparameter) ยังไม่ได้รับการเปิดเผยอย่างครบถ้วน[13]
- ความไวต่อ prompt เช่นเดียวกับ LLM อื่นๆ โมเดล Yi มีความไวต่อการกำหนดสูตรของ prompt ซึ่งส่งผลต่อความเสถียรของผลลัพธ์[1]
ไม่มีการบันทึกการถดถอยที่รุนแรงที่ทราบหลังการเปิดตัว ชุมชนสังเกตเห็นความเสถียรของเวอร์ชัน quantize[2]
ด้านจริยธรรมและกฎระเบียบ
Yi-Lightning ได้นำกรอบความปลอดภัย RAISE มาใช้ ซึ่งมีการป้องกันสี่ระดับ:[8]
- การกรองเนื้อหาที่เป็นพิษ, PII และวัสดุที่เป็นอันตรายในขั้นตอน pre-training
- Safety fine-tuning พร้อมตัวอย่างการจัดการคำขอที่ละเอียดอ่อนอย่างถูกต้อง
- การควบคุมขาเข้า (การจำแนก prompt)
- การควบคุมขาออก (การกรองการตอบสนอง)
ลิขสิทธิ์ Apache 2.0 สำหรับโมเดลแบบเปิดอนุญาตให้ใช้งานเชิงพาณิชย์ ผู้ให้บริการโฮสต์แต่ละรายอาจมีข้อกำหนดเพิ่มเติม โมเดลเป็นไปตามกฎระเบียบด้าน AI ของจีน (การรับรอง CAICT สำหรับโซลูชันองค์กร)[1][3]
แนวโน้มและทิศทางการวิจัย
ซีรีส์ Yi แสดงให้เห็นถึงประสิทธิภาพของแนวทางที่ให้ความสำคัญกับคุณภาพข้อมูลมากกว่าจำนวนพารามิเตอร์ รวมถึงการขยายขนาดแบบเบา (continual pretraining, depth upscaling, การปรับแต่ง MoE)[1]
หลังปี 2025 บริษัท 01.AI ได้เปลี่ยนความสนใจไปที่โซลูชันประยุกต์:[4]
- ระบบหลายตัวแทนและแพลตฟอร์มองค์กร WorldWise LLM Platform 2.5
- การผสานรวมโมเดลจากภายนอก (รวมถึง DeepSeek) เข้าสู่ workflow องค์กร
- การปรับแต่ง inference (การ quantize, FP8) เพื่อลดต้นทุนการนำไปใช้งาน
โมเดลแบบเปิดยังคงถูกใช้โดยชุมชนเพื่อการวิจัย, fine-tuning และ distillation[6]
เอกสารอ้างอิง
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
ลิงก์ภายนอก
- https://github.com/01-ai/Yi — คลัง GitHub อย่างเป็นทางการของ Yi
- https://github.com/01-ai/Yi-1.5 — คลัง Yi-1.5
- https://www.01.ai/yi-models — หน้าโมเดล Yi อย่างเป็นทางการ
- https://huggingface.co/01-ai — องค์กร 01-ai บน Hugging Face
- https://en.wikipedia.org/wiki/01.AI — บทความ Wikipedia เกี่ยวกับบริษัท 01.AI
หมายเหตุ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms