Yi (01.AI) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — họ các mô hình ngôn ngữ lớn (Large Language Model, LLM) và mô hình thị giác-ngôn ngữ (Vision-Language Model, VLM), được phát triển bởi công ty 01.AI (零一万物) dưới sự dẫn dắt của Kai-Fu Lee. Các mô hình được huấn luyện từ đầu trên kho ngữ liệu song ngữ chất lượng cao (tiếng Anh và tiếng Trung) với dung lượng 3,1 nghìn tỷ token, bao gồm các biến thể dành cho sinh văn bản, xử lý ngữ cảnh dài (lên đến 200 nghìn token), đầu vào đa phương thức (văn bản + hình ảnh), sinh mã nguồn và suy luận hiệu quả dựa trên kiến trúc Mixture-of-Experts (MoE). Các biến thể mã nguồn mở được phân phối theo giấy phép Apache 2.0 với quyền sử dụng thương mại; các mô hình flagship dạng đóng (Yi-Large, Yi-Lightning) có thể truy cập qua API.[1][2][3]

Lịch sử và niên đại phát triển

Công ty 01.AI được thành lập vào tháng 3 năm 2023 bởi Kai-Fu Lee, cựu lãnh đạo Microsoft Research Asia và Google China, có trụ sở tại Bắc Kinh. Trọng tâm của công ty là phát triển các LLM hiệu quả với chú trọng vào chất lượng dữ liệu và tối ưu hóa hạ tầng kỹ thuật. Đến tháng 11 năm 2023, 01.AI đạt được vị thế "kỳ lân" (định giá trên 1 tỷ đô la) sau vòng tài trợ có sự tham gia của Alibaba.[4][5]

Thế hệ đầu tiên (2023–2024)

Các mô hình mã nguồn mở đầu tiên Yi-6B và Yi-34B được giới thiệu vào ngày 2 tháng 11 năm 2023. Trong những tuần tiếp theo, dòng sản phẩm được bổ sung các biến thể với ngữ cảnh 200 nghìn token (ngày 5 tháng 11 năm 2023), các biến thể chat và mô hình được lượng tử hóa (ngày 23 tháng 11 năm 2023). Vào tháng 1 năm 2024, các mô hình đa phương thức Yi-VL-6B và Yi-VL-34B ra mắt. Vào tháng 3 năm 2024, mô hình Yi-9B được giới thiệu, thu được bằng phương pháp mở rộng chiều sâu (depth upscaling) từ Yi-6B, và báo cáo kỹ thuật arXiv:2403.04652 được công bố.[1][2]

Yi-1.5 và các mô hình chuyên biệt (2024)

Ngày 13 tháng 5 năm 2024, loạt Yi-1.5 (6B/9B/34B) được phát hành — kết quả của quá trình tiền huấn luyện liên tục trên thêm 500 tỷ token và tinh chỉnh trên 3 triệu ví dụ hướng dẫn. Vào tháng 5–6 năm 2024, mô hình độc quyền dạng đóng Yi-Large được ra mắt với quyền truy cập API, được định vị là SOTA. Vào tháng 9 năm 2024, loạt Yi-Coder chuyên biệt (1,5B/9B) dành cho sinh mã nguồn ra đời với ngữ cảnh 128 nghìn token và hỗ trợ 52 ngôn ngữ lập trình.[1][6][7]

Yi-Lightning (2024)

Vào tháng 10 năm 2024, mô hình flagship Yi-Lightning được giới thiệu dựa trên kiến trúc Mixture-of-Experts (MoE), được tối ưu hóa cho tốc độ và hiệu quả suy luận. Yi-Lightning đứng thứ 6 trong bảng xếp hạng chung LMSYS Chatbot Arena (Elo 1287), thứ 2 về tiếng Trung và thứ 3–4 về toán học và lập trình. Báo cáo kỹ thuật được công bố vào tháng 12 năm 2024 (arXiv:2412.01253).[8]

Thay đổi chiến lược (2025)

Vào tháng 3 năm 2025, công ty 01.AI tuyên bố ngừng tiền huấn luyện các mô hình ngôn ngữ lớn mới và tập trung vào các ứng dụng doanh nghiệp, hệ thống đa tác nhân và nền tảng WorldWise LLM Platform 2.5 dựa trên các mô hình của bên thứ ba (bao gồm DeepSeek).[4]

Niên đại tổng hợp

Ngày Sự kiện
Tháng 11 năm 2023 Phát hành Yi-6B và Yi-34B (base, chat, các biến thể 200K)
Tháng 1 năm 2024 Mô hình đa phương thức Yi-VL-6B và Yi-VL-34B
Tháng 3 năm 2024 Yi-9B (depth-upscaled); công bố báo cáo kỹ thuật arXiv:2403.04652
Tháng 5 năm 2024 Yi-1.5 (6B/9B/34B); Yi-Large (dạng đóng, API)
Tháng 9 năm 2024 Yi-Coder-1.5B/9B (chuyên biệt về mã nguồn, ngữ cảnh 128K)
Tháng 10 năm 2024 Yi-Lightning (kiến trúc MoE, mô hình flagship)
Tháng 12 năm 2024 Công bố báo cáo kỹ thuật Yi-Lightning (arXiv:2412.01253)
Tháng 3 năm 2025 Ngừng tiền huấn luyện các LLM mới; tập trung vào giải pháp doanh nghiệp

Cơ sở lý thuyết và kiến trúc

Kiến trúc nền tảng

Tất cả các mô hình trong họ Yi đều dựa trên kiến trúc transformer chỉ giải mã (decoder-only Transformer), được mô tả trong công trình của Vaswani et al.[9] Các mô hình được huấn luyện từ đầu và không phải là dẫn xuất từ LLaMA, mặc dù có sự tương đồng về cách triển khai.[1]

Cơ chế cơ bản của Multi-Head Self-Attention được mô tả bằng công thức:

Attention(Q,K,V)=softmax(QKdk)V

trong đó Q, K, V lần lượt là các ma trận truy vấn (queries), khóa (keys) và giá trị (values), dk là chiều của khóa.[9]

Các sửa đổi kiến trúc chính của Yi:[1]

  • Grouped-Query Attention (GQA) — chia các đầu query thành các nhóm với các đầu key/value chung, giúp giảm tiêu thụ bộ nhớ trong khi duy trì chất lượng.
  • Kích hoạt SwiGLU — thay thế ReLU/GELU tiêu chuẩn; giảm kích thước kích hoạt xuống còn 8/3 kích thước lớp ẩn (hidden size).
  • Rotary Position Embedding (RoPE) với tần số cơ sở được điều chỉnh (adjusted base frequency, ABF), đảm bảo mở rộng ngữ cảnh mà không cần thay đổi kiến trúc.
  • Từ điển (vocabulary): 64.000 token dựa trên BPE (SentencePiece) với việc tách các số thành chữ số và unicode-byte fallback cho các ký tự hiếm.

Cấu hình các mô hình nền tảng

Các tham số kiến trúc từ báo cáo kỹ thuật arXiv:2403.04652:[1]

Tham số Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Số lớp 32 60
Độ dài tiền huấn luyện (Pretrain Seq. Len) 4096 4096
Tốc độ học tối đa (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Nguồn: arXiv:2403.04652, bảng tham số.[1]

Kiến trúc Yi-Lightning (MoE)

Yi-Lightning (2024) sử dụng kiến trúc Mixture-of-Experts (MoE) cải tiến với các đặc điểm sau:[8]

  • Phân đoạn chuyên gia mịn (Fine-grained expert segmentation) — phân chia chi tiết các khối FFN thành các chuyên gia để tăng mức độ chuyên môn hóa.
  • Cân bằng tải đa cấp — kết hợp các hàm loss Switch-Transformer (ST), Expert Parallel (EP) và Partitioned EP (PEP) để phân phối token đều giữa các chuyên gia.
  • Attention lai — luân phiên 3 lớp với cửa sổ trượt (sliding window) và 1 lớp với attention đầy đủ (full attention), tái sử dụng KV-cache giữa các lớp.
  • Giảm bộ nhớ KV-cache đến 82,8% so với phương pháp tiêu chuẩn khi xử lý các chuỗi dài.
  • Cửa sổ ngữ cảnh được mở rộng đến 64 nghìn token.

Số lượng chuyên gia chính xác và tổng số tham số của Yi-Lightning không được tiết lộ trong các nguồn công khai.[8]

Các biến thể đa phương thức (Yi-VL)

Trong các mô hình đa phương thức Yi-VL, mô hình ngôn ngữ được kết nối với bộ mã hóa thị giác CLIP ViT-H/14 thông qua phép chiếu MLP. Hình ảnh I được bộ mã hóa thị giác chuyển đổi thành chuỗi embedding {v1,,vK}, được đưa vào mô hình ngôn ngữ cùng với các token văn bản. Quá trình huấn luyện diễn ra qua ba giai đoạn với độ phân giải tăng dần: 224×224 → 448×448 pixel.[1]

Pipeline huấn luyện và căn chỉnh

Tiền huấn luyện (Pre-training)

Các mô hình nền tảng Yi-6B và Yi-34B được tiền huấn luyện trên kho ngữ liệu song ngữ với dung lượng 3,1 nghìn tỷ token. Dữ liệu trải qua pipeline lọc và loại trùng lặp theo tầng: bộ lọc heuristic, bộ chấm điểm được huấn luyện (perplexity, quality, coherence, safety), phân cụm và loại trùng lặp MinHash. Nguồn dữ liệu — Common Crawl, sách và bài báo khoa học.[1]

Đối với Yi-1.5, việc tiền huấn luyện liên tục (continued pre-training) được thực hiện trên thêm 500 tỷ token kho ngữ liệu chất lượng cao.[7]

Tinh chỉnh có giám sát (Supervised Fine-Tuning, SFT)

Các biến thể chat thế hệ đầu tiên được tinh chỉnh trên tập dữ liệu nhỏ nhưng được chọn lọc kỹ lưỡng — ít hơn 10 nghìn ví dụ đa lượt (multi-turn), mỗi ví dụ được kiểm tra và chỉnh sửa thủ công bởi các kỹ sư machine learning. Đối với Yi-1.5, khối lượng dữ liệu SFT được tăng lên 3 triệu ví dụ.[1][7]

Căn chỉnh bằng học tăng cường

Đối với Yi-Lightning, quy trình căn chỉnh đa giai đoạn được áp dụng: SFT theo sau là RLHF/DPO. Dữ liệu tổng hợp được tạo ra sử dụng Monte Carlo Tree Search (MCTS). Framework bảo mật RAISE triển khai bảo vệ bốn lớp: lọc dữ liệu tiền huấn luyện, safety fine-tuning, kiểm soát đầu vào prompt và kiểm soát đầu ra phản hồi.[8]

Mở rộng ngữ cảnh

Việc mở rộng cửa sổ ngữ cảnh lên 200 nghìn token được thực hiện thông qua tiền huấn luyện liên tục nhẹ trên 5 tỷ token (sách + câu hỏi-trả lời tổng hợp) sử dụng kỹ thuật RoPE ABF. Sau khi tinh chỉnh, độ chính xác trong bài toán Needle-in-a-Haystack (tìm kiếm đoạn mục tiêu trong văn bản dài) đạt 99,8%.[1][2]

Mở rộng chiều sâu (Depth Upscaling)

Yi-9B được tạo ra bằng cách nhân đôi các lớp 12–28 của mô hình nền tảng Yi-6B với tiền huấn luyện tiếp theo trên 800 tỷ token. Phương pháp này cho phép tăng dung lượng mô hình mà không cần huấn luyện từ đầu.[1]

Thành phần họ mô hình

Các mô hình ngôn ngữ chính

Mô hình Tham số Loại Ngữ cảnh Ngày phát hành Giấy phép Ghi chú
Yi-6B / Yi-34B 6 tỷ / 34 tỷ Base / Chat 4K (mở rộng đến 32K) Tháng 11 năm 2023 Apache 2.0 Mô hình nền tảng, huấn luyện từ đầu
Yi-6B-200K / Yi-34B-200K 6 tỷ / 34 tỷ Base 200K Tháng 11 năm 2023 Apache 2.0 Tiền huấn luyện liên tục trên chuỗi dài
Yi-9B 9 tỷ Base 4K (mở rộng đến 200K) Tháng 3 năm 2024 Apache 2.0 Depth-upscale từ Yi-6B + 800 tỷ token
Yi-1.5-6B/9B/34B 6 / 9 / 34 tỷ Base / Chat 4K / 16K / 32K Tháng 5 năm 2024 Apache 2.0 +500 tỷ token + 3 triệu ví dụ SFT
Yi-Large ~1 nghìn tỷ (MoE, số tham số kích hoạt không được tiết lộ) LLM Không được tiết lộ Tháng 5 năm 2024 Dạng đóng (API) Được định vị là SOTA
Yi-Lightning MoE (số chuyên gia không được tiết lộ) LLM 64K Tháng 10 năm 2024 API Xếp thứ 6 LMSYS Chatbot Arena

Nguồn: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Các mô hình chuyên biệt

Mô hình Tham số Phương thức Ngữ cảnh Ngày phát hành Ghi chú
Yi-VL-6B / Yi-VL-34B 6 / 34 tỷ Văn bản + hình ảnh (448×448) Tiêu chuẩn của mô hình nền tảng Tháng 1 năm 2024 Bộ mã hóa ViT (CLIP ViT-H/14), huấn luyện ba giai đoạn
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 tỷ Văn bản (mã nguồn) 128K Tháng 9 năm 2024 52 ngôn ngữ lập trình

Nguồn: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Định danh API

Ví dụ trên nền tảng 01.AI và các nhà cung cấp bên thứ ba: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Đánh giá và benchmark

Kết quả các mô hình nền tảng

Dữ liệu từ báo cáo kỹ thuật arXiv:2403.04652 (điều kiện: 0-shot / 5-shot, tùy theo benchmark):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Nguồn: arXiv:2403.04652, bảng kết quả.[1]

Yi-34B đã cho thấy kết quả vượt trội so với Llama 2-70B (với kích thước nhỏ hơn gấp đôi) trên hầu hết các benchmark và dẫn đầu trong số các mô hình mã nguồn mở trên C-Eval và CMMLU tại thời điểm phát hành.[1][12]

Kết quả Yi-Lightning

Dữ liệu từ báo cáo kỹ thuật arXiv:2412.01253 (điều kiện: 0-shot, trừ khi có ghi chú khác):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Nguồn: arXiv:2412.01253.[8]

Xếp hạng người dùng

Yi-34B-Chat đứng thứ 2 trên AlpacaEval (94,08%, sau GPT-4 Turbo) vào tháng 12 năm 2023 – tháng 1 năm 2024, với điểm Elo ~1110 trên LMSYS Chatbot Arena. Yi-34B dẫn đầu trong số các mô hình mã nguồn mở trên Hugging Face Open LLM Leaderboard và C-Eval tại thời điểm phát hành.[2][1]

Yi-Lightning đứng thứ 6 chung trên LMSYS Chatbot Arena (điểm 1287), thứ 2 về tiếng Trung và thứ 3–4 trong các hạng mục "toán học", "lập trình", "hard prompts" và "multi-turn" tại thời điểm công bố báo cáo.[8]

Lưu ý. Việc so sánh trực tiếp các mô hình từ các phiên bản và cấu hình khác nhau đòi hỏi các điều kiện kiểm tra đồng nhất (cùng phiên bản benchmark, cùng tham số sinh văn bản). Các đánh giá chủ quan trên các nền tảng crowdsourcing phụ thuộc vào thành phần người tham gia và tập hợp mô hình hiện tại trong hệ thống.[12]

Ứng dụng

Họ Yi được ứng dụng trong nhiều tác vụ xử lý ngôn ngữ tự nhiên và phân tích đa phương thức:[3][13]

  • Trợ lý chat và hệ thống hội thoại — dựa trên các biến thể chat Yi-34B-Chat và Yi-1.5.
  • Sinh và phân tích mã nguồn — Yi-Coder hỗ trợ 52 ngôn ngữ lập trình.
  • Phân tích tài liệu dài — các biến thể với ngữ cảnh 200K cho các tác vụ pháp lý, kỹ thuật và phân tích.
  • Phân tích đa phương thức — mô tả hình ảnh và trả lời câu hỏi trực quan qua Yi-VL.
  • Tác nhân doanh nghiệp — hệ thống RAG, tìm kiếm tri thức và phân loại dữ liệu qua nền tảng 01.AI.
  • Triển khai cục bộ — qua vLLM, llama.cpp, Hugging Face Transformers; các phiên bản lượng tử hóa (AWQ/GPTQ 4/8-bit) có sẵn để triển khai trên GPU tiêu dùng (ví dụ: RTX 4090 cho Yi-34B-4bit).

Các biến thể API (Yi-Large, Yi-Lightning) được sử dụng cho chatbot, dịch vụ đa ngôn ngữ và suy luận chi phí thấp. Chi phí suy luận Yi-Lightning là 14 cent cho mỗi triệu token tính đến năm 2024.[8]

Hạn chế và vấn đề còn tồn tại

  • Ảo giác. Các mô hình dễ mắc lỗi thực tế điển hình của LLM trong các phản hồi được tạo ra, đặc biệt trong các suy luận phức tạp và chuỗi suy diễn dài.[1]
  • Toán học và mã nguồn trong các phiên bản đầu. Các mô hình nền tảng Yi-34B cho thấy kết quả yếu hơn trong lập trình và toán học phức tạp so với các mô hình frontier chuyên biệt (ví dụ: MATH Yi-34B ở 4-shot — 14,4). Vấn đề này được giải quyết một phần trong Yi-1.5 và Yi-Lightning.[1][8]
  • Ngữ cảnh dài. Việc mở rộng đến 200K đòi hỏi tiền huấn luyện bổ sung và tài nguyên tính toán; có thể xảy ra sự suy giảm hiệu suất nhỏ trên ngữ cảnh ngắn.[1]
  • Các mô hình dạng đóng. Yi-Large và Yi-Lightning không cung cấp trọng số để tải xuống, điều này hạn chế khả năng xác minh độc lập kiến trúc và dữ liệu.[8]
  • Khoảng cách giữa Arena và benchmark. Yi-Lightning cho thấy kết quả mạnh trong các đánh giá người dùng (Chatbot Arena), nhưng thua kém một số đối thủ cạnh tranh trên các benchmark học thuật tĩnh — phản ánh vấn đề chung về sự không nhất quán của các chỉ số.[8]
  • Khả năng tái tạo. Không phải tất cả các chi tiết huấn luyện (thành phần chính xác của dataset, phân phối lĩnh vực, siêu tham số) đều được tiết lộ đầy đủ.[13]
  • Độ nhạy với prompt. Cũng như các LLM khác, các mô hình Yi nhạy cảm với cách diễn đạt prompt, ảnh hưởng đến tính ổn định của kết quả.[1]

Không có sự hồi quy nghiêm trọng nào được ghi nhận sau các lần phát hành; cộng đồng ghi nhận tính ổn định của các phiên bản lượng tử hóa.[2]

Khía cạnh đạo đức và quy định

Trong Yi-Lightning, framework bảo mật RAISE được triển khai, thực hiện bảo vệ bốn lớp:[8]

  • Lọc nội dung độc hại, PII và tài liệu có hại trong giai đoạn tiền huấn luyện.
  • Safety fine-tuning với các ví dụ xử lý đúng đắn các yêu cầu nhạy cảm.
  • Kiểm soát đầu vào (phân loại prompt).
  • Kiểm soát đầu ra (lọc phản hồi).

Giấy phép Apache 2.0 cho các mô hình mã nguồn mở cho phép sử dụng thương mại; một số dịch vụ hosting riêng lẻ có thể đặt ra các yêu cầu bổ sung. Các mô hình tuân thủ các chuẩn mực pháp lý về AI của Trung Quốc (chứng nhận CAICT cho các giải pháp doanh nghiệp).[1][3]

Triển vọng và hướng nghiên cứu

Loạt Yi thể hiện hiệu quả của phương pháp tiếp cận đặt chất lượng dữ liệu lên trên quy mô tham số, cũng như mở rộng nhẹ nhàng (continual pretraining, depth upscaling, tối ưu hóa MoE).[1]

Sau năm 2025, trọng tâm của 01.AI chuyển sang các giải pháp ứng dụng:[4]

  • Hệ thống đa tác nhân và nền tảng doanh nghiệp WorldWise LLM Platform 2.5.
  • Tích hợp các mô hình của bên thứ ba (bao gồm DeepSeek) vào quy trình làm việc doanh nghiệp.
  • Tối ưu hóa suy luận (lượng tử hóa, FP8) để giảm chi phí triển khai.

Các mô hình mã nguồn mở tiếp tục được cộng đồng sử dụng cho nghiên cứu, fine-tuning và chắt lọc tri thức (distillation).[6]

Tài liệu tham khảo

Liên kết ngoài

Chú thích

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms