Hunyuan (Tencent) (TH)
Hunyuan (จีน: 腾讯混元大模型, Tencent Hunyuan, Tencent HY) — กลุ่มของ Foundation Models และ Large Language Models (LLM) ที่พัฒนาโดยทีม Tencent Hunyuan Foundation Model Team และให้บริการผ่านบริการคลาวด์ Tencent Cloud รวมถึงในรูปแบบ open weights บนแพลตฟอร์ม Hugging Face และ GitHub กลุ่มโมเดลนี้ครอบคลุมโมเดลสำหรับการสร้างและทำความเข้าใจข้อความ การอนุมานเชิงตรรกะและคณิตศาสตร์ การเขียนโปรแกรม การประมวลผลบริบทยาว รวมถึงส่วนขยายแบบมัลติโมดัล (ภาพ วิดีโอ 3D) Hunyuan ได้รับการวางตำแหน่งให้เป็นสายผลิตภัณฑ์ generative AI หลักของ Tencent และได้รับการผสานรวมเข้ากับระบบนิเวศผลิตภัณฑ์ของบริษัท (Yuanbao, WeChat, Tencent Meeting, Tencent Cloud)[1][2][3]
ประวัติและลำดับเวลาของการพัฒนา
การพัฒนา Hunyuan ดำเนินไปในบริบทของการแข่งขัน LLM ระดับโลกและกลยุทธ์ความเป็นอิสระทางเทคโนโลยีด้านปัญญาประดิษฐ์ของจีน สายผลิตภัณฑ์นี้มีการพัฒนาจาก dense models แบบปิดสู่ Mixture-of-Experts (MoE) แบบเปิดและสถาปัตยกรรมไฮบริด Transformer-Mamba[1]
รุ่นแรก (2023)
การประกาศสาธารณะของซีรีส์ Hunyuan เกิดขึ้นในวันที่ 7 กันยายน 2023 ในงาน Tencent Global Digital Ecosystem Summit ที่เมืองเซินเจิ้น เวอร์ชันแรกเป็น dense model แบบปิดที่มีพารามิเตอร์มากกว่า 1 แสนล้านตัว ผ่านการฝึกล่วงหน้าด้วย token มากกว่า 2 ล้านล้านตัว โมเดลนี้มุ่งเน้นภาษาจีน การอนุมานเชิงตรรกะ และการสร้างเนื้อหา ได้รับการผสานรวมเข้ากับผลิตภัณฑ์ Tencent มากกว่า 50 รายการ และเข้าถึงได้ผ่าน Tencent Cloud API[1]
Hunyuan-Large และการเปลี่ยนผ่านสู่ MoE (2024)
ในเดือนพฤศจิกายน 2024 Tencent เปิดตัว Hunyuan-Large ซึ่งในขณะนั้นเป็น Transformer-MoE model แบบเปิดที่ใหญ่ที่สุด มีพารามิเตอร์รวม 389 พันล้านตัวและพารามิเตอร์ที่ใช้งานอยู่ 52 พันล้านตัว โมเดลนี้ได้รับการเผยแพร่พร้อม open weights บน Hugging Face และ GitHub พร้อมด้วย preprint บน arXiv การเปิดตัวนี้ถือเป็นการเปลี่ยนทิศทางเชิงกลยุทธ์ของ Tencent สู่การพัฒนาแบบเปิด[2][4][5]
โมเดลไฮบริดและ reasoning (2025)
ในปี 2025 สายผลิตภัณฑ์ได้รับการขยายด้วยการเปิดตัวสำคัญหลายรายการ:
- Hunyuan-TurboS (กุมภาพันธ์ 2025) — โมเดลไฮบริด Transformer-Mamba-MoE ขนาดใหญ่ระดับอุตสาหกรรมรุ่นแรก มีพารามิเตอร์รวม 560 พันล้านตัวและพารามิเตอร์ที่ใช้งานอยู่ 56 พันล้านตัว ผ่านการฝึกล่วงหน้าด้วย 16 ล้านล้าน token มีการนำเสนอกลไก adaptive Chain-of-Thought (CoT) สำหรับการสลับแบบไดนามิกระหว่างการคิดเร็วและการคิดลึก[6]
- Hunyuan-T1 (มีนาคม 2025) — reasoning model เฉพาะทาง สร้างบน TurboS พร้อมการฝึก reinforcement learning แบบขนาดใหญ่ (96.7% ของการคำนวณหลังการฝึกเป็น reinforcement learning)[7]
- Hunyuan-A13B (มิถุนายน 2025) — MoE model ขนาดกะทัดรัด (พารามิเตอร์รวม 80 พันล้าน / ใช้งานอยู่ 13 พันล้านตัว) สำหรับสมดุลระหว่างประสิทธิภาพและต้นทุน รองรับการคิดเร็วและการคิดช้า[8]
- Dense models ขนาดเล็ก (กรกฎาคม 2025) — รุ่น 0.5B, 1.8B, 4B, 7B สำหรับอุปกรณ์ edge และสถานการณ์การนำไปใช้งานที่มีการแข่งขันสูง รองรับบริบท 256K[9]
Hunyuan 2.0 (พฤศจิกายน–ธันวาคม 2025)
ในเดือนธันวาคม 2025 มีการประกาศโมเดลเชิงพาณิชย์รุ่นที่สอง — Hunyuan 2.0 (HY 2.0) ที่ใช้สถาปัตยกรรม MoE (พารามิเตอร์รวม 406 พันล้าน / ใช้งานอยู่ 32 พันล้านตัว) และหน้าต่างบริบท 256K token สายผลิตภัณฑ์แบ่งออกเป็นสองรูปแบบ: HY 2.0 Think (การอนุมานเชิงลึก, โค้ด) และ HY 2.0 Instruct (การสนทนา, การสร้างสรรค์เนื้อหา) โมเดลเหล่านี้เข้าถึงได้ผ่าน Tencent Cloud API และได้รับการผสานรวมเข้ากับแอปพลิเคชัน Yuanbao และ ima[10][11]
ลำดับเวลาโดยสรุป
| วันที่ | เหตุการณ์ |
|---|---|
| กันยายน 2023 | การประกาศสาธารณะของ Hunyuan ในฐานะ LLM แบบปิด (>100B พารามิเตอร์); เปิดตัว Tencent Cloud API |
| กุมภาพันธ์ 2024 | MoE model ภายในสำหรับแชทบอต Yuanbao |
| เมษายน 2024 | เปลี่ยนชื่อ: «advanced» → hunyuan-pro, «standard» → hunyuan-standard; เพิ่ม hunyuan-lite |
| พฤษภาคม 2024 | hunyuan-lite เปลี่ยนมาใช้ MoE ขยายเป็นบริบท 256K |
| กันยายน 2024 | เปิดตัว hunyuan-turbo ใหม่ (MoE รุ่นใหม่) |
| พฤศจิกายน 2024 | เปิดตัว Hunyuan-Large แบบเปิด (389B/52B MoE), preprint arXiv:2411.02265 |
| กุมภาพันธ์–มีนาคม 2025 | Hunyuan-TurboS (ไฮบริด Mamba-MoE); Hunyuan-T1 (reasoning) |
| มิถุนายน 2025 | Hunyuan-A13B (80B/13B, fine-grained MoE) |
| กรกฎาคม 2025 | Dense models ขนาดเล็ก 0.5B–7B |
| กันยายน 2025 | Hunyuan-MT (โมเดลแปลภาษาเฉพาะทาง) |
| พฤศจิกายน–ธันวาคม 2025 | Hunyuan 2.0 (HY 2.0 Think / Instruct), 406B/32B MoE |
แหล่งที่มา: Tencent Cloud product dynamics; ที่เก็บโค้ดทางการ[12]
รากฐานทางทฤษฎีและสถาปัตยกรรม
สถาปัตยกรรม Mixture-of-Experts
โมเดลหลักของซีรีส์ (Hunyuan-Large, A13B, HY 2.0) ใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ซึ่งบางชั้นของ transformer ประกอบด้วย «ผู้เชี่ยวชาญ» (subnetworks) หลายตัว และ router (gating network) จะเลือกชุดผู้เชี่ยวชาญที่ใช้งานอยู่สำหรับแต่ละ token สูตรทั่วไปของชั้น MoE:[2]
โดยที่ คือฟังก์ชัน routing (gating), คือผู้เชี่ยวชาญคนที่ , คือจำนวนผู้เชี่ยวชาญทั้งหมด ด้วยแนวทางนี้ จำนวนพารามิเตอร์รวมของโมเดล มีค่ามากกว่าจำนวนพารามิเตอร์ที่ใช้งานอยู่ในการผ่านรอบเดียว อย่างมีนัยสำคัญ:[2]
ซึ่งทำให้สามารถเพิ่มความจุของโมเดลได้โดยไม่ต้องเพิ่มต้นทุนการคำนวณสำหรับ inference อย่างสัดส่วน
ใน Hunyuan-Large มีการนำโครงร่างที่มีผู้เชี่ยวชาญ shared 1 ตัวและผู้เชี่ยวชาญเฉพาะทาง 16 ตัวมาใช้ โดยเปิดใช้งานผู้เชี่ยวชาญ 1 ตัวต่อ token (top-1 routing) นวัตกรรมเพิ่มเติมได้แก่ การ routing แบบผสมพร้อมกลไก recycle (การนำ token ที่ถูกปฏิเสธมาใช้ใหม่) และ learning rates เฉพาะผู้เชี่ยวชาญเพื่อปรับปรุงความสมดุลของการมีส่วนร่วมของผู้เชี่ยวชาญ[2][5]
สถาปัตยกรรมไฮบริด Transformer-Mamba
Hunyuan-TurboS และ T1 นำเสนอสถาปัตยกรรมไฮบริดที่รวมบล็อก Transformer (attention) และ Mamba (state-space model) เข้าด้วยกัน Mamba มีความซับซ้อนเชิงเส้นตามความยาวของลำดับ:[6]
โดยที่ , คือเมทริกซ์ที่ฝึกได้, คือสถานะซ่อนเร้นที่ขั้นตอน , คือ token ขาเข้า ซึ่งทำให้มีการขยาย memory แบบ ตามความยาว (เทียบกับ ใน Transformer มาตรฐาน)[6]
TurboS มี 128 ชั้น จัดเป็นบล็อก: ชั้น Mamba2 จำนวน 57 ชั้น, ชั้น Attention จำนวน 7 ชั้น และชั้น FFN-MoE จำนวน 64 ชั้นที่มีผู้เชี่ยวชาญ 32 ตัว บล็อก AMF (Attention → Mamba2 → FFN) และ MF (Mamba2 → FFN) สลับกันเพื่อสร้างสมดุลระหว่างบริบทส่วนกลางและส่วนท้องถิ่น[6]
กลไก attention และ KV-cache
Hunyuan-Large ใช้ Grouped Query Attention (GQA) — รูปแบบ attention ที่ query หลายตัวแชร์ key และ value ร่วมกัน — และ Cross-Layer Attention (CLA) เพื่อลดขนาด KV-cache ขนาด KV-cache มาตรฐานสำหรับชั้น self-attention ที่มี heads, ความยาวลำดับ และขนาด head :[5]
โดยที่ คือขนาด KV-cache ด้วย GQA ที่มี กลุ่ม ขนาดจะลดลงเป็น:
CLA เพิ่มเติมด้วยการนำ KV-cache กลับมาใช้ซ้ำระหว่างชั้นต่างๆ รวมกันแล้วการปรับปรุงเหล่านี้ช่วยประหยัดหน่วยความจำได้ประมาณ 95%[4]
การเข้ารหัสตำแหน่งและบริบทยาว
โมเดลใช้ Rotary Position Embedding (RoPE) พร้อมการปรับขนาดเพื่อรองรับลำดับยาว การฝึกบริบทดำเนินการแบบเป็นขั้นตอน (curriculum learning): จาก 32K ถึง 256K token ฟังก์ชัน activation คือ SwiGLU พจนานุกรม tokenizer มีขนาด 128K (tiktoken พร้อมส่วนขยายสำหรับภาษาจีน)[2]
การฝึกและการขยายขนาด
สำหรับ MoE models มีการศึกษา scaling laws ในรูปแบบของความสัมพันธ์กำลังเชิงประจักษ์:[2]
โดยที่ คือเมตริกคุณภาพ, คือจำนวนพารามิเตอร์ที่ใช้งานอยู่, คือปริมาณข้อมูล, คือพารามิเตอร์ที่ได้จากการทดลอง Hunyuan-Large เน้นย้ำการใช้ข้อมูลสังเคราะห์ในปริมาณ 1.5 ล้านล้าน token — มากกว่างานวิจัย MoE ก่อนหน้านี้หลายระดับ[2]
กระบวนการฝึกและการปรับพฤติกรรม
กระบวนการฝึกโมเดล Hunyuan ประกอบด้วยหลายขั้นตอนที่เป็นลักษณะเฉพาะของ LLM สมัยใหม่:[2][7]
การฝึกล่วงหน้า (Pre-training)
การฝึกขนาดใหญ่บนคลังข้อมูลหลายภาษาขนาดใหญ่ (ภาษาจีน อังกฤษ และภาษาอื่นๆ) Hunyuan-Large ผ่านการฝึกล่วงหน้าด้วย 7 ล้านล้าน token (รวมถึง 1.5 ล้านล้าน token สังเคราะห์) TurboS ผ่านการฝึกล่วงหน้าด้วย 16 ล้านล้าน token ส่วนประกอบที่ชัดเจนของ dataset ไม่ได้รับการเปิดเผย[2][6]
การ fine-tuning แบบมีผู้ควบคุม (Supervised Fine-Tuning, SFT)
การ fine-tuning บนคำสั่งมากกว่า 1 ล้านรายการ (คู่ «คำสั่ง — คำตอบ») เพื่อให้โมเดลปฏิบัติตามคำสั่งของผู้ใช้[2]
การปรับพฤติกรรมด้วย reinforcement learning
สำหรับการปรับพฤติกรรมของโมเดลให้สอดคล้องกับความชอบของมนุษย์ มีการใช้:
Direct Preference Optimization (DPO) — วิธีการปรับพฤติกรรมโดยไม่มีโมเดลรางวัลที่ชัดเจน ใช้ใน Hunyuan-Large[2]
Reinforcement Learning (RL) — ใน Hunyuan-T1 มีการใช้ reinforcement learning ขนาดใหญ่พร้อม curriculum learning; ตามคำกล่าวอ้างของผู้พัฒนา 96.7% ของการคำนวณหลังการฝึกเป็น RL[7]
Adaptive Long-Short Chain-of-Thought — ใน TurboS มีการนำกลไกการสลับแบบไดนามิกระหว่างการคิดเร็วและการคิดลึกมาใช้ ช่วยให้โมเดลสามารถปรับความลึกของการอนุมานตามความซับซ้อนของงาน[6]
ประเภทของโมเดลในกลุ่มผลิตภัณฑ์
กลุ่มผลิตภัณฑ์แบ่งออกเป็นโมเดล API บนคลาวด์แบบปิดและโมเดลแบบเปิดพร้อม weights[3]
โมเดลหลัก (ภาพรวม)
| โมเดล | วันที่เปิดตัว | สถาปัตยกรรม | พารามิเตอร์ (รวม / ใช้งานอยู่) | บริบท | ความพร้อมใช้งาน |
|---|---|---|---|---|---|
| Hunyuan (2023) | กันยายน 2023 | Dense Transformer | >100 พันล้าน / — | ไม่เปิดเผย | API แบบปิด |
| Hunyuan-Large | พฤศจิกายน 2024 | Transformer-MoE | 389 พันล้าน / 52 พันล้าน | 256K (pretrain), 128K (instruct) | Open weights (GitHub, HF) |
| Hunyuan-TurboS | กุมภาพันธ์ 2025 | Hybrid Transformer-Mamba-MoE | 560 พันล้าน / 56 พันล้าน | 256K (สถาปัตยกรรม), 32K/16K (API) | API แบบปิด + รุ่นเปิด |
| Hunyuan-T1 | มีนาคม 2025 | บน TurboS + RL ขนาดใหญ่ | — | 32K/64K (API) | API แบบปิด |
| Hunyuan-A13B | มิถุนายน 2025 | Fine-grained MoE | 80 พันล้าน / 13 พันล้าน | 256K (เปิด), 224K/32K (API) | Open weights + API |
| ขนาดเล็ก (0.5–7B) | กรกฎาคม 2025 | Dense | 0.5–7 พันล้าน | 256K | Open weights |
| HY 2.0 Think | พฤศจิกายน 2025 | MoE | 406 พันล้าน / 32 พันล้าน | 128K ขาเข้า / 64K ขาออก (API) | API แบบปิด |
| HY 2.0 Instruct | พฤศจิกายน 2025 | MoE | 406 พันล้าน / 32 พันล้าน | 128K ขาเข้า / 16K ขาออก (API) | API แบบปิด |
แหล่งที่มา: arXiv:2411.02265; arXiv:2505.15431; Tencent Cloud docs; GitHub[2][6][3][10]
หมายเหตุ. สำหรับบางโมเดล ขีดจำกัดบริบทตามสถาปัตยกรรม (จากรายงานทางเทคนิค) และขีดจำกัดบริการ API (จากเอกสารผลิตภัณฑ์) แตกต่างกัน ซึ่งไม่ใช่ความขัดแย้ง แต่สะท้อนความแตกต่างระหว่างการกำหนดค่าการวิจัยและผลิตภัณฑ์[6][3]
โมเดลเฉพาะทาง
Hunyuan-MT (กันยายน 2025) — โมเดลแปลภาษาด้วยเครื่องเฉพาะทาง ได้อันดับ 1 ใน WMT25 ใน 30 จาก 31 หมวดหมู่[13]
HunyuanImage, HunyuanVideo, Hunyuan3D — โมเดลมัลติโมดัลของกลุ่มผลิตภัณฑ์สำหรับการสร้างภาพ วิดีโอ และวัตถุ 3D ตามลำดับ[14]
การวางตำแหน่งและความสัมพันธ์เชิงวิวัฒนาการ
ในเอกสาร Tencent Cloud มีความสัมพันธ์เชิงวิวัฒนาการดังต่อไปนี้:
hunyuan-a13bระบุว่าเป็นการอัพเกรดจากhunyuan-standard-256Khunyuan-t1สร้างบน TurboS พร้อมการ post-training แบบ RL ที่เข้มข้นยิ่งขึ้น- HY 2.0 Think/Instruct — สาขาที่มีการอัพเดตฐานจาก TurboS เป็น Hunyuan 2.0
- สาขาแบบเปิด (Hunyuan-Large, A13B, compact dense) พัฒนาขนานกับสาขา API แบบปิด เพื่อให้มีการเข้าถึงสำหรับการวิจัย[3]
สิ่งใหม่ในรุ่นสำคัญ
Hunyuan-Large (2024)
เมื่อเปรียบเทียบกับรุ่นแรกและแนวทาง MoE ก่อนหน้า Hunyuan-Large นำเสนอ:[2][4]
- ขนาด 389 พันล้านพารามิเตอร์ (52 พันล้านตัวที่ใช้งานอยู่) — Transformer-MoE model แบบเปิดที่ใหญ่ที่สุดในขณะที่เผยแพร่
- รองรับบริบท 256K (pretrain) และ 128K (instruct) — เกินกว่าค่าทั่วไปของ LLM ในปี 2024 อย่างมีนัยสำคัญ
- การบีบอัด KV-cache โดยใช้ GQA + CLA (ประหยัดหน่วยความจำ ~95%)
- ข้อมูลสังเคราะห์ขนาดใหญ่ (1.5 ล้านล้าน token ของข้อมูลสังเคราะห์)
- การ routing ผู้เชี่ยวชาญแบบผสมและ learning rates เฉพาะผู้เชี่ยวชาญ
Hunyuan-TurboS (2025)
การเปลี่ยนแปลงสถาปัตยกรรมหลัก:[6]
- ไฮบริด Mamba2 + Attention + MoE: รวม 560B / ใช้งานอยู่ 56B, 128 ชั้น
- ฝึกล่วงหน้าด้วย 16 ล้านล้าน token
- Adaptive Long-Short Chain-of-Thought สำหรับการจัดการความลึกของการอนุมานแบบไดนามิก
- ความเร็วในการถอดรหัสที่อ้างว่าเร็วขึ้น 1.8–2 เท่า เมื่อเทียบกับเวอร์ชัน Turbo ก่อนหน้า
Hunyuan-T1 (2025)
Reasoning model บน TurboS:[7]
- 96.7% ของการคำนวณหลังการฝึก — reinforcement learning
- ความเร็วในการถอดรหัสเร็วขึ้นสองเท่าโดยมี deployment envelope ที่เทียบเคียงได้
- Curriculum learning เพื่อปรับปรุงกลยุทธ์การอนุมาน
HY 2.0 (2025)
การอัพเดตผลิตภัณฑ์เชิงพาณิชย์หลัก:[10][11]
- สถาปัตยกรรม MoE: 406B รวม / 32B ที่ใช้งานอยู่
- หน้าต่างบริบท 256K token
- การเติบโตอย่างมีนัยสำคัญบน benchmark เฉพาะทาง: IMO-AnswerBench 73.4% (+20% จากเวอร์ชัน HY ก่อนหน้า), SWE-bench Verified 53.0 (จาก 6.0), τ²-Bench 72.4 (จาก 17.1)
- การปรับปรุง RLHF และกลยุทธ์การ post-training
การประเมินและ benchmark
การประเมินดำเนินการบน benchmark มาตรฐานโดยใช้โปรโตคอล zero-shot และ few-shot ผลลัพธ์อ้างอิงจากรายงานทางเทคนิคและที่เก็บโค้ดทางการ สำหรับบางโมเดล การตรวจสอบอิสระจากภายนอกยังมีจำกัด[2]
Benchmark ของ Hunyuan-Large (pretrain)
| Benchmark | Hunyuan-Large | Llama 3.1-405B | Llama 3.1-70B | Mixtral-8x22B | DeepSeek-V2 |
|---|---|---|---|---|---|
| MMLU | 88.4 | 85.2 | 79.3 | 77.8 | 78.5 |
| CMMLU | 90.2 | — | — | — | 84.0 |
| C-Eval | 91.9 | — | — | — | 81.7 |
| GSM8K | 92.8 | 89.0 | 83.7 | 83.7 | 79.2 |
| MATH | 69.8 | 53.8 | 41.4 | 42.5 | 43.6 |
| HumanEval | 71.4 | 61.0 | 58.5 | 53.1 | 48.8 |
แหล่งที่มา: arXiv:2411.02265[2]
ตามรายงานทางเทคนิค Hunyuan-Large (pretrain) นำใน 15 จาก 19 benchmark เมื่อเปรียบเทียบกับ Llama 3.1-405B, Mixtral-8x22B และ DeepSeek-V2[2]
Benchmark ของ Hunyuan-Large-Instruct
| Benchmark | Hunyuan-Large-Instruct |
|---|---|
| MMLU | 89.9 |
| MATH | 77.4 |
| HumanEval | 90.0 |
| Arena-Hard | 81.8 |
แหล่งที่มา: arXiv:2411.02265; Hugging Face model card[2][5]
ตามคำกล่าวอ้างของผู้พัฒนา Hunyuan-Large-Instruct มีประสิทธิภาพเหนือกว่า LLaMA 3.1-405B บน MMLU 2.6 เปอร์เซ็นต์[4]
Benchmark ของ TurboS และ T1
| Benchmark | TurboS | T1 |
|---|---|---|
| LMSYS Chatbot Arena | 1356 (อันดับ 7) | — |
| ค่าเฉลี่ยจาก 23 benchmark | 77.9% | — |
| MMLU-Pro | — | 87.2 |
| GPQA-Diamond | — | 69.3 |
| MATH-500 | — | 96.2 |
| LiveCodeBench | — | 64.9 |
| Arena-Hard | — | 91.9 |
แหล่งที่มา: arXiv:2505.15431; หน้าทางการของ T1[6][7]
Benchmark ของ Hunyuan-A13B
| Benchmark | Hunyuan-A13B | Hunyuan-Large | Qwen2.5-72B |
|---|---|---|---|
| MMLU | 88.17 | 88.4 | — |
| MMLU-Pro | 67.23 | 60.2 | — |
| BBH | 87.56 | 86.3 | — |
| MATH | 72.35 | 69.8 | — |
| GPQA | 49.12 | — | — |
| MBPP | 83.86 | — | — |
แหล่งที่มา: GitHub Hunyuan-A13B README[8]
A13B มีประสิทธิภาพเหนือกว่า Hunyuan-Large ในงานที่ไวต่อ post-training บางรายการ (MMLU-Pro, MATH, MBPP) ซึ่งสอดคล้องกับการวางตำแหน่งให้เป็นรุ่นที่ใหม่กว่าและใช้งานได้จริงมากกว่า[8]
Benchmark ของสาขา dense ขนาดกะทัดรัด
| โมเดล | MMLU | MMLU-Pro | BBH | GSM8K | MATH |
|---|---|---|---|---|---|
| Hunyuan-0.5B | 54.02 | 31.15 | 45.92 | 55.64 | 42.95 |
| Hunyuan-1.8B | 64.62 | 38.65 | 74.32 | 77.26 | 62.85 |
| Hunyuan-4B | 74.01 | 51.91 | 75.17 | 87.49 | 72.25 |
| Hunyuan-7B | 79.82 | 57.79 | 82.95 | 88.25 | 74.85 |
แหล่งที่มา: GitHub Hunyuan-7B README[9]
Benchmark ของ HY 2.0
ตัวเลขที่อ้างโดยผู้พัฒนา (แหล่งที่มาที่ชัดเจนเพียงแหล่งเดียว — บัญชีทางการของ Hunyuan):[11]
| Benchmark | HY 2.0 | เวอร์ชัน HY ก่อนหน้า |
|---|---|---|
| IMO-AnswerBench | 73.4 | ~53 (ประมาณการ, +20%) |
| SWE-bench Verified | 53.0 | 6.0 |
| τ²-Bench | 72.4 | 17.1 |
หมายเหตุ. ข้อมูลเหล่านี้จัดอยู่ในประเภท «อ้างโดยผู้พัฒนา รอการยืนยันจากภายนอกในวงกว้าง»[11]
รายละเอียดทางเทคนิคสำหรับการใช้งาน
หน้าต่างบริบทตามสาขา
| โมเดล | ขาเข้า (token) | ขาออก (token) |
|---|---|---|
| HY 2.0 Think | 128K | 64K |
| HY 2.0 Instruct | 128K | 16K |
| T1 (API) | 32K | 64K |
| A13B (API) | 224K | 32K |
| TurboS (API) | 32K | 16K |
| Lite (API) | 250K | 6K |
| Hunyuan-Large (แบบเปิด) | 256K (pretrain) / 128K (instruct) | — |
| Compact 0.5–7B | 256K | — |
แหล่งที่มา: Tencent Cloud product overview[3]
เครื่องมือที่รองรับ
ใน Tencent Cloud API มีการบันทึกไว้:[15]
- Function Calling (
tools,tool_choice) - AI Search Enhancement — การค้นหาจากแหล่งภายนอกในตัว (retrieval-augmented generation)
- SearchInfo และ Citation — เครื่องหมายอ้างอิงในคำตอบ
- EnableMultimedia — การแทรกมัลติมีเดียในผลลัพธ์
- EnableThinking — ตัวสลับ chain-of-thought สำหรับ A13B
- EnableRecommendedQuestions — การสร้างคำถามแนะนำ
ความเข้ากันได้ของ API
Hunyuan API รองรับรูปแบบที่เข้ากันได้กับ OpenAI:[16]
- Base URL:
https://api.hunyuan.cloud.tencent.com/v1 - รองรับ
/v1/chat/completionsและ/v1/embeddings - Embedding model:
hunyuan-embedding, มิติ 1024 - Streaming ผ่าน SSE
- Concurrency เริ่มต้น: 5 ต่อบัญชี
สำหรับ Hunyuan-Large (แบบเปิด) รูปแบบ input/output มาตรฐานเข้ากันได้กับ framework PyTorch/Transformers รองรับการควอนไทซ์: FP8, INT4 (GPTQ/AWQ)[5]
การประยุกต์ใช้และการผสานรวม
โมเดล Hunyuan ได้รับการผสานรวมเข้ากับระบบนิเวศของ Tencent และพร้อมใช้งานสำหรับนักพัฒนาภายนอก สถานการณ์การใช้งานหลักที่มีการบันทึกไว้:[1][17]
ผลิตภัณฑ์ Tencent
- Yuanbao — แชทบอทพร้อมรองรับ Hunyuan และ DeepSeek
- Tencent Meeting — การสร้างสรุปการประชุม
- Tencent Docs — การสร้างและวิเคราะห์ข้อความ
- ima — ผู้ช่วย AI ด้านการเงินและมัลติมีเดีย
การประยุกต์ใช้ระดับองค์กร
- การสร้างข้อความ: บทความ ข้อความโฆษณา บทภาพยนตร์ คำอธิบายผลิตภัณฑ์
- การสนับสนุนลูกค้าอัจฉริยะ: แชทบอท FAQ การตอบกลับอัตโนมัติ
- การสร้างและวิเคราะห์โค้ด (โดยเฉพาะ HY 2.0 Think และ T1)
- การอนุมานทางคณิตศาสตร์และตรรกศาสตร์ งานวิเคราะห์
- การแปลหลายภาษา (มากกว่า 30 ภาษา, Hunyuan-MT)
โมเดลแบบเปิด
รูปแบบแบบเปิดใช้สำหรับการวิจัย การ fine-tuning และการนำไปใช้งานบนอุปกรณ์ edge (dense models ขนาดเล็ก) ส่วนขยายมัลติโมดัล (HunyuanImage, HunyuanVideo, Hunyuan3D) ใช้สำหรับการสร้างโมเดล 3D และวิดีโอ[14]
ข้อจำกัดและปัญหาที่ยังเปิดอยู่
- ความเป็นปิดของโมเดลเชิงพาณิชย์. สำหรับ HY 2.0 และ T1 ไม่มี open weights และข้อกำหนดสถาปัตยกรรมโดยละเอียด การเข้าถึงจำกัดเฉพาะ API ซึ่งทำให้การทำซ้ำอิสระเป็นเรื่องยาก[3]
- ความไม่โปร่งใสของข้อมูลการฝึก. แม้จะเน้นการใช้ข้อมูลสังเคราะห์ขนาดใหญ่ แต่ส่วนประกอบที่ชัดเจนของ dataset สัดส่วนของภาษาและโดเมน ไม่ได้รับการเปิดเผย[2]
- ความต้องการการคำนวณ. โมเดลแบบเปิดต้องการทรัพยากรมาก: GPU อย่างน้อย 32 ตัวสำหรับการ fine-tuning แบบเต็มของ Hunyuan-Large; หน่วยความจำ VRAM หลายสิบ GB แม้จะใช้ FP8[5]
- การสร้างข้อมูลที่ไม่ถูกต้อง. เช่นเดียวกับ LLM อื่นๆ โมเดลมีความเสี่ยงต่อการสร้างข้อความที่ฟังดูน่าเชื่อถือแต่ผิดข้อเท็จจริง การวิจัยเชิงระบบในด้านนี้สำหรับ Hunyuan ในงานที่ผ่านการตรวจสอบโดยผู้เชี่ยวชาญแบบเปิดยังมีจำกัด[18]
- ความแตกต่างระหว่างขีดจำกัดสถาปัตยกรรมและบริการ. สำหรับบางโมเดล (TurboS, A13B) ขีดจำกัดบริการ API ต่ำกว่าความสามารถของสถาปัตยกรรมอย่างมีนัยสำคัญ[6][3]
- การเข้าถึงตามภูมิภาค. มุ่งเน้นตลาดจีนเป็นหลัก; API สำหรับผู้ใช้นอกประเทศจีนมีข้อจำกัดด้านภาษาและกฎหมาย[17]
- ขาดรายงาน safety โดยละเอียด. เอกสารระบุหลักการความปลอดภัยและการกรองทั่วไป แต่ไม่มีรายงานความปลอดภัยทางเทคนิคสาธารณะที่เทียบเคียงกับบางโมเดลระดับนานาชาติ[15]
- ความเข้ากันได้ของสาขา open-source. หลังจากการเปิดตัว มีการบันทึกปัญหาการผสานรวมกับ
transformers/vllmซึ่งไลบรารีไม่รู้จักประเภทสถาปัตยกรรมhunyuan_v1_denseต้องการtrust_remote_codeหรือสาขาพิเศษ[19]
เหตุการณ์และปัญหาที่รู้จัก
ตามข้อมูลที่มี (ปลายปี 2025 — ต้นปี 2026) ไม่มีการบันทึกเหตุการณ์สาธารณะขนาดใหญ่ที่เกี่ยวข้องโดยเฉพาะกับ Hunyuan (การรั่วไหลของข้อมูลขนาดใหญ่ ภัยคุกคามความปลอดภัยเฉพาะ)[17]
การแก้ไขผลิตภัณฑ์ที่มีการบันทึก
ใน product dynamics ของ Tencent Cloud มีการบันทึกการแก้ไขย่อย:[12]
- 2024-11-20:
hunyuan-turbo-latestได้รับการอัพเดตเพื่อแก้ไขการซ้ำกันเนื่องจาก special characters ปรับปรุงความเสถียรของผลลัพธ์ Markdown และลดการปฏิเสธที่ไม่มีเหตุผล - 2025-04-03: การอัพเดต T1 พร้อมการแก้ไขการผสมระหว่างภาษาจีนตัวย่อ/ตัวเต็มและการผสมระหว่างภาษาจีน/อังกฤษ บวกกับการปรับปรุงการสร้างโค้ดระดับโปรเจกต์
- 2025-04-20: Search Enhancement เปลี่ยนจาก default-on เป็น default-off — ซึ่งเป็นการเปลี่ยนแปลงพฤติกรรม API สำหรับการผสานรวม
การวิจัยความปลอดภัย MoE
ในระดับการวิจารณ์การวิจัย (ระดับ preprint) Hunyuan-A13B ปรากฏในงานวิจัยเกี่ยวกับการโจมตีการระบุตำแหน่งความปลอดภัยใน MoE models โดยเฉพาะในงาน Large Language Lobotomy และ GateBreaker รายงาน attack success rate สูงในการ «ปิดเสียง» ผู้เชี่ยวชาญด้านความปลอดภัย ซึ่งไม่ใช่การยืนยันเหตุการณ์ในระดับ production แต่แสดงให้เห็นว่าความปลอดภัยของ MoE routing ได้รับการมองว่าเป็นทิศทางการวิจัยที่มีความเสี่ยง[20][21]
ด้านจริยธรรมและกฎระเบียบ
Hunyuan ดำเนินงานภายในบริบทกฎหมายและกฎระเบียบของจีน รวมถึงกฎระเบียบระดับชาติเกี่ยวกับการจัดการ AI เชิงสร้างสรรค์ (CAC) และการกรองเนื้อหา ตลอดจนนโยบายความปลอดภัยข้อมูลภายในของ Tencent เอกสาร Tencent Cloud เน้นย้ำว่าการใช้ Hunyuan API ต้องเป็นไปตามกฎหมายที่บังคับใช้และนโยบายแพลตฟอร์ม[1]
มาตรการเฉพาะได้แก่:
- การกลั่นกรองเนื้อหาในตัวพร้อมการส่งออกแบบ streaming และ
FinishReason=sensitiveที่เป็นไปได้ - การปรับพฤติกรรมผ่าน RLHF/DPO เพื่อลดการสร้างข้อมูลที่ไม่ถูกต้องและพฤติกรรมที่ไม่พึงประสงค์
- การกรองข้อมูลการฝึกเพื่อลด bias
- ใบอนุญาตแบบเปิด (Tencent Hunyuan Community License Agreement) สำหรับโมเดลแบบเปิด โดยมีข้อสงวนว่าข้อตกลงนี้ไม่บังคับใช้ในสหภาพยุโรปสำหรับบางรุ่น[8][15]
รายงานอิสระเฉพาะทางเกี่ยวกับ bias (อคติ) และ fairness (ความเป็นธรรม) สำหรับ Hunyuan ยังมีน้อย การวิจัยคาดว่าจะเพิ่มขึ้นตามการขยาย open weights และการทดสอบอิสระ[2]
การตอบสนองของชุมชน
สัญญาณภายนอกที่มีความหมายที่สุดสำหรับสาขาแบบปิดคือผลลัพธ์ของ TurboS บน LMSYS Chatbot Arena (1356, อันดับ 7 ระดับโลก) สำหรับสาขาแบบเปิด ตัวชี้วัดทางอ้อมคือกิจกรรมบน GitHub: ประมาณ 1,600 stars สำหรับ Hunyuan-Large, 812 สำหรับ A13B, 683 สำหรับ Hunyuan-MT ซึ่งสะท้อนถึงระดับการมีส่วนร่วมที่เห็นได้ชัด แต่ไม่ถึงขั้นโดดเด่นในระบบนิเวศ open LLM ความคิดเห็นเชิงอัตนัยของชุมชน (Hugging Face, Reddit) สังเกตเห็นจุดแข็งในภาษาจีนและงาน agent[22]
แนวโน้มและทิศทางการวิจัย
ทิศทางการพัฒนาต่อไปที่ระบุในเอกสารสาธารณะ:[2][6][14]
- การผสมสถาปัตยกรรมเพิ่มเติม (Mamba + Transformer + MoE) และการศึกษา scaling laws สำหรับ MoE
- การขยายความสามารถมัลติโมดัล: การผสานรวม Hunyuan3D, HunyuanVideo และ HunyuanImage กับโมเดลภาษา
- การปรับปรุงการใช้เครื่องมือ (tool use) และความสามารถของ agent
- การลดต้นทุน inference: การควอนไทซ์ (2-bit สำหรับ edge) การปรับปรุงผ่าน TRT-LLM/vLLM
- การขยายพอร์ตโฟลิโอโมเดลแบบเปิด
- การพัฒนาและเผยแพร่รายงาน safety และ alignment โดยละเอียด
ดูเพิ่มเติม
- LLaMA (Meta)
- DeepSeek
วรรณกรรม
- Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- Tencent Hunyuan Team. Hunyuan-MT Technical Report. arXiv:2509.05209, 2025. https://arxiv.org/abs/2509.05209
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
ลิงก์
- https://cloud.tencent.com/document/product/1729/104753 — เอกสารทางการ Tencent Cloud Hunyuan
- https://huggingface.co/tencent/Tencent-Hunyuan-Large — Hunyuan-Large บน Hugging Face
- https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large — Hunyuan-Large บน GitHub
- https://github.com/Tencent-Hunyuan/Hunyuan-A13B — Hunyuan-A13B บน GitHub
- https://tencent.github.io/llm.hunyuan.T1/README_EN.html — หน้าทางการของ Hunyuan-T1
- https://www.tencent.com/en-us/articles/2201685.html — การประกาศ Hunyuan (กันยายน 2023)
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
- ↑ 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- ↑ 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
- ↑ 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
- ↑ 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
- ↑ 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
- ↑ 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
- ↑ 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
- ↑ Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
- ↑ 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
- ↑ 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
- ↑ Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
- ↑ 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
- ↑ LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
- ↑ GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
- ↑ Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
- ↑ Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
- ↑ Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS