Hunyuan (Tencent) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

Hunyuan (จีน: 腾讯混元大模型, Tencent Hunyuan, Tencent HY) — กลุ่มของ Foundation Models และ Large Language Models (LLM) ที่พัฒนาโดยทีม Tencent Hunyuan Foundation Model Team และให้บริการผ่านบริการคลาวด์ Tencent Cloud รวมถึงในรูปแบบ open weights บนแพลตฟอร์ม Hugging Face และ GitHub กลุ่มโมเดลนี้ครอบคลุมโมเดลสำหรับการสร้างและทำความเข้าใจข้อความ การอนุมานเชิงตรรกะและคณิตศาสตร์ การเขียนโปรแกรม การประมวลผลบริบทยาว รวมถึงส่วนขยายแบบมัลติโมดัล (ภาพ วิดีโอ 3D) Hunyuan ได้รับการวางตำแหน่งให้เป็นสายผลิตภัณฑ์ generative AI หลักของ Tencent และได้รับการผสานรวมเข้ากับระบบนิเวศผลิตภัณฑ์ของบริษัท (Yuanbao, WeChat, Tencent Meeting, Tencent Cloud)[1][2][3]

ประวัติและลำดับเวลาของการพัฒนา

การพัฒนา Hunyuan ดำเนินไปในบริบทของการแข่งขัน LLM ระดับโลกและกลยุทธ์ความเป็นอิสระทางเทคโนโลยีด้านปัญญาประดิษฐ์ของจีน สายผลิตภัณฑ์นี้มีการพัฒนาจาก dense models แบบปิดสู่ Mixture-of-Experts (MoE) แบบเปิดและสถาปัตยกรรมไฮบริด Transformer-Mamba[1]

รุ่นแรก (2023)

การประกาศสาธารณะของซีรีส์ Hunyuan เกิดขึ้นในวันที่ 7 กันยายน 2023 ในงาน Tencent Global Digital Ecosystem Summit ที่เมืองเซินเจิ้น เวอร์ชันแรกเป็น dense model แบบปิดที่มีพารามิเตอร์มากกว่า 1 แสนล้านตัว ผ่านการฝึกล่วงหน้าด้วย token มากกว่า 2 ล้านล้านตัว โมเดลนี้มุ่งเน้นภาษาจีน การอนุมานเชิงตรรกะ และการสร้างเนื้อหา ได้รับการผสานรวมเข้ากับผลิตภัณฑ์ Tencent มากกว่า 50 รายการ และเข้าถึงได้ผ่าน Tencent Cloud API[1]

Hunyuan-Large และการเปลี่ยนผ่านสู่ MoE (2024)

ในเดือนพฤศจิกายน 2024 Tencent เปิดตัว Hunyuan-Large ซึ่งในขณะนั้นเป็น Transformer-MoE model แบบเปิดที่ใหญ่ที่สุด มีพารามิเตอร์รวม 389 พันล้านตัวและพารามิเตอร์ที่ใช้งานอยู่ 52 พันล้านตัว โมเดลนี้ได้รับการเผยแพร่พร้อม open weights บน Hugging Face และ GitHub พร้อมด้วย preprint บน arXiv การเปิดตัวนี้ถือเป็นการเปลี่ยนทิศทางเชิงกลยุทธ์ของ Tencent สู่การพัฒนาแบบเปิด[2][4][5]

โมเดลไฮบริดและ reasoning (2025)

ในปี 2025 สายผลิตภัณฑ์ได้รับการขยายด้วยการเปิดตัวสำคัญหลายรายการ:

  • Hunyuan-TurboS (กุมภาพันธ์ 2025) — โมเดลไฮบริด Transformer-Mamba-MoE ขนาดใหญ่ระดับอุตสาหกรรมรุ่นแรก มีพารามิเตอร์รวม 560 พันล้านตัวและพารามิเตอร์ที่ใช้งานอยู่ 56 พันล้านตัว ผ่านการฝึกล่วงหน้าด้วย 16 ล้านล้าน token มีการนำเสนอกลไก adaptive Chain-of-Thought (CoT) สำหรับการสลับแบบไดนามิกระหว่างการคิดเร็วและการคิดลึก[6]
  • Hunyuan-T1 (มีนาคม 2025) — reasoning model เฉพาะทาง สร้างบน TurboS พร้อมการฝึก reinforcement learning แบบขนาดใหญ่ (96.7% ของการคำนวณหลังการฝึกเป็น reinforcement learning)[7]
  • Hunyuan-A13B (มิถุนายน 2025) — MoE model ขนาดกะทัดรัด (พารามิเตอร์รวม 80 พันล้าน / ใช้งานอยู่ 13 พันล้านตัว) สำหรับสมดุลระหว่างประสิทธิภาพและต้นทุน รองรับการคิดเร็วและการคิดช้า[8]
  • Dense models ขนาดเล็ก (กรกฎาคม 2025) — รุ่น 0.5B, 1.8B, 4B, 7B สำหรับอุปกรณ์ edge และสถานการณ์การนำไปใช้งานที่มีการแข่งขันสูง รองรับบริบท 256K[9]

Hunyuan 2.0 (พฤศจิกายน–ธันวาคม 2025)

ในเดือนธันวาคม 2025 มีการประกาศโมเดลเชิงพาณิชย์รุ่นที่สอง — Hunyuan 2.0 (HY 2.0) ที่ใช้สถาปัตยกรรม MoE (พารามิเตอร์รวม 406 พันล้าน / ใช้งานอยู่ 32 พันล้านตัว) และหน้าต่างบริบท 256K token สายผลิตภัณฑ์แบ่งออกเป็นสองรูปแบบ: HY 2.0 Think (การอนุมานเชิงลึก, โค้ด) และ HY 2.0 Instruct (การสนทนา, การสร้างสรรค์เนื้อหา) โมเดลเหล่านี้เข้าถึงได้ผ่าน Tencent Cloud API และได้รับการผสานรวมเข้ากับแอปพลิเคชัน Yuanbao และ ima[10][11]

ลำดับเวลาโดยสรุป

วันที่ เหตุการณ์
กันยายน 2023 การประกาศสาธารณะของ Hunyuan ในฐานะ LLM แบบปิด (>100B พารามิเตอร์); เปิดตัว Tencent Cloud API
กุมภาพันธ์ 2024 MoE model ภายในสำหรับแชทบอต Yuanbao
เมษายน 2024 เปลี่ยนชื่อ: «advanced» → hunyuan-pro, «standard» → hunyuan-standard; เพิ่ม hunyuan-lite
พฤษภาคม 2024 hunyuan-lite เปลี่ยนมาใช้ MoE ขยายเป็นบริบท 256K
กันยายน 2024 เปิดตัว hunyuan-turbo ใหม่ (MoE รุ่นใหม่)
พฤศจิกายน 2024 เปิดตัว Hunyuan-Large แบบเปิด (389B/52B MoE), preprint arXiv:2411.02265
กุมภาพันธ์–มีนาคม 2025 Hunyuan-TurboS (ไฮบริด Mamba-MoE); Hunyuan-T1 (reasoning)
มิถุนายน 2025 Hunyuan-A13B (80B/13B, fine-grained MoE)
กรกฎาคม 2025 Dense models ขนาดเล็ก 0.5B–7B
กันยายน 2025 Hunyuan-MT (โมเดลแปลภาษาเฉพาะทาง)
พฤศจิกายน–ธันวาคม 2025 Hunyuan 2.0 (HY 2.0 Think / Instruct), 406B/32B MoE

แหล่งที่มา: Tencent Cloud product dynamics; ที่เก็บโค้ดทางการ[12]

รากฐานทางทฤษฎีและสถาปัตยกรรม

สถาปัตยกรรม Mixture-of-Experts

โมเดลหลักของซีรีส์ (Hunyuan-Large, A13B, HY 2.0) ใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ซึ่งบางชั้นของ transformer ประกอบด้วย «ผู้เชี่ยวชาญ» (subnetworks) หลายตัว และ router (gating network) จะเลือกชุดผู้เชี่ยวชาญที่ใช้งานอยู่สำหรับแต่ละ token สูตรทั่วไปของชั้น MoE:[2]

Output=i=1NG(x)iEi(x)

โดยที่ G(x) คือฟังก์ชัน routing (gating), Ei คือผู้เชี่ยวชาญคนที่ i, N คือจำนวนผู้เชี่ยวชาญทั้งหมด ด้วยแนวทางนี้ จำนวนพารามิเตอร์รวมของโมเดล Ptotal มีค่ามากกว่าจำนวนพารามิเตอร์ที่ใช้งานอยู่ในการผ่านรอบเดียว Pactive อย่างมีนัยสำคัญ:[2]

PactivePtotal

ซึ่งทำให้สามารถเพิ่มความจุของโมเดลได้โดยไม่ต้องเพิ่มต้นทุนการคำนวณสำหรับ inference อย่างสัดส่วน

ใน Hunyuan-Large มีการนำโครงร่างที่มีผู้เชี่ยวชาญ shared 1 ตัวและผู้เชี่ยวชาญเฉพาะทาง 16 ตัวมาใช้ โดยเปิดใช้งานผู้เชี่ยวชาญ 1 ตัวต่อ token (top-1 routing) นวัตกรรมเพิ่มเติมได้แก่ การ routing แบบผสมพร้อมกลไก recycle (การนำ token ที่ถูกปฏิเสธมาใช้ใหม่) และ learning rates เฉพาะผู้เชี่ยวชาญเพื่อปรับปรุงความสมดุลของการมีส่วนร่วมของผู้เชี่ยวชาญ[2][5]

สถาปัตยกรรมไฮบริด Transformer-Mamba

Hunyuan-TurboS และ T1 นำเสนอสถาปัตยกรรมไฮบริดที่รวมบล็อก Transformer (attention) และ Mamba (state-space model) เข้าด้วยกัน Mamba มีความซับซ้อนเชิงเส้นตามความยาวของลำดับ:[6]

ht=Aht1+Bxt

โดยที่ A, B คือเมทริกซ์ที่ฝึกได้, ht คือสถานะซ่อนเร้นที่ขั้นตอน t, xt คือ token ขาเข้า ซึ่งทำให้มีการขยาย memory แบบ O(1) ตามความยาว (เทียบกับ O(N) ใน Transformer มาตรฐาน)[6]

TurboS มี 128 ชั้น จัดเป็นบล็อก: ชั้น Mamba2 จำนวน 57 ชั้น, ชั้น Attention จำนวน 7 ชั้น และชั้น FFN-MoE จำนวน 64 ชั้นที่มีผู้เชี่ยวชาญ 32 ตัว บล็อก AMF (Attention → Mamba2 → FFN) และ MF (Mamba2 → FFN) สลับกันเพื่อสร้างสมดุลระหว่างบริบทส่วนกลางและส่วนท้องถิ่น[6]

กลไก attention และ KV-cache

Hunyuan-Large ใช้ Grouped Query Attention (GQA) — รูปแบบ attention ที่ query หลายตัวแชร์ key และ value ร่วมกัน — และ Cross-Layer Attention (CLA) เพื่อลดขนาด KV-cache ขนาด KV-cache มาตรฐานสำหรับชั้น self-attention ที่มี H heads, ความยาวลำดับ L และขนาด head dh:[5]

SKV2HLdh

โดยที่ SKV คือขนาด KV-cache ด้วย GQA ที่มี Hg<H กลุ่ม ขนาดจะลดลงเป็น:

SKVGQA2HgLdh

CLA เพิ่มเติมด้วยการนำ KV-cache กลับมาใช้ซ้ำระหว่างชั้นต่างๆ รวมกันแล้วการปรับปรุงเหล่านี้ช่วยประหยัดหน่วยความจำได้ประมาณ 95%[4]

การเข้ารหัสตำแหน่งและบริบทยาว

โมเดลใช้ Rotary Position Embedding (RoPE) พร้อมการปรับขนาดเพื่อรองรับลำดับยาว การฝึกบริบทดำเนินการแบบเป็นขั้นตอน (curriculum learning): จาก 32K ถึง 256K token ฟังก์ชัน activation คือ SwiGLU พจนานุกรม tokenizer มีขนาด 128K (tiktoken พร้อมส่วนขยายสำหรับภาษาจีน)[2]

การฝึกและการขยายขนาด

สำหรับ MoE models มีการศึกษา scaling laws ในรูปแบบของความสัมพันธ์กำลังเชิงประจักษ์:[2]

QabPactiveαcNβ

โดยที่ Q คือเมตริกคุณภาพ, Pactive คือจำนวนพารามิเตอร์ที่ใช้งานอยู่, N คือปริมาณข้อมูล, a,b,c,α,β คือพารามิเตอร์ที่ได้จากการทดลอง Hunyuan-Large เน้นย้ำการใช้ข้อมูลสังเคราะห์ในปริมาณ 1.5 ล้านล้าน token — มากกว่างานวิจัย MoE ก่อนหน้านี้หลายระดับ[2]

กระบวนการฝึกและการปรับพฤติกรรม

กระบวนการฝึกโมเดล Hunyuan ประกอบด้วยหลายขั้นตอนที่เป็นลักษณะเฉพาะของ LLM สมัยใหม่:[2][7]

การฝึกล่วงหน้า (Pre-training)

การฝึกขนาดใหญ่บนคลังข้อมูลหลายภาษาขนาดใหญ่ (ภาษาจีน อังกฤษ และภาษาอื่นๆ) Hunyuan-Large ผ่านการฝึกล่วงหน้าด้วย 7 ล้านล้าน token (รวมถึง 1.5 ล้านล้าน token สังเคราะห์) TurboS ผ่านการฝึกล่วงหน้าด้วย 16 ล้านล้าน token ส่วนประกอบที่ชัดเจนของ dataset ไม่ได้รับการเปิดเผย[2][6]

การ fine-tuning แบบมีผู้ควบคุม (Supervised Fine-Tuning, SFT)

การ fine-tuning บนคำสั่งมากกว่า 1 ล้านรายการ (คู่ «คำสั่ง — คำตอบ») เพื่อให้โมเดลปฏิบัติตามคำสั่งของผู้ใช้[2]

การปรับพฤติกรรมด้วย reinforcement learning

สำหรับการปรับพฤติกรรมของโมเดลให้สอดคล้องกับความชอบของมนุษย์ มีการใช้:

Direct Preference Optimization (DPO) — วิธีการปรับพฤติกรรมโดยไม่มีโมเดลรางวัลที่ชัดเจน ใช้ใน Hunyuan-Large[2]

Reinforcement Learning (RL) — ใน Hunyuan-T1 มีการใช้ reinforcement learning ขนาดใหญ่พร้อม curriculum learning; ตามคำกล่าวอ้างของผู้พัฒนา 96.7% ของการคำนวณหลังการฝึกเป็น RL[7]

Adaptive Long-Short Chain-of-Thought — ใน TurboS มีการนำกลไกการสลับแบบไดนามิกระหว่างการคิดเร็วและการคิดลึกมาใช้ ช่วยให้โมเดลสามารถปรับความลึกของการอนุมานตามความซับซ้อนของงาน[6]

ประเภทของโมเดลในกลุ่มผลิตภัณฑ์

กลุ่มผลิตภัณฑ์แบ่งออกเป็นโมเดล API บนคลาวด์แบบปิดและโมเดลแบบเปิดพร้อม weights[3]

โมเดลหลัก (ภาพรวม)

โมเดล วันที่เปิดตัว สถาปัตยกรรม พารามิเตอร์ (รวม / ใช้งานอยู่) บริบท ความพร้อมใช้งาน
Hunyuan (2023) กันยายน 2023 Dense Transformer >100 พันล้าน / — ไม่เปิดเผย API แบบปิด
Hunyuan-Large พฤศจิกายน 2024 Transformer-MoE 389 พันล้าน / 52 พันล้าน 256K (pretrain), 128K (instruct) Open weights (GitHub, HF)
Hunyuan-TurboS กุมภาพันธ์ 2025 Hybrid Transformer-Mamba-MoE 560 พันล้าน / 56 พันล้าน 256K (สถาปัตยกรรม), 32K/16K (API) API แบบปิด + รุ่นเปิด
Hunyuan-T1 มีนาคม 2025 บน TurboS + RL ขนาดใหญ่ 32K/64K (API) API แบบปิด
Hunyuan-A13B มิถุนายน 2025 Fine-grained MoE 80 พันล้าน / 13 พันล้าน 256K (เปิด), 224K/32K (API) Open weights + API
ขนาดเล็ก (0.5–7B) กรกฎาคม 2025 Dense 0.5–7 พันล้าน 256K Open weights
HY 2.0 Think พฤศจิกายน 2025 MoE 406 พันล้าน / 32 พันล้าน 128K ขาเข้า / 64K ขาออก (API) API แบบปิด
HY 2.0 Instruct พฤศจิกายน 2025 MoE 406 พันล้าน / 32 พันล้าน 128K ขาเข้า / 16K ขาออก (API) API แบบปิด

แหล่งที่มา: arXiv:2411.02265; arXiv:2505.15431; Tencent Cloud docs; GitHub[2][6][3][10]

หมายเหตุ. สำหรับบางโมเดล ขีดจำกัดบริบทตามสถาปัตยกรรม (จากรายงานทางเทคนิค) และขีดจำกัดบริการ API (จากเอกสารผลิตภัณฑ์) แตกต่างกัน ซึ่งไม่ใช่ความขัดแย้ง แต่สะท้อนความแตกต่างระหว่างการกำหนดค่าการวิจัยและผลิตภัณฑ์[6][3]

โมเดลเฉพาะทาง

Hunyuan-MT (กันยายน 2025) — โมเดลแปลภาษาด้วยเครื่องเฉพาะทาง ได้อันดับ 1 ใน WMT25 ใน 30 จาก 31 หมวดหมู่[13]

HunyuanImage, HunyuanVideo, Hunyuan3D — โมเดลมัลติโมดัลของกลุ่มผลิตภัณฑ์สำหรับการสร้างภาพ วิดีโอ และวัตถุ 3D ตามลำดับ[14]

การวางตำแหน่งและความสัมพันธ์เชิงวิวัฒนาการ

ในเอกสาร Tencent Cloud มีความสัมพันธ์เชิงวิวัฒนาการดังต่อไปนี้:

  • hunyuan-a13b ระบุว่าเป็นการอัพเกรดจาก hunyuan-standard-256K
  • hunyuan-t1 สร้างบน TurboS พร้อมการ post-training แบบ RL ที่เข้มข้นยิ่งขึ้น
  • HY 2.0 Think/Instruct — สาขาที่มีการอัพเดตฐานจาก TurboS เป็น Hunyuan 2.0
  • สาขาแบบเปิด (Hunyuan-Large, A13B, compact dense) พัฒนาขนานกับสาขา API แบบปิด เพื่อให้มีการเข้าถึงสำหรับการวิจัย[3]

สิ่งใหม่ในรุ่นสำคัญ

Hunyuan-Large (2024)

เมื่อเปรียบเทียบกับรุ่นแรกและแนวทาง MoE ก่อนหน้า Hunyuan-Large นำเสนอ:[2][4]

  • ขนาด 389 พันล้านพารามิเตอร์ (52 พันล้านตัวที่ใช้งานอยู่) — Transformer-MoE model แบบเปิดที่ใหญ่ที่สุดในขณะที่เผยแพร่
  • รองรับบริบท 256K (pretrain) และ 128K (instruct) — เกินกว่าค่าทั่วไปของ LLM ในปี 2024 อย่างมีนัยสำคัญ
  • การบีบอัด KV-cache โดยใช้ GQA + CLA (ประหยัดหน่วยความจำ ~95%)
  • ข้อมูลสังเคราะห์ขนาดใหญ่ (1.5 ล้านล้าน token ของข้อมูลสังเคราะห์)
  • การ routing ผู้เชี่ยวชาญแบบผสมและ learning rates เฉพาะผู้เชี่ยวชาญ

Hunyuan-TurboS (2025)

การเปลี่ยนแปลงสถาปัตยกรรมหลัก:[6]

  • ไฮบริด Mamba2 + Attention + MoE: รวม 560B / ใช้งานอยู่ 56B, 128 ชั้น
  • ฝึกล่วงหน้าด้วย 16 ล้านล้าน token
  • Adaptive Long-Short Chain-of-Thought สำหรับการจัดการความลึกของการอนุมานแบบไดนามิก
  • ความเร็วในการถอดรหัสที่อ้างว่าเร็วขึ้น 1.8–2 เท่า เมื่อเทียบกับเวอร์ชัน Turbo ก่อนหน้า

Hunyuan-T1 (2025)

Reasoning model บน TurboS:[7]

  • 96.7% ของการคำนวณหลังการฝึก — reinforcement learning
  • ความเร็วในการถอดรหัสเร็วขึ้นสองเท่าโดยมี deployment envelope ที่เทียบเคียงได้
  • Curriculum learning เพื่อปรับปรุงกลยุทธ์การอนุมาน

HY 2.0 (2025)

การอัพเดตผลิตภัณฑ์เชิงพาณิชย์หลัก:[10][11]

  • สถาปัตยกรรม MoE: 406B รวม / 32B ที่ใช้งานอยู่
  • หน้าต่างบริบท 256K token
  • การเติบโตอย่างมีนัยสำคัญบน benchmark เฉพาะทาง: IMO-AnswerBench 73.4% (+20% จากเวอร์ชัน HY ก่อนหน้า), SWE-bench Verified 53.0 (จาก 6.0), τ²-Bench 72.4 (จาก 17.1)
  • การปรับปรุง RLHF และกลยุทธ์การ post-training

การประเมินและ benchmark

การประเมินดำเนินการบน benchmark มาตรฐานโดยใช้โปรโตคอล zero-shot และ few-shot ผลลัพธ์อ้างอิงจากรายงานทางเทคนิคและที่เก็บโค้ดทางการ สำหรับบางโมเดล การตรวจสอบอิสระจากภายนอกยังมีจำกัด[2]

Benchmark ของ Hunyuan-Large (pretrain)

Benchmark Hunyuan-Large Llama 3.1-405B Llama 3.1-70B Mixtral-8x22B DeepSeek-V2
MMLU 88.4 85.2 79.3 77.8 78.5
CMMLU 90.2 84.0
C-Eval 91.9 81.7
GSM8K 92.8 89.0 83.7 83.7 79.2
MATH 69.8 53.8 41.4 42.5 43.6
HumanEval 71.4 61.0 58.5 53.1 48.8

แหล่งที่มา: arXiv:2411.02265[2]

ตามรายงานทางเทคนิค Hunyuan-Large (pretrain) นำใน 15 จาก 19 benchmark เมื่อเปรียบเทียบกับ Llama 3.1-405B, Mixtral-8x22B และ DeepSeek-V2[2]

Benchmark ของ Hunyuan-Large-Instruct

Benchmark Hunyuan-Large-Instruct
MMLU 89.9
MATH 77.4
HumanEval 90.0
Arena-Hard 81.8

แหล่งที่มา: arXiv:2411.02265; Hugging Face model card[2][5]

ตามคำกล่าวอ้างของผู้พัฒนา Hunyuan-Large-Instruct มีประสิทธิภาพเหนือกว่า LLaMA 3.1-405B บน MMLU 2.6 เปอร์เซ็นต์[4]

Benchmark ของ TurboS และ T1

Benchmark TurboS T1
LMSYS Chatbot Arena 1356 (อันดับ 7)
ค่าเฉลี่ยจาก 23 benchmark 77.9%
MMLU-Pro 87.2
GPQA-Diamond 69.3
MATH-500 96.2
LiveCodeBench 64.9
Arena-Hard 91.9

แหล่งที่มา: arXiv:2505.15431; หน้าทางการของ T1[6][7]

Benchmark ของ Hunyuan-A13B

Benchmark Hunyuan-A13B Hunyuan-Large Qwen2.5-72B
MMLU 88.17 88.4
MMLU-Pro 67.23 60.2
BBH 87.56 86.3
MATH 72.35 69.8
GPQA 49.12
MBPP 83.86

แหล่งที่มา: GitHub Hunyuan-A13B README[8]

A13B มีประสิทธิภาพเหนือกว่า Hunyuan-Large ในงานที่ไวต่อ post-training บางรายการ (MMLU-Pro, MATH, MBPP) ซึ่งสอดคล้องกับการวางตำแหน่งให้เป็นรุ่นที่ใหม่กว่าและใช้งานได้จริงมากกว่า[8]

Benchmark ของสาขา dense ขนาดกะทัดรัด

โมเดล MMLU MMLU-Pro BBH GSM8K MATH
Hunyuan-0.5B 54.02 31.15 45.92 55.64 42.95
Hunyuan-1.8B 64.62 38.65 74.32 77.26 62.85
Hunyuan-4B 74.01 51.91 75.17 87.49 72.25
Hunyuan-7B 79.82 57.79 82.95 88.25 74.85

แหล่งที่มา: GitHub Hunyuan-7B README[9]

Benchmark ของ HY 2.0

ตัวเลขที่อ้างโดยผู้พัฒนา (แหล่งที่มาที่ชัดเจนเพียงแหล่งเดียว — บัญชีทางการของ Hunyuan):[11]

Benchmark HY 2.0 เวอร์ชัน HY ก่อนหน้า
IMO-AnswerBench 73.4 ~53 (ประมาณการ, +20%)
SWE-bench Verified 53.0 6.0
τ²-Bench 72.4 17.1

หมายเหตุ. ข้อมูลเหล่านี้จัดอยู่ในประเภท «อ้างโดยผู้พัฒนา รอการยืนยันจากภายนอกในวงกว้าง»[11]

รายละเอียดทางเทคนิคสำหรับการใช้งาน

หน้าต่างบริบทตามสาขา

โมเดล ขาเข้า (token) ขาออก (token)
HY 2.0 Think 128K 64K
HY 2.0 Instruct 128K 16K
T1 (API) 32K 64K
A13B (API) 224K 32K
TurboS (API) 32K 16K
Lite (API) 250K 6K
Hunyuan-Large (แบบเปิด) 256K (pretrain) / 128K (instruct)
Compact 0.5–7B 256K

แหล่งที่มา: Tencent Cloud product overview[3]

เครื่องมือที่รองรับ

ใน Tencent Cloud API มีการบันทึกไว้:[15]

  • Function Calling (tools, tool_choice)
  • AI Search Enhancement — การค้นหาจากแหล่งภายนอกในตัว (retrieval-augmented generation)
  • SearchInfo และ Citation — เครื่องหมายอ้างอิงในคำตอบ
  • EnableMultimedia — การแทรกมัลติมีเดียในผลลัพธ์
  • EnableThinking — ตัวสลับ chain-of-thought สำหรับ A13B
  • EnableRecommendedQuestions — การสร้างคำถามแนะนำ

ความเข้ากันได้ของ API

Hunyuan API รองรับรูปแบบที่เข้ากันได้กับ OpenAI:[16]

  • Base URL: https://api.hunyuan.cloud.tencent.com/v1
  • รองรับ /v1/chat/completions และ /v1/embeddings
  • Embedding model: hunyuan-embedding, มิติ 1024
  • Streaming ผ่าน SSE
  • Concurrency เริ่มต้น: 5 ต่อบัญชี

สำหรับ Hunyuan-Large (แบบเปิด) รูปแบบ input/output มาตรฐานเข้ากันได้กับ framework PyTorch/Transformers รองรับการควอนไทซ์: FP8, INT4 (GPTQ/AWQ)[5]

การประยุกต์ใช้และการผสานรวม

โมเดล Hunyuan ได้รับการผสานรวมเข้ากับระบบนิเวศของ Tencent และพร้อมใช้งานสำหรับนักพัฒนาภายนอก สถานการณ์การใช้งานหลักที่มีการบันทึกไว้:[1][17]

ผลิตภัณฑ์ Tencent

  • Yuanbao — แชทบอทพร้อมรองรับ Hunyuan และ DeepSeek
  • Tencent Meeting — การสร้างสรุปการประชุม
  • Tencent Docs — การสร้างและวิเคราะห์ข้อความ
  • ima — ผู้ช่วย AI ด้านการเงินและมัลติมีเดีย

การประยุกต์ใช้ระดับองค์กร

  • การสร้างข้อความ: บทความ ข้อความโฆษณา บทภาพยนตร์ คำอธิบายผลิตภัณฑ์
  • การสนับสนุนลูกค้าอัจฉริยะ: แชทบอท FAQ การตอบกลับอัตโนมัติ
  • การสร้างและวิเคราะห์โค้ด (โดยเฉพาะ HY 2.0 Think และ T1)
  • การอนุมานทางคณิตศาสตร์และตรรกศาสตร์ งานวิเคราะห์
  • การแปลหลายภาษา (มากกว่า 30 ภาษา, Hunyuan-MT)

โมเดลแบบเปิด

รูปแบบแบบเปิดใช้สำหรับการวิจัย การ fine-tuning และการนำไปใช้งานบนอุปกรณ์ edge (dense models ขนาดเล็ก) ส่วนขยายมัลติโมดัล (HunyuanImage, HunyuanVideo, Hunyuan3D) ใช้สำหรับการสร้างโมเดล 3D และวิดีโอ[14]

ข้อจำกัดและปัญหาที่ยังเปิดอยู่

  • ความเป็นปิดของโมเดลเชิงพาณิชย์. สำหรับ HY 2.0 และ T1 ไม่มี open weights และข้อกำหนดสถาปัตยกรรมโดยละเอียด การเข้าถึงจำกัดเฉพาะ API ซึ่งทำให้การทำซ้ำอิสระเป็นเรื่องยาก[3]
  • ความไม่โปร่งใสของข้อมูลการฝึก. แม้จะเน้นการใช้ข้อมูลสังเคราะห์ขนาดใหญ่ แต่ส่วนประกอบที่ชัดเจนของ dataset สัดส่วนของภาษาและโดเมน ไม่ได้รับการเปิดเผย[2]
  • ความต้องการการคำนวณ. โมเดลแบบเปิดต้องการทรัพยากรมาก: GPU อย่างน้อย 32 ตัวสำหรับการ fine-tuning แบบเต็มของ Hunyuan-Large; หน่วยความจำ VRAM หลายสิบ GB แม้จะใช้ FP8[5]
  • การสร้างข้อมูลที่ไม่ถูกต้อง. เช่นเดียวกับ LLM อื่นๆ โมเดลมีความเสี่ยงต่อการสร้างข้อความที่ฟังดูน่าเชื่อถือแต่ผิดข้อเท็จจริง การวิจัยเชิงระบบในด้านนี้สำหรับ Hunyuan ในงานที่ผ่านการตรวจสอบโดยผู้เชี่ยวชาญแบบเปิดยังมีจำกัด[18]
  • ความแตกต่างระหว่างขีดจำกัดสถาปัตยกรรมและบริการ. สำหรับบางโมเดล (TurboS, A13B) ขีดจำกัดบริการ API ต่ำกว่าความสามารถของสถาปัตยกรรมอย่างมีนัยสำคัญ[6][3]
  • การเข้าถึงตามภูมิภาค. มุ่งเน้นตลาดจีนเป็นหลัก; API สำหรับผู้ใช้นอกประเทศจีนมีข้อจำกัดด้านภาษาและกฎหมาย[17]
  • ขาดรายงาน safety โดยละเอียด. เอกสารระบุหลักการความปลอดภัยและการกรองทั่วไป แต่ไม่มีรายงานความปลอดภัยทางเทคนิคสาธารณะที่เทียบเคียงกับบางโมเดลระดับนานาชาติ[15]
  • ความเข้ากันได้ของสาขา open-source. หลังจากการเปิดตัว มีการบันทึกปัญหาการผสานรวมกับ transformers / vllm ซึ่งไลบรารีไม่รู้จักประเภทสถาปัตยกรรม hunyuan_v1_dense ต้องการ trust_remote_code หรือสาขาพิเศษ[19]

เหตุการณ์และปัญหาที่รู้จัก

ตามข้อมูลที่มี (ปลายปี 2025 — ต้นปี 2026) ไม่มีการบันทึกเหตุการณ์สาธารณะขนาดใหญ่ที่เกี่ยวข้องโดยเฉพาะกับ Hunyuan (การรั่วไหลของข้อมูลขนาดใหญ่ ภัยคุกคามความปลอดภัยเฉพาะ)[17]

การแก้ไขผลิตภัณฑ์ที่มีการบันทึก

ใน product dynamics ของ Tencent Cloud มีการบันทึกการแก้ไขย่อย:[12]

  • 2024-11-20: hunyuan-turbo-latest ได้รับการอัพเดตเพื่อแก้ไขการซ้ำกันเนื่องจาก special characters ปรับปรุงความเสถียรของผลลัพธ์ Markdown และลดการปฏิเสธที่ไม่มีเหตุผล
  • 2025-04-03: การอัพเดต T1 พร้อมการแก้ไขการผสมระหว่างภาษาจีนตัวย่อ/ตัวเต็มและการผสมระหว่างภาษาจีน/อังกฤษ บวกกับการปรับปรุงการสร้างโค้ดระดับโปรเจกต์
  • 2025-04-20: Search Enhancement เปลี่ยนจาก default-on เป็น default-off — ซึ่งเป็นการเปลี่ยนแปลงพฤติกรรม API สำหรับการผสานรวม

การวิจัยความปลอดภัย MoE

ในระดับการวิจารณ์การวิจัย (ระดับ preprint) Hunyuan-A13B ปรากฏในงานวิจัยเกี่ยวกับการโจมตีการระบุตำแหน่งความปลอดภัยใน MoE models โดยเฉพาะในงาน Large Language Lobotomy และ GateBreaker รายงาน attack success rate สูงในการ «ปิดเสียง» ผู้เชี่ยวชาญด้านความปลอดภัย ซึ่งไม่ใช่การยืนยันเหตุการณ์ในระดับ production แต่แสดงให้เห็นว่าความปลอดภัยของ MoE routing ได้รับการมองว่าเป็นทิศทางการวิจัยที่มีความเสี่ยง[20][21]

ด้านจริยธรรมและกฎระเบียบ

Hunyuan ดำเนินงานภายในบริบทกฎหมายและกฎระเบียบของจีน รวมถึงกฎระเบียบระดับชาติเกี่ยวกับการจัดการ AI เชิงสร้างสรรค์ (CAC) และการกรองเนื้อหา ตลอดจนนโยบายความปลอดภัยข้อมูลภายในของ Tencent เอกสาร Tencent Cloud เน้นย้ำว่าการใช้ Hunyuan API ต้องเป็นไปตามกฎหมายที่บังคับใช้และนโยบายแพลตฟอร์ม[1]

มาตรการเฉพาะได้แก่:

  • การกลั่นกรองเนื้อหาในตัวพร้อมการส่งออกแบบ streaming และ FinishReason=sensitive ที่เป็นไปได้
  • การปรับพฤติกรรมผ่าน RLHF/DPO เพื่อลดการสร้างข้อมูลที่ไม่ถูกต้องและพฤติกรรมที่ไม่พึงประสงค์
  • การกรองข้อมูลการฝึกเพื่อลด bias
  • ใบอนุญาตแบบเปิด (Tencent Hunyuan Community License Agreement) สำหรับโมเดลแบบเปิด โดยมีข้อสงวนว่าข้อตกลงนี้ไม่บังคับใช้ในสหภาพยุโรปสำหรับบางรุ่น[8][15]

รายงานอิสระเฉพาะทางเกี่ยวกับ bias (อคติ) และ fairness (ความเป็นธรรม) สำหรับ Hunyuan ยังมีน้อย การวิจัยคาดว่าจะเพิ่มขึ้นตามการขยาย open weights และการทดสอบอิสระ[2]

การตอบสนองของชุมชน

สัญญาณภายนอกที่มีความหมายที่สุดสำหรับสาขาแบบปิดคือผลลัพธ์ของ TurboS บน LMSYS Chatbot Arena (1356, อันดับ 7 ระดับโลก) สำหรับสาขาแบบเปิด ตัวชี้วัดทางอ้อมคือกิจกรรมบน GitHub: ประมาณ 1,600 stars สำหรับ Hunyuan-Large, 812 สำหรับ A13B, 683 สำหรับ Hunyuan-MT ซึ่งสะท้อนถึงระดับการมีส่วนร่วมที่เห็นได้ชัด แต่ไม่ถึงขั้นโดดเด่นในระบบนิเวศ open LLM ความคิดเห็นเชิงอัตนัยของชุมชน (Hugging Face, Reddit) สังเกตเห็นจุดแข็งในภาษาจีนและงาน agent[22]

แนวโน้มและทิศทางการวิจัย

ทิศทางการพัฒนาต่อไปที่ระบุในเอกสารสาธารณะ:[2][6][14]

  • การผสมสถาปัตยกรรมเพิ่มเติม (Mamba + Transformer + MoE) และการศึกษา scaling laws สำหรับ MoE
  • การขยายความสามารถมัลติโมดัล: การผสานรวม Hunyuan3D, HunyuanVideo และ HunyuanImage กับโมเดลภาษา
  • การปรับปรุงการใช้เครื่องมือ (tool use) และความสามารถของ agent
  • การลดต้นทุน inference: การควอนไทซ์ (2-bit สำหรับ edge) การปรับปรุงผ่าน TRT-LLM/vLLM
  • การขยายพอร์ตโฟลิโอโมเดลแบบเปิด
  • การพัฒนาและเผยแพร่รายงาน safety และ alignment โดยละเอียด

ดูเพิ่มเติม

  • LLaMA (Meta)
  • DeepSeek

วรรณกรรม

ลิงก์

หมายเหตุ

  1. 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
  4. 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
  5. 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
  7. 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
  8. 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
  9. 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
  10. 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
  11. 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
  12. 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
  13. Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
  14. 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
  15. 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
  16. Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
  17. 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
  18. LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
  19. GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
  20. Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
  21. Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
  22. Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS