Hunyuan (Tencent) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Hunyuan (चीनी: 腾讯混元大模型, Tencent Hunyuan, Tencent HY) — Foundation Models और Large Language Models (LLM) का एक परिवार है, जिसे Tencent Hunyuan Foundation Model Team द्वारा विकसित किया गया है और जो Tencent Cloud क्लाउड सेवा के माध्यम से, तथा Hugging Face और GitHub प्लेटफ़ॉर्म पर खुले भार (open weights) के रूप में उपलब्ध है। यह परिवार पाठ उत्पादन और समझ, तार्किक एवं गणितीय अनुमान, प्रोग्रामिंग, लंबे संदर्भों की प्रसंस्करण, तथा बहु-मोडल विस्तार (चित्र, वीडियो, 3D) के लिए मॉडल समाहित करता है। Hunyuan को Tencent की जनरेटिव AI की प्रमुख श्रृंखला के रूप में प्रस्तुत किया जाता है और यह कंपनी के उत्पाद पारिस्थितिकी तंत्र (Yuanbao, WeChat, Tencent Meeting, Tencent Cloud) में एकीकृत है।[1][2][3]

इतिहास और विकास का कालक्रम

Hunyuan का विकास LLM की वैश्विक प्रतिस्पर्धा और कृत्रिम बुद्धिमत्ता के क्षेत्र में चीन की तकनीकी स्वतंत्रता की रणनीति के संदर्भ में हुआ। यह श्रृंखला स्वामित्व (proprietary) dense-मॉडलों से विकसित होकर खुले Mixture-of-Experts (MoE) और हाइब्रिड Transformer-Mamba आर्किटेक्चर की ओर अग्रसर हुई।[1]

प्रथम पीढ़ी (2023)

Hunyuan श्रृंखला की सार्वजनिक घोषणा 7 सितंबर 2023 को शेन्झेन में Tencent Global Digital Ecosystem Summit में की गई। पहला संस्करण 100 अरब से अधिक पैरामीटर वाला एक proprietary dense-मॉडल था, जिसे 2 ट्रिलियन से अधिक token पर पूर्व-प्रशिक्षित किया गया था। यह मॉडल चीनी भाषा, तार्किक अनुमान और सामग्री उत्पादन पर केंद्रित था, Tencent के 50 से अधिक उत्पादों में एकीकृत था और Tencent Cloud API के माध्यम से उपलब्ध था।[1]

Hunyuan-Large और MoE की ओर परिवर्तन (2024)

नवंबर 2024 में Tencent ने Hunyuan-Large जारी किया — जो उस समय का सबसे बड़ा खुला Transformer-MoE मॉडल था, जिसमें कुल 389 अरब और 52 अरब सक्रिय पैरामीटर थे। यह मॉडल Hugging Face और GitHub पर खुले भार के साथ प्रकाशित किया गया और arXiv पर प्रीप्रिंट के साथ उपलब्ध कराया गया। इस रिलीज़ ने खुले विकास की ओर Tencent के रणनीतिक बदलाव को रेखांकित किया।[2][4][5]

हाइब्रिड और reasoning मॉडल (2025)

2025 में यह श्रृंखला कई प्रमुख रिलीज़ के साथ विस्तारित हुई:

  • Hunyuan-TurboS (फरवरी 2025) — पहला औद्योगिक बड़े पैमाने का हाइब्रिड Transformer-Mamba-MoE मॉडल, जिसमें कुल 560 अरब और 56 अरब सक्रिय पैरामीटर हैं, जिसे 16 ट्रिलियन token पर पूर्व-प्रशिक्षित किया गया है। इसमें तीव्र और गहरी सोच के बीच गतिशील स्विचिंग के लिए अनुकूली Chain-of-Thought (CoT) तंत्र लागू किया गया है।[6]
  • Hunyuan-T1 (मार्च 2025) — एक विशेष reasoning मॉडल, जो TurboS के ऊपर बड़े पैमाने पर reinforcement learning (पोस्ट-ट्रेनिंग कम्प्यूट का 96.7% reinforcement learning) के साथ बनाया गया है।[7]
  • Hunyuan-A13B (जून 2025) — प्रदर्शन और लागत के संतुलन के लिए एक कॉम्पैक्ट MoE मॉडल (कुल 80 अरब / 13 अरब सक्रिय पैरामीटर), जो तीव्र और धीमी सोच का समर्थन करता है।[8]
  • छोटे dense मॉडल (जुलाई 2025) — edge डिवाइस और उच्च-प्रतिस्पर्धी डेप्लॉयमेंट परिदृश्यों के लिए 0.5B, 1.8B, 4B, 7B के संस्करण, 256K संदर्भ के समर्थन के साथ।[9]

Hunyuan 2.0 (नवंबर–दिसंबर 2025)

दिसंबर 2025 में वाणिज्यिक मॉडल की दूसरी पीढ़ी — Hunyuan 2.0 (HY 2.0) — की घोषणा की गई, जिसमें MoE आर्किटेक्चर (कुल 406 अरब / 32 अरब सक्रिय पैरामीटर) और 256K token की संदर्भ विंडो है। यह श्रृंखला दो प्रकारों में विभाजित है: HY 2.0 Think (गहन तर्क, कोड) और HY 2.0 Instruct (संवाद, रचनात्मक उत्पादन)। मॉडल Tencent Cloud API के माध्यम से उपलब्ध हैं और Yuanbao तथा ima अनुप्रयोगों में एकीकृत हैं।[10][11]

संक्षिप्त कालक्रम

तारीख घटना
सितंबर 2023 Hunyuan की proprietary LLM (>100B पैरामीटर) के रूप में सार्वजनिक घोषणा; Tencent Cloud API का शुभारंभ
फरवरी 2024 Yuanbao चैटबॉट के लिए आंतरिक MoE मॉडल
अप्रैल 2024 री-ब्रांडिंग: 'advanced' → hunyuan-pro, 'standard' → hunyuan-standard; hunyuan-lite जोड़ा गया
मई 2024 hunyuan-lite को MoE में स्थानांतरित किया गया, 256K संदर्भ तक विस्तारित
सितंबर 2024 नए hunyuan-turbo (नई पीढ़ी MoE) का शुभारंभ
नवंबर 2024 Hunyuan-Large (389B/52B MoE) का खुला रिलीज़, प्रीप्रिंट arXiv:2411.02265
फरवरी–मार्च 2025 Hunyuan-TurboS (हाइब्रिड Mamba-MoE); Hunyuan-T1 (reasoning)
जून 2025 Hunyuan-A13B (80B/13B, fine-grained MoE)
जुलाई 2025 छोटे dense मॉडल 0.5B–7B
सितंबर 2025 Hunyuan-MT (विशेष अनुवाद मॉडल)
नवंबर–दिसंबर 2025 Hunyuan 2.0 (HY 2.0 Think / Instruct), 406B/32B MoE

स्रोत: Tencent Cloud product dynamics; आधिकारिक रिपोजिटरी।[12]

सैद्धांतिक आधार और आर्किटेक्चर

Mixture-of-Experts आर्किटेक्चर

श्रृंखला के प्रमुख मॉडल (Hunyuan-Large, A13B, HY 2.0) Mixture-of-Experts (MoE) आर्किटेक्चर का उपयोग करते हैं, जिसमें transformer की कुछ परतों में अनेक 'विशेषज्ञ' (उप-नेटवर्क) होते हैं, और एक राउटर (gating network) प्रत्येक token के लिए सक्रिय विशेषज्ञों के उपसमूह का चयन करता है। MoE परत का सामान्य सूत्र:[2]

Output=i=1NG(x)iEi(x)

जहाँ G(x) — रूटिंग फ़ंक्शन (gating), Eii-वाँ विशेषज्ञ, N — विशेषज्ञों की कुल संख्या। इस दृष्टिकोण में मॉडल के कुल पैरामीटरों की संख्या Ptotal एक पास में सक्रिय पैरामीटरों की संख्या Pactive से काफी अधिक होती है:[2]

PactivePtotal

जो inference पर आनुपातिक कम्प्यूटेशनल लागत बढ़ाए बिना मॉडल की क्षमता बढ़ाने की अनुमति देता है।

Hunyuan-Large में 1 साझा (shared) विशेषज्ञ और 16 विशेषीकृत विशेषज्ञों की योजना लागू है, जिसमें प्रति token 1 विशेषज्ञ सक्रिय होता है (top-1 routing)। अतिरिक्त नवाचारों में recycle-तंत्र के साथ मिश्रित रूटिंग (अस्वीकृत token का पुनर्चक्रण) और विशेषज्ञ-विशिष्ट learning rates शामिल हैं, जो विशेषज्ञों के योगदान का बेहतर संतुलन सुनिश्चित करते हैं।[2][5]

हाइब्रिड Transformer-Mamba आर्किटेक्चर

Hunyuan-TurboS और T1 एक हाइब्रिड आर्किटेक्चर प्रस्तुत करते हैं, जो Transformer (attention) और Mamba (state-space model) ब्लॉक को संयोजित करता है। Mamba अनुक्रम की लंबाई के सापेक्ष रैखिक जटिलता प्रदान करता है:[6]

ht=Aht1+Bxt

जहाँ A, B — प्रशिक्षण योग्य मैट्रिक्स, ht — चरण t पर छुपी हुई अवस्था, xt — इनपुट token। यह लंबाई के सापेक्ष O(1) memory scaling प्रदान करता है (मानक Transformer में O(N) के विपरीत)।[6]

TurboS में 128 परतें हैं, जो ब्लॉकों में व्यवस्थित हैं: 57 Mamba2 परतें, 7 Attention परतें और 32 विशेषज्ञों के साथ 64 FFN-MoE परतें। वैश्विक और स्थानीय संदर्भ का संतुलन सुनिश्चित करने के लिए AMF (Attention → Mamba2 → FFN) और MF (Mamba2 → FFN) ब्लॉक बारी-बारी से आते हैं।[6]

attention तंत्र और KV-कैश

Hunyuan-Large Grouped Query Attention (GQA) का उपयोग करता है — attention का एक प्रकार जिसमें कई क्वेरी साझा कुंजियाँ और मान साझा करती हैं — और KV-कैश की मात्रा कम करने के लिए Cross-Layer Attention (CLA) का उपयोग करता है। H हेड, अनुक्रम लंबाई L और हेड आकार dh के साथ self-attention परत के लिए KV-कैश की मानक मात्रा:[5]

SKV2HLdh

जहाँ SKV — KV-कैश की मात्रा। Hg<H समूहों के साथ GQA में मात्रा घटकर:

SKVGQA2HgLdh

CLA परतों के बीच KV-कैश के पुनः उपयोग की अतिरिक्त सुविधा प्रदान करता है। कुल मिलाकर, ये अनुकूलन लगभग 95% तक मेमोरी की बचत सुनिश्चित करते हैं।[4]

स्थितीय एन्कोडिंग और लंबा संदर्भ

मॉडल लंबे अनुक्रमों के समर्थन के लिए स्केलिंग के साथ Rotary Position Embedding (RoPE) का उपयोग करते हैं। संदर्भ प्रशिक्षण चरणबद्ध रूप से किया जाता है (curriculum learning): 32K से 256K token तक। सक्रियण — SwiGLU। टोकनाइज़र शब्दकोश — 128K (चीनी भाषा के विस्तार के साथ tiktoken)।[2]

प्रशिक्षण और स्केलिंग

MoE मॉडलों के लिए अनुभवजन्य घात निर्भरताओं के रूप में scaling laws का अध्ययन किया जाता है:[2]

QabPactiveαcNβ

जहाँ Q — गुणवत्ता मीट्रिक, Pactive — सक्रिय पैरामीटरों की संख्या, N — डेटा की मात्रा, a,b,c,α,β — प्रयोगात्मक रूप से चुने गए पैरामीटर। Hunyuan-Large 1.5 ट्रिलियन token के सिंथेटिक डेटा के उपयोग पर जोर देता है — जो पिछले MoE प्रकाशनों की तुलना में कई गुना अधिक है।[2]

प्रशिक्षण पाइपलाइन और संरेखण

Hunyuan मॉडलों के प्रशिक्षण प्रक्रिया में आधुनिक LLM की विशेषता वाले कई चरण शामिल हैं:[2][7]

Pre-training - पूर्व-प्रशिक्षण

एक बड़े बहुभाषी कॉर्पस (चीनी, अंग्रेज़ी और अन्य भाषाएँ) पर बड़े पैमाने पर प्रशिक्षण। Hunyuan-Large को 7 ट्रिलियन token (1.5 ट्रिलियन सिंथेटिक सहित) पर पूर्व-प्रशिक्षित किया गया है। TurboS को 16 ट्रिलियन token पर। dataset की सटीक संरचना प्रकट नहीं की गई है।[2][6]

Supervised Fine-Tuning (SFT) - पर्यवेक्षित fine-tuning

1 मिलियन से अधिक निर्देशों (निर्देश-उत्तर युग्मों) पर fine-tuning, जो मॉडल को उपयोगकर्ता के निर्देशों का पालन करने योग्य बनाती है।[2]

Reinforcement Learning के माध्यम से संरेखण

मॉडल के व्यवहार को मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए निम्नलिखित का उपयोग किया जाता है:

Direct Preference Optimization (DPO) — स्पष्ट पुरस्कार मॉडल के बिना संरेखण की विधि, जिसका उपयोग Hunyuan-Large में किया जाता है।[2]

Reinforcement Learning (RL) — Hunyuan-T1 में curriculum learning के साथ बड़े पैमाने पर reinforcement learning का उपयोग किया जाता है; डेवलपर के अनुसार, पोस्ट-ट्रेनिंग कम्प्यूट का 96.7% RL पर खर्च होता है।[7]

Adaptive Long-Short Chain-of-Thought — TurboS में तीव्र और गहरी सोच के बीच गतिशील स्विचिंग का तंत्र लागू है, जो मॉडल को कार्य की जटिलता के अनुसार तर्क की गहराई को अनुकूलित करने की अनुमति देता है।[6]

मॉडल परिवार की संरचना

यह परिवार बंद क्लाउड API मॉडलों और खुले भार वाले मॉडलों में विभाजित है।[3]

मुख्य मॉडल (अवलोकन)

मॉडल रिलीज़ तारीख आर्किटेक्चर पैरामीटर (कुल / सक्रिय) संदर्भ उपलब्धता
Hunyuan (2023) सितंबर 2023 Dense Transformer >100 अरब / — प्रकट नहीं Proprietary API
Hunyuan-Large नवंबर 2024 Transformer-MoE 389 अरब / 52 अरब 256K (pretrain), 128K (instruct) खुले भार (GitHub, HF)
Hunyuan-TurboS फरवरी 2025 Hybrid Transformer-Mamba-MoE 560 अरब / 56 अरब 256K (आर्किट.), 32K/16K (API) Proprietary API + खुले संस्करण
Hunyuan-T1 मार्च 2025 TurboS पर आधारित + बड़े पैमाने पर RL 32K/64K (API) Proprietary API
Hunyuan-A13B जून 2025 Fine-grained MoE 80 अरब / 13 अरब 256K (खुला), 224K/32K (API) खुले भार + API
छोटे (0.5–7B) जुलाई 2025 Dense 0.5–7 अरब 256K खुले भार
HY 2.0 Think नवंबर 2025 MoE 406 अरब / 32 अरब 128K इनपुट / 64K आउटपुट (API) Proprietary API
HY 2.0 Instruct नवंबर 2025 MoE 406 अरब / 32 अरब 128K इनपुट / 16K आउटपुट (API) Proprietary API

स्रोत: arXiv:2411.02265; arXiv:2505.15431; Tencent Cloud docs; GitHub।[2][6][3][10]

टिप्पणी। कुछ मॉडलों के लिए संदर्भ की आर्किटेक्चरल सीमाएँ (तकनीकी रिपोर्टों से) और API की सेवा सीमाएँ (product docs से) भिन्न होती हैं। यह कोई विरोधाभास नहीं है, बल्कि यह अनुसंधान और उत्पाद कॉन्फ़िगरेशन के बीच के अंतर को दर्शाता है।[6][3]

विशेष मॉडल

Hunyuan-MT (सितंबर 2025) — एक विशेष मशीन अनुवाद मॉडल, जिसने WMT25 पर 31 में से 30 श्रेणियों में पहला स्थान प्राप्त किया।[13]

HunyuanImage, HunyuanVideo, Hunyuan3D — परिवार के बहु-मोडल मॉडल जो क्रमशः चित्र, वीडियो और 3D ऑब्जेक्ट उत्पादन के लिए हैं।[14]

स्थितिनिर्धारण और विकासात्मक संबंध

Tencent Cloud दस्तावेज़ीकरण में निम्नलिखित विकासात्मक संबंध देखे जाते हैं:

  • hunyuan-a13b को hunyuan-standard-256K के अपग्रेड के रूप में दर्शाया गया है।
  • hunyuan-t1 को उन्नत RL पोस्ट-ट्रेनिंग के साथ TurboS के ऊपर बनाया गया है।
  • HY 2.0 Think/Instruct — वह शाखा जिसमें आधार TurboS से Hunyuan 2.0 में अद्यतन किया गया है।
  • खुली शाखा (Hunyuan-Large, A13B, compact dense) बंद API-शाखा के समानांतर विकसित होती है, जो अनुसंधान पहुँच प्रदान करती है।[3]

प्रमुख पीढ़ियों में नई विशेषताएँ

Hunyuan-Large (2024)

पहली पीढ़ी और पिछले MoE दृष्टिकोणों की तुलना में, Hunyuan-Large निम्नलिखित प्रस्तुत करता है:[2][4]

  • 389 अरब पैरामीटर (52 अरब सक्रिय) का पैमाना — प्रकाशन के समय सबसे बड़ा खुला Transformer-MoE मॉडल।
  • 256K संदर्भ (pretrain) और 128K (instruct) का समर्थन — 2024 के सामान्य LLM के विशिष्ट मानों से काफी अधिक।
  • GQA + CLA पर आधारित KV-cache compression (मेमोरी की ~95% बचत)।
  • बड़े पैमाने पर सिंथेटिक डेटा (1.5 ट्रिलियन token सिंथेटिक डेटा)।
  • विशेषज्ञों की मिश्रित रूटिंग और विशेषज्ञ-विशिष्ट learning rates।

Hunyuan-TurboS (2025)

प्रमुख आर्किटेक्चरल परिवर्तन:[6]

  • Mamba2 + Attention + MoE हाइब्रिड: 560B कुल / 56B सक्रिय, 128 परतें।
  • 16 ट्रिलियन token पर पूर्व-प्रशिक्षण।
  • तर्क की गहराई के गतिशील प्रबंधन के लिए Adaptive Long-Short Chain-of-Thought।
  • पिछले Turbo संस्करण की तुलना में decoding में 1.8–2 गुना तेज़ी का दावा।

Hunyuan-T1 (2025)

TurboS पर आधारित reasoning मॉडल:[7]

  • पोस्ट-ट्रेनिंग compute का 96.7% — reinforcement learning।
  • तुलनीय deployment envelope के साथ decoding में दोगुनी तेज़ी।
  • तर्क रणनीतियों में सुधार के लिए curriculum learning।

HY 2.0 (2025)

व्यावसायिक प्रमुख मॉडल का अद्यतन:[10][11]

  • MoE आर्किटेक्चर: 406B कुल / 32B सक्रिय पैरामीटर।
  • 256K token की संदर्भ विंडो।
  • विशेष benchmark पर उल्लेखनीय वृद्धि: IMO-AnswerBench 73.4% (HY के पिछले संस्करण से +20%), SWE-bench Verified 53.0 (6.0 से), τ²-Bench 72.4 (17.1 से)।
  • RLHF और पोस्ट-ट्रेनिंग रणनीतियों में सुधार।

मूल्यांकन और benchmark

मूल्यांकन zero-shot और few-shot प्रोटोकॉल का उपयोग करके मानक benchmark पर किया गया था। परिणाम आधिकारिक तकनीकी रिपोर्टों और रिपोजिटरी पर आधारित हैं; कुछ मॉडलों के लिए स्वतंत्र बाहरी सत्यापन अभी सीमित है।[2]

Hunyuan-Large (pretrain) benchmark

Benchmark Hunyuan-Large Llama 3.1-405B Llama 3.1-70B Mixtral-8x22B DeepSeek-V2
MMLU 88.4 85.2 79.3 77.8 78.5
CMMLU 90.2 84.0
C-Eval 91.9 81.7
GSM8K 92.8 89.0 83.7 83.7 79.2
MATH 69.8 53.8 41.4 42.5 43.6
HumanEval 71.4 61.0 58.5 53.1 48.8

स्रोत: arXiv:2411.02265।[2]

तकनीकी रिपोर्ट के अनुसार, Hunyuan-Large (pretrain) Llama 3.1-405B, Mixtral-8x22B और DeepSeek-V2 के साथ तुलना में 19 में से 15 benchmark में अग्रणी है।[2]

Hunyuan-Large-Instruct benchmark

Benchmark Hunyuan-Large-Instruct
MMLU 89.9
MATH 77.4
HumanEval 90.0
Arena-Hard 81.8

स्रोत: arXiv:2411.02265; Hugging Face model card।[2][5]

डेवलपर्स के अनुसार, Hunyuan-Large-Instruct MMLU पर LLaMA 3.1-405B को 2.6 प्रतिशत अंकों से पीछे छोड़ता है।[4]

TurboS और T1 benchmark

Benchmark TurboS T1
LMSYS Chatbot Arena 1356 (शीर्ष-7)
23 benchmark का औसत 77.9%
MMLU-Pro 87.2
GPQA-Diamond 69.3
MATH-500 96.2
LiveCodeBench 64.9
Arena-Hard 91.9

स्रोत: arXiv:2505.15431; T1 official page।[6][7]

Hunyuan-A13B benchmark

Benchmark Hunyuan-A13B Hunyuan-Large Qwen2.5-72B
MMLU 88.17 88.4
MMLU-Pro 67.23 60.2
BBH 87.56 86.3
MATH 72.35 69.8
GPQA 49.12
MBPP 83.86

स्रोत: GitHub Hunyuan-A13B README।[8]

A13B कई post-training-संवेदनशील कार्यों (MMLU-Pro, MATH, MBPP) पर Hunyuan-Large से बेहतर प्रदर्शन करता है, जो इसके अधिक नए और व्यावहारिक संस्करण के रूप में स्थितिनिर्धारण के अनुरूप है।[8]

कॉम्पैक्ट dense शाखा के benchmark

मॉडल MMLU MMLU-Pro BBH GSM8K MATH
Hunyuan-0.5B 54.02 31.15 45.92 55.64 42.95
Hunyuan-1.8B 64.62 38.65 74.32 77.26 62.85
Hunyuan-4B 74.01 51.91 75.17 87.49 72.25
Hunyuan-7B 79.82 57.79 82.95 88.25 74.85

स्रोत: GitHub Hunyuan-7B README।[9]

HY 2.0 benchmark

संकेतक डेवलपर द्वारा घोषित किए गए हैं (एकमात्र स्पष्ट स्रोत — Hunyuan का आधिकारिक खाता):[11]

Benchmark HY 2.0 HY का पिछला संस्करण
IMO-AnswerBench 73.4 ~53 (अनुमान, +20%)
SWE-bench Verified 53.0 6.0
τ²-Bench 72.4 17.1

टिप्पणी। इन आँकड़ों को 'डेवलपर द्वारा घोषित, व्यापक बाहरी पुष्टि की प्रतीक्षा में' के रूप में वर्गीकृत किया जाता है।[11]

उपयोग के तकनीकी विवरण

शाखाओं के अनुसार संदर्भ विंडो

मॉडल इनपुट (token) आउटपुट (token)
HY 2.0 Think 128K 64K
HY 2.0 Instruct 128K 16K
T1 (API) 32K 64K
A13B (API) 224K 32K
TurboS (API) 32K 16K
Lite (API) 250K 6K
Hunyuan-Large (खुला) 256K (pretrain) / 128K (instruct)
Compact 0.5–7B 256K

स्रोत: Tencent Cloud product overview।[3]

समर्थित उपकरण

Tencent Cloud API में निम्नलिखित दस्तावेज़ीकृत हैं:[15]

  • Function Calling (tools, tool_choice)।
  • AI Search Enhancement — बाहरी स्रोतों (retrieval-augmented generation) से अंतर्निहित खोज।
  • SearchInfo और Citation — उत्तरों में उद्धरण मार्कर।
  • EnableMultimedia — आउटपुट में मल्टीमीडिया प्रतिस्थापन।
  • EnableThinking — A13B के लिए chain-of-thought स्विच।
  • EnableRecommendedQuestions — अनुशंसित प्रश्नों का उत्पादन।

API अनुकूलता

Hunyuan API OpenAI-संगत प्रारूप का समर्थन करता है:[16]

  • Base URL: https://api.hunyuan.cloud.tencent.com/v1
  • /v1/chat/completions और /v1/embeddings का समर्थन किया जाता है।
  • Embedding model: hunyuan-embedding, आयाम 1024।
  • SSE के माध्यम से Streaming।
  • डिफ़ॉल्ट Concurrency: प्रति खाता 5।

Hunyuan-Large (खुले) के लिए मानक इनपुट/आउटपुट प्रारूप PyTorch/Transformers फ्रेमवर्क के अनुरूप है। क्वांटाइज़ेशन का समर्थन: FP8, INT4 (GPTQ/AWQ)।[5]

अनुप्रयोग और एकीकरण

Hunyuan मॉडल Tencent के पारिस्थितिकी तंत्र में एकीकृत हैं और बाहरी डेवलपर्स के लिए उपलब्ध हैं। मुख्य दस्तावेज़ीकृत परिदृश्य:[1][17]

Tencent उत्पाद

  • Yuanbao — Hunyuan और DeepSeek के समर्थन वाला चैटबॉट।
  • Tencent Meeting — बैठक सारांश उत्पादन।
  • Tencent Docs — पाठ उत्पादन और विश्लेषण।
  • ima — वित्तीय और मल्टीमीडिया AI सहायक।

Enterprise अनुप्रयोग

  • पाठ उत्पादन: लेख, विज्ञापन पाठ, परिदृश्य, उत्पाद विवरण।
  • बुद्धिमान ग्राहक सेवा: चैट-बॉट, FAQ, उत्तर स्वचालन।
  • कोड उत्पादन और विश्लेषण (विशेष रूप से HY 2.0 Think और T1)।
  • गणितीय और तार्किक तर्क, विश्लेषणात्मक कार्य।
  • बहुभाषी अनुवाद (30+ भाषाएँ, Hunyuan-MT)।

खुले मॉडल

खुले संस्करणों का उपयोग अनुसंधान, fine-tuning और edge डिवाइस पर डेप्लॉयमेंट के लिए किया जाता है (छोटे dense मॉडल)। बहु-मोडल विस्तार (HunyuanImage, HunyuanVideo, Hunyuan3D) का उपयोग 3D मॉडलिंग और वीडियो उत्पादन के लिए किया जाता है।[14]

सीमाएँ और खुली समस्याएँ

  • व्यावसायिक मॉडलों की बंद प्रकृति। HY 2.0 और T1 के लिए कोई खुले भार और विस्तृत आर्किटेक्चरल विशिष्टताएँ नहीं हैं; पहुँच API तक सीमित है, जो स्वतंत्र पुनरुत्पादकता को कठिन बनाता है।[3]
  • प्रशिक्षण डेटा की अपारदर्शिता। यद्यपि बड़े पैमाने पर सिंथेटिक डेटा के उपयोग पर जोर दिया जाता है, dataset की सटीक संरचना, भाषाओं का अनुपात और डोमेन क्षेत्र प्रकट नहीं किए गए हैं।[2]
  • कम्प्यूटेशनल आवश्यकताएँ। खुले मॉडलों को महत्वपूर्ण संसाधनों की आवश्यकता होती है: Hunyuan-Large के पूर्ण fine-tuning के लिए न्यूनतम 32 GPU; FP8 के साथ भी दसियों GB VRAM।[5]
  • हॉलुसिनेशन। अन्य LLM की तरह, मॉडल विश्वसनीय लेकिन तथ्यात्मक रूप से गलत कथन उत्पन्न करने के प्रति संवेदनशील हैं। Hunyuan के लिए इस पहलू का व्यवस्थित अध्ययन खुले सहकर्मी-समीक्षित कार्यों में अभी सीमित है।[18]
  • आर्किटेक्चरल और सेवा सीमाओं के बीच अंतर। कुछ मॉडलों (TurboS, A13B) के लिए API की सेवा सीमाएँ आर्किटेक्चरल क्षमताओं से काफी कम हैं।[6][3]
  • क्षेत्रीय उपलब्धता। मुख्य फ़ोकस चीनी बाजार पर; चीन के बाहर के उपयोगकर्ताओं के लिए API में भाषाई और कानूनी प्रतिबंध हैं।[17]
  • विस्तृत सुरक्षा रिपोर्टों का अभाव। दस्तावेज़ीकरण में सुरक्षा और फ़िल्टरिंग के सामान्य सिद्धांत उल्लिखित हैं, लेकिन कोई सार्वजनिक technical safety reports नहीं हैं जो कुछ अंतर्राष्ट्रीय मॉडलों के समान स्तर की हों।[15]
  • Open-source शाखा की अनुकूलता। रिलीज़ के बाद transformers / vllm के साथ एकीकरण की समस्याएँ दर्ज की गईं, जहाँ लाइब्रेरी hunyuan_v1_dense आर्किटेक्चर प्रकार को नहीं पहचान पाईं, जिसके लिए trust_remote_code या विशेष शाखाओं की आवश्यकता थी।[19]

घटनाएँ और ज्ञात समस्याएँ

उपलब्ध सामग्री (2025 के अंत — 2026 की शुरुआत) के अनुसार, Hunyuan से विशेष रूप से जुड़ी कोई बड़ी सार्वजनिक घटना (बड़े पैमाने पर डेटा लीक, अनोखे सुरक्षा खतरे) दर्ज नहीं की गई है।[17]

दस्तावेज़ीकृत उत्पाद सुधार

Tencent Cloud के product dynamics में सूक्ष्म सुधार दर्ज हैं:[12]

  • 2024-11-20: hunyuan-turbo-latest को special characters के कारण होने वाली पुनरावृत्ति ठीक करने, Markdown आउटपुट की स्थिरता बढ़ाने और अनुचित अस्वीकृतियों को कम करने के लिए अद्यतन किया गया।
  • 2025-04-03: T1 अद्यतन जिसमें सरलीकृत/पारंपरिक चीनी मिश्रण और चीनी/अंग्रेज़ी मिश्रण के सुधार, साथ ही परियोजना स्तर पर कोड उत्पादन में सुधार शामिल है।
  • 2025-04-20: Search Enhancement को default-on से default-off में स्थानांतरित किया गया — एकीकरण के लिए वास्तव में एक API व्यवहार परिवर्तन।

MoE सुरक्षा अनुसंधान

अनुसंधान आलोचना के स्तर पर (प्रीप्रिंट स्तर) Hunyuan-A13B का उल्लेख MoE मॉडलों में safety-स्थानीयकरण पर हमलों से संबंधित कार्यों में किया गया है। विशेष रूप से, Large Language Lobotomy और GateBreaker कार्यों में safety विशेषज्ञों को 'silencing' करने पर उच्च attack success rate की सूचना दी गई है। यह किसी उत्पादन घटना की पुष्टि नहीं है, लेकिन यह दर्शाता है कि MoE रूटिंग की सुरक्षा को एक कमजोर अनुसंधान वेक्टर के रूप में देखा जाता है।[20][21]

नैतिक और विनियामक पहलू

Hunyuan चीन के कानूनी और विनियामक संदर्भ में संचालित होता है, जिसमें जनरेटिव AI प्रबंधन पर राष्ट्रीय नियम (CAC), सामग्री फ़िल्टरिंग, और डेटा सुरक्षा पर Tencent की आंतरिक नीतियाँ शामिल हैं। Tencent Cloud दस्तावेज़ीकरण इस बात पर जोर देता है कि Hunyuan API का उपयोग लागू कानूनों और प्लेटफ़ॉर्म नीति के अनुरूप होना चाहिए।[1]

विशिष्ट उपायों में शामिल हैं:

  • स्ट्रीमिंग आउटपुट और संभावित FinishReason=sensitive के साथ अंतर्निहित सामग्री मॉडरेशन।
  • हॉलुसिनेशन और अवांछित व्यवहार को कम करने के लिए RLHF/DPO के माध्यम से alignment।
  • पूर्वाग्रह (bias) को न्यूनतम करने के लिए प्रशिक्षण डेटा का फ़िल्टरेशन।
  • खुले मॉडलों के लिए खुले लाइसेंस (Tencent Hunyuan Community License Agreement), इस चेतावनी के साथ कि कुछ संस्करणों के लिए यह समझौता EU में लागू नहीं होता।[8][15]

Hunyuan के लिए bias (पूर्वाग्रह) और fairness (निष्पक्षता) पर विशेष स्वतंत्र रिपोर्टें अभी कम हैं; खुले भार के विस्तार और स्वतंत्र परीक्षणों के साथ अनुसंधान की उम्मीद है।[2]

समुदाय की प्रतिक्रिया

बंद शाखा के लिए सबसे महत्वपूर्ण बाहरी संकेत — LMSYS Chatbot Arena पर TurboS का परिणाम (1356, वैश्विक शीर्ष-7)। खुली शाखा के लिए अप्रत्यक्ष संकेतक — GitHub गतिविधि: Hunyuan-Large के लगभग 1.6 हजार stars, A13B के 812, Hunyuan-MT के 683। यह open LLM पारिस्थितिकी तंत्र के मानकों से उल्लेखनीय, लेकिन प्रभुत्व स्तर से कम जुड़ाव को दर्शाता है। समुदाय के व्यक्तिपरक मूल्यांकन (Hugging Face, Reddit) चीनी भाषा और agent कार्यों में मजबूत पक्षों पर ध्यान देते हैं।[22]

संभावनाएँ और अनुसंधान की दिशाएँ

सार्वजनिक सामग्री में उल्लिखित आगे के विकास की दिशाएँ:[2][6][14]

  • आर्किटेक्चर का आगे का संकरण (Mamba + Transformer + MoE) और MoE के लिए scaling laws का अध्ययन।
  • बहु-मोडल क्षमताओं का विस्तार: Hunyuan3D, HunyuanVideo और HunyuanImage का भाषा मॉडलों के साथ एकीकरण।
  • उपकरण उपयोग (tool use) और agent क्षमताओं में सुधार।
  • inference लागत में कमी: क्वांटाइज़ेशन (edge के लिए 2-bit), TRT-LLM/vLLM के माध्यम से अनुकूलन।
  • खुले मॉडल पोर्टफ़ोलियो का विस्तार।
  • विस्तृत safety- और alignment-रिपोर्टों का विकास और प्रकाशन।

यह भी देखें

  • LLaMA (Meta)
  • DeepSeek

साहित्य

संदर्भ

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
  4. 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
  5. 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
  7. 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
  8. 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
  9. 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
  10. 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
  11. 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
  12. 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
  13. Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
  14. 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
  15. 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
  16. Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
  17. 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
  18. LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
  19. GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
  20. Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
  21. Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
  22. Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS