Hunyuan (Tencent) (HI)
Hunyuan (चीनी: 腾讯混元大模型, Tencent Hunyuan, Tencent HY) — Foundation Models और Large Language Models (LLM) का एक परिवार है, जिसे Tencent Hunyuan Foundation Model Team द्वारा विकसित किया गया है और जो Tencent Cloud क्लाउड सेवा के माध्यम से, तथा Hugging Face और GitHub प्लेटफ़ॉर्म पर खुले भार (open weights) के रूप में उपलब्ध है। यह परिवार पाठ उत्पादन और समझ, तार्किक एवं गणितीय अनुमान, प्रोग्रामिंग, लंबे संदर्भों की प्रसंस्करण, तथा बहु-मोडल विस्तार (चित्र, वीडियो, 3D) के लिए मॉडल समाहित करता है। Hunyuan को Tencent की जनरेटिव AI की प्रमुख श्रृंखला के रूप में प्रस्तुत किया जाता है और यह कंपनी के उत्पाद पारिस्थितिकी तंत्र (Yuanbao, WeChat, Tencent Meeting, Tencent Cloud) में एकीकृत है।[1][2][3]
इतिहास और विकास का कालक्रम
Hunyuan का विकास LLM की वैश्विक प्रतिस्पर्धा और कृत्रिम बुद्धिमत्ता के क्षेत्र में चीन की तकनीकी स्वतंत्रता की रणनीति के संदर्भ में हुआ। यह श्रृंखला स्वामित्व (proprietary) dense-मॉडलों से विकसित होकर खुले Mixture-of-Experts (MoE) और हाइब्रिड Transformer-Mamba आर्किटेक्चर की ओर अग्रसर हुई।[1]
प्रथम पीढ़ी (2023)
Hunyuan श्रृंखला की सार्वजनिक घोषणा 7 सितंबर 2023 को शेन्झेन में Tencent Global Digital Ecosystem Summit में की गई। पहला संस्करण 100 अरब से अधिक पैरामीटर वाला एक proprietary dense-मॉडल था, जिसे 2 ट्रिलियन से अधिक token पर पूर्व-प्रशिक्षित किया गया था। यह मॉडल चीनी भाषा, तार्किक अनुमान और सामग्री उत्पादन पर केंद्रित था, Tencent के 50 से अधिक उत्पादों में एकीकृत था और Tencent Cloud API के माध्यम से उपलब्ध था।[1]
Hunyuan-Large और MoE की ओर परिवर्तन (2024)
नवंबर 2024 में Tencent ने Hunyuan-Large जारी किया — जो उस समय का सबसे बड़ा खुला Transformer-MoE मॉडल था, जिसमें कुल 389 अरब और 52 अरब सक्रिय पैरामीटर थे। यह मॉडल Hugging Face और GitHub पर खुले भार के साथ प्रकाशित किया गया और arXiv पर प्रीप्रिंट के साथ उपलब्ध कराया गया। इस रिलीज़ ने खुले विकास की ओर Tencent के रणनीतिक बदलाव को रेखांकित किया।[2][4][5]
हाइब्रिड और reasoning मॉडल (2025)
2025 में यह श्रृंखला कई प्रमुख रिलीज़ के साथ विस्तारित हुई:
- Hunyuan-TurboS (फरवरी 2025) — पहला औद्योगिक बड़े पैमाने का हाइब्रिड Transformer-Mamba-MoE मॉडल, जिसमें कुल 560 अरब और 56 अरब सक्रिय पैरामीटर हैं, जिसे 16 ट्रिलियन token पर पूर्व-प्रशिक्षित किया गया है। इसमें तीव्र और गहरी सोच के बीच गतिशील स्विचिंग के लिए अनुकूली Chain-of-Thought (CoT) तंत्र लागू किया गया है।[6]
- Hunyuan-T1 (मार्च 2025) — एक विशेष reasoning मॉडल, जो TurboS के ऊपर बड़े पैमाने पर reinforcement learning (पोस्ट-ट्रेनिंग कम्प्यूट का 96.7% reinforcement learning) के साथ बनाया गया है।[7]
- Hunyuan-A13B (जून 2025) — प्रदर्शन और लागत के संतुलन के लिए एक कॉम्पैक्ट MoE मॉडल (कुल 80 अरब / 13 अरब सक्रिय पैरामीटर), जो तीव्र और धीमी सोच का समर्थन करता है।[8]
- छोटे dense मॉडल (जुलाई 2025) — edge डिवाइस और उच्च-प्रतिस्पर्धी डेप्लॉयमेंट परिदृश्यों के लिए 0.5B, 1.8B, 4B, 7B के संस्करण, 256K संदर्भ के समर्थन के साथ।[9]
Hunyuan 2.0 (नवंबर–दिसंबर 2025)
दिसंबर 2025 में वाणिज्यिक मॉडल की दूसरी पीढ़ी — Hunyuan 2.0 (HY 2.0) — की घोषणा की गई, जिसमें MoE आर्किटेक्चर (कुल 406 अरब / 32 अरब सक्रिय पैरामीटर) और 256K token की संदर्भ विंडो है। यह श्रृंखला दो प्रकारों में विभाजित है: HY 2.0 Think (गहन तर्क, कोड) और HY 2.0 Instruct (संवाद, रचनात्मक उत्पादन)। मॉडल Tencent Cloud API के माध्यम से उपलब्ध हैं और Yuanbao तथा ima अनुप्रयोगों में एकीकृत हैं।[10][11]
संक्षिप्त कालक्रम
| तारीख | घटना |
|---|---|
| सितंबर 2023 | Hunyuan की proprietary LLM (>100B पैरामीटर) के रूप में सार्वजनिक घोषणा; Tencent Cloud API का शुभारंभ |
| फरवरी 2024 | Yuanbao चैटबॉट के लिए आंतरिक MoE मॉडल |
| अप्रैल 2024 | री-ब्रांडिंग: 'advanced' → hunyuan-pro, 'standard' → hunyuan-standard; hunyuan-lite जोड़ा गया |
| मई 2024 | hunyuan-lite को MoE में स्थानांतरित किया गया, 256K संदर्भ तक विस्तारित |
| सितंबर 2024 | नए hunyuan-turbo (नई पीढ़ी MoE) का शुभारंभ |
| नवंबर 2024 | Hunyuan-Large (389B/52B MoE) का खुला रिलीज़, प्रीप्रिंट arXiv:2411.02265 |
| फरवरी–मार्च 2025 | Hunyuan-TurboS (हाइब्रिड Mamba-MoE); Hunyuan-T1 (reasoning) |
| जून 2025 | Hunyuan-A13B (80B/13B, fine-grained MoE) |
| जुलाई 2025 | छोटे dense मॉडल 0.5B–7B |
| सितंबर 2025 | Hunyuan-MT (विशेष अनुवाद मॉडल) |
| नवंबर–दिसंबर 2025 | Hunyuan 2.0 (HY 2.0 Think / Instruct), 406B/32B MoE |
स्रोत: Tencent Cloud product dynamics; आधिकारिक रिपोजिटरी।[12]
सैद्धांतिक आधार और आर्किटेक्चर
Mixture-of-Experts आर्किटेक्चर
श्रृंखला के प्रमुख मॉडल (Hunyuan-Large, A13B, HY 2.0) Mixture-of-Experts (MoE) आर्किटेक्चर का उपयोग करते हैं, जिसमें transformer की कुछ परतों में अनेक 'विशेषज्ञ' (उप-नेटवर्क) होते हैं, और एक राउटर (gating network) प्रत्येक token के लिए सक्रिय विशेषज्ञों के उपसमूह का चयन करता है। MoE परत का सामान्य सूत्र:[2]
जहाँ — रूटिंग फ़ंक्शन (gating), — -वाँ विशेषज्ञ, — विशेषज्ञों की कुल संख्या। इस दृष्टिकोण में मॉडल के कुल पैरामीटरों की संख्या एक पास में सक्रिय पैरामीटरों की संख्या से काफी अधिक होती है:[2]
जो inference पर आनुपातिक कम्प्यूटेशनल लागत बढ़ाए बिना मॉडल की क्षमता बढ़ाने की अनुमति देता है।
Hunyuan-Large में 1 साझा (shared) विशेषज्ञ और 16 विशेषीकृत विशेषज्ञों की योजना लागू है, जिसमें प्रति token 1 विशेषज्ञ सक्रिय होता है (top-1 routing)। अतिरिक्त नवाचारों में recycle-तंत्र के साथ मिश्रित रूटिंग (अस्वीकृत token का पुनर्चक्रण) और विशेषज्ञ-विशिष्ट learning rates शामिल हैं, जो विशेषज्ञों के योगदान का बेहतर संतुलन सुनिश्चित करते हैं।[2][5]
हाइब्रिड Transformer-Mamba आर्किटेक्चर
Hunyuan-TurboS और T1 एक हाइब्रिड आर्किटेक्चर प्रस्तुत करते हैं, जो Transformer (attention) और Mamba (state-space model) ब्लॉक को संयोजित करता है। Mamba अनुक्रम की लंबाई के सापेक्ष रैखिक जटिलता प्रदान करता है:[6]
जहाँ , — प्रशिक्षण योग्य मैट्रिक्स, — चरण पर छुपी हुई अवस्था, — इनपुट token। यह लंबाई के सापेक्ष memory scaling प्रदान करता है (मानक Transformer में के विपरीत)।[6]
TurboS में 128 परतें हैं, जो ब्लॉकों में व्यवस्थित हैं: 57 Mamba2 परतें, 7 Attention परतें और 32 विशेषज्ञों के साथ 64 FFN-MoE परतें। वैश्विक और स्थानीय संदर्भ का संतुलन सुनिश्चित करने के लिए AMF (Attention → Mamba2 → FFN) और MF (Mamba2 → FFN) ब्लॉक बारी-बारी से आते हैं।[6]
attention तंत्र और KV-कैश
Hunyuan-Large Grouped Query Attention (GQA) का उपयोग करता है — attention का एक प्रकार जिसमें कई क्वेरी साझा कुंजियाँ और मान साझा करती हैं — और KV-कैश की मात्रा कम करने के लिए Cross-Layer Attention (CLA) का उपयोग करता है। हेड, अनुक्रम लंबाई और हेड आकार के साथ self-attention परत के लिए KV-कैश की मानक मात्रा:[5]
जहाँ — KV-कैश की मात्रा। समूहों के साथ GQA में मात्रा घटकर:
CLA परतों के बीच KV-कैश के पुनः उपयोग की अतिरिक्त सुविधा प्रदान करता है। कुल मिलाकर, ये अनुकूलन लगभग 95% तक मेमोरी की बचत सुनिश्चित करते हैं।[4]
स्थितीय एन्कोडिंग और लंबा संदर्भ
मॉडल लंबे अनुक्रमों के समर्थन के लिए स्केलिंग के साथ Rotary Position Embedding (RoPE) का उपयोग करते हैं। संदर्भ प्रशिक्षण चरणबद्ध रूप से किया जाता है (curriculum learning): 32K से 256K token तक। सक्रियण — SwiGLU। टोकनाइज़र शब्दकोश — 128K (चीनी भाषा के विस्तार के साथ tiktoken)।[2]
प्रशिक्षण और स्केलिंग
MoE मॉडलों के लिए अनुभवजन्य घात निर्भरताओं के रूप में scaling laws का अध्ययन किया जाता है:[2]
जहाँ — गुणवत्ता मीट्रिक, — सक्रिय पैरामीटरों की संख्या, — डेटा की मात्रा, — प्रयोगात्मक रूप से चुने गए पैरामीटर। Hunyuan-Large 1.5 ट्रिलियन token के सिंथेटिक डेटा के उपयोग पर जोर देता है — जो पिछले MoE प्रकाशनों की तुलना में कई गुना अधिक है।[2]
प्रशिक्षण पाइपलाइन और संरेखण
Hunyuan मॉडलों के प्रशिक्षण प्रक्रिया में आधुनिक LLM की विशेषता वाले कई चरण शामिल हैं:[2][7]
Pre-training - पूर्व-प्रशिक्षण
एक बड़े बहुभाषी कॉर्पस (चीनी, अंग्रेज़ी और अन्य भाषाएँ) पर बड़े पैमाने पर प्रशिक्षण। Hunyuan-Large को 7 ट्रिलियन token (1.5 ट्रिलियन सिंथेटिक सहित) पर पूर्व-प्रशिक्षित किया गया है। TurboS को 16 ट्रिलियन token पर। dataset की सटीक संरचना प्रकट नहीं की गई है।[2][6]
Supervised Fine-Tuning (SFT) - पर्यवेक्षित fine-tuning
1 मिलियन से अधिक निर्देशों (निर्देश-उत्तर युग्मों) पर fine-tuning, जो मॉडल को उपयोगकर्ता के निर्देशों का पालन करने योग्य बनाती है।[2]
Reinforcement Learning के माध्यम से संरेखण
मॉडल के व्यवहार को मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए निम्नलिखित का उपयोग किया जाता है:
Direct Preference Optimization (DPO) — स्पष्ट पुरस्कार मॉडल के बिना संरेखण की विधि, जिसका उपयोग Hunyuan-Large में किया जाता है।[2]
Reinforcement Learning (RL) — Hunyuan-T1 में curriculum learning के साथ बड़े पैमाने पर reinforcement learning का उपयोग किया जाता है; डेवलपर के अनुसार, पोस्ट-ट्रेनिंग कम्प्यूट का 96.7% RL पर खर्च होता है।[7]
Adaptive Long-Short Chain-of-Thought — TurboS में तीव्र और गहरी सोच के बीच गतिशील स्विचिंग का तंत्र लागू है, जो मॉडल को कार्य की जटिलता के अनुसार तर्क की गहराई को अनुकूलित करने की अनुमति देता है।[6]
मॉडल परिवार की संरचना
यह परिवार बंद क्लाउड API मॉडलों और खुले भार वाले मॉडलों में विभाजित है।[3]
मुख्य मॉडल (अवलोकन)
| मॉडल | रिलीज़ तारीख | आर्किटेक्चर | पैरामीटर (कुल / सक्रिय) | संदर्भ | उपलब्धता |
|---|---|---|---|---|---|
| Hunyuan (2023) | सितंबर 2023 | Dense Transformer | >100 अरब / — | प्रकट नहीं | Proprietary API |
| Hunyuan-Large | नवंबर 2024 | Transformer-MoE | 389 अरब / 52 अरब | 256K (pretrain), 128K (instruct) | खुले भार (GitHub, HF) |
| Hunyuan-TurboS | फरवरी 2025 | Hybrid Transformer-Mamba-MoE | 560 अरब / 56 अरब | 256K (आर्किट.), 32K/16K (API) | Proprietary API + खुले संस्करण |
| Hunyuan-T1 | मार्च 2025 | TurboS पर आधारित + बड़े पैमाने पर RL | — | 32K/64K (API) | Proprietary API |
| Hunyuan-A13B | जून 2025 | Fine-grained MoE | 80 अरब / 13 अरब | 256K (खुला), 224K/32K (API) | खुले भार + API |
| छोटे (0.5–7B) | जुलाई 2025 | Dense | 0.5–7 अरब | 256K | खुले भार |
| HY 2.0 Think | नवंबर 2025 | MoE | 406 अरब / 32 अरब | 128K इनपुट / 64K आउटपुट (API) | Proprietary API |
| HY 2.0 Instruct | नवंबर 2025 | MoE | 406 अरब / 32 अरब | 128K इनपुट / 16K आउटपुट (API) | Proprietary API |
स्रोत: arXiv:2411.02265; arXiv:2505.15431; Tencent Cloud docs; GitHub।[2][6][3][10]
टिप्पणी। कुछ मॉडलों के लिए संदर्भ की आर्किटेक्चरल सीमाएँ (तकनीकी रिपोर्टों से) और API की सेवा सीमाएँ (product docs से) भिन्न होती हैं। यह कोई विरोधाभास नहीं है, बल्कि यह अनुसंधान और उत्पाद कॉन्फ़िगरेशन के बीच के अंतर को दर्शाता है।[6][3]
विशेष मॉडल
Hunyuan-MT (सितंबर 2025) — एक विशेष मशीन अनुवाद मॉडल, जिसने WMT25 पर 31 में से 30 श्रेणियों में पहला स्थान प्राप्त किया।[13]
HunyuanImage, HunyuanVideo, Hunyuan3D — परिवार के बहु-मोडल मॉडल जो क्रमशः चित्र, वीडियो और 3D ऑब्जेक्ट उत्पादन के लिए हैं।[14]
स्थितिनिर्धारण और विकासात्मक संबंध
Tencent Cloud दस्तावेज़ीकरण में निम्नलिखित विकासात्मक संबंध देखे जाते हैं:
hunyuan-a13bकोhunyuan-standard-256Kके अपग्रेड के रूप में दर्शाया गया है।hunyuan-t1को उन्नत RL पोस्ट-ट्रेनिंग के साथ TurboS के ऊपर बनाया गया है।- HY 2.0 Think/Instruct — वह शाखा जिसमें आधार TurboS से Hunyuan 2.0 में अद्यतन किया गया है।
- खुली शाखा (Hunyuan-Large, A13B, compact dense) बंद API-शाखा के समानांतर विकसित होती है, जो अनुसंधान पहुँच प्रदान करती है।[3]
प्रमुख पीढ़ियों में नई विशेषताएँ
Hunyuan-Large (2024)
पहली पीढ़ी और पिछले MoE दृष्टिकोणों की तुलना में, Hunyuan-Large निम्नलिखित प्रस्तुत करता है:[2][4]
- 389 अरब पैरामीटर (52 अरब सक्रिय) का पैमाना — प्रकाशन के समय सबसे बड़ा खुला Transformer-MoE मॉडल।
- 256K संदर्भ (pretrain) और 128K (instruct) का समर्थन — 2024 के सामान्य LLM के विशिष्ट मानों से काफी अधिक।
- GQA + CLA पर आधारित KV-cache compression (मेमोरी की ~95% बचत)।
- बड़े पैमाने पर सिंथेटिक डेटा (1.5 ट्रिलियन token सिंथेटिक डेटा)।
- विशेषज्ञों की मिश्रित रूटिंग और विशेषज्ञ-विशिष्ट learning rates।
Hunyuan-TurboS (2025)
प्रमुख आर्किटेक्चरल परिवर्तन:[6]
- Mamba2 + Attention + MoE हाइब्रिड: 560B कुल / 56B सक्रिय, 128 परतें।
- 16 ट्रिलियन token पर पूर्व-प्रशिक्षण।
- तर्क की गहराई के गतिशील प्रबंधन के लिए Adaptive Long-Short Chain-of-Thought।
- पिछले Turbo संस्करण की तुलना में decoding में 1.8–2 गुना तेज़ी का दावा।
Hunyuan-T1 (2025)
TurboS पर आधारित reasoning मॉडल:[7]
- पोस्ट-ट्रेनिंग compute का 96.7% — reinforcement learning।
- तुलनीय deployment envelope के साथ decoding में दोगुनी तेज़ी।
- तर्क रणनीतियों में सुधार के लिए curriculum learning।
HY 2.0 (2025)
व्यावसायिक प्रमुख मॉडल का अद्यतन:[10][11]
- MoE आर्किटेक्चर: 406B कुल / 32B सक्रिय पैरामीटर।
- 256K token की संदर्भ विंडो।
- विशेष benchmark पर उल्लेखनीय वृद्धि: IMO-AnswerBench 73.4% (HY के पिछले संस्करण से +20%), SWE-bench Verified 53.0 (6.0 से), τ²-Bench 72.4 (17.1 से)।
- RLHF और पोस्ट-ट्रेनिंग रणनीतियों में सुधार।
मूल्यांकन और benchmark
मूल्यांकन zero-shot और few-shot प्रोटोकॉल का उपयोग करके मानक benchmark पर किया गया था। परिणाम आधिकारिक तकनीकी रिपोर्टों और रिपोजिटरी पर आधारित हैं; कुछ मॉडलों के लिए स्वतंत्र बाहरी सत्यापन अभी सीमित है।[2]
Hunyuan-Large (pretrain) benchmark
| Benchmark | Hunyuan-Large | Llama 3.1-405B | Llama 3.1-70B | Mixtral-8x22B | DeepSeek-V2 |
|---|---|---|---|---|---|
| MMLU | 88.4 | 85.2 | 79.3 | 77.8 | 78.5 |
| CMMLU | 90.2 | — | — | — | 84.0 |
| C-Eval | 91.9 | — | — | — | 81.7 |
| GSM8K | 92.8 | 89.0 | 83.7 | 83.7 | 79.2 |
| MATH | 69.8 | 53.8 | 41.4 | 42.5 | 43.6 |
| HumanEval | 71.4 | 61.0 | 58.5 | 53.1 | 48.8 |
स्रोत: arXiv:2411.02265।[2]
तकनीकी रिपोर्ट के अनुसार, Hunyuan-Large (pretrain) Llama 3.1-405B, Mixtral-8x22B और DeepSeek-V2 के साथ तुलना में 19 में से 15 benchmark में अग्रणी है।[2]
Hunyuan-Large-Instruct benchmark
| Benchmark | Hunyuan-Large-Instruct |
|---|---|
| MMLU | 89.9 |
| MATH | 77.4 |
| HumanEval | 90.0 |
| Arena-Hard | 81.8 |
स्रोत: arXiv:2411.02265; Hugging Face model card।[2][5]
डेवलपर्स के अनुसार, Hunyuan-Large-Instruct MMLU पर LLaMA 3.1-405B को 2.6 प्रतिशत अंकों से पीछे छोड़ता है।[4]
TurboS और T1 benchmark
| Benchmark | TurboS | T1 |
|---|---|---|
| LMSYS Chatbot Arena | 1356 (शीर्ष-7) | — |
| 23 benchmark का औसत | 77.9% | — |
| MMLU-Pro | — | 87.2 |
| GPQA-Diamond | — | 69.3 |
| MATH-500 | — | 96.2 |
| LiveCodeBench | — | 64.9 |
| Arena-Hard | — | 91.9 |
स्रोत: arXiv:2505.15431; T1 official page।[6][7]
Hunyuan-A13B benchmark
| Benchmark | Hunyuan-A13B | Hunyuan-Large | Qwen2.5-72B |
|---|---|---|---|
| MMLU | 88.17 | 88.4 | — |
| MMLU-Pro | 67.23 | 60.2 | — |
| BBH | 87.56 | 86.3 | — |
| MATH | 72.35 | 69.8 | — |
| GPQA | 49.12 | — | — |
| MBPP | 83.86 | — | — |
स्रोत: GitHub Hunyuan-A13B README।[8]
A13B कई post-training-संवेदनशील कार्यों (MMLU-Pro, MATH, MBPP) पर Hunyuan-Large से बेहतर प्रदर्शन करता है, जो इसके अधिक नए और व्यावहारिक संस्करण के रूप में स्थितिनिर्धारण के अनुरूप है।[8]
कॉम्पैक्ट dense शाखा के benchmark
| मॉडल | MMLU | MMLU-Pro | BBH | GSM8K | MATH |
|---|---|---|---|---|---|
| Hunyuan-0.5B | 54.02 | 31.15 | 45.92 | 55.64 | 42.95 |
| Hunyuan-1.8B | 64.62 | 38.65 | 74.32 | 77.26 | 62.85 |
| Hunyuan-4B | 74.01 | 51.91 | 75.17 | 87.49 | 72.25 |
| Hunyuan-7B | 79.82 | 57.79 | 82.95 | 88.25 | 74.85 |
स्रोत: GitHub Hunyuan-7B README।[9]
HY 2.0 benchmark
संकेतक डेवलपर द्वारा घोषित किए गए हैं (एकमात्र स्पष्ट स्रोत — Hunyuan का आधिकारिक खाता):[11]
| Benchmark | HY 2.0 | HY का पिछला संस्करण |
|---|---|---|
| IMO-AnswerBench | 73.4 | ~53 (अनुमान, +20%) |
| SWE-bench Verified | 53.0 | 6.0 |
| τ²-Bench | 72.4 | 17.1 |
टिप्पणी। इन आँकड़ों को 'डेवलपर द्वारा घोषित, व्यापक बाहरी पुष्टि की प्रतीक्षा में' के रूप में वर्गीकृत किया जाता है।[11]
उपयोग के तकनीकी विवरण
शाखाओं के अनुसार संदर्भ विंडो
| मॉडल | इनपुट (token) | आउटपुट (token) |
|---|---|---|
| HY 2.0 Think | 128K | 64K |
| HY 2.0 Instruct | 128K | 16K |
| T1 (API) | 32K | 64K |
| A13B (API) | 224K | 32K |
| TurboS (API) | 32K | 16K |
| Lite (API) | 250K | 6K |
| Hunyuan-Large (खुला) | 256K (pretrain) / 128K (instruct) | — |
| Compact 0.5–7B | 256K | — |
स्रोत: Tencent Cloud product overview।[3]
समर्थित उपकरण
Tencent Cloud API में निम्नलिखित दस्तावेज़ीकृत हैं:[15]
- Function Calling (
tools,tool_choice)। - AI Search Enhancement — बाहरी स्रोतों (retrieval-augmented generation) से अंतर्निहित खोज।
- SearchInfo और Citation — उत्तरों में उद्धरण मार्कर।
- EnableMultimedia — आउटपुट में मल्टीमीडिया प्रतिस्थापन।
- EnableThinking — A13B के लिए chain-of-thought स्विच।
- EnableRecommendedQuestions — अनुशंसित प्रश्नों का उत्पादन।
API अनुकूलता
Hunyuan API OpenAI-संगत प्रारूप का समर्थन करता है:[16]
- Base URL:
https://api.hunyuan.cloud.tencent.com/v1। /v1/chat/completionsऔर/v1/embeddingsका समर्थन किया जाता है।- Embedding model:
hunyuan-embedding, आयाम 1024। - SSE के माध्यम से Streaming।
- डिफ़ॉल्ट Concurrency: प्रति खाता 5।
Hunyuan-Large (खुले) के लिए मानक इनपुट/आउटपुट प्रारूप PyTorch/Transformers फ्रेमवर्क के अनुरूप है। क्वांटाइज़ेशन का समर्थन: FP8, INT4 (GPTQ/AWQ)।[5]
अनुप्रयोग और एकीकरण
Hunyuan मॉडल Tencent के पारिस्थितिकी तंत्र में एकीकृत हैं और बाहरी डेवलपर्स के लिए उपलब्ध हैं। मुख्य दस्तावेज़ीकृत परिदृश्य:[1][17]
Tencent उत्पाद
- Yuanbao — Hunyuan और DeepSeek के समर्थन वाला चैटबॉट।
- Tencent Meeting — बैठक सारांश उत्पादन।
- Tencent Docs — पाठ उत्पादन और विश्लेषण।
- ima — वित्तीय और मल्टीमीडिया AI सहायक।
Enterprise अनुप्रयोग
- पाठ उत्पादन: लेख, विज्ञापन पाठ, परिदृश्य, उत्पाद विवरण।
- बुद्धिमान ग्राहक सेवा: चैट-बॉट, FAQ, उत्तर स्वचालन।
- कोड उत्पादन और विश्लेषण (विशेष रूप से HY 2.0 Think और T1)।
- गणितीय और तार्किक तर्क, विश्लेषणात्मक कार्य।
- बहुभाषी अनुवाद (30+ भाषाएँ, Hunyuan-MT)।
खुले मॉडल
खुले संस्करणों का उपयोग अनुसंधान, fine-tuning और edge डिवाइस पर डेप्लॉयमेंट के लिए किया जाता है (छोटे dense मॉडल)। बहु-मोडल विस्तार (HunyuanImage, HunyuanVideo, Hunyuan3D) का उपयोग 3D मॉडलिंग और वीडियो उत्पादन के लिए किया जाता है।[14]
सीमाएँ और खुली समस्याएँ
- व्यावसायिक मॉडलों की बंद प्रकृति। HY 2.0 और T1 के लिए कोई खुले भार और विस्तृत आर्किटेक्चरल विशिष्टताएँ नहीं हैं; पहुँच API तक सीमित है, जो स्वतंत्र पुनरुत्पादकता को कठिन बनाता है।[3]
- प्रशिक्षण डेटा की अपारदर्शिता। यद्यपि बड़े पैमाने पर सिंथेटिक डेटा के उपयोग पर जोर दिया जाता है, dataset की सटीक संरचना, भाषाओं का अनुपात और डोमेन क्षेत्र प्रकट नहीं किए गए हैं।[2]
- कम्प्यूटेशनल आवश्यकताएँ। खुले मॉडलों को महत्वपूर्ण संसाधनों की आवश्यकता होती है: Hunyuan-Large के पूर्ण fine-tuning के लिए न्यूनतम 32 GPU; FP8 के साथ भी दसियों GB VRAM।[5]
- हॉलुसिनेशन। अन्य LLM की तरह, मॉडल विश्वसनीय लेकिन तथ्यात्मक रूप से गलत कथन उत्पन्न करने के प्रति संवेदनशील हैं। Hunyuan के लिए इस पहलू का व्यवस्थित अध्ययन खुले सहकर्मी-समीक्षित कार्यों में अभी सीमित है।[18]
- आर्किटेक्चरल और सेवा सीमाओं के बीच अंतर। कुछ मॉडलों (TurboS, A13B) के लिए API की सेवा सीमाएँ आर्किटेक्चरल क्षमताओं से काफी कम हैं।[6][3]
- क्षेत्रीय उपलब्धता। मुख्य फ़ोकस चीनी बाजार पर; चीन के बाहर के उपयोगकर्ताओं के लिए API में भाषाई और कानूनी प्रतिबंध हैं।[17]
- विस्तृत सुरक्षा रिपोर्टों का अभाव। दस्तावेज़ीकरण में सुरक्षा और फ़िल्टरिंग के सामान्य सिद्धांत उल्लिखित हैं, लेकिन कोई सार्वजनिक technical safety reports नहीं हैं जो कुछ अंतर्राष्ट्रीय मॉडलों के समान स्तर की हों।[15]
- Open-source शाखा की अनुकूलता। रिलीज़ के बाद
transformers/vllmके साथ एकीकरण की समस्याएँ दर्ज की गईं, जहाँ लाइब्रेरीhunyuan_v1_denseआर्किटेक्चर प्रकार को नहीं पहचान पाईं, जिसके लिएtrust_remote_codeया विशेष शाखाओं की आवश्यकता थी।[19]
घटनाएँ और ज्ञात समस्याएँ
उपलब्ध सामग्री (2025 के अंत — 2026 की शुरुआत) के अनुसार, Hunyuan से विशेष रूप से जुड़ी कोई बड़ी सार्वजनिक घटना (बड़े पैमाने पर डेटा लीक, अनोखे सुरक्षा खतरे) दर्ज नहीं की गई है।[17]
दस्तावेज़ीकृत उत्पाद सुधार
Tencent Cloud के product dynamics में सूक्ष्म सुधार दर्ज हैं:[12]
- 2024-11-20:
hunyuan-turbo-latestको special characters के कारण होने वाली पुनरावृत्ति ठीक करने, Markdown आउटपुट की स्थिरता बढ़ाने और अनुचित अस्वीकृतियों को कम करने के लिए अद्यतन किया गया। - 2025-04-03: T1 अद्यतन जिसमें सरलीकृत/पारंपरिक चीनी मिश्रण और चीनी/अंग्रेज़ी मिश्रण के सुधार, साथ ही परियोजना स्तर पर कोड उत्पादन में सुधार शामिल है।
- 2025-04-20: Search Enhancement को default-on से default-off में स्थानांतरित किया गया — एकीकरण के लिए वास्तव में एक API व्यवहार परिवर्तन।
MoE सुरक्षा अनुसंधान
अनुसंधान आलोचना के स्तर पर (प्रीप्रिंट स्तर) Hunyuan-A13B का उल्लेख MoE मॉडलों में safety-स्थानीयकरण पर हमलों से संबंधित कार्यों में किया गया है। विशेष रूप से, Large Language Lobotomy और GateBreaker कार्यों में safety विशेषज्ञों को 'silencing' करने पर उच्च attack success rate की सूचना दी गई है। यह किसी उत्पादन घटना की पुष्टि नहीं है, लेकिन यह दर्शाता है कि MoE रूटिंग की सुरक्षा को एक कमजोर अनुसंधान वेक्टर के रूप में देखा जाता है।[20][21]
नैतिक और विनियामक पहलू
Hunyuan चीन के कानूनी और विनियामक संदर्भ में संचालित होता है, जिसमें जनरेटिव AI प्रबंधन पर राष्ट्रीय नियम (CAC), सामग्री फ़िल्टरिंग, और डेटा सुरक्षा पर Tencent की आंतरिक नीतियाँ शामिल हैं। Tencent Cloud दस्तावेज़ीकरण इस बात पर जोर देता है कि Hunyuan API का उपयोग लागू कानूनों और प्लेटफ़ॉर्म नीति के अनुरूप होना चाहिए।[1]
विशिष्ट उपायों में शामिल हैं:
- स्ट्रीमिंग आउटपुट और संभावित
FinishReason=sensitiveके साथ अंतर्निहित सामग्री मॉडरेशन। - हॉलुसिनेशन और अवांछित व्यवहार को कम करने के लिए RLHF/DPO के माध्यम से alignment।
- पूर्वाग्रह (bias) को न्यूनतम करने के लिए प्रशिक्षण डेटा का फ़िल्टरेशन।
- खुले मॉडलों के लिए खुले लाइसेंस (Tencent Hunyuan Community License Agreement), इस चेतावनी के साथ कि कुछ संस्करणों के लिए यह समझौता EU में लागू नहीं होता।[8][15]
Hunyuan के लिए bias (पूर्वाग्रह) और fairness (निष्पक्षता) पर विशेष स्वतंत्र रिपोर्टें अभी कम हैं; खुले भार के विस्तार और स्वतंत्र परीक्षणों के साथ अनुसंधान की उम्मीद है।[2]
समुदाय की प्रतिक्रिया
बंद शाखा के लिए सबसे महत्वपूर्ण बाहरी संकेत — LMSYS Chatbot Arena पर TurboS का परिणाम (1356, वैश्विक शीर्ष-7)। खुली शाखा के लिए अप्रत्यक्ष संकेतक — GitHub गतिविधि: Hunyuan-Large के लगभग 1.6 हजार stars, A13B के 812, Hunyuan-MT के 683। यह open LLM पारिस्थितिकी तंत्र के मानकों से उल्लेखनीय, लेकिन प्रभुत्व स्तर से कम जुड़ाव को दर्शाता है। समुदाय के व्यक्तिपरक मूल्यांकन (Hugging Face, Reddit) चीनी भाषा और agent कार्यों में मजबूत पक्षों पर ध्यान देते हैं।[22]
संभावनाएँ और अनुसंधान की दिशाएँ
सार्वजनिक सामग्री में उल्लिखित आगे के विकास की दिशाएँ:[2][6][14]
- आर्किटेक्चर का आगे का संकरण (Mamba + Transformer + MoE) और MoE के लिए scaling laws का अध्ययन।
- बहु-मोडल क्षमताओं का विस्तार: Hunyuan3D, HunyuanVideo और HunyuanImage का भाषा मॉडलों के साथ एकीकरण।
- उपकरण उपयोग (tool use) और agent क्षमताओं में सुधार।
- inference लागत में कमी: क्वांटाइज़ेशन (edge के लिए 2-bit), TRT-LLM/vLLM के माध्यम से अनुकूलन।
- खुले मॉडल पोर्टफ़ोलियो का विस्तार।
- विस्तृत safety- और alignment-रिपोर्टों का विकास और प्रकाशन।
यह भी देखें
- LLaMA (Meta)
- DeepSeek
साहित्य
- Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- Tencent Hunyuan Team. Hunyuan-MT Technical Report. arXiv:2509.05209, 2025. https://arxiv.org/abs/2509.05209
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
संदर्भ
- https://cloud.tencent.com/document/product/1729/104753 — Tencent Cloud Hunyuan का आधिकारिक दस्तावेज़ीकरण
- https://huggingface.co/tencent/Tencent-Hunyuan-Large — Hugging Face पर Hunyuan-Large
- https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large — GitHub पर Hunyuan-Large
- https://github.com/Tencent-Hunyuan/Hunyuan-A13B — GitHub पर Hunyuan-A13B
- https://tencent.github.io/llm.hunyuan.T1/README_EN.html — Hunyuan-T1 का आधिकारिक पृष्ठ
- https://www.tencent.com/en-us/articles/2201685.html — Hunyuan की घोषणा (सितंबर 2023)
टिप्पणियाँ
- ↑ 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
- ↑ 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- ↑ 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
- ↑ 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
- ↑ 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
- ↑ 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
- ↑ 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
- ↑ 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
- ↑ Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
- ↑ 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
- ↑ 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
- ↑ Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
- ↑ 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
- ↑ LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
- ↑ GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
- ↑ Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
- ↑ Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
- ↑ Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS