Hunyuan (Tencent) (UR)
Hunyuan (چینی: 腾讯混元大模型، Tencent Hunyuan، Tencent HY) — بنیادی ماڈلز (Foundation Models) اور بڑے لسانی ماڈلز (Large Language Model، LLM) کا ایک خاندان ہے جسے Tencent Hunyuan Foundation Model Team نے تیار کیا ہے اور یہ Tencent Cloud کلاؤڈ سروس کے ذریعے، نیز Hugging Face اور GitHub پلیٹ فارمز پر کھلے weights کی صورت میں دستیاب ہے۔ یہ خاندان متن کی تخلیق اور فہم، منطقی اور ریاضیاتی استنتاج، پروگرامنگ، طویل context کی پروسیسنگ، اور ملٹی موڈل توسیعات (تصاویر، ویڈیو، 3D) کے ماڈلز پر مشتمل ہے۔ Hunyuan کو Tencent کی جنریٹو AI کی فلیگ شپ لائن کے طور پر پیش کیا جاتا ہے اور یہ کمپنی کے مصنوعات کے ماحولیاتی نظام (Yuanbao، WeChat، Tencent Meeting، Tencent Cloud) میں ضم ہے۔[1][2][3]
تاریخ اور ترقی کی تسلسلی
Hunyuan کی ترقی LLM کی عالمی دوڑ اور مصنوعی ذہانت کے شعبے میں چینی تکنیکی خودانحصاری کی حکمت عملی کے تناظر میں ہوئی۔ یہ سلسلہ ملکیتی dense ماڈلز سے کھلے Mixture-of-Experts (MoE) اور ہائبرڈ Transformer-Mamba آرکیٹیکچرز کی طرف ارتقاء پذیر ہوا۔[1]
پہلی نسل (2023)
Hunyuan سیریز کا عوامی اعلان 7 ستمبر 2023 کو شینژن میں Tencent Global Digital Ecosystem Summit میں ہوا۔ پہلا ورژن ایک ملکیتی dense ماڈل تھا جس میں 100 ارب سے زائد پیرامیٹرز تھے اور یہ 2 ٹریلین سے زائد tokens پر پری ٹرین کیا گیا تھا۔ ماڈل کا رخ چینی زبان، منطقی استنتاج اور مواد کی تخلیق کی طرف تھا، یہ Tencent کی 50 سے زائد مصنوعات میں ضم کیا گیا اور Tencent Cloud API کے ذریعے دستیاب تھا۔[1]
Hunyuan-Large اور MoE کی طرف منتقلی (2024)
نومبر 2024 میں Tencent نے Hunyuan-Large جاری کی — جو اس وقت کا سب سے بڑا کھلا Transformer-MoE ماڈل تھا جس میں 389 ارب کل اور 52 ارب فعال پیرامیٹرز تھے۔ ماڈل Hugging Face اور GitHub پر کھلے weights کے ساتھ شائع کیا گیا اور arXiv پر ایک preprint کے ساتھ پیش کیا گیا۔ اس ریلیز نے Tencent کا کھلی ترقی کی طرف اسٹریٹجک رخ ظاہر کیا۔[2][4][5]
ہائبرڈ اور reasoning ماڈلز (2025)
2025 میں یہ سلسلہ کئی اہم ریلیزز کے ساتھ وسیع ہوا:
- Hunyuan-TurboS (فروری 2025) — پہلا صنعتی بڑے پیمانے کا ہائبرڈ Transformer-Mamba-MoE ماڈل جس میں 560 ارب کل اور 56 ارب فعال پیرامیٹرز تھے اور یہ 16 ٹریلین tokens پر پری ٹرین کیا گیا۔ تیز اور گہری سوچ کے درمیان متحرک سوئچنگ کے لیے موافق Chain-of-Thought (CoT) میکانزم متعارف کرایا گیا۔[6]
- Hunyuan-T1 (مارچ 2025) — ایک خصوصی reasoning ماڈل جو TurboS کے اوپر بنایا گیا اور اس میں وسیع reinforcement learning سے تربیت (پوسٹ ٹریننگ کمپیوٹ کا 96.7% — reinforcement learning) کی گئی۔[7]
- Hunyuan-A13B (جون 2025) — کارکردگی اور لاگت کے توازن کے لیے ایک مختصر MoE ماڈل (80 ارب کل / 13 ارب فعال پیرامیٹرز) جس میں تیز اور سست سوچ کی حمایت ہے۔[8]
- چھوٹے dense ماڈلز (جولائی 2025) — edge آلات اور انتہائی مسابقتی تعیناتی منظرناموں کے لیے 0.5B، 1.8B، 4B، 7B کے ورژنز، 256K context کی حمایت کے ساتھ۔[9]
Hunyuan 2.0 (نومبر–دسمبر 2025)
دسمبر 2025 میں تجارتی ماڈل کی دوسری نسل — Hunyuan 2.0 (HY 2.0) کا اعلان کیا گیا جس میں MoE آرکیٹیکچر (406 ارب کل / 32 ارب فعال پیرامیٹرز) اور 256K tokens کی context ونڈو ہے۔ سلسلہ دو ورژنز میں تقسیم کیا گیا: HY 2.0 Think (گہری استدلال، کوڈ) اور HY 2.0 Instruct (مکالمے، تخلیقی تخلیق)۔ ماڈلز Tencent Cloud API کے ذریعے دستیاب ہیں اور Yuanbao اور ima ایپلیکیشنز میں ضم ہیں۔[10][11]
مجموعی تسلسلی
| تاریخ | واقعہ |
|---|---|
| ستمبر 2023 | ملکیتی LLM (>100B پیرامیٹرز) کے طور پر Hunyuan کا عوامی اعلان؛ Tencent Cloud API کا آغاز |
| فروری 2024 | Yuanbao چیٹ بوٹ کے لیے داخلی MoE ماڈل |
| اپریل 2024 | ری برانڈنگ: «advanced» ← hunyuan-pro، «standard» ← hunyuan-standard؛ hunyuan-lite شامل |
| مئی 2024 | hunyuan-lite کو MoE پر منتقل کیا گیا، 256K context تک توسیع |
| ستمبر 2024 | نیا hunyuan-turbo لانچ (نئی نسل کا MoE) |
| نومبر 2024 | Hunyuan-Large کا کھلا ریلیز (389B/52B MoE)، preprint arXiv:2411.02265 |
| فروری–مارچ 2025 | Hunyuan-TurboS (ہائبرڈ Mamba-MoE)؛ Hunyuan-T1 (reasoning) |
| جون 2025 | Hunyuan-A13B (80B/13B، fine-grained MoE) |
| جولائی 2025 | چھوٹے dense ماڈلز 0.5B–7B |
| ستمبر 2025 | Hunyuan-MT (ترجمے کا خصوصی ماڈل) |
| نومبر–دسمبر 2025 | Hunyuan 2.0 (HY 2.0 Think / Instruct)، 406B/32B MoE |
ماخذ: Tencent Cloud product dynamics؛ سرکاری ذخیرے۔[12]
نظریاتی بنیادیں اور آرکیٹیکچر
Mixture-of-Experts - ماہرین کا مرکب آرکیٹیکچر
سیریز کے کلیدی ماڈلز (Hunyuan-Large، A13B، HY 2.0) Mixture-of-Experts (MoE) آرکیٹیکچر استعمال کرتے ہیں جس میں transformer کی کچھ تہوں میں متعدد «ماہرین» (ذیلی نیٹ ورکس) ہوتے ہیں، اور ایک راؤٹر (gating network) ہر token کے لیے فعال ماہرین کا ایک ذیلی مجموعہ منتخب کرتا ہے۔ MoE تہہ کا عمومی فارمولا:[2]
جہاں — راؤٹنگ فنکشن (gating)، — -واں ماہر، — ماہرین کی کل تعداد۔ اس نقطہ نظر سے ماڈل کے پیرامیٹرز کی کل تعداد ایک گزر کے دوران فعال پیرامیٹرز سے کافی زیادہ ہوتی ہے:[2]
جو inference پر حسابی اخراجات کے متناسب اضافے کے بغیر ماڈل کی گنجائش بڑھانے کی اجازت دیتا ہے۔
Hunyuan-Large میں 1 مشترک (shared) ماہر اور 16 خصوصی ماہرین کی اسکیم نافذ کی گئی ہے جس میں فی token 1 ماہر کو فعال کیا جاتا ہے (top-1 routing)۔ اضافی اختراعات میں recycle میکانزم (مسترد tokens کی دوبارہ کارروائی) کے ساتھ مخلوط روٹنگ اور ماہروں کے تعاون کے توازن کو بہتر بنانے کے لیے ماہر-مخصوص learning rates شامل ہیں۔[2][5]
Transformer-Mamba - ہائبرڈ آرکیٹیکچر
Hunyuan-TurboS اور T1 ایک ہائبرڈ آرکیٹیکچر متعارف کراتے ہیں جو Transformer (attention) اور Mamba (state-space model) بلاکس کو یکجا کرتا ہے۔ Mamba ترتیب کی لمبائی کے لحاظ سے خطی پیچیدگی فراہم کرتا ہے:[6]
جہاں ، — قابل تربیت میٹرکسز، — مرحلے پر پوشیدہ حالت، — ان پٹ token۔ یہ لمبائی کے لحاظ سے memory scaling فراہم کرتا ہے (معیاری Transformer میں کے مقابلے)۔[6]
TurboS میں 128 تہیں ہیں جو بلاکس میں منظم ہیں: 57 Mamba2 تہیں، 7 Attention تہیں اور 32 ماہرین کے ساتھ 64 FFN-MoE تہیں۔ AMF (Attention → Mamba2 → FFN) اور MF (Mamba2 → FFN) بلاکس عالمی اور مقامی context کے توازن کو یقینی بنانے کے لیے باری باری آتے ہیں۔[6]
توجہ کے میکانزمز اور KV-cache
Hunyuan-Large Grouped Query Attention (GQA) استعمال کرتا ہے — توجہ کا ایک ورژن جس میں متعدد queries مشترک keys اور values استعمال کرتی ہیں — اور KV-cache کے حجم کو کم کرنے کے لیے Cross-Layer Attention (CLA)۔ سروں، ترتیب کی لمبائی اور سر کے سائز کے ساتھ self-attention تہہ کے لیے معیاری KV-cache حجم:[5]
جہاں — KV-cache کا حجم۔ گروپس کے ساتھ GQA پر حجم کم ہو کر:
CLA مزید تہوں کے درمیان KV-cache کے دوبارہ استعمال کا مفروضہ رکھتا ہے۔ مجموعی طور پر یہ اصلاحات تقریباً 95% تک میموری کی بچت فراہم کرتی ہیں۔[4]
پوزیشنل انکوڈنگ اور طویل context
ماڈلز طویل ترتیبوں کی حمایت کے لیے اسکیلنگ کے ساتھ Rotary Position Embedding (RoPE) استعمال کرتے ہیں۔ context پر تربیت مرحلہ وار (curriculum learning) کی جاتی ہے: 32K سے 256K tokens تک۔ ایکٹیویشن — SwiGLU۔ tokenizer کی لغت — 128K (tiktoken چینی زبان کی توسیع کے ساتھ)۔[2]
تربیت اور پیمانہ کاری
MoE ماڈلز کے لیے تجرباتی طاقت کے تعلقات کی شکل میں scaling laws کی تحقیق کی جاتی ہے:[2]
جہاں — معیار کی پیمائش، — فعال پیرامیٹرز کی تعداد، — ڈیٹا کا حجم، — تجربات سے منتخب پیرامیٹرز۔ Hunyuan-Large 1.5 ٹریلین tokens کے مصنوعی ڈیٹا کے استعمال پر زور دیتا ہے — MoE پر پچھلی اشاعتوں کے مقابلے میں کئی گنا زیادہ۔[2]
تربیت کا پائپ لائن اور ہم آہنگی
Hunyuan ماڈلز کی تربیت کے عمل میں جدید LLMs کے لیے کئی خصوصی مراحل شامل ہیں:[2][7]
Pre-training - ابتدائی تربیت
ایک بڑے کثیر اللسانی کارپس (چینی، انگریزی اور دیگر زبانیں) پر وسیع پیمانے پر تربیت۔ Hunyuan-Large کو 7 ٹریلین tokens (1.5 ٹریلین مصنوعی سمیت) پر پری ٹرین کیا گیا۔ TurboS — 16 ٹریلین tokens پر۔ datasets کی درست ترکیب ظاہر نہیں کی گئی۔[2][6]
Supervised Fine-Tuning - زیرنگرانی فائن ٹیوننگ
10 لاکھ سے زائد ہدایات (ہدایت-جواب کے جوڑوں) پر fine-tuning جو ماڈل کو صارف کی ہدایات پر عمل کرنے کی طرف لے جاتی ہے۔[2]
تقویتی تعلم کے ذریعے ہم آہنگی
انسانی ترجیحات کے ساتھ ماڈل کے رویے کو ہم آہنگ کرنے کے لیے یہ طریقے استعمال کیے جاتے ہیں:
Direct Preference Optimization (DPO) — واضح انعام ماڈل کے بغیر ہم آہنگی کا طریقہ، جو Hunyuan-Large میں استعمال ہوتا ہے۔[2]
Reinforcement Learning (RL) — Hunyuan-T1 میں curriculum learning کے ساتھ وسیع reinforcement learning استعمال کی جاتی ہے؛ ڈویلپر کے بیان کے مطابق پوسٹ ٹریننگ کمپیوٹ کا 96.7% RL پر خرچ ہوتا ہے۔[7]
Adaptive Long-Short Chain-of-Thought — TurboS میں تیز اور گہری سوچ کے درمیان متحرک سوئچنگ کا میکانزم نافذ کیا گیا جو ماڈل کو کام کی پیچیدگی کے مطابق استدلال کی گہرائی کو ڈھالنے کی اجازت دیتا ہے۔[6]
ماڈلز کے خاندان کی ترکیب
یہ خاندان بند تجارتی API ماڈلز اور کھلے weights والے ماڈلز میں تقسیم ہے۔[3]
بنیادی ماڈلز (جائزہ)
| ماڈل | ریلیز کی تاریخ | آرکیٹیکچر | پیرامیٹرز (کل / فعال) | Context | دستیابی |
|---|---|---|---|---|---|
| Hunyuan (2023) | ستمبر 2023 | Dense Transformer | >100 ارب / — | ظاہر نہیں | ملکیتی API |
| Hunyuan-Large | نومبر 2024 | Transformer-MoE | 389 ارب / 52 ارب | 256K (pretrain)، 128K (instruct) | کھلے weights (GitHub، HF) |
| Hunyuan-TurboS | فروری 2025 | Hybrid Transformer-Mamba-MoE | 560 ارب / 56 ارب | 256K (آرکیٹ.)، 32K/16K (API) | ملکیتی API + کھلے ورژنز |
| Hunyuan-T1 | مارچ 2025 | TurboS کی بنیاد پر + وسیع RL | — | 32K/64K (API) | ملکیتی API |
| Hunyuan-A13B | جون 2025 | Fine-grained MoE | 80 ارب / 13 ارب | 256K (کھلا)، 224K/32K (API) | کھلے weights + API |
| چھوٹے (0.5–7B) | جولائی 2025 | Dense | 0.5–7 ارب | 256K | کھلے weights |
| HY 2.0 Think | نومبر 2025 | MoE | 406 ارب / 32 ارب | 128K ان پٹ / 64K آؤٹ پٹ (API) | ملکیتی API |
| HY 2.0 Instruct | نومبر 2025 | MoE | 406 ارب / 32 ارب | 128K ان پٹ / 16K آؤٹ پٹ (API) | ملکیتی API |
ماخذ: arXiv:2411.02265؛ arXiv:2505.15431؛ Tencent Cloud docs؛ GitHub۔[2][6][3][10]
نوٹ۔ کچھ ماڈلز کے لیے آرکیٹیکچرل context حدود (تکنیکی رپورٹس سے) اور سروس API حدود (product docs سے) مختلف ہیں۔ یہ تضاد نہیں ہے بلکہ تحقیقی اور پروڈکٹ کنفیگریشنز کے درمیان فرق کو ظاہر کرتا ہے۔[6][3]
خصوصی ماڈلز
Hunyuan-MT (ستمبر 2025) — مشین ترجمے کا خصوصی ماڈل جس نے WMT25 پر 31 میں سے 30 زمروں میں پہلا مقام حاصل کیا۔[13]
HunyuanImage، HunyuanVideo، Hunyuan3D — خاندان کے ملٹی موڈل ماڈلز بالترتیب تصاویر، ویڈیو اور 3D اشیاء کی تخلیق کے لیے۔[14]
پوزیشننگ اور ارتقائی روابط
Tencent Cloud کی دستاویزات میں درج ذیل ارتقائی روابط نظر آتے ہیں:
hunyuan-a13bکوhunyuan-standard-256Kکی اپگریڈ کے طور پر ظاہر کیا گیا ہے۔hunyuan-t1کو TurboS کے اوپر مضبوط RL پوسٹ ٹریننگ کے ساتھ بنایا گیا ہے۔- HY 2.0 Think/Instruct — وہ شاخ جس میں بیس کو TurboS سے Hunyuan 2.0 تک اپ ڈیٹ کیا گیا۔
- کھلی شاخ (Hunyuan-Large، A13B، compact dense) بند API شاخ کے متوازی ترقی پاتی ہے، جو تحقیقی رسائی فراہم کرتی ہے۔[3]
کلیدی نسلوں میں نئی خصوصیات
Hunyuan-Large (2024)
پہلی نسل اور پچھلے MoE نقطہ نظر کے مقابلے میں، Hunyuan-Large متعارف کراتا ہے:[2][4]
- 389 ارب پیرامیٹرز کا پیمانہ (52 ارب فعال) — اشاعت کے وقت سب سے بڑا کھلا Transformer-MoE ماڈل۔
- 256K context کی حمایت (pretrain) اور 128K (instruct) — 2024 کے بڑے LLMs کی عام اقدار سے نمایاں طور پر زیادہ۔
- GQA + CLA پر مبنی KV-cache compression (میموری کی بچت ~95%)۔
- بڑے پیمانے پر مصنوعی ڈیٹا (1.5 ٹریلین tokens مصنوعی ڈیٹا)۔
- ماہرین کی مخلوط روٹنگ اور ماہر-مخصوص learning rates۔
Hunyuan-TurboS (2025)
اہم آرکیٹیکچرل تبدیلی:[6]
- Mamba2 + Attention + MoE کا ہائبرڈ: 560B کل / 56B فعال، 128 تہیں۔
- 16 ٹریلین tokens پر پری ٹریننگ۔
- استدلال کی گہرائی کے متحرک انتظام کے لیے Adaptive Long-Short Chain-of-Thought۔
- پچھلے Turbo ورژن کے مقابلے ڈیکوڈنگ میں 1.8–2 گنا تیزی کا دعوی۔
Hunyuan-T1 (2025)
TurboS پر مبنی Reasoning ماڈل:[7]
- پوسٹ ٹریننگ compute کا 96.7% — reinforcement learning۔
- موازنہ deployment envelope کے ساتھ ڈیکوڈنگ میں دو گنا تیزی۔
- استدلال کی حکمت عملیوں کو بہتر بنانے کے لیے Curriculum learning۔
HY 2.0 (2025)
تجارتی فلیگ شپ کی تازہ کاری:[10][11]
- MoE آرکیٹیکچر: 406B کل / 32B فعال پیرامیٹرز۔
- 256K tokens کی context ونڈو۔
- خصوصی benchmarks پر نمایاں بہتری: IMO-AnswerBench 73.4% (HY کے پچھلے ورژن سے +20%)، SWE-bench Verified 53.0 (6.0 سے)، τ²-Bench 72.4 (17.1 سے)۔
- RLHF اور پوسٹ ٹریننگ حکمت عملیوں میں بہتری۔
تشخیص اور Benchmarks
تشخیص zero-shot اور few-shot پروٹوکولز کے ساتھ معیاری benchmarks پر کی گئی۔ نتائج سرکاری تکنیکی رپورٹس اور ذخیروں پر مبنی ہیں؛ کچھ ماڈلز کے لیے آزاد بیرونی تصدیق ابھی محدود ہے۔[2]
Hunyuan-Large (pretrain) کے Benchmarks
| Benchmark | Hunyuan-Large | Llama 3.1-405B | Llama 3.1-70B | Mixtral-8x22B | DeepSeek-V2 |
|---|---|---|---|---|---|
| MMLU | 88.4 | 85.2 | 79.3 | 77.8 | 78.5 |
| CMMLU | 90.2 | — | — | — | 84.0 |
| C-Eval | 91.9 | — | — | — | 81.7 |
| GSM8K | 92.8 | 89.0 | 83.7 | 83.7 | 79.2 |
| MATH | 69.8 | 53.8 | 41.4 | 42.5 | 43.6 |
| HumanEval | 71.4 | 61.0 | 58.5 | 53.1 | 48.8 |
ماخذ: arXiv:2411.02265۔[2]
تکنیکی رپورٹ کے مطابق، Hunyuan-Large (pretrain) Llama 3.1-405B، Mixtral-8x22B اور DeepSeek-V2 کے ساتھ موازنے میں 19 میں سے 15 benchmarks میں آگے ہے۔[2]
Hunyuan-Large-Instruct کے Benchmarks
| Benchmark | Hunyuan-Large-Instruct |
|---|---|
| MMLU | 89.9 |
| MATH | 77.4 |
| HumanEval | 90.0 |
| Arena-Hard | 81.8 |
ماخذ: arXiv:2411.02265؛ Hugging Face model card۔[2][5]
ڈویلپرز کے بیان کے مطابق، Hunyuan-Large-Instruct MMLU پر LLaMA 3.1-405B سے 2.6 فیصد پوائنٹس آگے ہے۔[4]
TurboS اور T1 کے Benchmarks
| Benchmark | TurboS | T1 |
|---|---|---|
| LMSYS Chatbot Arena | 1356 (ٹاپ 7) | — |
| 23 benchmarks کا اوسط | 77.9% | — |
| MMLU-Pro | — | 87.2 |
| GPQA-Diamond | — | 69.3 |
| MATH-500 | — | 96.2 |
| LiveCodeBench | — | 64.9 |
| Arena-Hard | — | 91.9 |
ماخذ: arXiv:2505.15431؛ T1 official page۔[6][7]
Hunyuan-A13B کے Benchmarks
| Benchmark | Hunyuan-A13B | Hunyuan-Large | Qwen2.5-72B |
|---|---|---|---|
| MMLU | 88.17 | 88.4 | — |
| MMLU-Pro | 67.23 | 60.2 | — |
| BBH | 87.56 | 86.3 | — |
| MATH | 72.35 | 69.8 | — |
| GPQA | 49.12 | — | — |
| MBPP | 83.86 | — | — |
ماخذ: GitHub Hunyuan-A13B README۔[8]
A13B پوسٹ ٹریننگ سے حساس کاموں (MMLU-Pro، MATH، MBPP) میں Hunyuan-Large سے آگے ہے، جو اس کی پوزیشننگ بطور زیادہ جدید اور عملی ورژن کے ساتھ مطابقت رکھتا ہے۔[8]
کمپیکٹ Dense شاخ کے Benchmarks
| ماڈل | MMLU | MMLU-Pro | BBH | GSM8K | MATH |
|---|---|---|---|---|---|
| Hunyuan-0.5B | 54.02 | 31.15 | 45.92 | 55.64 | 42.95 |
| Hunyuan-1.8B | 64.62 | 38.65 | 74.32 | 77.26 | 62.85 |
| Hunyuan-4B | 74.01 | 51.91 | 75.17 | 87.49 | 72.25 |
| Hunyuan-7B | 79.82 | 57.79 | 82.95 | 88.25 | 74.85 |
ماخذ: GitHub Hunyuan-7B README۔[9]
HY 2.0 کے Benchmarks
اعداد و شمار ڈویلپر کی طرف سے بیان کیے گئے ہیں (واحد صریح ماخذ Hunyuan کا سرکاری اکاؤنٹ ہے):[11]
| Benchmark | HY 2.0 | HY کا پچھلا ورژن |
|---|---|---|
| IMO-AnswerBench | 73.4 | ~53 (تخمینہ، +20%) |
| SWE-bench Verified | 53.0 | 6.0 |
| τ²-Bench | 72.4 | 17.1 |
نوٹ۔ یہ اعداد و شمار «ڈویلپر کے بیان کردہ، وسیع بیرونی تصدیق کے منتظر» کے طور پر درجہ بند کیے گئے ہیں۔[11]
استعمال کی تکنیکی تفصیلات
شاخوں کے مطابق Context ونڈو
| ماڈل | ان پٹ (tokens) | آؤٹ پٹ (tokens) |
|---|---|---|
| HY 2.0 Think | 128K | 64K |
| HY 2.0 Instruct | 128K | 16K |
| T1 (API) | 32K | 64K |
| A13B (API) | 224K | 32K |
| TurboS (API) | 32K | 16K |
| Lite (API) | 250K | 6K |
| Hunyuan-Large (کھلا) | 256K (pretrain) / 128K (instruct) | — |
| Compact 0.5–7B | 256K | — |
ماخذ: Tencent Cloud product overview۔[3]
حمایت یافتہ ٹولز
Tencent Cloud API میں دستاویز شدہ:[15]
- Function Calling (
tools،tool_choice)۔ - AI Search Enhancement — بیرونی ذرائع کے ذریعے بلٹ ان تلاش (retrieval-augmented generation)۔
- SearchInfo اور Citation — جوابات میں حوالہ جاتی نشانات۔
- EnableMultimedia — آؤٹ پٹ میں ملٹی میڈیا متبادلات۔
- EnableThinking — A13B کے لیے chain-of-thought سوئچ۔
- EnableRecommendedQuestions — تجویز کردہ سوالات کی تخلیق۔
API مطابقت
Hunyuan API OpenAI مطابق فارمیٹ کی حمایت کرتا ہے:[16]
- Base URL:
https://api.hunyuan.cloud.tencent.com/v1۔ /v1/chat/completionsاور/v1/embeddingsکی حمایت۔- Embedding model:
hunyuan-embedding، طول 1024۔ - SSE کے ذریعے Streaming۔
- ڈیفالٹ Concurrency: فی اکاؤنٹ 5۔
Hunyuan-Large (کھلے) کے لیے معیاری ان پٹ/آؤٹ پٹ فارمیٹ PyTorch/Transformers فریم ورکس کے مطابق ہے۔ کوانٹائزیشن کی حمایت: FP8، INT4 (GPTQ/AWQ)۔[5]
اطلاق اور انضمام
Hunyuan ماڈلز Tencent کے ماحولیاتی نظام میں ضم ہیں اور بیرونی ڈویلپرز کے لیے دستیاب ہیں۔ بنیادی دستاویز شدہ منظرنامے:[1][17]
Tencent مصنوعات
- Yuanbao — Hunyuan اور DeepSeek کی حمایت کے ساتھ چیٹ بوٹ۔
- Tencent Meeting — اجلاسوں کے خلاصے کی تخلیق۔
- Tencent Docs — متن کی تخلیق اور تجزیہ۔
- ima — مالیاتی اور ملٹی میڈیا AI اسسٹنٹ۔
کاروباری اطلاق
- متنی تخلیق: مضامین، اشتہاری متون، اسکرپٹس، مصنوعات کی تفصیلات۔
- ذہین گاہک سپورٹ: چیٹ بوٹس، FAQ، جوابات کی خودکاری۔
- کوڈ کی تخلیق اور تجزیہ (خاص طور پر HY 2.0 Think اور T1)۔
- ریاضیاتی اور منطقی استدلال، تجزیاتی کام۔
- کثیر اللسانی ترجمہ (30+ زبانیں، Hunyuan-MT)۔
کھلے ماڈلز
کھلے ورژنز تحقیق، fine-tuning اور edge آلات پر تعیناتی (چھوٹے dense ماڈلز) کے لیے استعمال ہوتے ہیں۔ ملٹی موڈل توسیعات (HunyuanImage، HunyuanVideo، Hunyuan3D) 3D ماڈلنگ اور ویڈیو تخلیق کے لیے استعمال ہوتی ہیں۔[14]
حدود اور کھلے مسائل
- تجارتی ماڈلز کی بندش۔ HY 2.0 اور T1 کے لیے کھلے weights اور تفصیلی آرکیٹیکچرل وضاحتیں موجود نہیں؛ رسائی API تک محدود ہے جو آزاد تولیدی صلاحیت کو مشکل بناتی ہے۔[3]
- تربیتی ڈیٹا کی عدم شفافیت۔ اگرچہ بڑے پیمانے پر مصنوعی ڈیٹا کے استعمال پر زور دیا جاتا ہے، datasets کی درست ترکیب، زبانوں کا تناسب اور ڈومین کے شعبوں کا انکشاف نہیں کیا گیا۔[2]
- حسابی تقاضے۔ کھلے ماڈلز کے لیے نمایاں وسائل درکار ہیں: Hunyuan-Large کی مکمل fine-tuning کے لیے کم از کم 32 GPUs؛ FP8 کے ساتھ بھی درجنوں GB VRAM۔[5]
- ہیلوسینیشنز۔ دیگر LLMs کی طرح، ماڈلز قابل قبول لیکن حقیقتاً غلط بیانات پیدا کر سکتے ہیں۔ Hunyuan کے لیے کھلے نظرثانی شدہ کاموں میں اس پہلو کی منظم تحقیق ابھی محدود ہے۔[18]
- آرکیٹیکچرل اور سروس حدود کے درمیان فرق۔ کچھ ماڈلز (TurboS، A13B) کے لیے API کی سروس حدود آرکیٹیکچرل صلاحیتوں سے نمایاں طور پر کم ہیں۔[6][3]
- علاقائی دستیابی۔ چینی بازار پر بنیادی توجہ؛ چین سے باہر صارفین کے لیے API پر زبانی اور قانونی پابندیاں ہیں۔[17]
- تفصیلی حفاظتی رپورٹس کا فقدان۔ دستاویزات میں حفاظت اور مواد کی فلٹرنگ کے عمومی اصول بیان کیے گئے ہیں، لیکن کچھ بین الاقوامی ماڈلز کے مقابلے میں حجم میں برابر کوئی عوامی تکنیکی حفاظتی رپورٹیں نہیں ہیں۔[15]
- open-source شاخ کی مطابقت۔ ریلیزز کے بعد
transformers/vllmکے ساتھ انضمام کے مسائل ریکارڈ کیے گئے جہاں لائبریریاںhunyuan_v1_denseآرکیٹیکچر کی قسم کو نہیں پہچانتی تھیں اورtrust_remote_codeیا خصوصی شاخوں کی ضرورت تھی۔[19]
واقعات اور معروف مسائل
دستیاب مواد کے مطابق (2025 کے آخر — 2026 کے اوائل) Hunyuan سے خاص طور پر منسلک کوئی بڑے عوامی واقعات (بڑے ڈیٹا لیک، منفرد حفاظتی خطرات) درج نہیں ہیں۔[17]
دستاویز شدہ پروڈکٹ اصلاحات
Tencent Cloud کے product dynamics میں مائیکرو اصلاحات درج ہیں:[12]
- 2024-11-20:
hunyuan-turbo-latestکو خصوصی حروف کی وجہ سے تکرار ٹھیک کرنے، Markdown آؤٹ پٹ کی استحکام بڑھانے اور بلا وجہ انکار کم کرنے کے لیے اپ ڈیٹ کیا گیا۔ - 2025-04-03: سادہ/روایتی چینی کی آمیزش اور چینی/انگریزی کی آمیزش کی اصلاحات کے ساتھ T1 کا اپ ڈیٹ، اور پروجیکٹ سطح پر کوڈ تخلیق میں بہتری۔
- 2025-04-20: Search Enhancement کو default-on سے default-off میں منتقل کیا گیا — عملاً انضمامات کے لیے ایک API رویہ تبدیلی۔
MoE حفاظتی تحقیقات
تحقیقی تنقید کی سطح پر (preprint سطح) Hunyuan-A13B MoE ماڈلز میں حفاظتی لوکلائزیشن پر حملوں کے بارے میں کاموں میں زیر بحث آیا ہے۔ خاص طور پر Large Language Lobotomy اور GateBreaker کاموں میں حفاظتی ماہرین کی «خاموشی» کے دوران اعلی attack success rate کی اطلاع دی گئی ہے۔ یہ کوئی پروڈکشن واقعے کی تصدیق نہیں ہے، لیکن یہ ظاہر کرتا ہے کہ MoE روٹنگ کی حفاظت ایک کمزور تحقیقی ویکٹر کے طور پر دیکھی جاتی ہے۔[20][21]
اخلاقی اور ریگولیٹری پہلو
Hunyuan چین کے قانونی اور ریگولیٹری تناظر میں کام کرتا ہے، جس میں جنریٹو AI کے انتظام (CAC) اور مواد کی فلٹرنگ کے قومی قوانین، اور ڈیٹا سیکیورٹی کے بارے میں Tencent کی اندرونی پالیسیاں شامل ہیں۔ Tencent Cloud کی دستاویزات اس بات پر زور دیتی ہیں کہ Hunyuan API کا استعمال متعلقہ قوانین اور پلیٹ فارم کی پالیسی کے مطابق ہونا چاہیے۔[1]
مخصوص اقدامات میں شامل ہیں:
- ممکنہ
FinishReason=sensitiveکے ساتھ اسٹریمنگ آؤٹ پٹ کے ساتھ بلٹ ان مواد کی نگرانی۔ - ہیلوسینیشن اور ناپسندیدہ رویے کو کم کرنے کے لیے RLHF/DPO کے ذریعے ہم آہنگی۔
- تعصب (bias) کو کم کرنے کے لیے تربیتی ڈیٹا کی فلٹرنگ۔
- کھلے ماڈلز کے لیے کھلے لائسنس (Tencent Hunyuan Community License Agreement)، اس نوٹ کے ساتھ کہ کچھ ورژنز کے لیے یہ معاہدہ EU میں لاگو نہیں ہوتا۔[8][15]
Hunyuan کے لیے تعصب اور انصاف کے بارے میں آزاد خصوصی رپورٹیں ابھی کم ہیں؛ کھلے weights اور آزاد ٹیسٹس کے پھیلاؤ کے ساتھ تحقیق متوقع ہے۔[2]
برادری کا ردعمل
بند شاخ کے لیے سب سے زیادہ معنی خیز بیرونی اشارہ LMSYS Chatbot Arena پر TurboS کا نتیجہ ہے (1356، عالمی سطح پر ٹاپ 7)۔ کھلی شاخ کے لیے بالواسطہ اشارہ GitHub سرگرمی ہے: Hunyuan-Large کے تقریباً 1.6 ہزار stars، A13B کے 812، Hunyuan-MT کے 683۔ یہ open LLM ماحولیاتی نظام کے معیار کے مطابق قابل ذکر لیکن غالب نہیں ایک مشغولیت کی سطح کی عکاسی کرتا ہے۔ برادری کے ساپیکش جائزے (Hugging Face، Reddit) چینی زبان اور agent کاموں میں مضبوط پہلوؤں کو نوٹ کرتے ہیں۔[22]
مستقبل کے نقطہ نظر اور تحقیق کی سمتیں
عوامی مواد میں بیان کردہ مزید ترقی کی سمتیں:[2][6][14]
- آرکیٹیکچرز کی مزید ہائبرڈائزیشن (Mamba + Transformer + MoE) اور MoE کے لیے scaling laws کی تحقیق۔
- ملٹی موڈل صلاحیتوں کا توسیع: Hunyuan3D، HunyuanVideo اور HunyuanImage کا لسانی ماڈلز کے ساتھ انضمام۔
- ٹول استعمال (tool use) اور ایجنٹ صلاحیتوں میں بہتری۔
- inference اخراجات میں کمی: کوانٹائزیشن (edge کے لیے 2-bit)، TRT-LLM/vLLM کے ذریعے اصلاح۔
- کھلے ماڈلز کے پورٹ فولیو کا توسیع۔
- تفصیلی حفاظتی اور ہم آہنگی رپورٹس کی تیاری اور اشاعت۔
مزید دیکھیں
- LLaMA (Meta)
- DeepSeek
ادبیات
- Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- Tencent Hunyuan Team. Hunyuan-MT Technical Report. arXiv:2509.05209, 2025. https://arxiv.org/abs/2509.05209
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
روابط
- https://cloud.tencent.com/document/product/1729/104753 — Tencent Cloud Hunyuan کی سرکاری دستاویزات
- https://huggingface.co/tencent/Tencent-Hunyuan-Large — Hugging Face پر Hunyuan-Large
- https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large — GitHub پر Hunyuan-Large
- https://github.com/Tencent-Hunyuan/Hunyuan-A13B — GitHub پر Hunyuan-A13B
- https://tencent.github.io/llm.hunyuan.T1/README_EN.html — Hunyuan-T1 کا سرکاری صفحہ
- https://www.tencent.com/en-us/articles/2201685.html — Hunyuan کا اعلان (ستمبر 2023)
حواشی
- ↑ 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
- ↑ 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- ↑ 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
- ↑ 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
- ↑ 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
- ↑ 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
- ↑ 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
- ↑ 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
- ↑ Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
- ↑ 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
- ↑ 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
- ↑ Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
- ↑ 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
- ↑ LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
- ↑ GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
- ↑ Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
- ↑ Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
- ↑ Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS