Hunyuan (Tencent) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Hunyuan (چینی: 腾讯混元大模型، Tencent Hunyuan، Tencent HY) — بنیادی ماڈلز (Foundation Models) اور بڑے لسانی ماڈلز (Large Language Model، LLM) کا ایک خاندان ہے جسے Tencent Hunyuan Foundation Model Team نے تیار کیا ہے اور یہ Tencent Cloud کلاؤڈ سروس کے ذریعے، نیز Hugging Face اور GitHub پلیٹ فارمز پر کھلے weights کی صورت میں دستیاب ہے۔ یہ خاندان متن کی تخلیق اور فہم، منطقی اور ریاضیاتی استنتاج، پروگرامنگ، طویل context کی پروسیسنگ، اور ملٹی موڈل توسیعات (تصاویر، ویڈیو، 3D) کے ماڈلز پر مشتمل ہے۔ Hunyuan کو Tencent کی جنریٹو AI کی فلیگ شپ لائن کے طور پر پیش کیا جاتا ہے اور یہ کمپنی کے مصنوعات کے ماحولیاتی نظام (Yuanbao، WeChat، Tencent Meeting، Tencent Cloud) میں ضم ہے۔[1][2][3]

تاریخ اور ترقی کی تسلسلی

Hunyuan کی ترقی LLM کی عالمی دوڑ اور مصنوعی ذہانت کے شعبے میں چینی تکنیکی خودانحصاری کی حکمت عملی کے تناظر میں ہوئی۔ یہ سلسلہ ملکیتی dense ماڈلز سے کھلے Mixture-of-Experts (MoE) اور ہائبرڈ Transformer-Mamba آرکیٹیکچرز کی طرف ارتقاء پذیر ہوا۔[1]

پہلی نسل (2023)

Hunyuan سیریز کا عوامی اعلان 7 ستمبر 2023 کو شینژن میں Tencent Global Digital Ecosystem Summit میں ہوا۔ پہلا ورژن ایک ملکیتی dense ماڈل تھا جس میں 100 ارب سے زائد پیرامیٹرز تھے اور یہ 2 ٹریلین سے زائد tokens پر پری ٹرین کیا گیا تھا۔ ماڈل کا رخ چینی زبان، منطقی استنتاج اور مواد کی تخلیق کی طرف تھا، یہ Tencent کی 50 سے زائد مصنوعات میں ضم کیا گیا اور Tencent Cloud API کے ذریعے دستیاب تھا۔[1]

Hunyuan-Large اور MoE کی طرف منتقلی (2024)

نومبر 2024 میں Tencent نے Hunyuan-Large جاری کی — جو اس وقت کا سب سے بڑا کھلا Transformer-MoE ماڈل تھا جس میں 389 ارب کل اور 52 ارب فعال پیرامیٹرز تھے۔ ماڈل Hugging Face اور GitHub پر کھلے weights کے ساتھ شائع کیا گیا اور arXiv پر ایک preprint کے ساتھ پیش کیا گیا۔ اس ریلیز نے Tencent کا کھلی ترقی کی طرف اسٹریٹجک رخ ظاہر کیا۔[2][4][5]

ہائبرڈ اور reasoning ماڈلز (2025)

2025 میں یہ سلسلہ کئی اہم ریلیزز کے ساتھ وسیع ہوا:

  • Hunyuan-TurboS (فروری 2025) — پہلا صنعتی بڑے پیمانے کا ہائبرڈ Transformer-Mamba-MoE ماڈل جس میں 560 ارب کل اور 56 ارب فعال پیرامیٹرز تھے اور یہ 16 ٹریلین tokens پر پری ٹرین کیا گیا۔ تیز اور گہری سوچ کے درمیان متحرک سوئچنگ کے لیے موافق Chain-of-Thought (CoT) میکانزم متعارف کرایا گیا۔[6]
  • Hunyuan-T1 (مارچ 2025) — ایک خصوصی reasoning ماڈل جو TurboS کے اوپر بنایا گیا اور اس میں وسیع reinforcement learning سے تربیت (پوسٹ ٹریننگ کمپیوٹ کا 96.7% — reinforcement learning) کی گئی۔[7]
  • Hunyuan-A13B (جون 2025) — کارکردگی اور لاگت کے توازن کے لیے ایک مختصر MoE ماڈل (80 ارب کل / 13 ارب فعال پیرامیٹرز) جس میں تیز اور سست سوچ کی حمایت ہے۔[8]
  • چھوٹے dense ماڈلز (جولائی 2025) — edge آلات اور انتہائی مسابقتی تعیناتی منظرناموں کے لیے 0.5B، 1.8B، 4B، 7B کے ورژنز، 256K context کی حمایت کے ساتھ۔[9]

Hunyuan 2.0 (نومبر–دسمبر 2025)

دسمبر 2025 میں تجارتی ماڈل کی دوسری نسل — Hunyuan 2.0 (HY 2.0) کا اعلان کیا گیا جس میں MoE آرکیٹیکچر (406 ارب کل / 32 ارب فعال پیرامیٹرز) اور 256K tokens کی context ونڈو ہے۔ سلسلہ دو ورژنز میں تقسیم کیا گیا: HY 2.0 Think (گہری استدلال، کوڈ) اور HY 2.0 Instruct (مکالمے، تخلیقی تخلیق)۔ ماڈلز Tencent Cloud API کے ذریعے دستیاب ہیں اور Yuanbao اور ima ایپلیکیشنز میں ضم ہیں۔[10][11]

مجموعی تسلسلی

تاریخ واقعہ
ستمبر 2023 ملکیتی LLM (>100B پیرامیٹرز) کے طور پر Hunyuan کا عوامی اعلان؛ Tencent Cloud API کا آغاز
فروری 2024 Yuanbao چیٹ بوٹ کے لیے داخلی MoE ماڈل
اپریل 2024 ری برانڈنگ: «advanced» ← hunyuan-pro، «standard» ← hunyuan-standard؛ hunyuan-lite شامل
مئی 2024 hunyuan-lite کو MoE پر منتقل کیا گیا، 256K context تک توسیع
ستمبر 2024 نیا hunyuan-turbo لانچ (نئی نسل کا MoE)
نومبر 2024 Hunyuan-Large کا کھلا ریلیز (389B/52B MoE)، preprint arXiv:2411.02265
فروری–مارچ 2025 Hunyuan-TurboS (ہائبرڈ Mamba-MoE)؛ Hunyuan-T1 (reasoning)
جون 2025 Hunyuan-A13B (80B/13B، fine-grained MoE)
جولائی 2025 چھوٹے dense ماڈلز 0.5B–7B
ستمبر 2025 Hunyuan-MT (ترجمے کا خصوصی ماڈل)
نومبر–دسمبر 2025 Hunyuan 2.0 (HY 2.0 Think / Instruct)، 406B/32B MoE

ماخذ: Tencent Cloud product dynamics؛ سرکاری ذخیرے۔[12]

نظریاتی بنیادیں اور آرکیٹیکچر

Mixture-of-Experts - ماہرین کا مرکب آرکیٹیکچر

سیریز کے کلیدی ماڈلز (Hunyuan-Large، A13B، HY 2.0) Mixture-of-Experts (MoE) آرکیٹیکچر استعمال کرتے ہیں جس میں transformer کی کچھ تہوں میں متعدد «ماہرین» (ذیلی نیٹ ورکس) ہوتے ہیں، اور ایک راؤٹر (gating network) ہر token کے لیے فعال ماہرین کا ایک ذیلی مجموعہ منتخب کرتا ہے۔ MoE تہہ کا عمومی فارمولا:[2]

Output=i=1NG(x)iEi(x)

جہاں G(x) — راؤٹنگ فنکشن (gating)، Eii-واں ماہر، N — ماہرین کی کل تعداد۔ اس نقطہ نظر سے ماڈل کے پیرامیٹرز کی کل تعداد Ptotal ایک گزر کے دوران فعال پیرامیٹرز Pactive سے کافی زیادہ ہوتی ہے:[2]

PactivePtotal

جو inference پر حسابی اخراجات کے متناسب اضافے کے بغیر ماڈل کی گنجائش بڑھانے کی اجازت دیتا ہے۔

Hunyuan-Large میں 1 مشترک (shared) ماہر اور 16 خصوصی ماہرین کی اسکیم نافذ کی گئی ہے جس میں فی token 1 ماہر کو فعال کیا جاتا ہے (top-1 routing)۔ اضافی اختراعات میں recycle میکانزم (مسترد tokens کی دوبارہ کارروائی) کے ساتھ مخلوط روٹنگ اور ماہروں کے تعاون کے توازن کو بہتر بنانے کے لیے ماہر-مخصوص learning rates شامل ہیں۔[2][5]

Transformer-Mamba - ہائبرڈ آرکیٹیکچر

Hunyuan-TurboS اور T1 ایک ہائبرڈ آرکیٹیکچر متعارف کراتے ہیں جو Transformer (attention) اور Mamba (state-space model) بلاکس کو یکجا کرتا ہے۔ Mamba ترتیب کی لمبائی کے لحاظ سے خطی پیچیدگی فراہم کرتا ہے:[6]

ht=Aht1+Bxt

جہاں A، B — قابل تربیت میٹرکسز، ht — مرحلے t پر پوشیدہ حالت، xt — ان پٹ token۔ یہ لمبائی کے لحاظ سے O(1) memory scaling فراہم کرتا ہے (معیاری Transformer میں O(N) کے مقابلے)۔[6]

TurboS میں 128 تہیں ہیں جو بلاکس میں منظم ہیں: 57 Mamba2 تہیں، 7 Attention تہیں اور 32 ماہرین کے ساتھ 64 FFN-MoE تہیں۔ AMF (Attention → Mamba2 → FFN) اور MF (Mamba2 → FFN) بلاکس عالمی اور مقامی context کے توازن کو یقینی بنانے کے لیے باری باری آتے ہیں۔[6]

توجہ کے میکانزمز اور KV-cache

Hunyuan-Large Grouped Query Attention (GQA) استعمال کرتا ہے — توجہ کا ایک ورژن جس میں متعدد queries مشترک keys اور values استعمال کرتی ہیں — اور KV-cache کے حجم کو کم کرنے کے لیے Cross-Layer Attention (CLA)۔ H سروں، L ترتیب کی لمبائی اور dh سر کے سائز کے ساتھ self-attention تہہ کے لیے معیاری KV-cache حجم:[5]

SKV2HLdh

جہاں SKV — KV-cache کا حجم۔ Hg<H گروپس کے ساتھ GQA پر حجم کم ہو کر:

SKVGQA2HgLdh

CLA مزید تہوں کے درمیان KV-cache کے دوبارہ استعمال کا مفروضہ رکھتا ہے۔ مجموعی طور پر یہ اصلاحات تقریباً 95% تک میموری کی بچت فراہم کرتی ہیں۔[4]

پوزیشنل انکوڈنگ اور طویل context

ماڈلز طویل ترتیبوں کی حمایت کے لیے اسکیلنگ کے ساتھ Rotary Position Embedding (RoPE) استعمال کرتے ہیں۔ context پر تربیت مرحلہ وار (curriculum learning) کی جاتی ہے: 32K سے 256K tokens تک۔ ایکٹیویشن — SwiGLU۔ tokenizer کی لغت — 128K (tiktoken چینی زبان کی توسیع کے ساتھ)۔[2]

تربیت اور پیمانہ کاری

MoE ماڈلز کے لیے تجرباتی طاقت کے تعلقات کی شکل میں scaling laws کی تحقیق کی جاتی ہے:[2]

QabPactiveαcNβ

جہاں Q — معیار کی پیمائش، Pactive — فعال پیرامیٹرز کی تعداد، N — ڈیٹا کا حجم، a,b,c,α,β — تجربات سے منتخب پیرامیٹرز۔ Hunyuan-Large 1.5 ٹریلین tokens کے مصنوعی ڈیٹا کے استعمال پر زور دیتا ہے — MoE پر پچھلی اشاعتوں کے مقابلے میں کئی گنا زیادہ۔[2]

تربیت کا پائپ لائن اور ہم آہنگی

Hunyuan ماڈلز کی تربیت کے عمل میں جدید LLMs کے لیے کئی خصوصی مراحل شامل ہیں:[2][7]

Pre-training - ابتدائی تربیت

ایک بڑے کثیر اللسانی کارپس (چینی، انگریزی اور دیگر زبانیں) پر وسیع پیمانے پر تربیت۔ Hunyuan-Large کو 7 ٹریلین tokens (1.5 ٹریلین مصنوعی سمیت) پر پری ٹرین کیا گیا۔ TurboS — 16 ٹریلین tokens پر۔ datasets کی درست ترکیب ظاہر نہیں کی گئی۔[2][6]

Supervised Fine-Tuning - زیرنگرانی فائن ٹیوننگ

10 لاکھ سے زائد ہدایات (ہدایت-جواب کے جوڑوں) پر fine-tuning جو ماڈل کو صارف کی ہدایات پر عمل کرنے کی طرف لے جاتی ہے۔[2]

تقویتی تعلم کے ذریعے ہم آہنگی

انسانی ترجیحات کے ساتھ ماڈل کے رویے کو ہم آہنگ کرنے کے لیے یہ طریقے استعمال کیے جاتے ہیں:

Direct Preference Optimization (DPO) — واضح انعام ماڈل کے بغیر ہم آہنگی کا طریقہ، جو Hunyuan-Large میں استعمال ہوتا ہے۔[2]

Reinforcement Learning (RL) — Hunyuan-T1 میں curriculum learning کے ساتھ وسیع reinforcement learning استعمال کی جاتی ہے؛ ڈویلپر کے بیان کے مطابق پوسٹ ٹریننگ کمپیوٹ کا 96.7% RL پر خرچ ہوتا ہے۔[7]

Adaptive Long-Short Chain-of-Thought — TurboS میں تیز اور گہری سوچ کے درمیان متحرک سوئچنگ کا میکانزم نافذ کیا گیا جو ماڈل کو کام کی پیچیدگی کے مطابق استدلال کی گہرائی کو ڈھالنے کی اجازت دیتا ہے۔[6]

ماڈلز کے خاندان کی ترکیب

یہ خاندان بند تجارتی API ماڈلز اور کھلے weights والے ماڈلز میں تقسیم ہے۔[3]

بنیادی ماڈلز (جائزہ)

ماڈل ریلیز کی تاریخ آرکیٹیکچر پیرامیٹرز (کل / فعال) Context دستیابی
Hunyuan (2023) ستمبر 2023 Dense Transformer >100 ارب / — ظاہر نہیں ملکیتی API
Hunyuan-Large نومبر 2024 Transformer-MoE 389 ارب / 52 ارب 256K (pretrain)، 128K (instruct) کھلے weights (GitHub، HF)
Hunyuan-TurboS فروری 2025 Hybrid Transformer-Mamba-MoE 560 ارب / 56 ارب 256K (آرکیٹ.)، 32K/16K (API) ملکیتی API + کھلے ورژنز
Hunyuan-T1 مارچ 2025 TurboS کی بنیاد پر + وسیع RL 32K/64K (API) ملکیتی API
Hunyuan-A13B جون 2025 Fine-grained MoE 80 ارب / 13 ارب 256K (کھلا)، 224K/32K (API) کھلے weights + API
چھوٹے (0.5–7B) جولائی 2025 Dense 0.5–7 ارب 256K کھلے weights
HY 2.0 Think نومبر 2025 MoE 406 ارب / 32 ارب 128K ان پٹ / 64K آؤٹ پٹ (API) ملکیتی API
HY 2.0 Instruct نومبر 2025 MoE 406 ارب / 32 ارب 128K ان پٹ / 16K آؤٹ پٹ (API) ملکیتی API

ماخذ: arXiv:2411.02265؛ arXiv:2505.15431؛ Tencent Cloud docs؛ GitHub۔[2][6][3][10]

نوٹ۔ کچھ ماڈلز کے لیے آرکیٹیکچرل context حدود (تکنیکی رپورٹس سے) اور سروس API حدود (product docs سے) مختلف ہیں۔ یہ تضاد نہیں ہے بلکہ تحقیقی اور پروڈکٹ کنفیگریشنز کے درمیان فرق کو ظاہر کرتا ہے۔[6][3]

خصوصی ماڈلز

Hunyuan-MT (ستمبر 2025) — مشین ترجمے کا خصوصی ماڈل جس نے WMT25 پر 31 میں سے 30 زمروں میں پہلا مقام حاصل کیا۔[13]

HunyuanImage، HunyuanVideo، Hunyuan3D — خاندان کے ملٹی موڈل ماڈلز بالترتیب تصاویر، ویڈیو اور 3D اشیاء کی تخلیق کے لیے۔[14]

پوزیشننگ اور ارتقائی روابط

Tencent Cloud کی دستاویزات میں درج ذیل ارتقائی روابط نظر آتے ہیں:

  • hunyuan-a13b کو hunyuan-standard-256K کی اپگریڈ کے طور پر ظاہر کیا گیا ہے۔
  • hunyuan-t1 کو TurboS کے اوپر مضبوط RL پوسٹ ٹریننگ کے ساتھ بنایا گیا ہے۔
  • HY 2.0 Think/Instruct — وہ شاخ جس میں بیس کو TurboS سے Hunyuan 2.0 تک اپ ڈیٹ کیا گیا۔
  • کھلی شاخ (Hunyuan-Large، A13B، compact dense) بند API شاخ کے متوازی ترقی پاتی ہے، جو تحقیقی رسائی فراہم کرتی ہے۔[3]

کلیدی نسلوں میں نئی خصوصیات

Hunyuan-Large (2024)

پہلی نسل اور پچھلے MoE نقطہ نظر کے مقابلے میں، Hunyuan-Large متعارف کراتا ہے:[2][4]

  • 389 ارب پیرامیٹرز کا پیمانہ (52 ارب فعال) — اشاعت کے وقت سب سے بڑا کھلا Transformer-MoE ماڈل۔
  • 256K context کی حمایت (pretrain) اور 128K (instruct) — 2024 کے بڑے LLMs کی عام اقدار سے نمایاں طور پر زیادہ۔
  • GQA + CLA پر مبنی KV-cache compression (میموری کی بچت ~95%)۔
  • بڑے پیمانے پر مصنوعی ڈیٹا (1.5 ٹریلین tokens مصنوعی ڈیٹا)۔
  • ماہرین کی مخلوط روٹنگ اور ماہر-مخصوص learning rates۔

Hunyuan-TurboS (2025)

اہم آرکیٹیکچرل تبدیلی:[6]

  • Mamba2 + Attention + MoE کا ہائبرڈ: 560B کل / 56B فعال، 128 تہیں۔
  • 16 ٹریلین tokens پر پری ٹریننگ۔
  • استدلال کی گہرائی کے متحرک انتظام کے لیے Adaptive Long-Short Chain-of-Thought۔
  • پچھلے Turbo ورژن کے مقابلے ڈیکوڈنگ میں 1.8–2 گنا تیزی کا دعوی۔

Hunyuan-T1 (2025)

TurboS پر مبنی Reasoning ماڈل:[7]

  • پوسٹ ٹریننگ compute کا 96.7% — reinforcement learning۔
  • موازنہ deployment envelope کے ساتھ ڈیکوڈنگ میں دو گنا تیزی۔
  • استدلال کی حکمت عملیوں کو بہتر بنانے کے لیے Curriculum learning۔

HY 2.0 (2025)

تجارتی فلیگ شپ کی تازہ کاری:[10][11]

  • MoE آرکیٹیکچر: 406B کل / 32B فعال پیرامیٹرز۔
  • 256K tokens کی context ونڈو۔
  • خصوصی benchmarks پر نمایاں بہتری: IMO-AnswerBench 73.4% (HY کے پچھلے ورژن سے +20%)، SWE-bench Verified 53.0 (6.0 سے)، τ²-Bench 72.4 (17.1 سے)۔
  • RLHF اور پوسٹ ٹریننگ حکمت عملیوں میں بہتری۔

تشخیص اور Benchmarks

تشخیص zero-shot اور few-shot پروٹوکولز کے ساتھ معیاری benchmarks پر کی گئی۔ نتائج سرکاری تکنیکی رپورٹس اور ذخیروں پر مبنی ہیں؛ کچھ ماڈلز کے لیے آزاد بیرونی تصدیق ابھی محدود ہے۔[2]

Hunyuan-Large (pretrain) کے Benchmarks

Benchmark Hunyuan-Large Llama 3.1-405B Llama 3.1-70B Mixtral-8x22B DeepSeek-V2
MMLU 88.4 85.2 79.3 77.8 78.5
CMMLU 90.2 84.0
C-Eval 91.9 81.7
GSM8K 92.8 89.0 83.7 83.7 79.2
MATH 69.8 53.8 41.4 42.5 43.6
HumanEval 71.4 61.0 58.5 53.1 48.8

ماخذ: arXiv:2411.02265۔[2]

تکنیکی رپورٹ کے مطابق، Hunyuan-Large (pretrain) Llama 3.1-405B، Mixtral-8x22B اور DeepSeek-V2 کے ساتھ موازنے میں 19 میں سے 15 benchmarks میں آگے ہے۔[2]

Hunyuan-Large-Instruct کے Benchmarks

Benchmark Hunyuan-Large-Instruct
MMLU 89.9
MATH 77.4
HumanEval 90.0
Arena-Hard 81.8

ماخذ: arXiv:2411.02265؛ Hugging Face model card۔[2][5]

ڈویلپرز کے بیان کے مطابق، Hunyuan-Large-Instruct MMLU پر LLaMA 3.1-405B سے 2.6 فیصد پوائنٹس آگے ہے۔[4]

TurboS اور T1 کے Benchmarks

Benchmark TurboS T1
LMSYS Chatbot Arena 1356 (ٹاپ 7)
23 benchmarks کا اوسط 77.9%
MMLU-Pro 87.2
GPQA-Diamond 69.3
MATH-500 96.2
LiveCodeBench 64.9
Arena-Hard 91.9

ماخذ: arXiv:2505.15431؛ T1 official page۔[6][7]

Hunyuan-A13B کے Benchmarks

Benchmark Hunyuan-A13B Hunyuan-Large Qwen2.5-72B
MMLU 88.17 88.4
MMLU-Pro 67.23 60.2
BBH 87.56 86.3
MATH 72.35 69.8
GPQA 49.12
MBPP 83.86

ماخذ: GitHub Hunyuan-A13B README۔[8]

A13B پوسٹ ٹریننگ سے حساس کاموں (MMLU-Pro، MATH، MBPP) میں Hunyuan-Large سے آگے ہے، جو اس کی پوزیشننگ بطور زیادہ جدید اور عملی ورژن کے ساتھ مطابقت رکھتا ہے۔[8]

کمپیکٹ Dense شاخ کے Benchmarks

ماڈل MMLU MMLU-Pro BBH GSM8K MATH
Hunyuan-0.5B 54.02 31.15 45.92 55.64 42.95
Hunyuan-1.8B 64.62 38.65 74.32 77.26 62.85
Hunyuan-4B 74.01 51.91 75.17 87.49 72.25
Hunyuan-7B 79.82 57.79 82.95 88.25 74.85

ماخذ: GitHub Hunyuan-7B README۔[9]

HY 2.0 کے Benchmarks

اعداد و شمار ڈویلپر کی طرف سے بیان کیے گئے ہیں (واحد صریح ماخذ Hunyuan کا سرکاری اکاؤنٹ ہے):[11]

Benchmark HY 2.0 HY کا پچھلا ورژن
IMO-AnswerBench 73.4 ~53 (تخمینہ، +20%)
SWE-bench Verified 53.0 6.0
τ²-Bench 72.4 17.1

نوٹ۔ یہ اعداد و شمار «ڈویلپر کے بیان کردہ، وسیع بیرونی تصدیق کے منتظر» کے طور پر درجہ بند کیے گئے ہیں۔[11]

استعمال کی تکنیکی تفصیلات

شاخوں کے مطابق Context ونڈو

ماڈل ان پٹ (tokens) آؤٹ پٹ (tokens)
HY 2.0 Think 128K 64K
HY 2.0 Instruct 128K 16K
T1 (API) 32K 64K
A13B (API) 224K 32K
TurboS (API) 32K 16K
Lite (API) 250K 6K
Hunyuan-Large (کھلا) 256K (pretrain) / 128K (instruct)
Compact 0.5–7B 256K

ماخذ: Tencent Cloud product overview۔[3]

حمایت یافتہ ٹولز

Tencent Cloud API میں دستاویز شدہ:[15]

  • Function Calling (tools، tool_choice
  • AI Search Enhancement — بیرونی ذرائع کے ذریعے بلٹ ان تلاش (retrieval-augmented generation)۔
  • SearchInfo اور Citation — جوابات میں حوالہ جاتی نشانات۔
  • EnableMultimedia — آؤٹ پٹ میں ملٹی میڈیا متبادلات۔
  • EnableThinking — A13B کے لیے chain-of-thought سوئچ۔
  • EnableRecommendedQuestions — تجویز کردہ سوالات کی تخلیق۔

API مطابقت

Hunyuan API OpenAI مطابق فارمیٹ کی حمایت کرتا ہے:[16]

  • Base URL: https://api.hunyuan.cloud.tencent.com/v1۔
  • /v1/chat/completions اور /v1/embeddings کی حمایت۔
  • Embedding model: hunyuan-embedding، طول 1024۔
  • SSE کے ذریعے Streaming۔
  • ڈیفالٹ Concurrency: فی اکاؤنٹ 5۔

Hunyuan-Large (کھلے) کے لیے معیاری ان پٹ/آؤٹ پٹ فارمیٹ PyTorch/Transformers فریم ورکس کے مطابق ہے۔ کوانٹائزیشن کی حمایت: FP8، INT4 (GPTQ/AWQ)۔[5]

اطلاق اور انضمام

Hunyuan ماڈلز Tencent کے ماحولیاتی نظام میں ضم ہیں اور بیرونی ڈویلپرز کے لیے دستیاب ہیں۔ بنیادی دستاویز شدہ منظرنامے:[1][17]

Tencent مصنوعات

  • Yuanbao — Hunyuan اور DeepSeek کی حمایت کے ساتھ چیٹ بوٹ۔
  • Tencent Meeting — اجلاسوں کے خلاصے کی تخلیق۔
  • Tencent Docs — متن کی تخلیق اور تجزیہ۔
  • ima — مالیاتی اور ملٹی میڈیا AI اسسٹنٹ۔

کاروباری اطلاق

  • متنی تخلیق: مضامین، اشتہاری متون، اسکرپٹس، مصنوعات کی تفصیلات۔
  • ذہین گاہک سپورٹ: چیٹ بوٹس، FAQ، جوابات کی خودکاری۔
  • کوڈ کی تخلیق اور تجزیہ (خاص طور پر HY 2.0 Think اور T1)۔
  • ریاضیاتی اور منطقی استدلال، تجزیاتی کام۔
  • کثیر اللسانی ترجمہ (30+ زبانیں، Hunyuan-MT)۔

کھلے ماڈلز

کھلے ورژنز تحقیق، fine-tuning اور edge آلات پر تعیناتی (چھوٹے dense ماڈلز) کے لیے استعمال ہوتے ہیں۔ ملٹی موڈل توسیعات (HunyuanImage، HunyuanVideo، Hunyuan3D) 3D ماڈلنگ اور ویڈیو تخلیق کے لیے استعمال ہوتی ہیں۔[14]

حدود اور کھلے مسائل

  • تجارتی ماڈلز کی بندش۔ HY 2.0 اور T1 کے لیے کھلے weights اور تفصیلی آرکیٹیکچرل وضاحتیں موجود نہیں؛ رسائی API تک محدود ہے جو آزاد تولیدی صلاحیت کو مشکل بناتی ہے۔[3]
  • تربیتی ڈیٹا کی عدم شفافیت۔ اگرچہ بڑے پیمانے پر مصنوعی ڈیٹا کے استعمال پر زور دیا جاتا ہے، datasets کی درست ترکیب، زبانوں کا تناسب اور ڈومین کے شعبوں کا انکشاف نہیں کیا گیا۔[2]
  • حسابی تقاضے۔ کھلے ماڈلز کے لیے نمایاں وسائل درکار ہیں: Hunyuan-Large کی مکمل fine-tuning کے لیے کم از کم 32 GPUs؛ FP8 کے ساتھ بھی درجنوں GB VRAM۔[5]
  • ہیلوسینیشنز۔ دیگر LLMs کی طرح، ماڈلز قابل قبول لیکن حقیقتاً غلط بیانات پیدا کر سکتے ہیں۔ Hunyuan کے لیے کھلے نظرثانی شدہ کاموں میں اس پہلو کی منظم تحقیق ابھی محدود ہے۔[18]
  • آرکیٹیکچرل اور سروس حدود کے درمیان فرق۔ کچھ ماڈلز (TurboS، A13B) کے لیے API کی سروس حدود آرکیٹیکچرل صلاحیتوں سے نمایاں طور پر کم ہیں۔[6][3]
  • علاقائی دستیابی۔ چینی بازار پر بنیادی توجہ؛ چین سے باہر صارفین کے لیے API پر زبانی اور قانونی پابندیاں ہیں۔[17]
  • تفصیلی حفاظتی رپورٹس کا فقدان۔ دستاویزات میں حفاظت اور مواد کی فلٹرنگ کے عمومی اصول بیان کیے گئے ہیں، لیکن کچھ بین الاقوامی ماڈلز کے مقابلے میں حجم میں برابر کوئی عوامی تکنیکی حفاظتی رپورٹیں نہیں ہیں۔[15]
  • open-source شاخ کی مطابقت۔ ریلیزز کے بعد transformers / vllm کے ساتھ انضمام کے مسائل ریکارڈ کیے گئے جہاں لائبریریاں hunyuan_v1_dense آرکیٹیکچر کی قسم کو نہیں پہچانتی تھیں اور trust_remote_code یا خصوصی شاخوں کی ضرورت تھی۔[19]

واقعات اور معروف مسائل

دستیاب مواد کے مطابق (2025 کے آخر — 2026 کے اوائل) Hunyuan سے خاص طور پر منسلک کوئی بڑے عوامی واقعات (بڑے ڈیٹا لیک، منفرد حفاظتی خطرات) درج نہیں ہیں۔[17]

دستاویز شدہ پروڈکٹ اصلاحات

Tencent Cloud کے product dynamics میں مائیکرو اصلاحات درج ہیں:[12]

  • 2024-11-20: hunyuan-turbo-latest کو خصوصی حروف کی وجہ سے تکرار ٹھیک کرنے، Markdown آؤٹ پٹ کی استحکام بڑھانے اور بلا وجہ انکار کم کرنے کے لیے اپ ڈیٹ کیا گیا۔
  • 2025-04-03: سادہ/روایتی چینی کی آمیزش اور چینی/انگریزی کی آمیزش کی اصلاحات کے ساتھ T1 کا اپ ڈیٹ، اور پروجیکٹ سطح پر کوڈ تخلیق میں بہتری۔
  • 2025-04-20: Search Enhancement کو default-on سے default-off میں منتقل کیا گیا — عملاً انضمامات کے لیے ایک API رویہ تبدیلی۔

MoE حفاظتی تحقیقات

تحقیقی تنقید کی سطح پر (preprint سطح) Hunyuan-A13B MoE ماڈلز میں حفاظتی لوکلائزیشن پر حملوں کے بارے میں کاموں میں زیر بحث آیا ہے۔ خاص طور پر Large Language Lobotomy اور GateBreaker کاموں میں حفاظتی ماہرین کی «خاموشی» کے دوران اعلی attack success rate کی اطلاع دی گئی ہے۔ یہ کوئی پروڈکشن واقعے کی تصدیق نہیں ہے، لیکن یہ ظاہر کرتا ہے کہ MoE روٹنگ کی حفاظت ایک کمزور تحقیقی ویکٹر کے طور پر دیکھی جاتی ہے۔[20][21]

اخلاقی اور ریگولیٹری پہلو

Hunyuan چین کے قانونی اور ریگولیٹری تناظر میں کام کرتا ہے، جس میں جنریٹو AI کے انتظام (CAC) اور مواد کی فلٹرنگ کے قومی قوانین، اور ڈیٹا سیکیورٹی کے بارے میں Tencent کی اندرونی پالیسیاں شامل ہیں۔ Tencent Cloud کی دستاویزات اس بات پر زور دیتی ہیں کہ Hunyuan API کا استعمال متعلقہ قوانین اور پلیٹ فارم کی پالیسی کے مطابق ہونا چاہیے۔[1]

مخصوص اقدامات میں شامل ہیں:

  • ممکنہ FinishReason=sensitive کے ساتھ اسٹریمنگ آؤٹ پٹ کے ساتھ بلٹ ان مواد کی نگرانی۔
  • ہیلوسینیشن اور ناپسندیدہ رویے کو کم کرنے کے لیے RLHF/DPO کے ذریعے ہم آہنگی۔
  • تعصب (bias) کو کم کرنے کے لیے تربیتی ڈیٹا کی فلٹرنگ۔
  • کھلے ماڈلز کے لیے کھلے لائسنس (Tencent Hunyuan Community License Agreement)، اس نوٹ کے ساتھ کہ کچھ ورژنز کے لیے یہ معاہدہ EU میں لاگو نہیں ہوتا۔[8][15]

Hunyuan کے لیے تعصب اور انصاف کے بارے میں آزاد خصوصی رپورٹیں ابھی کم ہیں؛ کھلے weights اور آزاد ٹیسٹس کے پھیلاؤ کے ساتھ تحقیق متوقع ہے۔[2]

برادری کا ردعمل

بند شاخ کے لیے سب سے زیادہ معنی خیز بیرونی اشارہ LMSYS Chatbot Arena پر TurboS کا نتیجہ ہے (1356، عالمی سطح پر ٹاپ 7)۔ کھلی شاخ کے لیے بالواسطہ اشارہ GitHub سرگرمی ہے: Hunyuan-Large کے تقریباً 1.6 ہزار stars، A13B کے 812، Hunyuan-MT کے 683۔ یہ open LLM ماحولیاتی نظام کے معیار کے مطابق قابل ذکر لیکن غالب نہیں ایک مشغولیت کی سطح کی عکاسی کرتا ہے۔ برادری کے ساپیکش جائزے (Hugging Face، Reddit) چینی زبان اور agent کاموں میں مضبوط پہلوؤں کو نوٹ کرتے ہیں۔[22]

مستقبل کے نقطہ نظر اور تحقیق کی سمتیں

عوامی مواد میں بیان کردہ مزید ترقی کی سمتیں:[2][6][14]

  • آرکیٹیکچرز کی مزید ہائبرڈائزیشن (Mamba + Transformer + MoE) اور MoE کے لیے scaling laws کی تحقیق۔
  • ملٹی موڈل صلاحیتوں کا توسیع: Hunyuan3D، HunyuanVideo اور HunyuanImage کا لسانی ماڈلز کے ساتھ انضمام۔
  • ٹول استعمال (tool use) اور ایجنٹ صلاحیتوں میں بہتری۔
  • inference اخراجات میں کمی: کوانٹائزیشن (edge کے لیے 2-bit)، TRT-LLM/vLLM کے ذریعے اصلاح۔
  • کھلے ماڈلز کے پورٹ فولیو کا توسیع۔
  • تفصیلی حفاظتی اور ہم آہنگی رپورٹس کی تیاری اور اشاعت۔

مزید دیکھیں

  • LLaMA (Meta)
  • DeepSeek

ادبیات

روابط

حواشی

  1. 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
  4. 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
  5. 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
  7. 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
  8. 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
  9. 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
  10. 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
  11. 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
  12. 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
  13. Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
  14. 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
  15. 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
  16. Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
  17. 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
  18. LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
  19. GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
  20. Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
  21. Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
  22. Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS