Hunyuan (Tencent) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Hunyuan (кит. 腾讯混元大模型, Tencent Hunyuan, Tencent HY) — семейство фундаментални модели (Foundation Models) и големи езикови модели (Large Language Model, LLM), разработени от звеното Tencent Hunyuan Foundation Model Team и достъпни чрез облачната услуга Tencent Cloud, както и под формата на отворени тегла на платформите Hugging Face и GitHub. Семейството обхваща модели за генериране и разбиране на текст, логически и математически извод, програмиране, обработка на дълги контексти, както и мултимодални разширения (изображения, видео, 3D). Hunyuan се позиционира като флагманска линия на генеративния ИИ на Tencent и е интегрирана в екосистемата от продукти на компанията (Yuanbao, WeChat, Tencent Meeting, Tencent Cloud).[1][2][3]

История и хронология на развитието

Разработката на Hunyuan се осъществяваше в контекста на глобалното надпреварване в областта на LLM и китайската стратегия за технологична независимост в областта на изкуствения интелект. Линията еволюира от проприетарни dense-модели към отворени Mixture-of-Experts (MoE) и хибридни Transformer-Mamba архитектури.[1]

Първо поколение (2023)

Публичното обявяване на серията Hunyuan се състоя на 7 септември 2023 г. на Tencent Global Digital Ecosystem Summit в Шенжен. Първата версия представляваше проприетарен dense-модел с повече от 100 млрд. параметъра, предварително обучен на повече от 2 трлн. токена. Моделът беше насочен към китайски език, логически извод и генериране на съдържание, интегриран в повече от 50 продукта на Tencent и достъпен чрез API на Tencent Cloud.[1]

Hunyuan-Large и преходът към MoE (2024)

През ноември 2024 г. Tencent пусна Hunyuan-Large — най-големият по онова време отворен Transformer-MoE-модел с 389 млрд. общи и 52 млрд. активни параметъра. Моделът беше публикуван с отворени тегла на Hugging Face и GitHub, придружен от препринт на arXiv. Пускането бележи стратегически завой на Tencent към отворена разработка.[2][4][5]

Хибридни и reasoning-модели (2025)

През 2025 г. линията се разшири с няколко ключови издания:

  • Hunyuan-TurboS (февруари 2025) — първият промишлен мащабен хибриден модел Transformer-Mamba-MoE с 560 млрд. общи и 56 млрд. активни параметъра, предварително обучен на 16 трлн. токена. Въведен е механизъм на адаптивен Chain-of-Thought (CoT) за динамично превключване между бързо и дълбоко мислене.[6]
  • Hunyuan-T1 (март 2025) — специализиран reasoning-модел, изграден върху TurboS с мащабно обучение с подкрепление (96,7 % от изчисленията след предобучението са reinforcement learning).[7]
  • Hunyuan-A13B (юни 2025) — компактен MoE-модел (80 млрд. общи / 13 млрд. активни параметъра) за баланс между производителност и разходи, с поддръжка на бързо и бавно мислене.[8]
  • Малки dense-модели (юли 2025) — варианти 0,5B, 1,8B, 4B, 7B за edge-устройства и силно конкурентни сценарии на разгръщане, с поддръжка на 256K контекст.[9]

Hunyuan 2.0 (ноември–декември 2025)

През декември 2025 г. беше обявено второто поколение на търговския модел — Hunyuan 2.0 (HY 2.0) с архитектура MoE (406 млрд. общи / 32 млрд. активни параметъра) и контекстен прозорец от 256K токена. Линията е разделена на два варианта: HY 2.0 Think (дълбоко разсъждение, код) и HY 2.0 Instruct (диалози, творческа генерация). Моделите са достъпни чрез Tencent Cloud API и интегрирани в приложенията Yuanbao и ima.[10][11]

Обобщена хронология

Дата Събитие
Септември 2023 Публично обявяване на Hunyuan като проприетарен LLM (>100B параметъра); стартиране на API на Tencent Cloud
Февруари 2024 Вътрешен MoE-модел за чатбота Yuanbao
Април 2024 Ребрандинг: «advanced» → hunyuan-pro, «standard» → hunyuan-standard; добавен hunyuan-lite
Май 2024 hunyuan-lite преведен към MoE, разширен до 256K контекст
Септември 2024 Стартиране на нов hunyuan-turbo (MoE от ново поколение)
Ноември 2024 Отворено издание на Hunyuan-Large (389B/52B MoE), препринт arXiv:2411.02265
Февруари–март 2025 Hunyuan-TurboS (хибриден Mamba-MoE); Hunyuan-T1 (reasoning)
Юни 2025 Hunyuan-A13B (80B/13B, fine-grained MoE)
Юли 2025 Малки dense-модели 0,5B–7B
Септември 2025 Hunyuan-MT (специализиран модел за превод)
Ноември–декември 2025 Hunyuan 2.0 (HY 2.0 Think / Instruct), 406B/32B MoE

Източник: Tencent Cloud product dynamics; официални хранилища.[12]

Теоретични основи и архитектура

Архитектура Mixture-of-Experts

Ключовите модели от серията (Hunyuan-Large, A13B, HY 2.0) използват архитектурата Mixture-of-Experts (MoE), при която част от слоевете на трансформера съдържа множество „експерти" (подмрежи), а маршрутизаторът (gating network) избира подмножество от активни експерти за всеки токен. Общата формула на MoE-слоя:[2]

Output=i=1NG(x)iEi(x)

където G(x) — функция на маршрутизация (gating), Eii-ият експерт, N — общият брой експерти. При такъв подход общият брой параметри на модела Ptotal значително надвишава броя на активните при един проход параметри Pactive:[2]

PactivePtotal

което позволява да се увеличава капацитетът на модела без пропорционален ръст на изчислителните разходи при инференс.

В Hunyuan-Large е реализирана схема с 1 общ (shared) експерт и 16 специализирани експерта при активиране на 1 специалист на токен (top-1 routing). Допълнителните иновации включват смесено маршрутизиране с recycle-механизъм (преработка на отхвърлените токени) и специфични за експертите learning rates за подобряване на баланса в приноса на експертите.[2][5]

Хибридна архитектура Transformer-Mamba

Hunyuan-TurboS и T1 въвеждат хибридна архитектура, обединяваща блокове Transformer (attention) и Mamba (state-space model). Mamba осигурява линейна сложност по дължина на последователността:[6]

ht=Aht1+Bxt

където A, B — обучаеми матрици, ht — скритото състояние на стъпка t, xt — входният токен. Това осигурява O(1) memory scaling по дължина (срещу O(N) в стандартния Transformer).[6]

TurboS съдържа 128 слоя, организирани в блокове: 57 слоя Mamba2, 7 слоя Attention и 64 слоя FFN-MoE с 32 експерта. Блоковете AMF (Attention → Mamba2 → FFN) и MF (Mamba2 → FFN) се редуват за осигуряване на баланс между глобален и локален контекст.[6]

Механизми на внимание и KV-кеш

Hunyuan-Large използва Grouped Query Attention (GQA) — вариант на внимание, при който множество заявки споделят общи ключове и стойности, — и Cross-Layer Attention (CLA) за намаляване на обема на KV-кеша. Стандартният обем на KV-кеша за слой self-attention с H глави, дължина на последователността L и размер на главата dh:[5]

SKV2HLdh

където SKV — обемът на KV-кеша. При GQA с Hg<H групи обемът се намалява до:

SKVGQA2HgLdh

CLA допълнително предполага повторно използване на KV-кеша между слоевете. В съвкупност тези оптимизации осигуряват икономия на памет до приблизително 95 %.[4]

Позиционно кодиране и дълъг контекст

Моделите използват Rotary Position Embedding (RoPE) с мащабиране за поддръжка на дълги последователности. Обучението на контекст се провежда поетапно (curriculum learning): от 32K до 256K токена. Активацията е SwiGLU. Речникът на токенизатора е 128K (tiktoken с разширение за китайски език).[2]

Обучение и мащабиране

За MoE-моделите се изследват scaling laws под формата на емпирични степенни зависимости:[2]

QabPactiveαcNβ

където Q — метрика за качество, Pactive — брой активни параметри, N — обем на данните, a,b,c,α,β — параметри, подбирани експериментално. Hunyuan-Large подчертава използването на синтетични данни в обем от 1,5 трлн. токена — с порядки повече от предишните публикации за MoE.[2]

Конвейер на обучение и изравняване

Процесът на обучение на моделите Hunyuan включва няколко етапа, характерни за съвременните LLM:[2][7]

Предварително обучение (Pre-training)

Мащабно обучение на голям многоезичен корпус (китайски, английски и други езици). Hunyuan-Large е предварително обучен на 7 трлн. токена (включително 1,5 трлн. синтетични). TurboS — на 16 трлн. токена. Точният състав на dataset-ите не е разкрит.[2][6]

Контролирано дообучение (Supervised Fine-Tuning, SFT)

Дообучение на повече от 1 млн. инструкции (двойки „инструкция — отговор"), приближаващо модела към следване на инструкциите на потребителя.[2]

Изравняване с помощта на обучение с подкрепление

За изравняване на поведението на модела с предпочитанията на човека се прилагат:

Direct Preference Optimization (DPO) — метод на изравняване без явен модел на възнаграждение, използван в Hunyuan-Large.[2]

Reinforcement Learning (RL) — в Hunyuan-T1 се прилага мащабно обучение с подкрепление с curriculum learning; по заявление на разработчика, 96,7 % от изчисленията след предобучението се падат на RL.[7]

Adaptive Long-Short Chain-of-Thought — в TurboS е реализиран механизъм за динамично превключване между бързо и дълбоко мислене, позволяващ на модела да адаптира дълбочината на разсъждение към сложността на задачата.[6]

Състав на семейството от модели

Семейството е разделено на затворени облачни API-модели и отворени модели с тегла.[3]

Основни модели (преглед)

Модел Дата на издаване Архитектура Параметри (общо / активни) Контекст Достъпност
Hunyuan (2023) Септември 2023 Dense Transformer >100 млрд. / — не е разкрит Проприетарен API
Hunyuan-Large Ноември 2024 Transformer-MoE 389 млрд. / 52 млрд. 256K (pretrain), 128K (instruct) Отворени тегла (GitHub, HF)
Hunyuan-TurboS Февруари 2025 Hybrid Transformer-Mamba-MoE 560 млрд. / 56 млрд. 256K (архит.), 32K/16K (API) Проприетарен API + откр. варианти
Hunyuan-T1 Март 2025 На база TurboS + мащабен RL 32K/64K (API) Проприетарен API
Hunyuan-A13B Юни 2025 Fine-grained MoE 80 млрд. / 13 млрд. 256K (откр.), 224K/32K (API) Отворени тегла + API
Малки (0,5–7B) Юли 2025 Dense 0,5–7 млрд. 256K Отворени тегла
HY 2.0 Think Ноември 2025 MoE 406 млрд. / 32 млрд. 128K вход / 64K изход (API) Проприетарен API
HY 2.0 Instruct Ноември 2025 MoE 406 млрд. / 32 млрд. 128K вход / 16K изход (API) Проприетарен API

Източници: arXiv:2411.02265; arXiv:2505.15431; Tencent Cloud docs; GitHub.[2][6][3][10]

Забележка. За редица модели архитектурните лимити на контекста (от техническите доклади) и сервисните лимити на API (от product docs) се различават. Това не е противоречие, а отразява разликите между изследователската и продуктовата конфигурация.[6][3]

Специализирани модели

Hunyuan-MT (септември 2025) — специализиран модел за машинен превод, заел 1-во място на WMT25 в 30 от 31 категории.[13]

HunyuanImage, HunyuanVideo, Hunyuan3D — мултимодални модели от семейството за генериране на изображения, видео и 3D-обекти съответно.[14]

Позициониране и еволюционни връзки

В документацията на Tencent Cloud се проследяват следните еволюционни връзки:

  • hunyuan-a13b е посочен като надграждане на hunyuan-standard-256K.
  • hunyuan-t1 е изграден върху TurboS с усилено RL-пост-обучение.
  • HY 2.0 Think/Instruct — клон, в който базата е актуализирана от TurboS до Hunyuan 2.0.
  • Отвореният клон (Hunyuan-Large, A13B, compact dense) се развива паралелно на затворения API-клон, осигурявайки изследователски достъп.[3]

Какво е новото в ключовите поколения

Hunyuan-Large (2024)

В сравнение с първото поколение и предишните MoE-подходи, Hunyuan-Large въвежда:[2][4]

  • Мащаб от 389 млрд. параметъра (52 млрд. активни) — най-големият отворен Transformer-MoE-модел към момента на публикуването.
  • Поддръжка на 256K контекст (pretrain) и 128K (instruct) — значително надвишаване на типичните стойности за масовите LLM от 2024 г.
  • KV-cache compression на основата на GQA + CLA (икономия на памет ~95 %).
  • Мащабни синтетични данни (1,5 трлн. токена синтетични данни).
  • Смесено маршрутизиране на експертите и специфични за експертите learning rates.

Hunyuan-TurboS (2025)

Ключова архитектурна промяна:[6]

  • Хибрид Mamba2 + Attention + MoE: 560B total / 56B active, 128 слоя.
  • Предварително обучение на 16 трлн. токена.
  • Adaptive Long-Short Chain-of-Thought за динамично управление на дълбочината на разсъждение.
  • Заявено ускорение на декодирането с 1,8–2 пъти в сравнение с предишната Turbo-версия.

Hunyuan-T1 (2025)

Reasoning-модел на база TurboS:[7]

  • 96,7 % от изчисленията след предобучението — reinforcement learning.
  • Двукратно ускорение на декодирането при сравним deployment envelope.
  • Curriculum learning за подобряване на стратегиите за разсъждение.

HY 2.0 (2025)

Актуализация на търговския флагман:[10][11]

  • Архитектура MoE: 406B общи / 32B активни параметъра.
  • Контекстен прозорец от 256K токена.
  • Значителен ръст на специализираните benchmark-и: IMO-AnswerBench 73,4 % (+20 % спрямо предишната версия HY), SWE-bench Verified 53,0 (от 6,0), τ²-Bench 72,4 (от 17,1).
  • Подобрения в RLHF и стратегиите за пост-обучение.

Оценка и benchmark-и

Оценката се провеждаше на стандартни benchmark-и с използване на zero-shot и few-shot протоколи. Резултатите се основават на официални технически доклади и хранилища; за редица модели независимите външни верификации засега са ограничени.[2]

Benchmark-и на Hunyuan-Large (pretrain)

Benchmark Hunyuan-Large Llama 3.1-405B Llama 3.1-70B Mixtral-8x22B DeepSeek-V2
MMLU 88,4 85,2 79,3 77,8 78,5
CMMLU 90,2 84,0
C-Eval 91,9 81,7
GSM8K 92,8 89,0 83,7 83,7 79,2
MATH 69,8 53,8 41,4 42,5 43,6
HumanEval 71,4 61,0 58,5 53,1 48,8

Източник: arXiv:2411.02265.[2]

Според техническия доклад, Hunyuan-Large (pretrain) води в 15 от 19 benchmark-а при сравнение с Llama 3.1-405B, Mixtral-8x22B и DeepSeek-V2.[2]

Benchmark-и на Hunyuan-Large-Instruct

Benchmark Hunyuan-Large-Instruct
MMLU 89,9
MATH 77,4
HumanEval 90,0
Arena-Hard 81,8

Източник: arXiv:2411.02265; Hugging Face model card.[2][5]

Според разработчиците, Hunyuan-Large-Instruct превъзхожда LLaMA 3.1-405B на MMLU с 2,6 процентни пункта.[4]

Benchmark-и на TurboS и T1

Benchmark TurboS T1
LMSYS Chatbot Arena 1356 (топ-7)
Средно по 23 benchmark-а 77,9 %
MMLU-Pro 87,2
GPQA-Diamond 69,3
MATH-500 96,2
LiveCodeBench 64,9
Arena-Hard 91,9

Източници: arXiv:2505.15431; T1 official page.[6][7]

Benchmark-и на Hunyuan-A13B

Benchmark Hunyuan-A13B Hunyuan-Large Qwen2.5-72B
MMLU 88,17 88,4
MMLU-Pro 67,23 60,2
BBH 87,56 86,3
MATH 72,35 69,8
GPQA 49,12
MBPP 83,86

Източник: GitHub Hunyuan-A13B README.[8]

A13B превъзхожда Hunyuan-Large при редица задачи, чувствителни към post-training (MMLU-Pro, MATH, MBPP), което съответства на позиционирането му като по-нов и приложен вариант.[8]

Benchmark-и на компактния dense-клон

Модел MMLU MMLU-Pro BBH GSM8K MATH
Hunyuan-0,5B 54,02 31,15 45,92 55,64 42,95
Hunyuan-1,8B 64,62 38,65 74,32 77,26 62,85
Hunyuan-4B 74,01 51,91 75,17 87,49 72,25
Hunyuan-7B 79,82 57,79 82,95 88,25 74,85

Източник: GitHub Hunyuan-7B README.[9]

Benchmark-и на HY 2.0

Показателите са обявени от разработчика (единственият явен източник е официалният акаунт на Hunyuan):[11]

Benchmark HY 2.0 Предишна версия HY
IMO-AnswerBench 73,4 ~53 (оценка, +20 %)
SWE-bench Verified 53,0 6,0
τ²-Bench 72,4 17,1

Забележка. Тези данни се класифицират като „обявени от разработчика, очакващи широко външно потвърждение".[11]

Технически подробности за използването

Контекстен прозорец по клонове

Модел Вход (токени) Изход (токени)
HY 2.0 Think 128K 64K
HY 2.0 Instruct 128K 16K
T1 (API) 32K 64K
A13B (API) 224K 32K
TurboS (API) 32K 16K
Lite (API) 250K 6K
Hunyuan-Large (отворен) 256K (pretrain) / 128K (instruct)
Compact 0,5–7B 256K

Източник: Tencent Cloud product overview.[3]

Поддържани инструменти

В Tencent Cloud API са документирани:[15]

  • Function Calling (tools, tool_choice).
  • AI Search Enhancement — вграден търсачки по външни източници (retrieval-augmented generation).
  • SearchInfo и Citation — маркери за цитиране в отговорите.
  • EnableMultimedia — мултимедийни вмъквания в изхода.
  • EnableThinking — превключвател на chain-of-thought за A13B.
  • EnableRecommendedQuestions — генериране на препоръчани въпроси.

Съвместимост на API

Hunyuan API поддържа формат, съвместим с OpenAI:[16]

  • Base URL: https://api.hunyuan.cloud.tencent.com/v1.
  • Поддържат се /v1/chat/completions и /v1/embeddings.
  • Embedding model: hunyuan-embedding, размерност 1024.
  • Streaming чрез SSE.
  • Concurrency по подразбиране: 5 на акаунт.

За Hunyuan-Large (отворен) стандартният формат на вход/изход съответства на фреймворките PyTorch/Transformers. Поддържа се квантизация: FP8, INT4 (GPTQ/AWQ).[5]

Приложение и интеграция

Моделите Hunyuan са интегрирани в екосистемата на Tencent и са достъпни за външни разработчици. Основни документирани сценарии:[1][17]

Продукти на Tencent

  • Yuanbao — чатбот с поддръжка на Hunyuan и DeepSeek.
  • Tencent Meeting — генериране на резюмета на срещи.
  • Tencent Docs — генериране и анализ на текст.
  • ima — финансов и мултимедиен ИИ-асистент.

Enterprise-приложения

  • Генериране на текст: статии, рекламни текстове, сценарии, описания на продукти.
  • Интелигентна поддръжка на клиенти: чат-ботове, FAQ, автоматизация на отговори.
  • Генериране и анализ на код (особено HY 2.0 Think и T1).
  • Математическо и логическо разсъждение, аналитични задачи.
  • Многоезичен превод (30+ езика, Hunyuan-MT).

Отворени модели

Отворените варианти се използват за изследвания, fine-tuning и разгръщане на edge-устройства (малки dense-модели). Мултимодалните разширения (HunyuanImage, HunyuanVideo, Hunyuan3D) се прилагат за 3D-моделиране и генериране на видео.[14]

Ограничения и открити проблеми

  • Затвореност на търговските модели. За HY 2.0 и T1 липсват отворени тегла и подробни архитектурни спецификации; достъпът е ограничен до API, което затруднява независимата възпроизводимост.[3]
  • Непрозрачност на данните за обучение. Въпреки че се подчертава използването на мащабни синтетични данни, точният състав на dataset-ите, делът на езиците и тематичните области не са разкрити.[2]
  • Изчислителни изисквания. Отворените модели изискват значителни ресурси: минимум 32 GPU за пълен fine-tuning на Hunyuan-Large; десетки ГБ VRAM дори с FP8.[5]
  • Халюцинации. Както и другите LLM, моделите са склонни към генериране на правдоподобни, но фактически неверни твърдения. Систематичните изследвания на този аспект за Hunyuan в открити рецензирани публикации засега са ограничени.[18]
  • Разлики между архитектурни и сервисни лимити. За редица модели (TurboS, A13B) сервисните лимити на API са значително по-ниски от архитектурните възможности.[6][3]
  • Регионална достъпност. Основният фокус е върху китайския пазар; API за потребители извън Китай има езикови и правни ограничения.[17]
  • Липса на детайлни safety-доклади. В документацията са посочени общи принципи на сигурност и филтриране, но няма публични технически safety reports, сравними по обем с някои международни модели.[15]
  • Съвместимост на open-source клона. След издаванията са регистрирани проблеми с интеграцията с transformers / vllm, при които библиотеките не разпознават типа на архитектурата hunyuan_v1_dense, изисквайки trust_remote_code или специални клонове.[19]

Инциденти и известни проблеми

Към момента на наличните материали (края на 2025 — началото на 2026 г.) не са регистрирани крупни публични инциденти, специфично свързани с Hunyuan (мащабни изтичания на данни, уникални заплахи за сигурността).[17]

Документирани продуктови корекции

В product dynamics на Tencent Cloud са отразени микрокорекции:[12]

  • 2024-11-20: hunyuan-turbo-latest е актуализиран за отстраняване на повторения поради специални символи, повишаване на стабилността на Markdown-изхода и намаляване на неоснователните откази.
  • 2025-04-03: актуализация на T1 с корекции на смесването на опростен/традиционен китайски и смесването на китайски/английски, плюс подобряване на генерирането на код на ниво проект.
  • 2025-04-20: Search Enhancement е преведен от default-on на default-off — фактически промяна в поведението на API за интеграции.

Изследвания на сигурността на MoE

На ниво изследователска критика (ниво на препринт) Hunyuan-A13B фигурира в публикации за атаки срещу safety-локализацията в MoE-модели. По-конкретно, в публикациите Large Language Lobotomy и GateBreaker се съобщава за висок attack success rate при „заглушаване" на safety-експертите. Това не е потвърждение на производствен инцидент, но показва, че сигурността на MoE-маршрутизирането се разглежда като уязвим изследователски вектор.[20][21]

Етични и регулаторни аспекти

Hunyuan действа в правния и регулаторен контекст на Китай, включително националните правила за управление на генеративния ИИ (CAC) и филтриране на съдържание, както и вътрешните политики на Tencent за сигурност на данните. Документацията на Tencent Cloud подчертава, че използването на Hunyuan API трябва да съответства на приложимите закони и политиката на платформата.[1]

Конкретните мерки включват:

  • Вградена модерация на съдържание с поточна обработка и възможен FinishReason=sensitive.
  • Изравняване чрез RLHF/DPO за намаляване на халюцинациите и нежеланото поведение.
  • Филтриране на данните за обучение за минимизиране на предвзетостта.
  • Отворени лицензи (Tencent Hunyuan Community License Agreement) за отворените модели, с уговорката, че споразумението не се прилага в ЕС за редица варианти.[8][15]

Специализирани независими доклади за предвзетост (bias) и справедливост (fairness) за Hunyuan засега са малко; изследванията се очакват с разширяването на отворените тегла и независимите тестове.[2]

Реакция на общността

Най-съдържателният външен сигнал за затворения клон е резултатът на TurboS на LMSYS Chatbot Arena (1356, топ-7 глобално). За отворения клон косвен индикатор е активността в GitHub: около 1,6 хил. stars при Hunyuan-Large, 812 при A13B, 683 при Hunyuan-MT. Това отразява забележимо, но не доминиращо по мащабите на open LLM екосистемата ниво на ангажираност. Субективните оценки на общността (Hugging Face, Reddit) отбелязват силни страни в китайски език и задачи за агенти.[22]

Перспективи и направления на изследванията

Насоките за по-нататъшно развитие, посочени в публичните материали:[2][6][14]

  • По-нататъшна хибридизация на архитектурите (Mamba + Transformer + MoE) и изследване на scaling laws за MoE.
  • Разширяване на мултимодалните възможности: интеграция на Hunyuan3D, HunyuanVideo и HunyuanImage с езиковите модели.
  • Подобряване на използването на инструменти (tool use) и агентните възможности.
  • Намаляване на разходите за инференс: квантизация (2-bit за edge), оптимизации чрез TRT-LLM/vLLM.
  • Разширяване на открития портфейл от модели.
  • Разработване и публикуване на детайлни safety- и alignment-доклади.

Вижте също

  • LLaMA (Meta)
  • DeepSeek

Литература

Връзки

Бележки

  1. 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
  4. 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
  5. 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
  7. 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
  8. 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
  9. 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
  10. 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
  11. 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
  12. 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
  13. Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
  14. 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
  15. 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
  16. Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
  17. 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
  18. LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
  19. GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
  20. Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
  21. Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
  22. Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS