Hunyuan (Tencent) (NL)
Hunyuan (Chin. 腾讯混元大模型, Tencent Hunyuan, Tencent HY) — een familie van Foundation Models en Large Language Models (LLM), ontwikkeld door het Tencent Hunyuan Foundation Model Team en beschikbaar via de clouddienst Tencent Cloud, alsmede als open gewichten op de platforms Hugging Face en GitHub. De familie omvat modellen voor het genereren en begrijpen van tekst, logisch en wiskundig redeneren, programmeren, verwerking van lange contexten, evenals multimodale uitbreidingen (afbeeldingen, video, 3D). Hunyuan wordt gepositioneerd als de flagship-lijn voor generatieve AI van Tencent en is geïntegreerd in het productenecosysteem van het bedrijf (Yuanbao, WeChat, Tencent Meeting, Tencent Cloud).[1][2][3]
Geschiedenis en chronologie van de ontwikkeling
De ontwikkeling van Hunyuan vond plaats in de context van de mondiale LLM-wedloop en de Chinese strategie voor technologische onafhankelijkheid op het gebied van kunstmatige intelligentie. De lijn evolueerde van propriëtaire dense-modellen naar open Mixture-of-Experts (MoE) en hybride Transformer-Mamba-architecturen.[1]
Eerste generatie (2023)
De publieke aankondiging van de Hunyuan-serie vond plaats op 7 september 2023 tijdens de Tencent Global Digital Ecosystem Summit in Shenzhen. De eerste versie was een propriëtair dense-model met meer dan 100 miljard parameters, voorgetraind op meer dan 2 biljoen tokens. Het model was gericht op de Chinese taal, logisch redeneren en contentgeneratie, was geïntegreerd in meer dan 50 Tencent-producten en beschikbaar via de Tencent Cloud API.[1]
Hunyuan-Large en de overgang naar MoE (2024)
In november 2024 bracht Tencent Hunyuan-Large uit — destijds het grootste open Transformer-MoE-model met 389 miljard totale en 52 miljard actieve parameters. Het model werd gepubliceerd met open gewichten op Hugging Face en GitHub, vergezeld van een preprint op arXiv. De release markeerde een strategische wending van Tencent naar open ontwikkeling.[2][4][5]
Hybride en reasoning-modellen (2025)
In 2025 werd de lijn uitgebreid met verscheidene sleutelreleases:
- Hunyuan-TurboS (februari 2025) — het eerste industriële grootschalige hybride Transformer-Mamba-MoE-model met 560 miljard totale en 56 miljard actieve parameters, voorgetraind op 16 biljoen tokens. Er werd een adaptief Chain-of-Thought (CoT)-mechanisme geïntroduceerd voor dynamisch schakelen tussen snel en diep redeneren.[6]
- Hunyuan-T1 (maart 2025) — een gespecialiseerd reasoning-model, gebouwd bovenop TurboS met grootschalig Reinforcement Learning (96,7% van de post-training rekenkracht betreft Reinforcement Learning).[7]
- Hunyuan-A13B (juni 2025) — een compact MoE-model (80 miljard totaal / 13 miljard actief) voor een balans tussen prestaties en kosten, met ondersteuning voor snel en langzaam redeneren.[8]
- Kleine dense-modellen (juli 2025) — varianten van 0,5B, 1,8B, 4B, 7B voor edge-apparaten en sterk concurrerende implementatiescenario's, met ondersteuning voor een context van 256K.[9]
Hunyuan 2.0 (november–december 2025)
In december 2025 werd de tweede generatie van het commerciële model aangekondigd — Hunyuan 2.0 (HY 2.0) met een MoE-architectuur (406 miljard totaal / 32 miljard actieve parameters) en een contextvenster van 256K tokens. De lijn is onderverdeeld in twee varianten: HY 2.0 Think (diep redeneren, code) en HY 2.0 Instruct (dialogen, creatieve generatie). De modellen zijn beschikbaar via de Tencent Cloud API en geïntegreerd in de applicaties Yuanbao en ima.[10][11]
Samenvattende chronologie
| Datum | Gebeurtenis |
|---|---|
| September 2023 | Publieke aankondiging van Hunyuan als propriëtaire LLM (>100B parameters); lancering van de Tencent Cloud API |
| Februari 2024 | Intern MoE-model voor de chatbot Yuanbao |
| April 2024 | Rebranding: «advanced» → hunyuan-pro, «standard» → hunyuan-standard; hunyuan-lite toegevoegd |
| Mei 2024 | hunyuan-lite overgezet naar MoE, uitgebreid naar 256K context |
| September 2024 | Lancering van de nieuwe hunyuan-turbo (MoE van de nieuwe generatie) |
| November 2024 | Open release van Hunyuan-Large (389B/52B MoE), preprint arXiv:2411.02265 |
| Februari–maart 2025 | Hunyuan-TurboS (hybride Mamba-MoE); Hunyuan-T1 (reasoning) |
| Juni 2025 | Hunyuan-A13B (80B/13B, fine-grained MoE) |
| Juli 2025 | Kleine dense-modellen 0,5B–7B |
| September 2025 | Hunyuan-MT (gespecialiseerd vertaalmodel) |
| November–december 2025 | Hunyuan 2.0 (HY 2.0 Think / Instruct), 406B/32B MoE |
Bron: Tencent Cloud product dynamics; officiële repositories.[12]
Theoretische grondslagen en architectuur
Mixture-of-Experts - Mixture-of-Experts-architectuur
De sleutelmodellen van de serie (Hunyuan-Large, A13B, HY 2.0) maken gebruik van de Mixture-of-Experts (MoE)-architectuur, waarbij een deel van de transformer-lagen meerdere «experts» (subnetwerken) bevat, en een router (gating network) een deelverzameling van actieve experts selecteert voor elk token. De algemene formule van een MoE-laag:[2]
waar de routeringsfunctie (gating) is, de -de expert, het totale aantal experts. Bij deze aanpak overschrijdt het totale aantal parameters van het model het aantal parameters dat bij één doorgang actief is aanzienlijk:[2]
waardoor de capaciteit van het model kan worden vergroot zonder evenredige toename van de rekenkosten voor inferentie.
In Hunyuan-Large is een schema geïmplementeerd met 1 gedeelde (shared) expert en 16 gespecialiseerde experts, waarbij per token 1 specialist wordt geactiveerd (top-1 routing). Aanvullende innovaties omvatten gemengde routing met een recycle-mechanisme (herverwerking van afgewezen tokens) en expert-specifieke learning rates voor een betere balans in de bijdrage van experts.[2][5]
Hybride Transformer-Mamba-architectuur
Hunyuan-TurboS en T1 introduceren een hybride architectuur die Transformer-blokken (attention) en Mamba-blokken (state-space model) combineert. Mamba biedt lineaire complexiteit ten opzichte van de sequentielengte:[6]
waar , trainbare matrices zijn, de verborgen toestand op stap , het invoertoken. Dit zorgt voor memory scaling op lengte (versus in een standaard Transformer).[6]
TurboS bevat 128 lagen, georganiseerd in blokken: 57 Mamba2-lagen, 7 Attention-lagen en 64 FFN-MoE-lagen met 32 experts. AMF-blokken (Attention → Mamba2 → FFN) en MF-blokken (Mamba2 → FFN) wisselen elkaar af voor een balans tussen globale en lokale context.[6]
Aandachtsmechanismen en KV-cache
Hunyuan-Large maakt gebruik van Grouped Query Attention (GQA) — een variant van attention waarbij meerdere queries gedeelde sleutels en waarden delen — en Cross-Layer Attention (CLA) om de omvang van de KV-cache te verkleinen. Het standaard KV-cache-volume voor een self-attention-laag met hoofden, sequentielengte en hoofdgrootte :[5]
waar het KV-cache-volume is. Bij GQA met groepen daalt het volume tot:
CLA voorziet aanvullend in hergebruik van de KV-cache tussen lagen. Samen zorgen deze optimalisaties voor een geheugenbesparingen van circa 95%.[4]
Positionele codering en lange context
De modellen maken gebruik van Rotary Position Embedding (RoPE) met schaling voor ondersteuning van lange sequenties. Het trainen op context wordt stapsgewijs uitgevoerd (curriculum learning): van 32K tot 256K tokens. De activatiefunctie is SwiGLU. Het tokenizer-woordenboek telt 128K (tiktoken met uitbreiding voor de Chinese taal).[2]
Training en schaling
Voor MoE-modellen worden scaling laws onderzocht in de vorm van empirische machtsfuncties:[2]
waar de kwaliteitsmetriek is, het aantal actieve parameters, de hoeveelheid data, parameters die experimenteel worden bepaald. Hunyuan-Large benadrukt het gebruik van synthetische data met een omvang van 1,5 biljoen tokens — ordes van grootte meer dan in eerdere publicaties over MoE.[2]
Trainingspijplijn en afstemming
Het trainingsproces van Hunyuan-modellen omvat verschillende stadia, kenmerkend voor moderne LLM's:[2][7]
Voortraining (Pre-training)
Grootschalige training op een groot meertalig corpus (Chinees, Engels en andere talen). Hunyuan-Large is voorgetraind op 7 biljoen tokens (inclusief 1,5 biljoen synthetische tokens). TurboS is voorgetraind op 16 biljoen tokens. De exacte samenstelling van de datasets is niet openbaar gemaakt.[2][6]
Supervised Fine-Tuning (SFT)
Fine-tuning op meer dan 1 miljoen instructies (instructie-antwoordparen), waarbij het model wordt geleid naar het opvolgen van gebruikersinstructies.[2]
Afstemming via Reinforcement Learning
Voor het afstemmen van het modelgedrag op menselijke voorkeuren worden de volgende methoden toegepast:
Direct Preference Optimization (DPO) — een afstemmingsmethode zonder expliciet beloningsmodel, toegepast in Hunyuan-Large.[2]
Reinforcement Learning (RL) — in Hunyuan-T1 wordt grootschalig Reinforcement Learning met curriculum learning toegepast; volgens de ontwikkelaar betreft 96,7% van de post-training rekenkracht Reinforcement Learning.[7]
Adaptive Long-Short Chain-of-Thought — in TurboS is een mechanisme geïmplementeerd voor dynamisch schakelen tussen snel en diep redeneren, waardoor het model de redeneerdiepte kan aanpassen aan de complexiteit van de taak.[6]
Samenstelling van de modellengroep
De familie is onderverdeeld in gesloten cloudgebaseerde API-modellen en open modellen met gewichten.[3]
Hoofdmodellen (overzicht)
| Model | Releasedatum | Architectuur | Parameters (totaal / actief) | Context | Beschikbaarheid |
|---|---|---|---|---|---|
| Hunyuan (2023) | September 2023 | Dense Transformer | >100 miljard / — | niet openbaar | Propriëtaire API |
| Hunyuan-Large | November 2024 | Transformer-MoE | 389 miljard / 52 miljard | 256K (pretrain), 128K (instruct) | Open gewichten (GitHub, HF) |
| Hunyuan-TurboS | Februari 2025 | Hybrid Transformer-Mamba-MoE | 560 miljard / 56 miljard | 256K (architect.), 32K/16K (API) | Propriëtaire API + open varianten |
| Hunyuan-T1 | Maart 2025 | Gebaseerd op TurboS + grootschalig RL | — | 32K/64K (API) | Propriëtaire API |
| Hunyuan-A13B | Juni 2025 | Fine-grained MoE | 80 miljard / 13 miljard | 256K (open), 224K/32K (API) | Open gewichten + API |
| Klein (0,5–7B) | Juli 2025 | Dense | 0,5–7 miljard | 256K | Open gewichten |
| HY 2.0 Think | November 2025 | MoE | 406 miljard / 32 miljard | 128K invoer / 64K uitvoer (API) | Propriëtaire API |
| HY 2.0 Instruct | November 2025 | MoE | 406 miljard / 32 miljard | 128K invoer / 16K uitvoer (API) | Propriëtaire API |
Bronnen: arXiv:2411.02265; arXiv:2505.15431; Tencent Cloud docs; GitHub.[2][6][3][10]
Opmerking. Voor een aantal modellen verschillen de architectuurlimieten van de context (uit technische rapporten) van de servicelimieten van de API (uit productdocumentatie). Dit is geen tegenstrijdigheid, maar weerspiegelt de verschillen tussen de onderzoeks- en productconfiguratie.[6][3]
Gespecialiseerde modellen
Hunyuan-MT (september 2025) — een gespecialiseerd modelmachinevertaalmodel dat de 1e plaats behaalde op WMT25 in 30 van de 31 categorieën.[13]
HunyuanImage, HunyuanVideo, Hunyuan3D — multimodale modellen van de familie voor respectievelijk het genereren van afbeeldingen, video en 3D-objecten.[14]
Positionering en evolutionaire verbanden
In de Tencent Cloud-documentatie zijn de volgende evolutionaire verbanden terug te vinden:
hunyuan-a13bwordt aangeduid als een upgrade vanhunyuan-standard-256K.hunyuan-t1is gebouwd bovenop TurboS met versterkte RL-post-training.- HY 2.0 Think/Instruct — een tak waarbij de basis is bijgewerkt van TurboS naar Hunyuan 2.0.
- De open tak (Hunyuan-Large, A13B, compacte dense) ontwikkelt zich parallel aan de gesloten API-tak en biedt onderzoekstoegang.[3]
Wat is nieuw in de sleutelgeneraties
Hunyuan-Large (2024)
Vergeleken met de eerste generatie en eerdere MoE-benaderingen introduceert Hunyuan-Large:[2][4]
- Schaal van 389 miljard parameters (52 miljard actief) — het grootste open Transformer-MoE-model op het moment van publicatie.
- Ondersteuning voor 256K context (pretrain) en 128K (instruct) — een aanzienlijke overschrijding van de typische waarden voor gangbare LLM's in 2024.
- KV-cache-compressie op basis van GQA + CLA (geheugenbesparingen ~95%).
- Grootschalige synthetische data (1,5 biljoen tokens aan synthetische gegevens).
- Gemengde expert-routing en expert-specifieke learning rates.
Hunyuan-TurboS (2025)
De belangrijkste architectuurverschuiving:[6]
- Hybride Mamba2 + Attention + MoE: 560B totaal / 56B actief, 128 lagen.
- Voortraining op 16 biljoen tokens.
- Adaptive Long-Short Chain-of-Thought voor dynamisch beheer van redeneerdiepte.
- Geclaimde decoderingsversnelling van 1,8–2 keer ten opzichte van de vorige Turbo-versie.
Hunyuan-T1 (2025)
Reasoning-model gebaseerd op TurboS:[7]
- 96,7% van de post-training rekenkracht betreft Reinforcement Learning.
- Tweevoudige decoderingsversnelling bij vergelijkbare deployment-omgeving.
- Curriculum learning voor verbetering van redeneerstrategieën.
HY 2.0 (2025)
Update van het commerciële flagship:[10][11]
- MoE-architectuur: 406B totaal / 32B actieve parameters.
- Contextvenster van 256K tokens.
- Aanzienlijke groei op gespecialiseerde benchmarks: IMO-AnswerBench 73,4% (+20% ten opzichte van de vorige HY-versie), SWE-bench Verified 53,0 (was 6,0), τ²-Bench 72,4 (was 17,1).
- Verbeteringen in RLHF en post-trainingsstrategieën.
Evaluatie en benchmarks
De evaluatie werd uitgevoerd op standaard benchmarks met behulp van zero-shot- en few-shot-protocollen. De resultaten zijn gebaseerd op officiële technische rapporten en repositories; voor een aantal modellen zijn onafhankelijke externe verificaties vooralsnog beperkt.[2]
Benchmarks Hunyuan-Large (pretrain)
| Benchmark | Hunyuan-Large | Llama 3.1-405B | Llama 3.1-70B | Mixtral-8x22B | DeepSeek-V2 |
|---|---|---|---|---|---|
| MMLU | 88,4 | 85,2 | 79,3 | 77,8 | 78,5 |
| CMMLU | 90,2 | — | — | — | 84,0 |
| C-Eval | 91,9 | — | — | — | 81,7 |
| GSM8K | 92,8 | 89,0 | 83,7 | 83,7 | 79,2 |
| MATH | 69,8 | 53,8 | 41,4 | 42,5 | 43,6 |
| HumanEval | 71,4 | 61,0 | 58,5 | 53,1 | 48,8 |
Bron: arXiv:2411.02265.[2]
Volgens het technische rapport leidt Hunyuan-Large (pretrain) in 15 van de 19 benchmarks bij vergelijking met Llama 3.1-405B, Mixtral-8x22B en DeepSeek-V2.[2]
Benchmarks Hunyuan-Large-Instruct
| Benchmark | Hunyuan-Large-Instruct |
|---|---|
| MMLU | 89,9 |
| MATH | 77,4 |
| HumanEval | 90,0 |
| Arena-Hard | 81,8 |
Bron: arXiv:2411.02265; Hugging Face model card.[2][5]
Volgens de ontwikkelaars overtreft Hunyuan-Large-Instruct LLaMA 3.1-405B op MMLU met 2,6 procentpunten.[4]
Benchmarks TurboS en T1
| Benchmark | TurboS | T1 |
|---|---|---|
| LMSYS Chatbot Arena | 1356 (top-7) | — |
| Gemiddelde over 23 benchmarks | 77,9% | — |
| MMLU-Pro | — | 87,2 |
| GPQA-Diamond | — | 69,3 |
| MATH-500 | — | 96,2 |
| LiveCodeBench | — | 64,9 |
| Arena-Hard | — | 91,9 |
Bronnen: arXiv:2505.15431; T1 official page.[6][7]
Benchmarks Hunyuan-A13B
| Benchmark | Hunyuan-A13B | Hunyuan-Large | Qwen2.5-72B |
|---|---|---|---|
| MMLU | 88,17 | 88,4 | — |
| MMLU-Pro | 67,23 | 60,2 | — |
| BBH | 87,56 | 86,3 | — |
| MATH | 72,35 | 69,8 | — |
| GPQA | 49,12 | — | — |
| MBPP | 83,86 | — | — |
Bron: GitHub Hunyuan-A13B README.[8]
A13B overtreft Hunyuan-Large op een aantal post-training-gevoelige taken (MMLU-Pro, MATH, MBPP), wat strookt met de positionering als recentere en meer toepassingsgerichte variant.[8]
Benchmarks van de compacte dense-tak
| Model | MMLU | MMLU-Pro | BBH | GSM8K | MATH |
|---|---|---|---|---|---|
| Hunyuan-0,5B | 54,02 | 31,15 | 45,92 | 55,64 | 42,95 |
| Hunyuan-1,8B | 64,62 | 38,65 | 74,32 | 77,26 | 62,85 |
| Hunyuan-4B | 74,01 | 51,91 | 75,17 | 87,49 | 72,25 |
| Hunyuan-7B | 79,82 | 57,79 | 82,95 | 88,25 | 74,85 |
Bron: GitHub Hunyuan-7B README.[9]
Benchmarks HY 2.0
De resultaten zijn gepubliceerd door de ontwikkelaar (de enige expliciete bron is het officiële Hunyuan-account):[11]
| Benchmark | HY 2.0 | Vorige versie HY |
|---|---|---|
| IMO-AnswerBench | 73,4 | ~53 (schatting, +20%) |
| SWE-bench Verified | 53,0 | 6,0 |
| τ²-Bench | 72,4 | 17,1 |
Opmerking. Deze gegevens worden geclassificeerd als «door de ontwikkelaar geclaimd, in afwachting van brede externe bevestiging».[11]
Technische gebruiksdetails
Contextvenster per tak
| Model | Invoer (tokens) | Uitvoer (tokens) |
|---|---|---|
| HY 2.0 Think | 128K | 64K |
| HY 2.0 Instruct | 128K | 16K |
| T1 (API) | 32K | 64K |
| A13B (API) | 224K | 32K |
| TurboS (API) | 32K | 16K |
| Lite (API) | 250K | 6K |
| Hunyuan-Large (open) | 256K (pretrain) / 128K (instruct) | — |
| Compact 0,5–7B | 256K | — |
Bron: Tencent Cloud product overview.[3]
Ondersteunde functies
In de Tencent Cloud API zijn de volgende functies gedocumenteerd:[15]
- Function Calling (
tools,tool_choice). - AI Search Enhancement — ingebouwde zoekfunctie via externe bronnen (retrieval-augmented generation).
- SearchInfo en Citation — citatiemarkering in antwoorden.
- EnableMultimedia — multimediasubstituties in de uitvoer.
- EnableThinking — schakelaar voor chain-of-thought bij A13B.
- EnableRecommendedQuestions — generatie van aanbevolen vragen.
API-compatibiliteit
De Hunyuan API ondersteunt het OpenAI-compatibele formaat:[16]
- Base URL:
https://api.hunyuan.cloud.tencent.com/v1. /v1/chat/completionsen/v1/embeddingsworden ondersteund.- Embedding-model:
hunyuan-embedding, dimensie 1024. - Streaming via SSE.
- Standaard gelijktijdigheid: 5 per account.
Voor Hunyuan-Large (open) is het standaard invoer-/uitvoerformaat compatibel met de PyTorch/Transformers-frameworks. Kwantisatie wordt ondersteund: FP8, INT4 (GPTQ/AWQ).[5]
Toepassingen en integratie
De Hunyuan-modellen zijn geïntegreerd in het Tencent-ecosysteem en beschikbaar voor externe ontwikkelaars. De voornaamste gedocumenteerde scenario's:[1][17]
Tencent-producten
- Yuanbao — chatbot met ondersteuning voor Hunyuan en DeepSeek.
- Tencent Meeting — generatie van vergaderingssamenvattingen.
- Tencent Docs — tekst genereren en analyseren.
- ima — financiële en multimediale AI-assistent.
Enterprise-toepassingen
- Tekstgeneratie: artikelen, advertentieteksten, scenario's, productbeschrijvingen.
- Intelligente klantenondersteuning: chatbots, FAQ, automatisering van antwoorden.
- Generatie en analyse van code (met name HY 2.0 Think en T1).
- Wiskundig en logisch redeneren, analytische taken.
- Meertalige vertaling (30+ talen, Hunyuan-MT).
Open modellen
De open varianten worden gebruikt voor onderzoek, fine-tuning en implementatie op edge-apparaten (kleine dense-modellen). Multimodale uitbreidingen (HunyuanImage, HunyuanVideo, Hunyuan3D) worden toegepast voor 3D-modellering en videogeneratie.[14]
Beperkingen en openstaande problemen
- Gesloten karakter van commerciële modellen. Voor HY 2.0 en T1 zijn geen open gewichten en gedetailleerde architectuurspecificaties beschikbaar; toegang is beperkt tot de API, wat onafhankelijke reproduceerbaarheid bemoeilijkt.[3]
- Ondoorzichtigheid van trainingsdata. Hoewel het gebruik van grootschalige synthetische data wordt benadrukt, is de exacte samenstelling van de datasets, het aandeel van talen en vakgebieden niet openbaar gemaakt.[2]
- Rekenvereisten. De open modellen vereisen aanzienlijke resources: minimaal 32 GPU's voor volledige fine-tuning van Hunyuan-Large; tientallen GB VRAM zelfs met FP8.[5]
- Hallucinaties. Zoals andere LLM's zijn de modellen vatbaar voor het genereren van plausibele maar feitelijk onjuiste uitspraken. Systematisch onderzoek naar dit aspect voor Hunyuan in open peer-reviewed publicaties is vooralsnog beperkt.[18]
- Verschillen tussen architectuur- en servicelimieten. Voor een aantal modellen (TurboS, A13B) liggen de servicelimieten van de API aanzienlijk lager dan de architecturale mogelijkheden.[6][3]
- Regionale beschikbaarheid. De primaire focus ligt op de Chinese markt; de API kent taal- en juridische beperkingen voor gebruikers buiten China.[17]
- Ontbreken van gedetailleerde veiligheidsrapporten. De documentatie vermeldt algemene veiligheids- en filterprincipes, maar er zijn geen publieke technische veiligheidsrapporten beschikbaar die qua omvang vergelijkbaar zijn met die van sommige internationale modellen.[15]
- Compatibiliteit van de open-source-tak. Na releases werden integratieproblemen geconstateerd met
transformers/vllm, waarbij bibliotheken het architectuurtypehunyuan_v1_denseniet herkenden entrust_remote_codeof speciale branches vereisten.[19]
Incidenten en bekende problemen
Op basis van het beschikbare materiaal (eind 2025 – begin 2026) zijn er geen grote publieke incidenten geregistreerd die specifiek verband houden met Hunyuan (grootschalige datalekken, unieke beveiligingsrisico's).[17]
Gedocumenteerde productcorrecties
In de product dynamics van Tencent Cloud zijn microcorrecties vastgelegd:[12]
- 2024-11-20:
hunyuan-turbo-latestbijgewerkt om herhalingen door speciale tekens te corrigeren, de stabiliteit van de Markdown-uitvoer te verbeteren en onterechte weigeringen te verminderen. - 2025-04-03: update van T1 met correcties voor het mengen van vereenvoudigd/traditioneel Chinees en het mengen van Chinees/Engels, plus verbetering van codegeneratie op projectniveau.
- 2025-04-20: Search Enhancement overgeschakeld van standaard aan naar standaard uit — in feite een API-gedragswijziging voor integraties.
Veiligheidsonderzoek naar MoE
Op het niveau van onderzoekskritiek (preprintniveau) figureert Hunyuan-A13B in publicaties over aanvallen op veiligheidslokalisatie in MoE-modellen. In het bijzonder rapporteren de werken Large Language Lobotomy en GateBreaker een hoge attack success rate bij het «tot zwijgen brengen» van veiligheidsexperts. Dit bevestigt geen productie-incident, maar toont aan dat de beveiliging van MoE-routing wordt beschouwd als een kwetsbare onderzoeksvector.[20][21]
Ethische en regelgevingsaspecten
Hunyuan opereert binnen het juridische en regelgevingskader van China, inclusief nationale regels voor het beheer van generatieve AI (CAC) en contentfiltering, alsmede het interne beleid van Tencent inzake gegevensbeveiliging. De Tencent Cloud-documentatie benadrukt dat het gebruik van de Hunyuan API moet voldoen aan de toepasselijke wetgeving en het platformbeleid.[1]
Concreet omvatten de maatregelen:
- Ingebouwde contentmoderatie met streaming-uitvoer en mogelijke
FinishReason=sensitive. - Afstemming via RLHF/DPO ter vermindering van hallucinaties en ongewenst gedrag.
- Filtering van trainingsdata om vooringenomenheid te minimaliseren.
- Open licenties (Tencent Hunyuan Community License Agreement) voor open modellen, met de kanttekening dat de overeenkomst voor bepaalde varianten niet van toepassing is in de EU.[8][15]
Gespecialiseerde onafhankelijke rapporten over bias (vooringenomenheid) en fairness (eerlijkheid) voor Hunyuan zijn vooralsnog beperkt; onderzoek wordt verwacht naarmate de open gewichten en onafhankelijke tests worden uitgebreid.[2]
Reactie van de gemeenschap
Het meest inhoudelijke externe signaal voor de gesloten tak is het resultaat van TurboS op de LMSYS Chatbot Arena (1356, top-7 wereldwijd). Voor de open tak is een indirecte indicator de GitHub-activiteit: circa 1.600 stars voor Hunyuan-Large, 812 voor A13B, 683 voor Hunyuan-MT. Dit weerspiegelt een merkbare, maar niet dominante betrokkenheid naar de maatstaven van het open LLM-ecosysteem. Subjectieve beoordelingen van de gemeenschap (Hugging Face, Reddit) wijzen op sterke punten in de Chinese taal en agent-taken.[22]
Vooruitzichten en onderzoeksrichtingen
Richtingen voor verdere ontwikkeling, aangeduid in publieke materialen:[2][6][14]
- Verdere hybridisering van architecturen (Mamba + Transformer + MoE) en onderzoek naar scaling laws voor MoE.
- Uitbreiding van multimodale mogelijkheden: integratie van Hunyuan3D, HunyuanVideo en HunyuanImage met taalmodellen.
- Verbetering van tool use en agentmogelijkheden.
- Verlaging van inferentiekosten: kwantisatie (2-bit voor edge), optimalisaties via TRT-LLM/vLLM.
- Uitbreiding van het open modellenportfolio.
- Ontwikkeling en publicatie van gedetailleerde veiligheids- en afstemmingsrapporten.
Zie ook
- LLaMA (Meta)
- DeepSeek
Literatuur
- Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- Tencent Hunyuan Team. Hunyuan-MT Technical Report. arXiv:2509.05209, 2025. https://arxiv.org/abs/2509.05209
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
Verwijzingen
- https://cloud.tencent.com/document/product/1729/104753 — Officiële Tencent Cloud Hunyuan-documentatie
- https://huggingface.co/tencent/Tencent-Hunyuan-Large — Hunyuan-Large op Hugging Face
- https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large — Hunyuan-Large op GitHub
- https://github.com/Tencent-Hunyuan/Hunyuan-A13B — Hunyuan-A13B op GitHub
- https://tencent.github.io/llm.hunyuan.T1/README_EN.html — Officiële pagina van Hunyuan-T1
- https://www.tencent.com/en-us/articles/2201685.html — Aankondiging van Hunyuan (september 2023)
Noten
- ↑ 1.0 1.1 1.2 1.3 1.4 Tencent. Tencent Unveils Hunyuan, its Proprietary Large Foundation Model on Tencent Cloud. tencent.com, 7 сентября 2023. https://www.tencent.com/en-us/articles/2201685.html
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 Sun, X. et al. Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent. arXiv:2411.02265, 2024. https://arxiv.org/abs/2411.02265
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 Tencent Cloud. «腾讯混元大模型 产品概述». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/104753
- ↑ 4.0 4.1 4.2 4.3 Tencent-Hunyuan. Tencent-Hunyuan-Large. GitHub, 2024. https://github.com/Tencent-Hunyuan/Tencent-Hunyuan-Large
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 Tencent. tencent/Tencent-Hunyuan-Large. Hugging Face. https://huggingface.co/tencent/Tencent-Hunyuan-Large
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 Tencent Hunyuan Team. Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought. arXiv:2505.15431, 2025. https://arxiv.org/abs/2505.15431
- ↑ 7.0 7.1 7.2 7.3 7.4 Tencent. llm.hunyuan.T1. Tencent GitHub Pages, 2025. https://tencent.github.io/llm.hunyuan.T1/README_EN.html
- ↑ 8.0 8.1 8.2 8.3 Tencent-Hunyuan. Hunyuan-A13B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-A13B
- ↑ 9.0 9.1 Tencent-Hunyuan. Hunyuan-7B. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-7B
- ↑ 10.0 10.1 10.2 TechNode. Tencent releases Hunyuan 2.0, its next-generation AI model. technode.com, 8 декабря 2025. https://technode.com/2025/12/08/tencent-releases-hunyuan-2-0-its-next-generation-ai-model/
- ↑ 11.0 11.1 11.2 11.3 Hunyuan Official Account. Tencent HY 2.0 is officially released. X (бывш. Twitter), 4 декабря 2025. https://x.com/TencentHunyuan/status/1996948083377332614
- ↑ 12.0 12.1 Tencent Cloud. «腾讯混元大模型 产品动态». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/97765
- ↑ Tencent-Hunyuan. Hunyuan-MT. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan-MT
- ↑ 14.0 14.1 14.2 Tencent-Hunyuan. Hunyuan3D-2. GitHub, 2025. https://github.com/Tencent-Hunyuan/Hunyuan3D-2
- ↑ 15.0 15.1 15.2 Tencent Cloud. «对话» (Chat). Tencent Cloud API Documentation. https://cloud.tencent.com/document/product/1729/105701
- ↑ Tencent Cloud. «混元 OpenAI 兼容接口相关调用示例». Tencent Cloud Documentation. https://cloud.tencent.com/document/product/1729/111007
- ↑ 17.0 17.1 17.2 Tencent Cloud. How to use Tencent Hunyuan large model for natural language processing. Tencent Cloud Techpedia. https://www.tencentcloud.com/techpedia/109099
- ↑ LangChain. Tencent Hunyuan integration. Docs by LangChain, 2026. https://docs.langchain.com/oss/python/integrations/chat/tencent_hunyuan
- ↑ GitHub Issues. Hunyuan-1.8B issues. https://github.com/Tencent-Hunyuan/Hunyuan-1.8B/issues
- ↑ Lintelo, J. et al. Large Language Lobotomy: Jailbreaking Mixture-of-Experts LLMs. arXiv:2602.08741, 2026. https://arxiv.org/abs/2602.08741
- ↑ Wu, L. et al. GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs. arXiv:2512.21008, 2025. https://arxiv.org/abs/2512.21008
- ↑ Tencent-Hunyuan. Hunyuan-TurboS. GitHub. https://github.com/Tencent-Hunyuan/Hunyuan-TurboS