Generatie van synthetische data
Generatie van synthetische data met behulp van LLM — dit is een technologie voor het kunstmatig aanmaken van gegevens die qua statistische en structurele kenmerken echte data nabootsen, maar geen feitelijke persoonlijke informatie bevatten. Deze aanpak, die gebruikmaakt van de mogelijkheden van grote taalmodellen (LLM), is een sleutelinstrument geworden in modern machine learning voor het oplossen van problemen rondom datatekort, privacy en de hoge kosten van handmatige annotatie[1].
Definitie en achtergrond
Wat zijn synthetische data?
Synthetische data zijn kunstmatig gegenereerde informatie die de statistische eigenschappen en patronen van een originele, echte dataset reproduceert. Het Amerikaanse Nationaal Instituut voor Standaarden en Technologie (NIST) definieert deze als gegevens die de statistische eigenschappen van het origineel behouden, maar geen individuele details onthullen[2]. In tegenstelling tot eenvoudige anonimisering creëert datasynthese volledig nieuwe records, wat een hoger niveau van privacybescherming biedt.
Waarom ontstond de behoefte?
De groeiende interesse in synthetische generatie wordt veroorzaakt door een aantal factoren:
- Datatekort: In veel vakgebieden, met name in sterk gespecialiseerde domeinen, zijn er onvoldoende kwalitatieve gelabelde gegevens beschikbaar om robuuste modellen te trainen.
- Hoge kosten van annotatie: Handmatige data-annotatie is een arbeidsintensief en kostbaar proces.
- Privacyvereisten: Juridische en ethische normen (zoals de GDPR) beperken het gebruik van echte gegevens die persoonlijke, medische of financiële informatie bevatten.
- Klassenonevenwicht: In echte data kunnen bepaalde belangrijke maar zeldzame gebeurtenissen (edge cases) ondervertegenwoordigd zijn, waardoor een model ze moeilijk kan leren.
LLM's, getraind op enorme corpora van tekst en code, zijn een krachtig instrument geworden voor het aanpakken van deze problemen, omdat ze in staat zijn samenhangende en gevarieerde inhoud te genereren die stijlen en distributies van echte data nabootst.
Belangrijkste generatiemethoden met behulp van LLM
Er bestaan verschillende sleutelbenaderingen voor het aanmaken van synthetische data met behulp van LLM.
1. Generatie op basis van prompts (Prompt-based)
Dit is een directe methode waarbij een LLM gegevens genereert op basis van een tekstuele aanwijzing (prompt).
- Zero-shot (vanaf nul): Het model genereert voorbeelden op basis van alleen een taakomschrijving, zonder dat er voorbeelden worden verstrekt. Deze aanpak bevordert diversiteit, maar kan leiden tot minder relevante resultaten.
- Few-shot (met enkele voorbeelden): In de prompt worden enkele voorbeelden van de gewenste uitvoer opgenomen. Dit stuurt het model en verhoogt de relevantie van de gegenereerde data, maar brengt het risico van duplicatie en verlies van diversiteit met zich mee, omdat het model de neiging heeft patronen te kopiëren[1].
2. Generatie met aanvulling van externe informatie (Retrieval-Augmented)
Deze methode is bedoeld om de feitelijke juistheid van synthetische data te verhogen en het risico op hallucinaties te verminderen. Het model vertrouwt niet uitsluitend op zijn interne kennis, maar maakt gebruik van aangeboden context uit een betrouwbare externe bron. Bijvoorbeeld: voor het genereren van een vraag-antwoordpaar wordt eerst een relevant alinea uit Wikipedia opgehaald, waarna de LLM wordt gevraagd een vraag en antwoord te formuleren die strikt gebaseerd zijn op die tekst.
3. Iteratieve verfijning en zelfverbetering (Self-Refinement)
Deze klasse van methoden gebruikt een feedbacklus om de kwaliteit van de data te verbeteren. Het bekendste voorbeeld is de methode Self-Instruct[1].
- Het model genereert een initiële dataset.
- Deze data worden gebruikt voor het fine-tunen van het model zelf (of een kopie ervan).
- Fouten en zwakke plekken van het model op de gegenereerde data worden geanalyseerd.
- Het model wordt gevraagd nieuwe, complexere voorbeelden te genereren die lijken op die waarbij het fouten maakte.
Volgens dit schema werd de beroemde dataset Stanford Alpaca gecreëerd — 52.000 instructie-antwoordparen, gegenereerd door het model GPT-3, waarmee het open model LLaMA kon worden fine-getuned tot het niveau van een instructievolgende assistent.
4. Nabewerking en filtering
Na het genereren van data wordt altijd filtering toegepast om kwalitatief slechte voorbeelden te verwijderen. De methoden variëren van eenvoudig (verwijderen van duplicaten, formaatcontrole) tot complex, zoals:
- Gebruik van een kritiekmodel: Een afzonderlijke classifier wordt getraind die echte data onderscheidt van synthetische data en de minst realistische voorbeelden eruit filtert.
- Filtering op betrouwbaarheid: Alleen die voorbeelden worden behouden waarvoor de LLM met grote zekerheid het juiste antwoord of label voorspelt.
- Weging van data: Voorbeelden die verdacht zijn op fouten of hallucinaties krijgen een lager gewicht in de verliesfunctie tijdens het trainen, om hun negatieve invloed te verminderen (methode SunGen).
5. Leren met uitvoeringsreacties (Execution Feedback)
Deze methode is bijzonder effectief voor het genereren van programmacode. In tegenstelling tot tekst in natuurlijke taal heeft code een formeel correctheidscriterium — het kan worden uitgevoerd. De cyclus ziet er als volgt uit:
- De LLM genereert code om een taak op te lossen.
- De code wordt automatisch uitgevoerd en gecontroleerd aan de hand van tests.
- Correcte oplossingen worden opgenomen in de trainingsset. Incorrecte oplossingen worden verworpen, of het model ontvangt een signaal (reward) om de fout te corrigeren.
Toepassingen van synthetische data
- Verbetering van taken bij gebrek aan data: Synthetische data zijn het meest effectief wanneer er weinig echte gelabelde gegevens beschikbaar zijn. Onderzoek toont aan dat het toevoegen van 100 synthetische voorbeelden aan 100 echte voorbeelden de nauwkeurigheid van een classifier met 3–26% kan verhogen[3].
- Aanmaken van instructiesets (Instruction Tuning): Projecten zoals Alpaca en Code Alpaca hebben aangetoond dat met behulp van LLM grote en kwalitatieve datasets kunnen worden gecreëerd voor het trainen van assistentmodellen, vrijwel vanaf nul.
- Informatiezoeken en vraagbeantwoording (QA): De methode InPars gebruikt LLM voor het genereren van zoekopdrachten bij bestaande documenten. Hiermee kunnen automatisch vraag-relevantdocumentparen worden aangemaakt voor het trainen van zoeksystemen.
- Privacybescherming: In de geneeskunde en financiële sector worden synthetische data gebruikt voor het trainen van modellen zonder toegang tot echte persoonsgegevens. Zo genereerde het Amerikaanse Ministerie van Veteranenzaken tijdens de COVID-19-pandemie synthetische medische gegevens voor informatiedeling[2].
Voordelen en risico's
Voordelen
- Kostenverlaging en versnelling van ontwikkeling: Het genereren van data door een model is aanzienlijk goedkoper en sneller dan handmatige annotatie.
- Schaalbaarheid: Synthetische data kunnen in vrijwel onbeperkte hoeveelheden worden gegenereerd.
- Beheersbaarheid: De ontwikkelaar kan de samenstelling, stijl en complexiteit van de gegenereerde data flexibel instellen.
- Naleving van privacy: Ze bieden een geanonimiseerd alternatief voor het werken met gevoelige gegevens.
- Modelrobuustheid (Robustness): Trainen op gevarieerde en zelfs uitdagende synthetische voorbeelden maakt modellen minder vatbaar voor overfitting en robuuster voor onverwachte invoer.
Beperkingen en risico's
- Feitelijke onjuistheden (hallucinaties): LLM's kunnen onjuiste feiten genereren die, wanneer ze in de trainingsset worden opgenomen, worden overgedragen op nieuwe modellen.
- Onvoldoende realisme: Synthetische teksten kunnen te schematisch, formeel of te weinig representatief zijn voor de rijkdom van levende taal, wat de generaliseerbaarheid van het model vermindert.
- Versterking van systeemvertekeningen (Bias): LLM's erven sociale stereotypen en vooroordelen uit hun trainingsdata en kunnen deze versterken.
- Risico op "modelcollaps": Een verschijnsel waarbij het herhaaldelijk trainen van modellen op data gegenereerd door eerdere versies van modellen leidt tot geleidelijke kwaliteitsachteruitgang en het "vergeten" van zeldzame verschijnselen.
- Mogelijke privacylekken: Zonder speciale maatregelen (zoals differentiële privacy) kunnen LLM's per ongeluk fragmenten van echte gegevens uit hun trainingsset reproduceren, wat het risico op de-anonimisering met zich meebrengt[4].
Perspectieven en onderzoeksrichtingen
- Automatisering van promptselectie: Ontwikkeling van methoden die automatisch optimale prompts vinden voor het genereren van kwalitatieve data.
- Multimodale synthetische generatie: Uitbreiding van de methodologieën naar het genereren van gecombineerde data (tekst + afbeelding, audio, video).
- Ontwikkeling van kwaliteitsmetrieken: Het creëren van gestandaardiseerde benchmarks voor het beoordelen van de bruikbaarheid, diversiteit en het realisme van synthetische data.
- Beheersing van vertekeningen: Ontwikkeling van methoden voor het beheersen en verminderen van bias in gegenereerde data, bijvoorbeeld via het genereren van contrafeitelijke voorbeelden.
- Veilige toepassing in de industrie: Ontwikkeling van juridische en ethische normen voor het gebruik van synthetische data in kritische domeinen.
Verwijzingen
- Overzichtsartikel: Synthetic Data Generation Using Large Language Models (2025)
- Blog van Google Research over datageneratie met differentiële privacy
Literatuur
- Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
- Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
- Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
- Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
- Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
- Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
- Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
- Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
- Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
- Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.
Noten
- ↑ 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 марта 2025 г. [1]
- ↑ 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [2]
- ↑ Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [3]
- ↑ Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [4]