Generering av syntetiska data

From Systems analysis Wiki
Jump to navigation Jump to search

Generering av syntetiska data med hjälp av LLM — är en teknik för artificiellt skapande av data som till sina statistiska och strukturella egenskaper imiterar verkliga data, men som inte innehåller faktisk personlig information. Detta tillvägagångssätt, som utnyttjar kapaciteten hos stora språkmodeller (LLM), har blivit ett centralt verktyg inom modern maskininlärning för att lösa problem med databrist, integritetskrav och höga kostnader för manuell annotering[1].

Definition och förutsättningar

Vad är syntetiska data?

Syntetiska data — är artificiellt genererad information som återger de statistiska egenskaperna och mönstren hos ett ursprungligt, verkligt dataset. USA:s nationella institut för standarder och teknik (NIST) definierar dem som data som bevarar originalets statistiska egenskaper men inte avslöjar individuella detaljer[2]. Till skillnad från enkel avidentifiering (anonymisering) skapar datasyntes helt nya poster, vilket ger en högre nivå av integritetsskydd.

Varför uppstod behovet?

Det växande intresset för syntetisk generering beror på ett antal faktorer:

  • Databrist: Inom många områden, särskilt högspecialiserade sådana, finns det inte tillräckligt med kvalitativt annoterade data för att träna robusta modeller.
  • Höga annotationskostnader: Manuell annotering av data är en arbetsintensiv och kostsam process.
  • Integritetskrav: Rättsliga och etiska normer (t.ex. GDPR) begränsar användningen av verkliga data som innehåller personlig, medicinsk eller finansiell information.
  • Klassobalans: I verkliga data kan vissa viktiga men sällsynta händelser (edge cases) vara underrepresenterade, vilket hindrar modellen från att lära sig dem.

LLM, tränade på enorma textkorpusar och kod, har blivit ett kraftfullt verktyg för att lösa dessa problem, eftersom de kan generera sammanhängande och varierat innehåll som imiterar stilar och fördelningar i verkliga data.

Huvudsakliga genereringsmetoder med hjälp av LLM

Det finns flera centrala tillvägagångssätt för att skapa syntetiska data med hjälp av LLM.

1. Generering via prompt (Prompt-based)

Detta är en direkt metod där LLM genererar data baserat på en textfråga (prompt).

  • Zero-shot (från grunden): Modellen genererar exempel enbart utifrån en uppgiftsbeskrivning, utan att tillhandahålla exempeldata. Detta tillvägagångssätt främjar variation men kan leda till mindre relevanta resultat.
  • Few-shot (med några exempel): Ett antal exempel (prov) på önskat utdata inkluderas i prompten. Detta vägleder modellen och ökar relevansen hos de genererade data, men medför risk för duplicering och förlust av variation, eftersom modellen tenderar att kopiera mönster[1].

2. Generering med tillägg av extern information (Retrieval-Augmented)

Denna metod syftar till att förbättra den faktamässiga korrektheten hos syntetiska data och minska risken för hallucinationer. Modellen förlitar sig inte enbart på sin interna kunskap, utan använder ett tillhandahållet sammanhang från en tillförlitlig extern källa. Till exempel, för att generera ett fråga-svar-par hämtas först ett relevant stycke från Wikipedia, varefter LLM ombeds formulera en fråga och ett svar som strikt baseras på denna text.

3. Iterativ förfining och självlärande (Self-Refinement)

Denna klass av metoder använder en återkopplingsloop för att förbättra datakvaliteten. Det mest kända exemplet är metoden Self-Instruct[1].

  1. Modellen genererar en initial datamängd.
  2. Dessa data används för att finjustera modellen själv (eller en kopia av den).
  3. Modellens fel och svagheter på de genererade data analyseras.
  4. Modellen ombeds generera nya, mer komplexa exempel som liknar de där den begick fel.

Enligt just detta schema skapades det berömda datasetet Stanford Alpaca — 52 000 instruktions-svar-par genererade av modellen GPT-3, vilket möjliggjorde finjustering av den öppna modellen LLaMA till nivån av en instruktionsföljarassistent.

4. Efterbearbetning och filtrering

Efter generering av data tillämpas alltid filtrering för att gallra bort lågkvalitativa exempel. Metoderna varierar från enkla (borttagning av dubbletter, formatvalidering) till komplexa, såsom:

  • Användning av en kritikermodell: En separat klassificerare tränas för att skilja verkliga data från syntetiska och gallrar bort de minst realistiska exemplen.
  • Konfidensbaserad filtrering: Endast de exempel behålls för vilka LLM med hög säkerhet förutsäger rätt svar/etikett.
  • Viktning av data: Exempel som är misstänkta för fel eller hallucinationer tilldelas lägre vikt i förlustfunktionen under träning, för att minska deras negativa påverkan (metoden SunGen).

5. Träning med exekveringsfeedback (Execution Feedback)

Denna metod är särskilt effektiv för generering av programkod. Till skillnad från naturligt språklig text har kod ett formellt korrekthetskriterium — den kan exekveras. Cykeln ser ut som följer:

  1. LLM genererar kod för att lösa en uppgift.
  2. Koden körs automatiskt och kontrolleras mot tester.
  3. Korrekta lösningar inkluderas i träningssetet. Inkorrekta förkastas, eller så får modellen en signal (reward) för att rätta till felet.

Tillämpningar av syntetiska data

  • Förbättring av uppgifter vid databrist: Syntetiska data är mest effektiva när det finns få verkliga annoterade data. Forskning visar att tillägg av 100 syntetiska exempel till 100 verkliga kan förbättra en klassificerares noggrannhet med 3–26%[3].
  • Skapande av instruktionsdataset (Instruction Tuning): Projekt som Alpaca och Code Alpaca visade att man med hjälp av LLM kan skapa stora och kvalitativa dataset för träning av assistentmodeller nästan från grunden.
  • Informationssökning och frågesvar (QA): Metoden InPars använder LLM för att generera sökfrågor till befintliga dokument. Detta möjliggör automatiskt skapande av fråga–relevant-dokument-par för träning av söksystem.
  • Integritetsskydd: Inom medicin och finans används syntetiska data för att träna modeller utan tillgång till verkliga personuppgifter. Till exempel genererade USA:s veterandepartement syntetiska medicinska data under COVID-19-pandemin för informationsutbyte[2].

Fördelar och risker

Fördelar

  • Minskade kostnader och snabbare utveckling: Generering av data med en modell är betydligt billigare och snabbare än manuell annotering.
  • Skalbarhet: Syntetiska data kan genereras i praktiskt taget obegränsade mängder.
  • Kontrollerbarhet: Utvecklaren kan flexibelt styra sammansättning, stil och komplexitet hos de genererade data.
  • Integritetsskydd: Erbjuder ett avidentifierat alternativ för arbete med känsliga data.
  • Modellrobusthet (Robustness): Träning på varierade och till och med "knepiga" syntetiska exempel gör modeller mindre benägna till överanpassning och mer robusta mot oväntade indata.

Begränsningar och risker

  • Faktamässiga felaktigheter (hallucinationer): LLM kan generera felaktiga fakta som, när de inkluderas i träningssetet, befästs i nya modeller.
  • Otillräcklig realism: Syntetiska texter kan vara alltför schablonartade, formella eller inte återspegla hela mångfalden av levande språk, vilket minskar modellens generaliseringsförmåga.
  • Förstärkning av systematiska snedvridningar (Bias): LLM ärver och kan förstärka sociala stereotyper och fördomar som finns i deras träningsdata.
  • Risk för "modellkollaps": Ett fenomen där upprepad träning av modeller på data som genererats av tidigare versioner av modeller leder till gradvis kvalitetsförsämring och "glömska" av sällsynta företeelser.
  • Möjliga integritetsläckor: Utan särskilda åtgärder (t.ex. differentiell integritet) kan LLM av misstag återge fragment av verkliga data från sitt träningsset, vilket medför risk för avidentifiering[4].

Framtidsutsikter och forskningsinriktningar

  • Automatisering av prompt-urval: Utveckling av metoder som automatiskt hittar optimala prompts för generering av kvalitativa data.
  • Multimodal syntetisk generering: Utvidgning av metodologin till generering av kombinerade data (text + bild, ljud, video).
  • Utveckling av kvalitetsmått: Skapande av standardiserade benchmark för utvärdering av nyttighet, variation och realism hos syntetiska data.
  • Hantering av snedvridningar: Utveckling av metoder för att kontrollera och minska bias i genererade data, t.ex. genom generering av kontrafaktiska exempel.
  • Säker implementering i industrin: Utveckling av rättsliga och etiska standarder för användning av syntetiska data inom kritiska områden.

Externa länkar

  • Översiktsartikel: Synthetic Data Generation Using Large Language Models (2025)
  • Google Research-blogg om datagenerering med differentiell integritet

Litteratur

  • Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
  • Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
  • Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
  • Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
  • Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
  • Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
  • Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
  • Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
  • Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
  • Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.

Noter

  1. 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 марта 2025 г. [1]
  2. 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [2]
  3. Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [3]
  4. Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [4]