Generarea datelor sintetice

From Systems analysis Wiki
Jump to navigation Jump to search

Generarea datelor sintetice cu ajutorul LLM este o tehnologie de creare artificială a datelor care, prin caracteristicile lor statistice și structurale, imită datele reale, dar nu conțin informații personale factuale. Această abordare, care valorifică capacitățile modelelor lingvistice mari (LLM), a devenit un instrument-cheie în machine learning-ul modern pentru rezolvarea problemelor de deficit de date, confidențialitate și cost ridicat al adnotării manuale[1].

Definiție și premise

Ce sunt datele sintetice?

Datele sintetice sunt informații generate artificial care reproduc proprietățile statistice și tiparele unui set de date original, real. Institutul Național de Standarde și Tehnologie al SUA (NIST) le definește ca date care păstrează proprietățile statistice ale originalului, fără a dezvălui detalii individuale[2]. Spre deosebire de simpla anonimizare, sinteza datelor creează înregistrări complet noi, ceea ce asigură un nivel mai ridicat de protecție a confidențialității.

De ce a apărut această necesitate?

Creșterea interesului față de generarea sintetică este determinată de mai mulți factori:

  • Deficitul de date: În multe domenii, în special în cele de nișă, datele adnotate de calitate sunt insuficiente pentru antrenarea unor modele robuste.
  • Costul ridicat al adnotării: Adnotarea manuală a datelor este un proces laborios și costisitor.
  • Cerințe de confidențialitate: Normele juridice și etice (de exemplu, GDPR) restricționează utilizarea datelor reale care conțin informații personale, medicale sau financiare.
  • Dezechilibrul claselor: În datele reale, unele evenimente importante, dar rare (edge cases) pot fi insuficient reprezentate, împiedicând modelul să le învețe.

LLM-urile, antrenate pe corpusuri uriașe de text și cod, au devenit un instrument puternic pentru rezolvarea acestor probleme, deoarece sunt capabile să genereze conținut coerent și divers, imitând stilurile și distribuțiile datelor reale.

Principalele metode de generare cu ajutorul LLM

Există câteva abordări-cheie pentru crearea datelor sintetice folosind LLM-uri.

1. Generarea pe bază de instrucțiuni (Prompt-based)

Acesta este un method direct prin care LLM generează date pe baza unei cereri text (prompt).

  • Zero-shot (de la zero): Modelul generează exemple bazându-se doar pe descrierea sarcinii, fără a furniza mostre. Această abordare favorizează diversitatea, dar poate conduce la rezultate mai puțin relevante.
  • Few-shot (cu câteva exemple): În prompt sunt incluse câteva exemple (mostre) ale rezultatului dorit. Aceasta ghidează modelul și îmbunătățește relevanța datelor generate, dar prezintă riscul de duplicare și pierdere a diversității, deoarece modelul tinde să copieze șabloane[1].

2. Generarea augmentată prin recuperare de informații (Retrieval-Augmented)

Această metodă urmărește să crească acuratețea factuală a datelor sintetice și să reducă riscul de halucinații. Modelul nu se bazează exclusiv pe cunoștințele sale interne, ci utilizează contextul furnizat dintr-o sursă externă de încredere. De exemplu, pentru a genera o pereche „întrebare-răspuns", se extrage mai întâi un paragraf relevant din Wikipedia, după care LLM-ul este solicitat să formuleze întrebarea și răspunsul bazate strict pe acel text.

3. Rafinare iterativă și auto-îmbunătățire (Self-Refinement)

Această clasă de metode utilizează o buclă de feedback pentru îmbunătățirea calității datelor. Cel mai cunoscut exemplu este metoda Self-Instruct[1].

  1. Modelul generează un set inițial de date.
  2. Aceste date sunt folosite pentru a re-antrena modelul însuși (sau o copie a acestuia).
  3. Sunt analizate erorile și punctele slabe ale modelului pe datele generate.
  4. Modelul este solicitat să genereze exemple noi, mai complexe, similare celor pe care le-a greșit.

Tocmai după această schemă a fost creat celebrul set de date Stanford Alpaca — 52.000 de perechi „instrucțiune-răspuns" generate de modelul GPT-3, care au permis re-antrenarea modelului open-source LLaMA până la nivelul unui asistent capabil să urmeze instrucțiuni.

4. Post-procesare și filtrare

După generarea datelor, se aplică întotdeauna filtrarea pentru eliminarea exemplelor de calitate scăzută. Metodele variază de la simple (eliminarea duplicatelor, verificarea formatului) până la complexe, precum:

  • Utilizarea unui model-critic: Se antrenează un clasificator separat care distinge datele reale de cele sintetice și elimină mostrele cele mai puțin realiste.
  • Filtrarea după încredere: Sunt păstrate doar acele exemple pentru care LLM-ul prezice cu mare încredere răspunsul/eticheta corectă.
  • Ponderarea datelor: Exemplelor suspecte de erori sau halucinații li se atribuie o pondere mai mică în funcția de pierdere la antrenare, pentru a le reduce influența negativă (metoda SunGen).

5. Antrenare cu feedback de execuție (Execution Feedback)

Această metodă este deosebit de eficientă pentru generarea de cod sursă. Spre deosebire de textul în limbaj natural, codul are un criteriu formal de corectitudine — poate fi executat. Ciclul arată astfel:

  1. LLM generează cod pentru rezolvarea unei sarcini.
  2. Codul este rulat automat și verificat față de teste.
  3. Soluțiile corecte sunt incluse în setul de antrenare. Cele incorecte sunt respinse sau modelul primește un semnal (reward) pentru corectarea erorii.

Aplicații ale datelor sintetice

  • Îmbunătățirea sarcinilor în condiții de lipsă de date: Datele sintetice sunt cele mai eficiente atunci când datele reale adnotate sunt puține. Cercetările arată că adăugarea a 100 de exemple sintetice la 100 reale poate crește acuratețea unui clasificator cu 3–26%[3].
  • Crearea seturilor de instrucțiuni (Instruction Tuning): Proiecte precum Alpaca și Code Alpaca au demonstrat că, folosind LLM-uri, pot fi create seturi de date mari și de calitate pentru antrenarea modelelor-asistent, practic de la zero.
  • Recuperarea informațiilor și răspunsuri la întrebări (QA): Metoda InPars folosește LLM-uri pentru a genera interogări de căutare pentru documentele existente. Aceasta permite crearea automată a perechilor „întrebare — document relevant" pentru antrenarea sistemelor de căutare.
  • Protecția confidențialității: În medicină și finanțe, datele sintetice sunt folosite pentru antrenarea modelelor fără acces la date personale reale. De exemplu, Departamentul pentru Afacerile Veteranilor din SUA a generat date medicale sintetice în timpul pandemiei COVID-19 pentru schimbul de informații[2].

Avantaje și riscuri

Avantaje

  • Reducerea costurilor și accelerarea dezvoltării: Generarea datelor de către un model este semnificativ mai ieftină și mai rapidă decât adnotarea manuală.
  • Scalabilitate: Datele sintetice pot fi generate în volume practic nelimitate.
  • Controlabilitate: Dezvoltatorul poate configura flexibil compoziția, stilul și complexitatea datelor generate.
  • Respectarea confidențialității: Oferă o alternativă anonimizată pentru lucrul cu date sensibile.
  • Robustețea modelelor (Robustness): Antrenarea pe exemple sintetice diverse și chiar „dificile" face modelele mai puțin predispuse la supraadaptare și mai rezistente la intrări neobișnuite.

Limitări și riscuri

  • Inexactități factuale (halucinații): LLM-urile pot genera fapte incorecte care, odată incluse în setul de antrenare, se consolidează în modelele noi.
  • Realism insuficient: Textele sintetice pot fi prea șablonarde, formale sau pot să nu reflecte întreaga diversitate a limbajului viu, reducând capacitatea de generalizare a modelului.
  • Amplificarea distorsiunilor sistemice (Bias): LLM-urile moștenesc și pot amplifica stereotipurile sociale și prejudecățile prezente în datele lor de antrenare.
  • Riscul „colapsului modelului": Fenomenul prin care re-antrenarea repetată a modelelor pe date generate de versiuni anterioare ale modelelor conduce la degradarea treptată a calității și la „uitarea" fenomenelor rare.
  • Posibile scurgeri de confidențialitate: Fără măsuri speciale (de exemplu, confidențialitate diferențială), LLM-urile pot reproduce accidental fragmente din datele reale din setul lor de antrenare, prezentând riscul de deanonimizare[4].

Perspective și direcții de cercetare

  • Automatizarea selectării prompturilor: Dezvoltarea metodelor care găsesc automat prompturile optime pentru generarea de date de calitate.
  • Generarea sintetică multimodală: Extinderea metodologiilor la generarea de date combinate (text + imagine, audio, video).
  • Dezvoltarea metricilor de calitate: Crearea unor benchmark-uri standardizate pentru evaluarea utilității, diversității și realismului datelor sintetice.
  • Gestionarea distorsiunilor: Elaborarea metodelor pentru controlul și reducerea prejudecăților în datele generate, de exemplu prin generarea de exemple contrafactuale.
  • Implementarea sigură în industrie: Elaborarea standardelor juridice și etice pentru utilizarea datelor sintetice în domenii critice.

Referințe

  • Articol de sinteză: Synthetic Data Generation Using Large Language Models (2025)
  • Blogul Google Research despre generarea datelor cu confidențialitate diferențială

Bibliografie

  • Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
  • Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
  • Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
  • Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
  • Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
  • Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
  • Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
  • Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
  • Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
  • Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.

Note

  1. 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 марта 2025 г. [1]
  2. 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [2]
  3. Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [3]
  4. Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [4]