Paglikha ng Synthetic Data

From Systems analysis Wiki
Jump to navigation Jump to search

Pagbuo ng synthetic na data gamit ang LLM — ito ay isang teknolohiya ng artipisyal na paglikha ng data na, sa kanilang mga estadistikal at istrukturang katangian, ay ginagaya ang tunay na data, ngunit hindi naglalaman ng aktwal na personal na impormasyon. Ang pamamaraang ito, na gumagamit ng mga kakayahan ng malalaking language model (LLM), ay naging pangunahing kagamitan sa modernong Machine Learning para sa paglutas ng mga problemang may kaugnayan sa kakulangan ng data, confidentiality, at mataas na gastos ng manu-manong pag-label[1].

Kahulugan at Mga Paunang Kondisyon

Ano ang synthetic na data?

Synthetic na data — ito ay artipisyal na nabuong impormasyon na ginagaya ang mga estadistikal na katangian at mga pattern ng orihinal, tunay na dataset. Tinutukoy ng National Institute of Standards and Technology ng USA (NIST) ang mga ito bilang data na nagpapanatili ng mga estadistikal na katangian ng orihinal, ngunit hindi nagbubunyag ng mga indibidwal na detalye[2]. Hindi tulad ng simpleng pagtatanggal ng pagkakakilanlan (anonymization), ang synthesis ng data ay lumilikha ng ganap na bagong mga talaan, na nagbibigay ng mas mataas na antas ng proteksyon ng privacy.

Bakit lumitaw ang pangangailangan?

Ang lumalaking interes sa synthetic na pagbuo ay dulot ng ilang mga kadahilanan:

  • Kakulangan ng data: Sa maraming larangan, lalo na sa mga espesyalisadong lugar, ang mga de-kalidad na may-label na data ay hindi sapat para sa pagsasanay ng mga matibay na modelo.
  • Mataas na gastos ng pag-label: Ang manu-manong pag-label ng data ay isang napakahirap at mahal na proseso.
  • Mga kinakailangan sa confidentiality: Ang mga legal at etikal na pamantayan (halimbawa, GDPR) ay nililimitahan ang paggamit ng tunay na data na naglalaman ng personal, medikal, o pinansyal na impormasyon.
  • Kawalan ng balanse sa klase: Sa tunay na data, ang ilang mahahalagang ngunit bihirang mga kaganapan (edge cases) ay maaaring hindi sapat na kinakatawan, na pumipigil sa modelo na matutunan ang mga ito.

Ang mga LLM na sinanay sa napakalaking corpus ng teksto at code ay naging makapangyarihang kagamitan para sa paglutas ng mga problemang ito, dahil kaya nilang bumuo ng magkakaugnay at magkakaibang nilalaman na ginagaya ang mga estilo at distribusyon ng tunay na data.

Mga Pangunahing Paraan ng Pagbuo gamit ang LLM

Mayroong ilang mga pangunahing pamamaraan para sa paglikha ng synthetic na data gamit ang mga LLM.

1. Pagbuo batay sa prompt (Prompt-based)

Ito ay isang direktang paraan kung saan ang LLM ay bumubuo ng data batay sa isang tekstwal na kahilingan (prompt).

  • Zero-shot (mula sa simula): Ang modelo ay bumubuo ng mga halimbawa batay lamang sa paglalarawan ng gawain, nang walang pagbibigay ng mga sample. Ang pamamaraang ito ay nagtataguyod ng pagkakaiba-iba, ngunit maaaring humantong sa mas hindi angkop na mga resulta.
  • Few-shot (may ilang mga halimbawa): Ang ilang mga halimbawa (sample) ng nais na output ay isinama sa prompt. Ginagabayan nito ang modelo at pinapataas ang kaugnayan ng nabuong data, ngunit nagdadala ng panganib ng pagdoble at pagkawala ng pagkakaiba-iba, dahil ang modelo ay may tendensiyang kopyahin ang mga pattern[1].

2. Pagbuo na may karagdagang panlabas na impormasyon (Retrieval-Augmented)

Ang pamamaraang ito ay naglalayong mapataas ang katumpakan ng katotohanan ng synthetic na data at mabawasan ang panganib ng mga hallucination. Ang modelo ay hindi umaasa lamang sa sarili nitong panloob na kaalaman, kundi gumagamit ng ibinigay na konteksto mula sa isang mapagkakatiwalaang panlabas na pinagkukunan. Halimbawa, para sa pagbuo ng pares na "tanong-sagot", una munang kinukuha ang isang kaugnay na talata mula sa Wikipedia, at pagkatapos ay hinihingi sa LLM na bumuo ng tanong at sagot na mahigpit na batay sa tekstong iyon.

3. Iteratibong Pagpipino at Self-Refinement

Ang klase ng mga pamamaraang ito ay gumagamit ng feedback loop para mapabuti ang kalidad ng data. Ang pinakakilalang halimbawa ay ang pamamaraang Self-Instruct[1].

  1. Ang modelo ay bumubuo ng paunang dataset.
  2. Ang data na ito ay ginagamit para sa fine-tuning ng mismong modelo (o ng kopya nito).
  3. Ang mga pagkakamali at mahinang bahagi ng modelo ay sinusuri sa nabuong data.
  4. Ang modelo ay hinihiling na bumuo ng mga bago, mas kumplikadong halimbawa na katulad ng mga pinagkakamalan nito.

Ayon sa pamamaraang ito nilikha ang sikat na dataset na Stanford Alpaca — 52,000 pares ng "instruksyon-tugon" na binuo ng GPT-3, na nagpahintulot sa fine-tuning ng bukas na modelong LLaMA hanggang sa antas ng isang assistant na sumusunod sa mga instruksyon.

4. Post-processing at Pag-filter

Pagkatapos ng pagbuo ng data, palaging isinasagawa ang pag-filter upang alisin ang mga hindi magandang kalidad na halimbawa. Ang mga pamamaraan ay nagmimistula mula sa simple (pag-aalis ng mga duplicate, pagsusuri ng format) hanggang sa kumplikado, tulad ng:

  • Paggamit ng critic model: Isang hiwalay na classifier ang sinasamahan upang makilala ang tunay na data mula sa synthetic at alisin ang mga pinaka-hindi makatotohanang sample.
  • Pag-filter ayon sa kumpiyansa: Mga halimbawa lamang ang pinapanatili kung saan ang LLM ay may mataas na kumpiyansang hinuhulaan ang tamang sagot/label.
  • Pagbibigay ng timbang sa data: Ang mga halimbawa na pinaghihinalaang may mga pagkakamali o hallucination ay binibigyan ng mas mababang timbang sa loss function sa panahon ng pagsasanay, upang mabawasan ang kanilang negatibong epekto (pamamaraan ng SunGen).

5. Pagsasanay na may feedback (Execution Feedback)

Ang pamamaraang ito ay lalong epektibo para sa pagbuo ng program code. Hindi tulad ng natural na tekstong wika, ang code ay may pormal na pamantayan ng kawastuhan — maaari itong ipatupad. Ang siklo ay ganito:

  1. Ang LLM ay bumubuo ng code para sa paglutas ng isang gawain.
  2. Ang code ay awtomatikong pinapatakbo at sinusuri laban sa mga pagsusulit.
  3. Ang mga tamang solusyon ay isinama sa training set. Ang mga hindi tamang solusyon ay itinatanggal, o ang modelo ay tumatanggap ng signal (reward) para iwasto ang pagkakamali.

Paggamit ng Synthetic na Data

  • Pagpapabuti ng mga gawain sa kakulangan ng data: Ang synthetic na data ay pinakaepektibo kapag kakaunti ang tunay na may-label na data. Ipinapakita ng mga pananaliksik na ang pagdaragdag ng 100 synthetic na halimbawa sa 100 tunay na halimbawa ay maaaring mapataas ang katumpakan ng classifier ng 3–26%[3].
  • Paglikha ng mga set ng instruksyon (Instruction Tuning): Ang mga proyekto tulad ng Alpaca at Code Alpaca ay nagpakita na sa pamamagitan ng mga LLM ay maaaring lumikha ng malalaki at de-kalidad na mga dataset para sa pagsasanay ng mga assistant model mula sa halos simula.
  • Paghahanap ng impormasyon at pagsagot sa mga tanong (QA): Ginagamit ng pamamaraang InPars ang mga LLM para bumuo ng mga search query para sa mga kasalukuyang dokumento. Nagbibigay-daan ito sa awtomatikong paglikha ng mga pares na "tanong — kaugnay na dokumento" para sa pagsasanay ng mga sistema ng paghahanap.
  • Proteksyon ng confidentiality: Sa medisina at pananalapi, ginagamit ang synthetic na data para sa pagsasanay ng mga modelo nang walang access sa tunay na personal na data. Halimbawa, ang Department of Veterans Affairs ng USA ay bumuo ng synthetic na medikal na data sa panahon ng pandemya ng COVID-19 para sa pagbabahagi ng impormasyon[2].

Mga Kalamangan at Panganib

Mga Kalamangan

  • Pagbabawas ng gastos at pagpapabilis ng pagpapaunlad: Ang pagbuo ng data ng modelo ay mas mura at mas mabilis kaysa sa manu-manong pag-label.
  • Scalability: Ang synthetic na data ay maaaring buuin sa halos walang limitasyong dami.
  • Kakayahang kontrolin: Ang developer ay maaaring nag-aayos nang may kakayahang umangkop sa komposisyon, estilo, at kumplikasyon ng nabuong data.
  • Pagsunod sa confidentiality: Nagbibigay ng anonymized na alternatibo para sa pagtatrabaho sa sensitibong data.
  • Katatagan ng mga modelo (Robustness): Ang pagsasanay sa magkakaibang at maging "nagtutukso" na synthetic na mga halimbawa ay ginagawang mas hindi madaling mag-overfit ang mga modelo at mas matibay laban sa mga hindi inaasahang input data.

Mga Limitasyon at Panganib

  • Mga katotohanang kamalian (hallucination): Ang mga LLM ay maaaring bumuo ng maling mga katotohanan, na, kapag isinama sa training set, ay naka-ingat sa mga bagong modelo.
  • Hindi sapat na pagiging makatotohanan: Ang mga synthetic na teksto ay maaaring masyadong template, pormal, o hindi sumasalamin sa buong pagkakaiba-iba ng buhay na wika, na nagpapababa ng kakayahang mag-generalize ng modelo.
  • Pagpapalaki ng mga sistemikong bias (Bias): Ang mga LLM ay nagmamana at maaaring magpalakas ng mga sosyal na stereotipo at pagkiling na naroroon sa kanilang mga training data.
  • Panganib ng "pagbagsak ng modelo": Isang kababalaghan kung saan ang paulit-ulit na pagsasanay ng mga modelo sa data na binuo ng mga nakaraang bersyon ng modelo ay humahantong sa unti-unting pagkasira ng kalidad at "pagkalimot" ng mga bihirang kababalaghan.
  • Mga posibleng pagtagas ng confidentiality: Nang walang mga espesyal na hakbang (halimbawa, differential privacy) ang mga LLM ay maaaring hindi sinasadyang ipareplika ang mga fragment ng tunay na data mula sa kanilang training set, na nagdadala ng panganib ng deanonymization[4].

Mga Pananaw at Direksyon ng Pananaliksik

  • Awtomatisasyon ng pagpili ng prompt: Pagpapaunlad ng mga pamamaraan na awtomatikong naghahanap ng pinakamainam na mga prompt para sa pagbuo ng de-kalidad na data.
  • Multimodal synthetic na pagbuo: Pagpapalawak ng mga metodolohiya sa pagbuo ng kombinadong data (teksto + imahe, audio, video).
  • Pagpapaunlad ng mga sukatan ng kalidad: Paglikha ng mga standardized na benchmark para sa pagtatasa ng pagiging kapaki-pakinabang, pagkakaiba-iba, at pagiging makatotohanan ng synthetic na data.
  • Pamamahala ng mga bias: Pagbuo ng mga pamamaraan para sa kontrol at pagbabawas ng pagkiling sa nabuong data, halimbawa, sa pamamagitan ng pagbuo ng mga counterfactual na halimbawa.
  • Ligtas na pagpapakilala sa industriya: Pagbuo ng mga legal at etikal na pamantayan para sa paggamit ng synthetic na data sa mga kritikal na larangan.

Mga Sanggunian

  • Pangkalahatang artikulo: Synthetic Data Generation Using Large Language Models (2025)
  • Blog ng Google Research tungkol sa pagbuo ng data na may differential privacy

Literatura

  • Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
  • Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
  • Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
  • Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
  • Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
  • Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
  • Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
  • Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
  • Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
  • Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.

Mga Tala

  1. 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 марта 2025 г. [1]
  2. 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [2]
  3. Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [3]
  4. Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [4]