In-Context Learning (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Pag-aaral sa Loob ng Konteksto (Ingles: In-Context Learning, ICL) — ito ay isang pangunahing kakayahan ng malalaking language model (LLM) na matuto ng mga bagong gawain nang mabilis, gamit lamang ang mga halimbawa (demonstrasyon) na ibinibigay sa konteksto (prompt) ng kahilingan. Ang pangunahing katangian nito ay ang proseso ng adaptasyong ito ay nagaganap nang walang pag-update ng mga weight (parameter) ng modelo, ibig sabihin, nang walang tradisyonal na fine-tuning[1][2].

Ang mekanismong ito ay nagbibigay-daan sa mga modelo na magpakita ng kahanga-hangang kakayahang umangkop, na nilulutas ang mga gawaing hindi sila espesyal na sinanay. Ang ICL ay naging isa sa mga pangunahing tagumpay na nagpagaling at nagpalakas sa malalaking language model[3].

Mga Mekanismo ng Pagtatrabaho

Ang tumpak na pag-unawa sa kung paano gumagana ang ICL ay nananatiling aktibong larangan ng pananaliksik, ngunit mayroon nang ilang nangungunang teorya na nagpapaliwanag sa penomenong ito.

Transformer bilang Meta-Optimizer

Ang isa sa mga sikat na teorya ay nagsasaad na ang arkitektura ng Transformer sa panahon ng pre-training ay natututo na ipatupad ang mga algorithm ng pag-aaral sa loob ng mga forward pass nito. Kapag nakatanggap ang modelo ng prompt na may mga halimbawa, ito ay tahimik na nagsasagawa ng isang uri ng optimisasyon upang malutas ang ipinakitang gawain, iniaangkop ang mga panloob na estado (activations) nito, hindi ang mga weight[4].

Bayesian Inference

Ang isa pang teorya ay itinuturing ang ICL bilang isang anyo ng Bayesian inference. Ang modelo, na pre-trained sa napakalaking dami ng datos, ay mayroon nang paunang representasyon ng maraming konsepto. Ang mga halimbawa sa konteksto ay nagsisilbing ebidensya na nagbibigay-daan sa modelo na pinuhin ang posterior na distribusyon ng probabilidad nito sa mga nakatagong konsepto. Sa madaling salita, ang mga halimbawa ay tumutulong sa modelo na "maunawaan" kung alin sa libu-libong gawaing kilala nito ang kailangang lutasin sa kasalukuyan[5].

Mga Uri ng In-Context Learning

Depende sa bilang ng ibinibigay na halimbawa, ang ICL ay nahahati sa tatlong pangunahing uri.

  • Few-shot Learning (pag-aaral sa ilang halimbawa): Ito ang pinakakaraniwang at balanseng diskarte. Ang modelo ay binibigyan ng ilang (karaniwan ay 2 hanggang 10) demonstrasyong halimbawa.

Halimbawa (klasipikasyon ng tono):

Текст: "Какой прекрасный день!"
Тональность: Позитивная

Текст: "Я ненавижу стоять в пробках."
Тональность: Негативная

Текст: "Этот фильм был довольно средним."
Тональность:

Inaasahang sagot:

Нейтральная
  • One-shot Learning (pag-aaral sa isang halimbawa): Ang modelo ay binibigyan lamang ng isang halimbawa. Madalas ito ay sapat na upang matukoy ang format ng sagot at makabuluhang mapabuti ang pagganap kumpara sa zero-shot na diskarte.
  • Zero-shot Learning (pag-aaral nang walang halimbawa): Ang modelo ay hindi binibigyan ng mga halimbawa, kundi isang instruksyon lamang o paglalarawan ng gawain. Sa kasong ito, ang modelo ay ganap na umaasa sa kaalaman na nakuha sa panahon ng pre-training.

Praktikal na Paggamit

Ang tamang paggamit ng ICL ay nagbibigay-daan na malutas ang malawak na hanay ng mga gawain nang walang mahal na pagbuo at fine-tuning.

  • Para sa mga malikhaing at istilo-batay na gawain (pagbuo ng code sa isang partikular na istilo, pagsulat ng teksto sa paraan ng isang partikular na may-akda):
    • Inirerekomenda ang Few-shot Learning.
    • Ang mga halimbawa ay tumutulong sa modelo na mahulaan ang kinakailangang istilo, format at istraktura ng output.
  • Para sa mga simpleng gawain na may malinaw na mga instruksyon (pagsasalin, pagbubuod, pagsagot sa mga simpleng tanong):
    • Madalas ay sapat na ang Zero-shot Learning.
    • Ang mga modernong modelo ay medyo mahusay na sa ganitong mga gawain kung sila ay bahagi ng kanilang pre-training.
  • Para sa mga gawain kung saan mahalaga ang format ng output (pagbuo ng JSON, pagkuha ng mga entity):
    • Inirerekomenda ang One-shot o Few-shot Learning.
    • Kahit isang halimbawa ay maaaring malinaw na magtakda ng kinakailangang istraktura ng sagot, na pinipigilan ang mga pagkakamali sa pag-format.

Mga Kalamangan at Kahinaan

Paghahambing ng mga kalamangan at kahinaan ng ICL
Mga Kalamangan Mga Kahinaan
  • Kakayahang umangkop at bilis: Agarang adaptasyon sa mga bagong gawain nang hindi kailangang mag-retrain.
  • Pagtitipid ng mga mapagkukunan: Hindi nangangailangan ng pagkolekta ng datos, paglalagyan ng label, at lakas ng pagkalkula para sa fine-tuning.
  • Pagiging accessible: Nagbibigay-daan sa mga gumagamit na walang kaalaman sa ML na i-configure ang mga modelo gamit ang mga simpleng halimbawang teksto.
  • Mga limitasyon ng context window: Ang bilang ng mga halimbawa ay limitado ng maximum na haba ng konteksto ng modelo.
  • Sensitivity sa mga halimbawa: Ang resulta ay lubos na nakasalalay sa kalidad, pagkakasunod-sunod, at format ng mga ibinigay na demonstrasyon.
  • Mataas na gastos sa yugto ng inference: Ang mahahabang prompt na may maraming halimbawa ay nagpapataas ng gastos at oras ng pagbuo.
  • Mga panganib sa seguridad: Ang pagpapasa ng kumpidensyal na impormasyon bilang mga halimbawa ay maaaring hindi ligtas.

Paghahambing sa Iba Pang Paradigma

ICL vs. Fine-tuning

Ang Fine-tuning (karagdagang pagsasanay) ay binabago ang mga weight ng modelo, "nini-imprint" ang mga bagong kaalaman dito. Ginagawa nitong eksperto ang modelo sa isang makitid na larangan, ngunit binabawasan ang pangkalahatang kakayahang umangkop nito. Ang ICL, sa kabilang banda, ay hindi binabago ang mga weight at mas flexible, ngunit maaaring mababa ang pagganap sa mga highly specialized na gawain na nangangailangan ng malalim na kaalaman sa domain.

ICL vs. RAG (Retrieval-Augmented Generation)

Ang parehong pamamaraan ay nagpapalawak ng konteksto ng modelo, ngunit para sa iba't ibang layunin:

  • Ginagamit ng ICL ang mga halimbawa upang turuan ang modelo kung paano isasagawa ang gawain (demonstrasyon ng kasanayan).
  • Ginagamit ng RAG ang nakuhang impormasyon upang ipaalam sa modelo ang mga katotohanang kinakailangan para sa sagot (pagbibigay ng kaalaman).

Sa praktis, ang ICL at RAG ay madalas na pinagsasama upang makamit ang pinakamahusay na resulta.

Talasanggunian

  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Dai, D. et al. (2022). Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers. arXiv:2212.10559.
  • Panwar, M.; Ahuja, K.; Goyal, N. (2024). In-Context Learning through the Bayesian Prism. arXiv:2306.04891.
  • Müller, S. et al. (2021). Transformers Can Do Bayesian Inference. arXiv:2112.10510.
  • Garg, S. et al. (2022). What Can Transformers Learn In-Context? A Case Study of Simple Function Classes. arXiv:2208.01066.
  • Min, S. et al. (2022). Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?. arXiv:2202.12837.
  • Wang, X. et al. (2023). Explaining and Finding Good Demonstrations for In-Context Learning. arXiv:2302.13971.
  • Xie, S. et al. (2024). A Survey on In-Context Learning. arXiv:2301.00234.
  • Yu, Z.; Ananiadou, S. (2024). How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning. arXiv:2402.02872.
  • Wibisono, K. C.; Wang, Y. (2024). From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When. arXiv:2406.00131.
  • Chan, J. K. et al. (2022). Data Distributional Properties Drive Emergent In-Context Learning in Transformers. arXiv:2205.05055.
  • Hahn, M.; Goyal, N. (2023). A Theory of Emergent In-Context Learning as Implicit Structure Induction. arXiv:2303.07971.

Mga Tala