In-Context Learning (TL)
Pag-aaral sa Loob ng Konteksto (Ingles: In-Context Learning, ICL) — ito ay isang pangunahing kakayahan ng malalaking language model (LLM) na matuto ng mga bagong gawain nang mabilis, gamit lamang ang mga halimbawa (demonstrasyon) na ibinibigay sa konteksto (prompt) ng kahilingan. Ang pangunahing katangian nito ay ang proseso ng adaptasyong ito ay nagaganap nang walang pag-update ng mga weight (parameter) ng modelo, ibig sabihin, nang walang tradisyonal na fine-tuning[1][2].
Ang mekanismong ito ay nagbibigay-daan sa mga modelo na magpakita ng kahanga-hangang kakayahang umangkop, na nilulutas ang mga gawaing hindi sila espesyal na sinanay. Ang ICL ay naging isa sa mga pangunahing tagumpay na nagpagaling at nagpalakas sa malalaking language model[3].
Mga Mekanismo ng Pagtatrabaho
Ang tumpak na pag-unawa sa kung paano gumagana ang ICL ay nananatiling aktibong larangan ng pananaliksik, ngunit mayroon nang ilang nangungunang teorya na nagpapaliwanag sa penomenong ito.
Transformer bilang Meta-Optimizer
Ang isa sa mga sikat na teorya ay nagsasaad na ang arkitektura ng Transformer sa panahon ng pre-training ay natututo na ipatupad ang mga algorithm ng pag-aaral sa loob ng mga forward pass nito. Kapag nakatanggap ang modelo ng prompt na may mga halimbawa, ito ay tahimik na nagsasagawa ng isang uri ng optimisasyon upang malutas ang ipinakitang gawain, iniaangkop ang mga panloob na estado (activations) nito, hindi ang mga weight[4].
Bayesian Inference
Ang isa pang teorya ay itinuturing ang ICL bilang isang anyo ng Bayesian inference. Ang modelo, na pre-trained sa napakalaking dami ng datos, ay mayroon nang paunang representasyon ng maraming konsepto. Ang mga halimbawa sa konteksto ay nagsisilbing ebidensya na nagbibigay-daan sa modelo na pinuhin ang posterior na distribusyon ng probabilidad nito sa mga nakatagong konsepto. Sa madaling salita, ang mga halimbawa ay tumutulong sa modelo na "maunawaan" kung alin sa libu-libong gawaing kilala nito ang kailangang lutasin sa kasalukuyan[5].
Mga Uri ng In-Context Learning
Depende sa bilang ng ibinibigay na halimbawa, ang ICL ay nahahati sa tatlong pangunahing uri.
- Few-shot Learning (pag-aaral sa ilang halimbawa): Ito ang pinakakaraniwang at balanseng diskarte. Ang modelo ay binibigyan ng ilang (karaniwan ay 2 hanggang 10) demonstrasyong halimbawa.
Halimbawa (klasipikasyon ng tono):
Текст: "Какой прекрасный день!" Тональность: Позитивная Текст: "Я ненавижу стоять в пробках." Тональность: Негативная Текст: "Этот фильм был довольно средним." Тональность:
Inaasahang sagot:
Нейтральная
- One-shot Learning (pag-aaral sa isang halimbawa): Ang modelo ay binibigyan lamang ng isang halimbawa. Madalas ito ay sapat na upang matukoy ang format ng sagot at makabuluhang mapabuti ang pagganap kumpara sa zero-shot na diskarte.
- Zero-shot Learning (pag-aaral nang walang halimbawa): Ang modelo ay hindi binibigyan ng mga halimbawa, kundi isang instruksyon lamang o paglalarawan ng gawain. Sa kasong ito, ang modelo ay ganap na umaasa sa kaalaman na nakuha sa panahon ng pre-training.
Praktikal na Paggamit
Ang tamang paggamit ng ICL ay nagbibigay-daan na malutas ang malawak na hanay ng mga gawain nang walang mahal na pagbuo at fine-tuning.
- Para sa mga malikhaing at istilo-batay na gawain (pagbuo ng code sa isang partikular na istilo, pagsulat ng teksto sa paraan ng isang partikular na may-akda):
- Inirerekomenda ang Few-shot Learning.
- Ang mga halimbawa ay tumutulong sa modelo na mahulaan ang kinakailangang istilo, format at istraktura ng output.
- Para sa mga simpleng gawain na may malinaw na mga instruksyon (pagsasalin, pagbubuod, pagsagot sa mga simpleng tanong):
- Madalas ay sapat na ang Zero-shot Learning.
- Ang mga modernong modelo ay medyo mahusay na sa ganitong mga gawain kung sila ay bahagi ng kanilang pre-training.
- Para sa mga gawain kung saan mahalaga ang format ng output (pagbuo ng JSON, pagkuha ng mga entity):
- Inirerekomenda ang One-shot o Few-shot Learning.
- Kahit isang halimbawa ay maaaring malinaw na magtakda ng kinakailangang istraktura ng sagot, na pinipigilan ang mga pagkakamali sa pag-format.
Mga Kalamangan at Kahinaan
| Mga Kalamangan | Mga Kahinaan |
|---|---|
|
|
Paghahambing sa Iba Pang Paradigma
ICL vs. Fine-tuning
Ang Fine-tuning (karagdagang pagsasanay) ay binabago ang mga weight ng modelo, "nini-imprint" ang mga bagong kaalaman dito. Ginagawa nitong eksperto ang modelo sa isang makitid na larangan, ngunit binabawasan ang pangkalahatang kakayahang umangkop nito. Ang ICL, sa kabilang banda, ay hindi binabago ang mga weight at mas flexible, ngunit maaaring mababa ang pagganap sa mga highly specialized na gawain na nangangailangan ng malalim na kaalaman sa domain.
ICL vs. RAG (Retrieval-Augmented Generation)
Ang parehong pamamaraan ay nagpapalawak ng konteksto ng modelo, ngunit para sa iba't ibang layunin:
- Ginagamit ng ICL ang mga halimbawa upang turuan ang modelo kung paano isasagawa ang gawain (demonstrasyon ng kasanayan).
- Ginagamit ng RAG ang nakuhang impormasyon upang ipaalam sa modelo ang mga katotohanang kinakailangan para sa sagot (pagbibigay ng kaalaman).
Sa praktis, ang ICL at RAG ay madalas na pinagsasama upang makamit ang pinakamahusay na resulta.
Talasanggunian
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Dai, D. et al. (2022). Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers. arXiv:2212.10559.
- Panwar, M.; Ahuja, K.; Goyal, N. (2024). In-Context Learning through the Bayesian Prism. arXiv:2306.04891.
- Müller, S. et al. (2021). Transformers Can Do Bayesian Inference. arXiv:2112.10510.
- Garg, S. et al. (2022). What Can Transformers Learn In-Context? A Case Study of Simple Function Classes. arXiv:2208.01066.
- Min, S. et al. (2022). Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?. arXiv:2202.12837.
- Wang, X. et al. (2023). Explaining and Finding Good Demonstrations for In-Context Learning. arXiv:2302.13971.
- Xie, S. et al. (2024). A Survey on In-Context Learning. arXiv:2301.00234.
- Yu, Z.; Ananiadou, S. (2024). How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning. arXiv:2402.02872.
- Wibisono, K. C.; Wang, Y. (2024). From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When. arXiv:2406.00131.
- Chan, J. K. et al. (2022). Data Distributional Properties Drive Emergent In-Context Learning in Transformers. arXiv:2205.05055.
- Hahn, M.; Goyal, N. (2023). A Theory of Emergent In-Context Learning as Implicit Structure Induction. arXiv:2303.07971.
Mga Tala
- ↑ What is In-Context Learning (ICL)? // Lakera.ai
- ↑ In-Context Learning (ICL) // Hopsworks.ai
- ↑ In-Context Learning, In Context // The Gradient
- ↑ Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers // arXiv, 2022.
- ↑ Understanding In-Context Learning // Stanford Human-Centered AI, 2023.