Retrieval-augmented generation (RAG) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Retrieval-Augmented Generation (RAG) (Tagalog: Henerasyon na Pinahusay ng Paghahanap) — ito ay isang pamamaraan sa larangan ng artificial intelligence kung saan ang generative na language model (LLM) ay binibigyan ng access sa mga panlabas na pinagkukunan ng impormasyon upang mapabuti ang katumpakan at pagiging mapagkakatiwalaan ng mga sagot. Sa madaling salita, bago gumawa ng sagot, ang modelo ay nagsasagawa ng paghahanap ng mga kaugnay na datos (halimbawa, sa isang base ng mga dokumento, sa isang website, o sa isang database) at ginagamit ang nahanap na impormasyon sa pagbuo ng sagot[1][2]. Ang ganitong diskarte ay nagbibigay ng "pagdaragdag" ng kaalaman mula sa mga kasalukuyang pinagkukunan at tumutulong na malampasan ang mga limitasyon ng mismong mga LLM na kaugnay ng limitadong kapasidad ng "memorya" at lumang impormasyon[3]. Ang isang RAG-system ay kayang mag-refer sa mga tiyak na dokumento (halimbawa, sa pamamagitan ng mga footnote) sa nabuong sagot, na nagpapataas ng transparency at nagpapahintulot sa gumagamit na suriin ang mga katotohanan[1]. Bilang resulta, nababawasan ang panganib ng paglabas ng mga hallucination — ang mga sitwasyon kung saan ang modelo ay buong-tiwalang nagbibigay ng maling impormasyon[1][3]. Pinalawak ng RAG ang base ng kaalaman ng LLM sa halos walang limitasyong dami at pinapayagan ang mga modelo na gumamit ng pinakabagong datos nang hindi kinakailangan ng muling pagsasanay[4].

Pinagmulan at Pag-unlad ng Pamamaraan

Ang ideya ng pagsasama ng paghahanap ng impormasyon at awtomatikong pagbuo ng mga sagot ay lumitaw nang matagal bago pa man lumabas ang mga modernong LLM. Noong dekada 1970, may mga pagtatangkang lumikha ng mga sistema ng question-answering na naghahanap ng mga sagot sa mga textual na database batay sa isang ibinigay na tanong[1]. Noong dekada 1990, lumabas ang web service na Ask Jeeves, na nagpalaganap ng paghahanap ng mga sagot sa natural na wika, at noong taong 2011, ipinakita ng sistema ng IBM Watson ang mga kakayahan ng AI nang manalo ito sa teleserye na Jeopardy! laban sa mga taong kalahok[1].

Ang kasalukuyang yugto ng pag-unlad ay nauugnay sa pagpapakilala ng mga neural network language model: ang Retrieval-Augmented Generation bilang isang hiwalay na diskarte ay iminungkahi noong 2020 ng isang grupo ng mga mananaliksik mula sa Facebook AI Research, University College London, at iba pa sa ilalim ng pamumuno ni Patrick Lewis[1]. Sa kanilang trabaho, na tinanggap sa NeurIPS 2020, inilarawan ang RAG model — isang generative seq2seq model (halimbawa, BART) na may differentiable na access sa panlabas na "non-parametric" na imbakan ng kaalaman[5]. Ginamit ng mga may-akda ang buong Ingles na Wikipedia bilang panlabas na base ng kaalaman, inilalarawan ito bilang isang vector index (~21 milyong fragment ng teksto), kung saan ang paghahanap ay isinasagawa gamit ang neural algorithm na Dense Passage Retrieval[5]. Para sa isang papasok na kahilingan, kinukuha ng RAG model mula sa index ang mga pinaka-angkop na fragment at idinaragdag ang mga ito sa konteksto ng pagbuo ng sagot. Ang ganitong mekanismo ay nagpahintulot na makamit ang mga bagong rekord na resulta (state-of-the-art) sa mga gawain na may bukas na base ng kaalaman, halimbawa sa mga pagsubok na Natural Questions, WebQuestions, at iba pa[2]. Napansin na ang mga sagot ng RAG model ay mas tiyak at mas tumpak sa katotohanan kaysa sa mga nakaraang generative na diskarte, salamat sa synthesis ng impormasyon mula sa ilang mga pinagkukunan nang sabay-sabay[2]. Kalaunan, bukas na inilathala ng Facebook ang source code ng RAG: ang modelo ay isinama sa library na HuggingFace Transformers at ang nauugnay na dataset, na nagpapahintulot sa mga developer na madaling gamitin ang RAG sa kanilang mga proyekto[2]. Mula noong 2020, mabilis na nakakuha ng popularidad ang pamamaraan ng RAG — ayon sa may-akda, sa kabila ng hindi kagandahang tunog ng abbreviation, ang diskarte ay kumalat nang malawak, na nagbunga ng daan-daang siyentipikong gawa at naging pundasyon ng maraming komersyal na serbisyo[1].

Prinsipyo ng Pagtatrabaho ng RAG

Ang pangunahing iskema ng Retrieval-Augmented Generation: ang module ng paghahanap (kaliwa) ay kumukuha ng mga kaugnay na dokumento mula sa base ng kaalaman, pagkatapos ay ang generative model (kanan) ay bumubuo ng sagot batay sa kahilingan ng gumagamit na isinasaalang-alang ang nahanap na impormasyon[6]. Ang ganitong diskarte ay nagpapahintulot sa LLM na umasa sa mga kasalukuyang panlabas na datos sa panahon ng pagbuo ng sagot. Ipinapakita ng diagram kung paano ang kahilingan ng gumagamit ay ginagawang vector at ginagamit para sa paghahanap ng mga katulad na fragment ng teksto; pagkatapos ay ikinokonekta ang mga ito sa konteksto ng modelo, na "nagpapalawak" ng kaalaman nito at nagpapataas ng katumpakan ng sagot.

Ang isang RAG-system ay karaniwang binubuo ng dalawang pangunahing bahagi: module ng paghahanap (retriever) at module ng pagbuo ng sagot (generator)[6]. Sa yugto ng paghahanda, isang vector index ng base ng kaalaman ay itinayo: lahat ng mga dokumento (teksto) ay hati-hatiin sa mga fragment at ginagawang mga numerical vector ng modelo ng embedding, na iniimbak sa isang espesyalisadong database para sa kasunod na paghahanap[6]. Kapag natanggap ang kahilingan ng gumagamit, ang parehong embedding model ay nagko-code ng kahilingan sa isang vector; pagkatapos ay isinasagawa ang paghahanap ng pinakamalapit na kapitbahay sa vector space — pinipili ang top K na pinakamagkaparehong fragment mula sa index ng kaalaman (halimbawa, K = 5)[6]. Ang mga fragment na ito ay itinuturing na panlabas na konteksto na naglalaman ng mga malamang na katotohanan tungkol sa paksa ng kahilingan.

Sa susunod na yugto, ang nabuo konteksto ay ginagamit ng generative model. Ang orihinal na tanong kasama ang mga nahanap na fragment ng teksto ay ipinasok sa LLM (halimbawa, isang transformer na uri ng seq2seq o isang instruction-oriented na modelo) para sa pagbuo ng huling sagot[2]. Ang language model, sa gayon, ay kondisyonal na umaasa hindi lamang sa sarili nitong natutunang (parametric) kaalaman, kundi pati na rin sa panlabas na datos na ibinigay sa kanya. Sa orihinal na implementasyon ng RAG, ang pretrained na modelo ng BART ay gumanap bilang generator, at ang panlabas na "memorya" ay kinatawan ng koleksyon ng Wikipedia, na na-index gamit ang pamamaraan ng DPR[5].

Fusion-approach - Diskarte sa Pagsasama ng Kaalaman

Isang mahalagang katangian ng RAG ang paraan kung saan pinagsasama ng modelo ang impormasyon mula sa ilang nahanap na dokumento. Hindi tulad ng simpleng pagsasama-sama ng lahat ng teksto, gumagamit ang RAG ng diskarte na kilala bilang late fusion («huling pagsasama ng mga resulta») — ang generative model ay nagpoproseso nang sabay-sabay ng bawat isa sa K na natanggap na fragment at bumubuo ng isang hypothetical na sagot na may taya ng kumpiyansa, pagkatapos ay pinagsasama-sama ang mga pagpipiliang ito sa isang panghuling output[2]. Ang ganitong pamamaraan ay nagpapahintulot sa RAG na bumuo ng sagot kahit sa mga kaso kung saan wala sa alinmang pinagkukunan ang naglalaman ng direkta at kumpletong sagot sa tanong. Halimbawa, kung ang kinakailangang impormasyon ay nakakalat sa iba't ibang artikulo, ang modelo ay kayang pagsamahin ang mga "pahiwatig" mula sa ilang dokumento sa isang solong sagot[2] (Napansin na ang pagdaragdag ng bilang ng mga ginamit na dokumento ay karaniwang nagpapataas ng pagkakumpleto ng sagot sa gastos ng maliit na pagkawala ng pagkakaugnay ng teksto[7].)

Mga Variant ng Implementasyon

Sa orihinal na gawain noong 2020, dalawang modipikasyon ng arkitektura ng RAG ang iminungkahi[6]. Sa mode na RAG-Sequence, ang generative model ay tumatanggap ng isang nakapirming hanay ng mga nahanap na dokumento at ginagamit ang mga ito upang buuin ang buong sagot nang buo. Sa mode na RAG-Token, sa kabaligtaran, ang dynamic na pag-update ay pinahihintulutan: sa bawat hakbang ng pagbuo ng susunod na token, ang modelo ay maaaring muling magsagawa ng paghahanap at mag-load ng karagdagang fragment ng teksto kung kinakailangan para sa paglilinaw ng sagot. Ang parehong mga diskarte ay nagpapakita ng katulad na mataas na antas ng kalidad; ang RAG-Sequence ay mas simple at mas mabilis, habang ang RAG-Token sa teorya ay nagpapahintulot na ipagsaalang-alang ang higit pang iba't ibang impormasyon sa mahahabang sagot[6].

Mga Kalamangan ng RAG

  • Kasalukuyan at katumpakan ng katotohanan. Ang pagkonekta sa panlabas na datos ay nagpapahintulot sa LLM na magbigay ng mas tumpak at mas makatwirang mga sagot, umaasa sa tunay na impormasyon, at hindi lamang sa mga parameter ng modelo. Ito ay makabuluhang nagpapababa ng panganib ng lipas na o simpleng kathang-isip na impormasyon sa sagot ng modelo[3][1]. Hindi tulad ng mga modelo na may nakapirming "hiwa ng kaalaman", ang RAG ay maaaring sumagot kahit sa mga tanong tungkol sa mga kaganapan o katotohanan na lumabas pagkatapos makumpleto ang pagsasanay ng modelo — dahil sa access sa mga sariwang pinagkukunan ng datos[4].
  • Transparency at tiwala ng mga gumagamit. Ang mga RAG-system ay kayang magbigay ng mga link sa mga pinagkukunan ng impormasyon (halimbawa, sa mga artikulo, ulat, o database) na nagsilbing batayan ng sagot[1]. Sa esensya, ang modelo ay nagbubuod ng mga sagot nito katulad ng isang siyentipikong gawa na may mga footnote, na nagpapahintulot na suriin ang katumpakan ng bawat katotohanan. Ang pagkakaroon ng mga sinipi na pangunahing pinagkukunan ay nagpapataas ng tiwala ng mga gumagamit at nagpapadali ng pag-verify ng natanggap na impormasyon.
  • Espesyalisasyon sa larangan ng paksa. Ang retrieval-augmentation ay nagbibigay ng pagkakataon na medyo madaling i-adapt ang gawa ng modelo sa isang makitid na domain ng kaalaman, nang hindi binabago ang mismong language model. Para dito, sapat na ang bigyan ang LLM ng espesyalisadong base ng kaalaman sa kinakailangang paksa — ito man ay mga medikal na artikulo, legal na dokumento, o teknikal na manwal ng kumpanya. Ang modelo, habang nananatiling pangkalahatan sa mga parameter nito, ay nagsisimulang kumilos bilang isang eksperto sa larangang ito, dahil kumukuha ito ng mga katotohanan mula sa piniling dataset[4][8]. Halimbawa, ang isang legal na katulong batay sa RAG ay maaaring limitahan ang saklaw ng paghahanap sa isang corpus ng isang hurisdiksyon (mga batas ng isang tiyak na bansa), ginagarantiyahan na ang mga sagot ay tutugma sa partikular na batasang iyon[8].
  • Kakayahang umangkop at pag-update ng kaalaman. Sa mga klasikal na modelo, upang magdagdag ng bagong kaalaman o maiwasto ang mga maling katotohanan, kinakailangang magsagawa ng muling pagsasanay (fine-tuning) sa isang pinalawak na dataset, na mahal sa oras at mga mapagkukunan. Nilulutas ng RAG ang problemang ito: upang i-update ang kaalaman ng modelo, sapat na i-update ang panlabas na database o magkonekta ng mga karagdagang pinagkukunan, at agad na magsisimulang gumamit ng bagong impormasyon ang modelo[2]. Ito ay nagpapahintulot na madaling mapanatili ang kasalukuyan ng sistema — sa katunayan, ang mga datos ay maaaring "mainit" na palitan kahit sa real time nang hindi naaantala ang gawa ng modelo[1].
  • Kahusayan at pagtitipid ng mga mapagkukunan. Ang diskarte ng RAG ay madalas na mas praktikal kaysa sa pagsasanay ng malalaking modelo na nagsisikap na sasakupin ang lahat ng impormasyon sa kanilang mga parameter. Sa pamamagitan ng integrasyon ng paghahanap, posibleng makamit ang katulad na mga resulta gamit ang isang modelo ng katamtamang sukat, nang hindi sinusubukang kabisahin ang lahat ng mga katotohanan sa loob ng mismong neural network[6]. Bukod dito, ang pagpapakilala ng RAG pipeline ay medyo hindi kumplikado: may mga handa na mga kagamitan (mga framework, mga library), at ipinapakita ng mga developer na ang isang pangunahing prototype ng RAG ay maaaring i-assemble nang literal sa ilang linya ng code[1]. Sa gayon, binabawasan ng RAG ang kabuuang gastos sa pagpapakilala ng AI: sa halip na magsanay ng bagong modelo para sa bawat gawain, sapat na i-configure ang mekanismo ng paghahanap at magbigay ng angkop na datos.

Mga Problema at Limitasyon ng RAG

Sa kabila ng mga maliwanag na kalamangan, ang Retrieval-Augmented Generation ay nagmamana ng mga limitasyon mula sa parehong mga bahagi ng paghahanap at mula sa mismong mga language model[9]. Nasa ibaba ang mga pangunahing problema na likas sa mga RAG-system:

  • Pag-asa sa kalidad ng paghahanap. Ang natanggap na sagot ay magiging tama sa eksaktong lawak na kaugnay at maaasahan ang mga kinukuhang datos. Kung ang module ng paghahanap ay nagbabalik ng mga dokumento na hindi nauugnay sa tanong o naglalaman ng mga pagkakamali, hindi maaaring "itama" ng generative model ang mga katotohanang ito — ito ay makakabuo ng sagot batay sa mga ito[8]. Sa gayon, ang kalidad at kasalukuyan ng panlabas na base ng kaalaman ay direktang tumutukoy sa katumpakan ng RAG. Kinakailangan ang regular na pag-update ng index at pag-configure ng mga algorithm ng pag-rank upang ang output ng mga dokumento ay manatiling kaugnay.
  • Mataas na kumplikado at mapagkukunang-intensive. Para sa pagtatrabaho, ang RAG-system ay nangangailangan hindi lamang ng mismong LLM, kundi pati na rin ng imprastraktura para sa paghahanap: pag-iimbak at pag-update ng malaking database, pag-index, oras para sa pagpapatupad ng kahilingan. Lahat ito ay nagpapataas ng mga computational na gastos at maaaring magpababa ng bilis ng sagot kumpara sa language model lamang[8]. Sa pinakamasamang kaso, ang mga pagkaantala sa yugto ng paghahanap o ang pagproseso ng napakaraming dami ng datos ay magpapabagal sa sistema. Sa pagsasanay, kailangang magsagawa ng balanse sa pagitan ng kalidad ng sagot at pagganap, na ino-optimize ang pipeline (halimbawa, paglilimita sa sukat ng base ng kaalaman o lalim ng paghahanap upang mapanatili ang oras ng tugon sa loob ng normal).
  • Mga kinakailangan sa datos at suporta. Para sa epektibong pagtatrabaho ng RAG, kinakailangan ang mataas na kalidad, nakaayos, at naa-access na panlabas na datos. Ang modelo ng paghahanap ay maaaring mahirapang makahanap ng kapaki-pakinabang na impormasyon kung ang panlabas na base ng kaalaman ay mahina ang organisasyon o naglalaman ng ingay[8]. Bukod dito, ang kinakailangang datos ay hindi laging bukas o mura: ang mga kumpanya ay kailangang lumikha at mapanatili ang sariling mga knowledge base. Ito ay lumilikha ng mga karagdagang gastos at nangangailangan ng mga pagsisikap sa aktualisasyon ng datos (halimbawa, pagdaragdag ng mga bagong dokumento, paglilinis ng lipas na impormasyon). Ang mahinang bahagi ng RAG ay ang pag-asa sa pagpapanatili ng base ng kaalaman sa kasalukuyang estado.
  • Hindi maalis na ilang pagkakamali ng LLM. Kahit malaki ang pagbabawas ng RAG sa bilang ng mga confabulation, hindi palaging posibleng ganap na alisin ang mga maling sagot[9]. Ang generative model ay maaari pa ring gumawa ng lohikal na pagkakamali o hindi tama ang pagbubuod ng impormasyon, lalo na kung ang ibinigay na konteksto ay hindi sapat na kumpleto o nagkakasalungatan[9]. Sa katunayan, inililipat ng RAG ang pokus ng mga pagkakamali: sa halip na tuwiran na kathang-isip na mga katotohanan («mga hallucination»), mas madalas na nakikita ang mga pagkakamali sa integrasyon ng kaalaman — halimbawa, ang modelo ay maaaring makaligtaan ang isang mahalagang fragment o hindi tama ang pagkonekta ng iba't ibang mga pinagkukunan sa isa't isa. Samakatuwid, sa mga responsableng aplikasyon (medisina, batas), kinakailangan pa rin ang pakikilahok ng tao para sa pag-verify at pagwawasto ng mga sagot ng sistema.

Paggamit ng RAG

Ang pamamaraan ng Retrieval-Augmented Generation ay nakahanap ng aplikasyon sa maraming sitwasyon na nauugnay sa pagkuha at paggamit ng kaalaman. Nasa ibaba ang mga pangunahing larangan kung saan nagpapakita ang RAG ng pinakamataas na pakinabang:

  • Mga sistema ng tanong-sagot at mga chatbot. Ang RAG ay nagpapahintulot na lumikha ng mga virtual na katulong at mga chatbot na sumasagot sa mga tanong ng mga gumagamit nang may mataas na katumpakan at kayang magbigay ng mga link sa mga pinagkukunan. Sa larangan ng serbisyo sa customer, ang ganitong mga bot ay bumabaling sa panloob na base ng kaalaman ng kumpanya (FAQ, mga reference na artikulo) at nagbibigay ng mga agarang sagot sa mga kahilingan ng mga customer, binabawasan ang load sa mga empleyado[8]. Hindi tulad ng mga klasikal na FAQ-system, ang mga RAG-bot ay nagbubuod ng sagot sa natural na wika, ngunit sa parehong oras ay "sinusuportahan" ito ng kasalukuyang datos na tiyak sa problema ng gumagamit.
  • Medisina at pangangalagang pangkalusugan. Ang isang generative model, na pinalawak ng isang espesyalisadong medikal na database (mga siyentipikong artikulo, mga klinikal na protocol, mga sanggunian), ay maaaring kumilos bilang isang matalinong katulong ng isang doktor o pasyente. Halimbawa, ang sistema ay makakapagsagot sa isang tanong tungkol sa isang bihirang diagnosis, na nakahanap ng mga pinakabagong pag-aaral sa paksa sa medikal na literatura[8]. Ang isang mahalagang kalamangan ng RAG sa medisina ay ang kakayahang mag-refer sa mga pangunahing pinagkukunan (halimbawa, sa mga resulta ng mga klinikal na pagsubok), na kinakailangan para sa tiwala ng mga doktor. Ang mga ganitong sistema ay ginagamit para sa suporta ng paggawa ng desisyon, pag-verify ng mga sintomas, pagtuturo ng mga mag-aaral ng medisina, atbp., na nagbibigay ng access sa pinakabagong medikal na kaalaman.
  • Batas at pananalapi. Sa legal na pagsasanay at pagsusuri sa pananalapi, ang katumpakan at verifiability ng impormasyon ay partikular na kritikal. Ang mga RAG-system ay maaaring makatulong sa mga propesyonal na mabilis na mahanap ang kinakailangang datos: halimbawa, sa tulong ng modelo, mahahanap at sisipihin ng isang abogado ang isang nakaraang desisyon ng hukuman o isang probisyon ng batas na kaugnay sa kasalukuyang kaso, at ang isang financial analyst — mabilis na makakakuha ng mga sipi mula sa mga sariwang ulat sa ekonomiya o mga balita ng merkado[8]. Kasabay nito, ang bawat sagot ng modelo ay maaaring maglaman ng mga link sa mga tiyak na dokumento (mga regulasyon, mga ulat, mga artikulo), na naaayon sa mga pamantayan ng industriya at nagpapadali ng kasunod na manu-manong trabaho ng espesyalista.
  • Siyentipikong pananaliksik at paglikha ng nilalaman. Ang mga mamamahayag, mananaliksik, at mga manunulat ay maaaring gumamit ng RAG para mapabilis ang paghahanap ng mga katotohanan at pinagkukunan sa paghahanda ng mga materyal. Halimbawa, ang modelo ay kayang ayon sa kahilingan na "mangolekta" ng impormasyon mula sa ilang mapagkakatiwalaang publikasyon at sa gayon ay makabuluhang bawasan ang oras sa fact-checking at pagpili ng mga sipi[8]. Ang mga research assistant batay sa RAG ay awtomatikong kumukuha ng mga reference sa mga kaugnay na gawa, datos mula sa mga bukas na base (halimbawa, istatistika mula sa mga internasyonal na ulat) at kahit mga draft na pagsasalin, na nagpapahintulot sa mga may-akda na mag-focus sa analytical na bahagi ng trabaho. Ang mga ganitong kagamitan ay nakahanap ng aplikasyon sa media, akademikong kapaligiran, sa paghahanda ng mga review ng literatura, atbp.
  • Korporasyon na kaalaman at paghahanap sa mga dokumento. Sa maraming organisasyon, ang makabuluhang dami ng mahalagang impormasyon ay nakaimbak sa anyo ng mga textual na dokumento: mga regulasyon, mga manwal, mga ulat, mga sulat, mga log file. Nagbibigay ang RAG ng paraan ng interactive na paghahanap sa naturang hindi nakaayos na datos gamit ang wika. Ang isang empleyado ay maaaring magtanong («Ano ang sinasabi tungkol sa patakaran ng bakasyon para sa mga remote na empleyado?») — at mahahanap ng modelo ang kinakailangang seksyon ng panloob na dokumento, sisipihin ito at bubuuin ng isang buod na sagot[1]. Ito ay nagpapataas ng kahusayan ng trabaho: mas mabilis na nakakakita ng mga sagot sa mga tanong ang mga bagong empleyado, ang mga departamento ng suporta ay nakatanggap ng isang kagamitan para sa mabilis na paghahanap sa base ng mga insidente, at ang pamamahala ay isang paraan upang suriin ang mga naipon na textual na datos. Ang malalaking IT-kumpanya ay nagpapakilala na ng diskarte ng RAG sa mga corporate na solusyon: ang mga teknolohiya mula sa Microsoft, Google, IBM, AWS, at iba pa ay nag-iintegrate ng LLM sa paghahanap sa mga datos ng organisasyon[1].

Mga Pananaw at Karagdagang Pananaliksik

Ang pamamaraan ng Retrieval-Augmented Generation ay aktibong nagtatagal, at sa mga darating na taon, inaasahang higit pang mapalawak ang mga kakayahan nito. Isa sa mga direksyon ay ang multimodal RAG, kung saan ang panlabas na impormasyon ay maaaring hindi lamang mga teksto, kundi pati na rin ang mga larawan, audio/video, o kahit mga datos mula sa mga sensor. Ipinapakita ng mga eksperimento ang pananaw ng pagsasama ng mga language model sa paghahanap sa mga visual na database, na magpapahintulot, halimbawa, na sumagot sa mga tanong tungkol sa nilalaman ng mga larawan o video, umaasa sa mga paglalarawan at mga kaugnay na teksto[2]. Isa pang mahalagang direksyon ay ang sabay-sabay na paggamit ng maraming pinagkukunan ng kaalaman: ang mga hinaharap na sistema ng RAG ay makakapagsama ng datos mula sa iba't ibang base (halimbawa, Wikipedia, mga espesyalisadong ensiklopedya, mga personal na tala ng gumagamit) at makakapagsynthesis ng mga sagot na isinasaalang-alang ang lahat ng magkakaibang impormasyong ito[2].

Nakaharap din sa mga mananaliksik ang gawain ng pagpapataas ng pagiging mapagkakatiwalaan at kaligtasan ng RAG. Kinakailangan na bawasan ang panganib ng pagkalat ng mga pagkiling at pagkakamali na maaaring maglaman ng panlabas na datos, pati na rin ang pagtiyak ng konsistensya ng mga sagot. Ang koponan ng mga developer ng orihinal na RAG ay nagsagawa na ng mga hakbang sa direksyong ito — halimbawa, paglilimita ng paunang base ng kaalaman sa mga artikulo ng Wikipedia lamang bilang isang medyo na-verify at neutral na pinagkukunan[2]. Sa hinaharap, plano na lumikha ng mga espesyal na filter at mga pamamaraan ng pagpili ng mga dokumento upang ang modelo ay makatanggap ng malinaw na mataas na kalidad na konteksto. Bukod dito, ang mga pananaliksik ay nakatuon sa pagpapabuti ng mismong mekanismo ng paghahanap: ang mga bagong algorithm ng pag-rank at semantic indexing ay binubuo, na kayang mas tumpak na maunawaan ang mga kahilingan at makahanap ng kaugnay na impormasyon kahit sa kumplikado o hindi malinaw na mga pahayag.

Sa wakas, ang mas malalim na integrasyon ng RAG sa proseso ng pagsasanay ng mga language model ay kawili-wili. Lumalabas na ang mga diskarte kung saan ang mga mekanismo ng retrieval ay ginagamit hindi lamang sa yugto ng output, kundi pati na rin sa panahon ng paunang pagsasanay o fine-tuning ng LLM[10]. Ito ay maaaring higit pang mapataas ang pagiging tumpak sa katotohanan ng mga modelo at bawasan ang kanilang pag-asa sa statically na naka-record sa mga timbang na kaalaman. Ayon sa mga review na inilathala noong 2024, nakikita ng komunidad ang malaking pananaw sa pag-unlad ng ecosystem ng RAG: mula sa pag-optimize ng imprastraktura (pagpapabilis ng paghahanap, pagbabawas ng mga gastos sa memorya) hanggang sa paglikha ng mga pamantayang benchmark para sa pagtatasa ng kalidad ng mga RAG-system[3]. Lahat ito ay naglalayong gawing mas tumpak, mas maraming gamit, at mas ligtas ang mga generative model kapag nagtatrabaho sa patuloy na ina-update na panlabas na kaalaman, na isang pangunahing hakbang patungo sa mapagkakatiwalaang artificial intelligence ng bagong henerasyon.

  • Ano ang Retrieval-Augmented Generation (RAG) — blog ng NVIDIA
  • Retrieval-Augmented Generation for Large Language Models: A Survey — siyentipikong review sa arXiv
  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — orihinal na artikulo tungkol sa RAG
  • Ano ang RAG? Aplikasyon, mga limitasyon at mga hamon — blog ng Bright Data

Panitikan

  • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
  • Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2004.04906.
  • Guu, K. et al. (2020). REALM: Retrieval-Augmented Language Model Pre-Training. arXiv:2002.08909.
  • Qu, Y. et al. (2020). RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2010.08191.
  • Izacard, G.; Grave, E. (2021). Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering. arXiv:2007.01282.
  • Borgeaud, S. et al. (2022). Improving Language Models by Retrieving from Trillions of Tokens. arXiv:2112.04426.
  • Wei, J. et al. (2022). Chain of Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
  • Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
  • Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
  • Mialon, G. et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997.
  • Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
  • Yang, Z. et al. (2023). Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning. arXiv:2302.04858.
  • Barnett, S. et al. (2024). Seven Failure Points When Engineering a Retrieval Augmented Generation System. arXiv:2401.05856.
  • Wang, Y. et al. (2024). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Han, H. et al. (2025). Retrieval-Augmented Generation with Graphs (GraphRAG). arXiv:2501.00309.

Mga Tala

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 «What Is Retrieval-Augmented Generation aka RAG». NVIDIA Blogs. [1]
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 «Facebook open-sources RAG, an AI model that retrieves documents to answer questions». VentureBeat. [2]
  3. 3.0 3.1 3.2 3.3 Mialon, Grégoire et al. «Retrieval-Augmented Generation for Large Language Models: A Survey». arXiv. [3]
  4. 4.0 4.1 4.2 «Applied AI Software Engineering: RAG». Pragmatic Engineer. [4]
  5. 5.0 5.1 5.2 Lewis, Patrick et al. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». arXiv. [5]
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «How RAG Makes LLMs Smarter». Exxact Blog. [6]
  7. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». arXiv. [7]
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 «What Is RAG? Use Cases, Limitations, and Challenges». Bright Data Blog. [8]
  9. 9.0 9.1 9.2 Lewis, Patrick et al. «Seven Failure Points When Engineering a Retrieval Augmented Generation System». arXiv. [9]
  10. «Генерация, дополненная поиском». Википедия. [10]