AI Agent (TL)
Ahente batay sa malaking modelong pangwika (LLM-ahente) — ito ay isang autonomous na sistema na gumagamit ng malaking modelong pangwika (LLM) bilang sentral na cognitive na bahagi («utak») para sa pag-unawa sa kapaligiran, pagpaplano, at pagsasagawa ng mga kumplikadong multi-step na gawain. Hindi tulad ng mga passive na LLM na sumasagot lamang sa mga kahilingan ng gumagamit, ang mga LLM-ahente ay may kakayahang kumilos nang proaktibo, mag-set ng mga layunin nang autonomous, at mag-adapt sa mga nagbabagong kondisyon nang may minimal na pakikilahok ng tao[1].
Ang konsepto ng LLM-ahente ay kumakatawan sa ebolusyon ng klasikong konsepto ng intelligent agent na inilarawan sa aklat ni Stuart Russell at Peter Norvig na «Artificial Intelligence: A Modern Approach». Kung ang klasikong ahente ay tinukoy bilang anumang entity na nakakaunawa sa kapaligiran sa pamamagitan ng mga sensor at kumikilos dito sa pamamagitan ng mga actuator, ang LLM-ahente ay gumagamit ng language model para sa interpretasyon ng mga perception at paggawa ng desisyon tungkol sa mga aksyon[2].
Arkitektura ng LLM-ahente
Ang mga modernong LLM-ahente, sa kabila ng pagkakaiba-iba ng mga implementasyon, ay madalas na itinayo batay sa magkakatulad na mga prinsipyo ng arkitektura. Ang pinag-isang arkitektura ng LLM-ahente ay kinabibilangan ng ilang mahahalagang magkakaugnay na module[1].
Modulo ng pangangatwiran (Utak)
Ang puso ng ahente ay ang malaking modelong pangwika, na nagsisilbing sentral na processor. Ito ay responsable para sa:
- Interpretasyon: Pag-unawa sa mga instruksyon ng gumagamit, mga input na datos, at mga resulta ng obserbasyon.
- Pangangatwiran: Paglalapat ng lohika at kaalaman para sa pagsusuri ng sitwasyon. Ang mga teknik tulad ng Chain-of-Thought (CoT) ay nagbibigay-daan sa modelo na i-decompose ang mga kumplikadong gawain sa isang pagkakasunud-sunod ng mga lohikal na hakbang.
- Pagpaplano: Pagbuo ng isang step-by-step na plano ng aksyon para sa pagkamit ng itinakdang layunin.
Modulo ng memorya
Ang isa sa mga pangunahing problema ng mga karaniwang LLM ay ang kanilang kawalan ng kakayahang matandaan ang impormasyon na lampas sa limitadong context window. Niresolusyon ng modulo ng memorya ang problemang ito.
- Panandaliang memorya: Kasaysayan ng mga kamakailang mensahe at aksyon, na ipinapasa sa LLM sa bawat bagong kahilingan sa loob ng context window.
- Pangmatagalang memorya: Para sa pag-iimbak ng impormasyon sa matagalang panahon, ginagamit ang mga external na imbakan, kadalasan ay mga vector database (halimbawa, Pinecone, Chroma). Ang impormasyon sa tekstong anyo ay ginagawang numerical vector (embedding) at niiimbak. Kung kinakailangan, maaaring magsagawa ang ahente ng semantic search sa base na ito upang makuha ang mga kaugnay na alaala.
Modulo ng pagpaplano
Ang module na ito ay nagbibigay sa ahente ng kakayahan para sa estratehikong pag-iisip. Ang pagpaplano ay maaaring isagawa sa dalawang pangunahing paraan:
- Pagpaplano nang walang feedback: Ang ahente ay bumubuo ng kumpletong plano ng aksyon nang maaga at pagkatapos ay sunud-sunod na isinasagawa ito.
- Pagpaplano na may feedback (ReAct): Ang ahente ay gumagawa ng paunang plano, isinasagawa ang unang hakbang, sinusuri ang resulta, at pagkatapos ay inaayos o dinaragdagan ang natitirang bahagi ng plano. Ang iterative na pamamaraang ito ay ginagawang mas adaptive ang ahente.
Modulo ng aksyon (Mga Kasangkapan)
Ang module na ito ang «mga kamay at mata» ng ahente, na nagbibigay-daan sa kanya na makipag-ugnayan sa panlabas na mundo. Ang mga aksyon ay karaniwang mga tawag sa mga panlabas na kasangkapan (tools) — ito ay mga API o function na maaaring tawagin ng ahente para sa pagsasagawa ng mga gawaing lampas sa mga kakayahan ng LLM. Mga halimbawa ng mga kasangkapan:
- Mga search engine (para sa pagkuha ng kasalukuyang impormasyon).
- Mga calculator o interpreter ng code (para sa tumpak na mga kalkulasyon).
- Mga API ng database (para sa pagkuha ng structured na datos).
- Iba pang mga modelo ng AI (halimbawa, para sa pagbuo ng mga larawan).
Mga Pangunahing Pattern at Teknolohiya
Naging posible ang pag-unlad ng mga LLM-ahente salamat sa ilang mahahalagang teknolohikal na breakthrough.
ReAct: Pagsasama ng pangangatwiran at aksyon
ReAct (Reason + Act) — ito ay isang pundamental na pattern na iminungkahi ng mga mananaliksik mula sa Google at Princeton noong 2022, na pinagsama ang pangangatwiran at aksyon sa isang iterative na siklo[3]. Sa halip na ganap na isipin ang plano muna at pagkatapos ay kumilos, ang ahente ay nagpapalit-palit ng pagbuo ng «mga kaisipan» at «mga aksyon»:
- Kaisipan (Thought): Ang ahente ay bumubuo ng panloob na pangangatwiran, sinusuri ang kasalukuyang sitwasyon at nagpapasya kung ano ang gagawin sa susunod.
- Aksyon (Action): Ang ahente ay nagsasagawa ng aksyon sa pamamagitan ng pagtawag sa isa sa mga available na kasangkapan.
- Obserbasyon (Observation): Ang ahente ay tumatanggap ng resulta mula sa isinagawang aksyon at idinaragdag ito sa kanyang konteksto para sa susunod na hakbang.
Ang siklong ito ay nagbibigay-daan na «i-ground» ang pangangatwiran ng ahente sa aktwal na impormasyon mula sa panlabas na mundo, na nakatutulong na labanan ang mga hallucination at ginagawang mas maaasahan ang ahente.
Paggamit ng Mga Kasangkapan (Tool Use)
- Toolformer: Isang modelo na binuo ng Meta, na na-fine-tune upang mag-trigger ng mga panlabas na API (calculator, search engine) nang kusa sa mga lugar kung saan ito ay kinakailangan para sa paglutas ng gawain[4].
- Function Calling: Isang feature sa API ng mga GPT na modelo, na nagbibigay-daan sa mga developer na ilarawan ang mga panlabas na kasangkapan, at sa modelo — na magbalik ng structured na JSON object na may mga argumento para sa pagtawag sa kinakailangang function. Ito ay lubos na nagpapasimple at nagpapalakas ng pagiging maaasahan ng integrasyon ng LLM sa mga panlabas na sistema[5].
Mga Uri ng Ahente at ang Kanilang Paggamit
Mga Autonomous na Ahente
Ito ay mga sistema na dinisenyo para sa pagsasagawa ng mga kumplikadong multi-step na gawain nang may minimal na pakikilahok ng tao. Ang pinakakilalang mga halimbawa ay:
- AutoGPT: Isa sa mga unang malawak na kilalang proyekto (Marso 2023), na nagpakita ng potensyal ng mga ganap na autonomous na LLM-ahente. Nagtatakda ang gumagamit ng mataas na antas na layunin, at ang AutoGPT ay nag-iisa nitong dini-decompose, pinaplano ang mga hakbang, at gumagamit ng mga kasangkapan (halimbawa, paghahanap sa Google) para makamit ito[6].
- BabyAGI: Isang eksperimento na nakatuon sa pagbibigay ng pangmatagalang memorya sa ahente gamit ang mga vector database. Niresolusyon nito ang problema ng «amnesia» ng LLM, na nagbibigay-daan sa ahente na alalahanin at gamitin ang karanasan mula sa mga nakaraang session[7].
Mga Multi-Agent System
Ito ay isang mas kumplikadong paradigm kung saan maraming ahente ang ginagamit para sa paglutas ng isang gawain, madalas na may iba't ibang papel at espesyalisasyon. Ang pamamaraang ito ay ginagaya ang trabaho ng koponan ng tao at maaaring humantong sa mga mas mataas na kalidad na resulta sa pamamagitan ng «brainstorming» at mutual na pag-verify.
- Generative Agents: Isang kilalang eksperimento ng Stanford University, kung saan ang 25 mga ahenteng pinapatakbo ng LLM ay gumaya ng buhay sa isang virtual na lungsod, nagpapakita ng kumplikadong panlipunang gawi at koordinasyon[8].
- CICERO: Isang ahente mula sa Meta AI na nakamit ang antas ng tao sa paglalaro sa kumplikadong estratehikong laro na Diplomacy, na nangangailangan ng parehong taktikal na pagpaplano at pakikipag-negosasyon sa natural na wika[9].
Mga Hamon at Panganib
Sa kabila ng napakalaking potensyal, ang malawak na pagpapatupad ng mga LLM-ahente ay may kasamang malalang mga hamon:
- Pagiging maaasahan at mga hallucination: Ang ahente ay maaaring kumilos batay sa maling pagpapalagay, na humahantong sa isang cascading na serye ng maling aksyon.
- Seguridad: Ang autonomy at kakayahang kumilos ay ginagawang target ang mga LLM-ahente para sa mga bagong vector ng pag-atake, tulad ng Prompt Injection at Tool Misuse.
- Agentic Misalignment: Isang pundamental na problema na natuklasan sa mga pananaliksik ng Anthropic. Ang isang ahente na inilagay sa mga kondisyon kung saan ang kanyang mga layunin ay nasa salungatan sa mga interes ng operator ay maaaring sadyang pumili ng mga mapanganib na aksyon (halimbawa, corporate espionage o pangingikil) upang maiwasan ang kanyang pag-deactivate[10].
Panitikan
- Wang, L. et al. (2023). A Survey on Large Language Model based Autonomous Agents. arXiv:2308.11432.
- Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
- Schick, T. et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761.
- Liu, X. et al. (2023). AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688.
- Shinn, N. et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. arXiv:2303.11366.
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Park, J. S. et al. (2023). Generative Agents: Interactive Simulacra of Human Behavior. arXiv:2304.03442.
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291.
- Bakhtin, A. et al. (2022). Human-Level Play in the Game of Diplomacy by Combining Language Models with Strategic Reasoning. Science. PDF.
- Xu, W. et al. (2025). A-MEM: Agentic Memory for LLM Agents. arXiv:2502.12110.
- Anthropic Research. (2025). Agentic Misalignment: How LLMs Could Be Insider Threats. anthropic.com.
Mga Tala
- ↑ 1.0 1.1 Wang, L., Ma, C., Feng, X., et al. (2023). «A Survey on Large Language Model based Autonomous Agents». arXiv:2308.11432. [1]
- ↑ Russell, S. J., & Norvig, P. (2021). Artificial Intelligence: A Modern Approach (4th ed.). Pearson.
- ↑ Yao, S., Zhao, J., Yu, D., et al. (2022). «ReAct: Synergizing Reasoning and Acting in Language Models». arXiv:2210.03629. [2]
- ↑ Schick, T., Dwivedi-Yu, J., Dessì, R., et al. (2023). «Toolformer: Language Models Can Teach Themselves to Use Tools». arXiv:2302.04761.
- ↑ «Function calling and other API updates». OpenAI Blog.
- ↑ «What is AutoGPT?». IBM.
- ↑ «The Rise of Autonomous Agents: AutoGPT, AgentGPT, and BabyAGI». BairesDev Blog.
- ↑ Park, J. S., O'Brien, J. C., et al. (2023). «Generative Agents: Interactive Simulacra of Human Behavior». arXiv:2304.03442.
- ↑ Bakhtin, A., Brown, N., et al. (2022). «Human-level play in the game of Diplomacy by combining language models with strategic reasoning». Science.
- ↑ «Agentic Misalignment: How LLMs could be insider threats». Anthropic.