LaMDA (Google) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

LaMDA (Language Model for Dialogue Applications) — ito ay isang pamilya ng malalaking language model batay sa arkitektura ng transformer, na binuo ng kumpanyang Google at espesyalisado sa pagpapatibay ng makahulugan at bukas na mga diyalogo[1]. Hindi tulad ng maraming pangkalahatang modelo sa panahon nito, ang LaMDA ay sadyang sinanay para sa pagpapanatili ng magkakaugnay na, multi-turn na mga pag-uusap sa halos anumang paksa, na malaya itong lumilipat ng mga konteksto[2].

Ang modelo ay unang pampublikong ipinakita sa kumperensya ng Google I/O noong Mayo 2021[3]. Ang LaMDA ay inilalarawan bilang isang pundamental na hakbang patungo sa mas natural na pakikipag-ugnayan ng tao sa teknolohiya, halimbawa, sa pamamagitan ng mga conversational na interface sa paghahanap at mga voice assistant[4].

Arkitektura at Pagsasanay

Pundamental na Arkitektura: «decoder lamang»

Ang LaMDA ay isang language model na uri ng «decoder lamang» (decoder-only), na itinayo sa arkitektura ng transformer. Ang arkitekturang ito ang pamantayan para sa mga gawain ng pagbuo ng teksto. Gumagana ang modelo nang autoregressive — hinuhulaan nito ang susunod na salita (token) sa isang zaporedom, batay sa lahat ng nakaraang salita. Nagbibigay-daan ito sa kanya na bumuo ng magkakaugnay at lohikal na teksto, na ipinagpapatuloy ang isang naibigay na pag-uusap, ngunit nililimitahan ang kakayahan nitong makita ang «kanang» konteksto, hindi tulad ng BERT[5].

Sukat at Data ng Pagsasanay

Ang pamilya ng LaMDA ay kinabibilangan ng mga modelo na may iba't ibang bilang ng mga parameter, mula 2 hanggang 137 bilyon. Para sa pre-training, isang napakalaking corpus ng datos na may sukat na 1.56 trilyon na salita ang ginamit, na binubuo ng mga pampublikong datos ng diyalogo at mga teksto mula sa web. Ang dami na ito ay halos 40 beses na mas malaki kaysa sa datos na ginamit para sa pagsasanay ng hinalinhan ng LaMDA, ang modelong Meena[1].

Proseso ng Fine-Tuning at mga Sukatan

Natuklasan ng mga mananaliksik ng Google na ang pagpapalaki ng sukat lamang ay hindi sapat para matiyak ang kaligtasan at katumpakan ng mga sagot. Kaya naman, isang multi-stage na proseso ng fine-tuning ang binuo, kung saan ang modelo ay sadyang na-configure ayon sa tatlong pangunahing sukatan na sinusuri ng mga human annotator[1]:

  • Kalidad (Quality): Sinusuri sa pamamagitan ng tatlong bahagi:
    • Kahulugan (Sensibleness): Lohika at pagsasaalang-alang sa konteksto.
    • Pagiging Tiyak (Specificity): Pagiging kongkreto at pagiging maalam ng mga sagot.
    • Kawili-wili (Interestingness): Katalinuhan at katalinuhang-biro.
  • Kaligtasan (Safety): Pag-iwas sa pagbuo ng mga mapanganib, biased, o nakakalason na pahayag. Para dito, isang espesyal na classifier-filter ang na-fine-tune.
  • Pagkakabase-sa-Katotohanan (Groundedness): Naglalayong labanan ang «mga hallucination» (mga gawa-gawang katotohanan). Ang LaMDA ay na-fine-tune upang kapag kinakailangan, makipag-ugnayan sa isang hanay ng mga panlabas na kagamitan (search engine, calculator, tagapagsalin) para sa pag-verify at paglilinaw ng mga katotohanang impormasyon[1]. Ang inobasyong ito ay naging isa sa mga unang sistematikong solusyon sa problema ng pagiging mapagkakatiwalaan sa malalaking language model.

Kasaysayan ng Pagpapaunlad at Pagsasakatuparan

Mga Pampublikong Anunsyo at LaMDA 2

Sa Google I/O 2021, ipinakita ng CEO na si Sundar Pichai ang mga kakayahan ng LaMDA, na nagpapakita ng mga diyalogo kung saan ang modelo ay nagpapanggap na ang planeta Pluto at isang papel na eroplano[6].

Isang taon pagkatapos, sa Google I/O 2022, ipinakita ang LaMDA 2, na naging «mas pinahusay pang kausap». Kasabay nito, inilunsad ng Google ang application na AI Test Kitchen — isang «laboratoryo» para sa pampublikong pagsubok, kung saan maaaring subukan ng mga gumagamit ang LaMDA sa ilang mga demonstration na senaryo[7]. Nagbigay-daan ito sa pagkolekta ng malawak na feedback para sa karagdagang pagpapabuti ng modelo.

Integrasyon sa Google Bard

Noong Pebrero 2023, sa gitna ng mabilis na paglaki ng katanyagan ng ChatGPT, inanunsyo ng Google ang paglulunsad ng sarili nitong eksperimental na chatbot na Bard[8]. Sa simula, ang Bard ay gumagana sa isang magaang na bersyon ng LaMDA upang mabawasan ang mga kinakailangan sa computational na resources. Ang LaMDA ay nagsilbing pangunahing «transitional» na teknolohiya, na nagbibigay-daan sa Google na mabilis na maglabas sa merkado ng isang mapagkumpetensyang produkto habang inihahanda ang mga mas makapangyarihang modelo tulad ng PaLM.

Insidente kay Blake Lemoine

Noong Hunyo 2022, ang LaMDA ay naging sentro ng malawak na pampublikong talakayan matapos na ang inhinyero mula sa AI Ethics department ng Google na si Blake Lemoine ay pampublikong ipinahayag na ang modelo, sa kanyang palagay, ay umabot na sa antas ng isang malay na nilalang (sentient). Nag-publish siya ng mga sipi mula sa kanyang mga diyalogo sa LaMDA, kung saan ang modelo ay nagmumuni-muni tungkol sa kamalayan sa sarili, mga damdamin, at nagpapahayag ng takot sa pagsasara[9].

Opisyal na Posisyon at Reaksyon ng Siyentipikong Komunidad

Tinanggihan ng Google ang mga pahayag ni Lemoine, na nagsasabing matapos ang pagsusuri ay walang natagpuang katibayan ng malay na kakayahan ng modelo, at mayroon pang «maraming ebidensya laban dito»[9]. Noong Hulyo 2022, si Lemoine ay tinanggal sa trabaho dahil sa paglabag sa corporate na patakaran sa confidentiality[10].

Ang malaking mayorya ng mga siyentipiko at eksperto sa AI ay tinanggihan din ang ideya ng pagiging malay ng LaMDA. Binigyang-diin ng linggwista na si Emily M. Bender at ng iba pang mga mananaliksik na ang mga ganitong modelo ay «mga stochastic na loro» — mga kumplikadong algorithm na estadistikang bumubuo ng magkakaugnay na mga teksto, na ginagaya ang pananalita ng tao, ngunit walang tunay na pag-unawa o kamalayan[11]. Malinaw na ipinapakita ng insidenteng ito kung gaano kadali ang pagiging hilig ng tao sa anthropomorphism, na iniaatributo sa mga makina ang mga katangiang pantao, at pinukaw nito ang isang pandaigdigang talakayan tungkol sa kalikasan ng AI.

Kontribusyon at Pamana

Sa kabila ng medyo maikling ikot ng buhay bilang pangunahing teknolohiya, ang LaMDA ay nag-iwan ng makabuluhang bakas sa kasaysayan ng pag-unlad ng conversational AI.

  • Teknolohikal na Kontribusyon: Ipinakita ng LaMDA ang posibilidad ng paglikha ng bukas at context-dependent na mga sistema ng diyalogo at naging pioneer sa sistematikong diskarte sa pagtiyak ng kaligtasan (pag-filter batay sa mga pagpapahalaga) at katotohanang pagkakabase (pagsangguni sa mga panlabas na kagamitan).
  • Papel sa Ecosystem ng Google: Ang LaMDA ay naging kritikal na transitional na teknolohiya na nagpahintulot sa Google na mabilis na pumasok sa «digmaan ng mga chatbot» gamit ang produktong Bard at nagsilbing testing ground para sa mga pamamaraan na naging pundasyon ng mas makapangyarihang mga modelo tulad ng PaLM at Gemini.
  • Panlipunang Impluwensya: Inilunsad ng insidente kay Blake Lemoine ang talakayan tungkol sa kalikasan ng AI, kamalayan, at mga panganib ng anthropomorphism sa isang bagong pandaigdigang antas.

Mga Sanggunian

  • Opisyal na anunsyo ng LaMDA sa blog ng Google
  • Pahina ng siyentipikong publikasyon tungkol sa LaMDA sa Google Research

Panitikan

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • So, D. R. et al. (2019). The Evolved Transformer. arXiv:1901.11117.
  • Zhang, Y. et al. (2020). DialoGPT: Large-Scale Generative Pre-training for Conversational Response Generation. arXiv:1911.00536.
  • Adiwardana, D. et al. (2020). Towards a Human-like Open-Domain Chatbot. arXiv:2001.09977.
  • Roller, S. et al. (2021). Recipes for Building an Open-Domain Chatbot. arXiv:2004.13637.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.

Mga Tala

  1. 1.0 1.1 1.2 1.3 Thoppilan, Romal; De Freitas, Daniel; Hall, Jamie; et al. «LaMDA: Language Models for Dialog Applications». arXiv. [1]
  2. Collins, Eli; Ghahramani, Zoubin. «LaMDA: our breakthrough conversation technology». Google AI Blog. [2]
  3. Peters, Jay. «Google I/O 2021: the 14 biggest announcements». The Verge. [3]
  4. «Google I/O 2021: Being helpful in moments that matter». Официальный блог Google. [4]
  5. «What is LaMDA? Google's AI Explained and How It Led to PaLM 2». DataCamp. [5]
  6. Vincent, James. «Google showed off its next-generation AI by talking to Pluto and a paper airplane». The Verge. [6]
  7. «Google I/O 2022: Advancing knowledge and computing (Keynote)». Официальный блог Google. [7]
  8. Pichai, Sundar. «An important next step on our AI journey». Официальный блог Google. [8]
  9. 9.0 9.1 Luscombe, Richard. «Google engineer put on leave after saying AI chatbot has become sentient». The Guardian. [9]
  10. «Google fires software engineer who claims AI chatbot is sentient». The Guardian. [10]
  11. Tiku, Nitasha. «The Google engineer who thinks the company's AI has come to life». The Washington Post. [11]