Temperature (LLM) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Temperatura (Ingles: Temperature) sa konteksto ng malalaking language model (LLM) — ito ay isang hyperparameter na kumokontrol sa antas ng randomness at "pagkamalikhain" sa panahon ng pagbuo ng teksto. Kinokontrol nito ang "katigasan" o, sa kabaligtaran, "pagkakainis" ng probability distribution ng susunod na token sa bawat hakbang ng decoding. Sa pamamagitan ng pagmamanipula ng temperatura, maaaring kontrolin ang balanse sa pagitan ng predictability (coherence) at pagkakaiba-iba (creativity) ng nabuong teksto.

Simpleng Paliwanag

Temperatura — ito ay isang parameter na nagtatakda, gaano kaingat o, sa kabaligtaran, gaano kalaya ang pagpili ng susunod na salita ng modelo. Sa isang malaking language model ay halos wala na lamang na isang posibleng pagpapatuloy: karaniwan sa bawat hakbang ay may ilang angkop na pagpipilian, at ang bawat isa sa kanila ay may sariling probability. Ang temperatura ay hindi nakakaapekto sa kaalaman mismo ng modelo at hindi sa "kung ano ang alam nito", kundi sa kung paano mismo ito pumipili sa pagitan ng mga pagpipiliang ito sa panahon ng pagbuo.

Sa mababang temperatura ang modelo ay kumikilos nang mas konserbatibo. "Tiwala" ito nang higit pa sa mga pinaka-malamang na salita at bihirang lumihis mula sa pinaka-inaasahang pagpapatuloy. Bilang resulta, ang teksto ay karaniwang mas pantay, mahuhulaan, pormal na tama, at magkakasunod. Ang ganitong mode ay kapaki-pakinabang kung saan mahalaga ang katumpakan ng mga pagpapaliwanag, katatagan ng sagot, reproducibility ng resulta, at pagbabawas ng hindi kinakailangang pagkakaiba-iba. Gayunpaman, ang diskarteng ito ay may kabaligtaran din: ang teksto ay maaaring maging masyadong template, tuyo, paulit-ulit, at minsan ay labis na "maingat". Sa labis na mababang temperatura, ang modelo ay maaari pang magsimulang walang katapusang ulitin ang parehong mga konstruksyon (ma-loop), na "naiipit" sa mga pinaka-malamang ngunit hindi palaging angkop na pagpapatuloy.

Sa mataas na temperatura ang modelo ay kumikilos nang mas matapang. Mas madalas itong nagpapahintulot na pumili hindi lamang ng mga pinakamalamang kundi pati na rin ng mga hindi gaanong halata na salita. Dahil dito, ang mga sagot ay nagiging mas magkakaiba-iba, makulay, hindi pamantayan, at minsan ay mas orihinal. Maaari itong maging kapaki-pakinabang sa mga malikhaing gawain, brainstorming, pagbuo ng mga ideya, mga tekstong pampanitikan, o paghahanap ng ilang iba't ibang pagpapaliwanag. Ngunit kasabay ng pagtaas ng pagkakaiba-iba, tumataas din ang panganib: ang teksto ay maaaring maging hindi gaanong magkakaugnay, hindi gaanong tumpak, at sa mga matinding kaso — kakaiba, hindi lohikal, o random.

Ang maginhawang intuisyon ay ang temperatura — ito ay hindi regulator ng kaalaman, kundi regulator ng panganib sa pagpili ng mga salita. Ang mababang temperatura ay pinipilit ang modelo na halos palaging pumili ng "pinakaligtas" na pagpipilian. Ang mataas — ay nagbibigay-daan sa modelo na mas madalas na "mag-risgo" at subukan ang mga hindi gaanong halata na pagpapatuloy.

Isa pang kapaki-pakinabang na larawan: ang temperatura ay maaaring ihambing sa kung paano sumasagot ang isang tao sa isang tanong. Kung kinakailangan ang isang opisyal, tumpak at maingat na sagot, ang tao, bilang panuntunan, ay pumipili ng pinaka-neutral at inaasahang mga pagpapaliwanag — ito ay katulad ng mababang temperatura. Kung ang gawain ay mag-isip ng hindi karaniwang ideya, metapora, plot twist, o ilang hindi pamantayang pagpipilian, ang mga pagpapaliwanag ay nagiging mas malaya at matapang — ito ay katulad ng mataas na temperatura.

Kaya, ang temperatura ay responsable para sa balanse sa pagitan ng dalawang katangian ng pagbuo:

  • predictability at katatagan ng sagot;
  • pagkakaiba-iba at hindi inaasahan ng mga pagpapaliwanag.

Kung mas mababa ang temperatura, mas malapit ang modelo sa pinaka-malamang at pamantayang pagpapatuloy. Kung mas mataas ang temperatura, mas malaki ang espasyo para sa pagkakaiba-iba, ngunit mas mahina ang kontrol sa kahigpitan at koherensya ng resulta.

Teoretikal na Kahulugan

Matematikal, ang temperatura (T) ay ipinakilala bilang divisor sa softmax function, na nagko-convert ng output logits ng modelo (ui) sa probability distribution (Pi). Ang formula ay ganito:

Pi(T)=eui/Tjeuj/T

Kung saan:

  • Pi(T) — ang panghuling probability ng i-th token sa temperatura T.
  • ui — ang logit (hindi normalized na pagtatasa) para sa i-th token, na inilabas ng modelo.
  • T — ang parameter ng temperatura (mahigpit na positibong numero). Halimbawa, sa OpenAI API para sa karamihan ng mga modelo, ang pinapayagang hanay ay mula 0 hanggang 2.0, kung saan ang 0 ay isang espesyal na kaso ng greedy decoding (tingnan sa ibaba). Sa iba pang mga library (Hugging Face Transformers, llama.cpp) ang temperatura ay maaaring kumuha ng anumang positibong halaga.

Mahalaga: ang temperatura ay nakakaapekto sa output sa mga mode lamang na may sampling. Sa mga mode na walang sampling (greedy decoding, klasikal na beam search) ang parameter ng temperatura ay walang epekto. Halimbawa, sa Hugging Face Transformers para sa pagtatrabaho ng temperatura, kinakailangang paganahin ang do_sample=True.

Impluwensya ng Halaga ng Temperatura

  • T=1 (pamantayang halaga): Ang probability distribution ay nananatiling hindi nagbabago. Ito ang pamantayang softmax, na sumasalamin sa orihinal na mga hula ng modelo.
  • T<1 (mababang temperatura, halimbawa, 0.20.7): Ang distribution ay nagiging mas matalas o peaked. Ang mga probability ng pinaka-malamang na mga token ay tumataas, at ang mga hindi gaanong malamang — ay bumababa. Ginagawa nitong mas deterministic at predictable ang pagbuo. Ang modelo ay mas madalas na pumipili ng mga halata, mataas na dalas na salita, na nagpapataas ng koherensya at gramatikang katumpakan ng teksto, ngunit nagpapababa ng pagkakaiba-iba nito.
  • T>1 (mataas na temperatura, halimbawa, 1.11.5): Ang distribution ay nagiging mas maayos o pantay-pantay. Ang pagkakaiba sa pagitan ng mga probability ng mga token ay naha-smooth out, na nagpapataas ng pagkakataon ng pagpili ng mga hindi gaanong malamang (at mas "hindi inaasahan") na mga token. Ginagawa nitong mas malikhain, magkakaiba-iba, at hindi mahuhulaan ang teksto, ngunit nagpapataas ng panganib ng pagbuo ng mga hindi magkakaugnay o gramatikang maling parirala.

Mga Hangganan na Kaso

  • T0: Sa limitasyon, kapag ang temperatura ay papalapit sa zero, ang softmax function ay nagiging argmax. Ang modelo ay palaging pipili ng token na may pinakamataas na logit. Ang mode na ito ay katumbas ng greedy decoding at ganap na deterministic. Madalas itong humahantong sa paulit-ulit at template na teksto. Tandaan: ang halaga T=0 ay hindi maaaring direktang ilagay sa formula (paghahati sa zero); sa maraming implementasyon ito ay pinangangasiwaan bilang isang espesyal na mode ng pinakamaingat na pagpipilian, malapit sa greedy decoding. Gayunpaman, hindi lahat ng hosted API ay ginagarantiyahan ang ganap na determinism sa T=0 — halimbawa, sa Anthropic API kahit sa zero na temperatura, ang mga resulta ay maaaring bahagyang mag-iba.
  • T: Kapag ang temperatura ay papalapit sa infinity, ang probability distribution ay nagiging pantay-pantay. Lahat ng token sa bokabularyo ay nagiging pantay-pantay na malamang, at ang modelo ay bumubuo ng random na "stream of consciousness", ganap na nawawalan ng koherensya. Sa pagsasanay, ang infinity ay hindi kailangan: kahit sa T>2.0 ang distribution ay nagiging halos pantay-pantay, at ang teksto ay nagiging hindi magkakaugnay na hanay ng mga token.

Praktikal na Paggamit at Mga Rekomendasyon

Ang tamang pagpili ng temperatura ay kritikal na mahalaga at nakasalalay sa partikular na gawain. Ang mga hanay na ibinibigay sa ibaba ay magaspang na heuristics — ang mga optimal na halaga ay maaaring makabuluhang mag-iba depende sa partikular na modelo, domain, at gawain.

  • Para sa mga malikhaing gawain (pagsusulat ng mga kwento, tula, marketing slogans):
    • Inirerekomenda ang mas mataas na temperatura (T0.71.2).
    • Hinihikayat nito ang modelo na bumuo ng mas hindi inaasahan at malikhaing mga ideya, gumamit ng magkakaibang bokabularyo, at maiwasan ang mga template na parirala.
  • Para sa mga gawaing nangangailangan ng katumpakan at pagiging makatotohanan (mga sagot sa mga tanong, summarization, pagbuo ng code):
    • Inirerekomenda ang mababang temperatura (T0.00.4).
    • Binabawasan nito ang pagkakaiba-iba at pinapataas ang reproducibility ng resulta, pinipilit ang modelo na manatili sa mga pinaka-malamang na pagpapatuloy ng teksto. Sa T=0 ang pagbuo ay nagiging deterministic (sa fixed seed at kawalan ng iba pang mga pinagkukunan ng randomness), na kapaki-pakinabang para sa pagsubok at pag-debug, ngunit maaaring magtago ng mga problemang lumalabas lamang sa sampling. Gayunpaman, ang mababang temperatura mismo ay hindi ginagarantiyahan ang katotohanang katumpakan — kung ang modelo ay walang kinakailangang kaalaman, maaari itong may kumpiyansang bumuo ng maling sagot. Para sa pinakamataas na pagiging makatotohanan, inirerekomenda ang pagsasama ng mababang temperatura sa mga pamamaraan ng paghahanap sa knowledge base (RAG) at pinahusay na prompting. Sa dokumentasyon ng OpenAI para sa mga gawain ng pagkuha ng data at mga makatotohanang sagot, inirerekomenda ang T=0.
  • Para sa mga gawain ng reasoning, matematika, at pagbuo ng code:
    • Bilang panuntunan, ginagamit ang mas mababang mga temperatura, gayunpaman ang optimal na halaga ay kapansin-pansing nakasalalay sa partikular na modelo at gawain.
    • Tandaan: sa ilang mga reasoning model (halimbawa, ang pamilyang OpenAI o1/o3) ang mga parameter ng sampling ay maaaring limitado o nakatakda sa panig ng provider. Ang panloob na chain-of-thought ay nangangailangan ng matatag na distribution, kaya maaaring ganap na harangan ng mga provider ang pagbabago ng temperatura o tanggapin ang mga halaga ng gumagamit sa makitid na hanay lamang.
  • Para sa mga dialogue system at chat-bot:
    • Inirerekomenda ang katamtamang temperatura (T0.50.8).
    • Nagbibigay-daan ito na mahanap ang balanse: ang mga sagot ay nananatiling magkakaugnay at nasa paksa, ngunit hindi nagiging masyadong tuyo at paulit-ulit.

Tandaan: sa dokumentasyon ng OpenAI API inirerekomenda ang pagbabago ng alinman sa temperature, o top_p, ngunit hindi pareho nang sabay — kung hindi, ang gawi ay nagiging mahirap hulaan. Sa mga sangguniang halimbawa ng OpenAI API, bilang default na halaga ay karaniwang lumalabas ang T=1.0.

Paghahambing sa Top-k at Top-p

Ang temperatura, hindi tulad ng mga paraan ng pag-truncate, tulad ng Top-k at Top-p (nucleus sampling), ay gumagana nang naiiba:

  • Temperatura ay nagre-redistribute ng mga probability sa pagitan ng lahat ng token sa bokabularyo, ngunit hindi nag-aalis ng kahit isa sa kanila. Kahit sa napakababang temperatura, ang mga hindi gaanong malamang na token ay mayroon pa ring napakaliit, ngunit hindi-zero na pagkakataon na mapili.
  • Top-k at Top-p ay nagpapakilala ng mahigpit na pagtanggal, ganap na iniaalis ang mga token na hindi napasok sa nucleus ng sampling. Ang ganitong pagtanggal ay nagpapababa ng panganib ng pagpili ng mga tail token, ngunit ito mismo ay isang magaspang na heuristic at maaaring itapon ang mga makatotohanang pagpapatuloy na may hindi-zero na "tunay" na probability.

Sa pagsasanay, ang mga parameter na ito ay madalas na ginagamit nang magkasama. Halimbawa, maaari kang magtakda ng katamtamang temperatura (halimbawa, T=0.8) para sa pangkalahatang estilo at magdagdag ng Top-p (halimbawa, p=0.9), upang alisin ang "buntot" ng distribution at bawasan ang panganib ng malalaking pagkakamali. Sa napakababang temperatura (T0) ang Top-p ay halos nawawalan ng kahulugan, dahil ang distribution ay mayroon na lamang isang makabuluhang peak.

Pakikipag-ugnayan ng Temperatura sa Iba Pang Mga Parameter ng Decoding

Ang temperatura ay halos hindi kailanman ginagamit nang mag-isa. Sa pagsasanay, ito ay pinagsama sa iba pang mga hyperparameter para sa pinong pag-tune ng balanse na "creativity ↔ reliability".

Karaniwang Pagkakasunod-sunod ng Paglalapat ng mga Parameter

Sa karaniwang mga implementasyon ng sampling (partikular, Hugging Face Transformers) ang mga parameter ay karaniwang inilalapat sa sumusunod na pagkakasunod-sunod:

  1. Ang modelo ay nagbibigay ng mga hilaw na logit (ui).
  2. Inilalapat ang mga parusa sa pag-uulit (repetition / frequency / presence penalty) — pagbabago ng mga logit batay sa mga naunang nabuong token.
  3. Temperatura ay nagsa-scale ng mga logit: ui/T.
  4. Inilalapat ang softmax → nakukuha ang bagong probability distribution.
  5. Pag-truncate: una ang Top-k (kung tinukoy), pagkatapos Top-p o Min-p.
  6. Mula sa natitirang "nucleus" nangyayari ang random na sampling.

Sa karaniwang scheme na ito, binabago ng temperatura ang anyo ng distribution pagkatapos ng paglalapat ng mga parusa sa pag-uulit, ngunit bago ang softmax at pag-filter. Kaya naman, ang parehong top_p=0.9 sa T=0.2 at sa T=1.5 ay nagbibigay ng ganap na ibang laki ng "nucleus". Ang mga parusa at temperatura ay nakikipag-ugnayan nang hindi linear — ito ay mahalaga na isaalang-alang kapag pinipili ang mga parameter. Ang panloob na pagkakasunod-sunod ng paglalapat sa hosted API (OpenAI, Anthropic) ay hindi pampublikong dokumentado sa ganoong antas ng detalye.

Top-p (nucleus sampling) at Min-p

Min-p (minimum probability sampling) — isang medyo bagong paraan ng pag-truncate, na nagtatakda ng mas mababang threshold ng probability kaugnay ng pinaka-malamang na token (karaniwang 0.05–0.1). Hindi tulad ng Top-p, ito ay nag-aalis ng mga token ayon sa relatibong threshold (nakaangkla sa probability ng pinakamahusay na token, at hindi sa nakapirming cumulative mass), na lalo itong epektibo sa mataas na temperatura (>0.8): pinipigilan ang pagpili ng ganap na hindi angkop na mga token nang walang makabuluhang pagkawala ng pagkakaiba-iba. Sinusuportahan ng Min-p ang ilang sikat na open-source inference stack, kabilang ang vLLM at llama.cpp.

Repetition / Frequency / Presence Penalty

Frequency_penalty at presence_penalty (OpenAI API) ay nagpapababa ng probability ng pag-uulit ng mga naunang naganap na token. Maaari nilang mabayaran ang isa sa mga disadvantage ng mababang temperatura — ang pagkahilig sa mga template at pag-loop.

Typical Sampling at Mirostat

Typical sampling (Meister et al., 2023) ay pumipili ng mga token na ang probability ay malapit sa "inaasahang" entropy ng konteksto. Mirostat (v2) ay dinamikong ina-adjust ang mga parameter ng pag-truncate upang ang target na perplexity ay manatiling pare-pareho — ito ay kapaki-pakinabang para sa mahahabang teksto, kung saan ang katatagan ng estilo ay kritikal.

Mga Illustrative na Halimbawa ng Pag-configure

Sa ibaba ay mga tinatayang configuration para sa iba't ibang uri ng gawain. Ang mga halagang ito ay hindi mga pangkalahatang rekomendasyon — ang mga optimal na parameter ay nakasalalay sa partikular na modelo, gawain, at inference stack.

Gawain Temperatura Posibleng Kombinasyon Lohika
Factual Q&A, summarization 0.0–0.3 T + top_p=0.9 Pagbabawas ng random na pagkakaiba-iba
Pagbuo ng code, matematika 0.1–0.4 T + repetition_penalty Katatagan + pag-iwas sa pag-loop
Mga diyalogo / chat-bot 0.6–0.85 T + top_p=0.92 o min_p=0.1 Balanse ng natural at koherensya
Pagkamalikhain (mga kwento, marketing) 0.75–1.1 T + min_p=0.07–0.1 Pagkakaiba-iba na may pag-filter ng buntot
Long-form / mga ahente 0.5–0.8 Mirostat o T + frequency_penalty Kontrol ng haba at koherensya

Pangkalahatang payo: hindi dapat sabay-sabay na baguhin nang malaki ang temperature at top_p. Bilang panuntunan, mas maginhawang i-fix ang isa sa mga truncation parameter at kontrolin ang pagkamalikhain sa pamamagitan ng temperatura — ginagawa nitong mas predictable ang gawi ng modelo.

Katangian ng mga modernong aligned model: sa mga matibay na aligned na modelo (na dumaan sa RLHF / Constitutional AI / RLAIF) ang epekto ng mataas na temperatura ay pinahina kumpara sa mga base model — ang modelo ay mas bihirang bumuo ng hindi magkakaugnay na teksto kahit sa T=1.2. Ang mga partikular na optimal na halaga ay maaaring magbago sa pagdating ng mga bagong henerasyon ng mga modelo; ang mga rekomendasyon na ibinibigay sa itaas ay may kaugnayan sa estado ng 2025–2026 taon.

Talasanggunian

  • Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
  • Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
  • Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
  • Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
  • Hewitt, J.; Manning, C.; Liang, P. (2022). Truncation Sampling as Language Model Desmoothing. arXiv:2210.15191.
  • Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
  • O'Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
  • Finlayson, M. et al. (2023). Closing the Curious Case of Neural Text Degeneration. arXiv:2310.01693.
  • Shi, C. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
  • Ravfogel, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
  • Sen, J. et al. (2025). Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs. arXiv:2506.05387.
  • Basu, S. et al. (2021). Mirostat: A Perplexity-Controlled Neural Text Decoding Algorithm. arXiv:2007.14966.
  • Nguyen, M. N. et al. (2025). Turning Up the Heat: Min-p Sampling for Diverse and High-Quality Text Generation. arXiv:2407.01082.
  • Renze, M.; Guven, E. (2024). The Effect of Sampling Temperature on Problem Solving in Large Language Models. arXiv:2402.05201.
  • Zhang, S. et al. (2024). EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling. arXiv:2403.14541.
  • Li, L. et al. (2025). Exploring the Impact of Temperature on Large Language Models: Hot or Cold?. arXiv:2506.07295.

Tingnan Din

  • Malalaking Language Model