Temperature (LLM) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

तापमान (अंग्रेज़ी: Temperature) बड़े भाषा मॉडलों (LLM) के संदर्भ में एक hyperparameter है, जो टेक्स्ट जनरेशन के दौरान यादृच्छिकता और "रचनात्मकता" के स्तर को नियंत्रित करता है। यह decoding के प्रत्येक चरण में अगले token के संभाव्यता वितरण की "तीक्ष्णता" या, इसके विपरीत, "समतलता" को नियंत्रित करता है। तापमान में परिवर्तन करके, जनरेट किए गए टेक्स्ट में पूर्वानुमेयता (coherence) और विविधता (रचनात्मकता) के बीच संतुलन को प्रबंधित किया जा सकता है।

सरल व्याख्या

तापमान एक ऐसा parameter है, जो यह निर्धारित करता है कि मॉडल अगला शब्द चुनते समय कितना सतर्क या, इसके विपरीत, कितना स्वतंत्र होता है। बड़े भाषा मॉडल के पास लगभग कभी भी केवल एक ही संभावित अगला शब्द नहीं होता: आमतौर पर प्रत्येक चरण में कई उपयुक्त विकल्प होते हैं, और प्रत्येक की अपनी संभावना होती है। तापमान मॉडल के ज्ञान पर या "वह क्या जानता है" इस पर प्रभाव नहीं डालता, बल्कि इस पर डालता है कि जनरेशन के दौरान वह इन विकल्पों में से चुनाव किस प्रकार करता है

कम तापमान पर मॉडल अधिक रूढ़िवादी व्यवहार करता है। वह सबसे संभावित शब्दों पर अधिक "भरोसा" करता है और सबसे अपेक्षित अगले शब्द से कम भटकता है। परिणामस्वरूप, टेक्स्ट आमतौर पर अधिक सुव्यवस्थित, पूर्वानुमेय, औपचारिक रूप से सही और सुसंगत होता है। यह मोड उन स्थानों पर उपयोगी है जहाँ सटीक शब्दावली, उत्तर की स्थिरता, परिणाम की पुनरावृत्ति और अतिरिक्त परिवर्तनशीलता को न्यूनतम करना महत्वपूर्ण हो। हालाँकि, इस दृष्टिकोण का एक दूसरा पक्ष भी है: टेक्स्ट अत्यधिक साँचेबद्ध, शुष्क, एकरूप और कभी-कभी बहुत अधिक "सावधान" हो सकता है। अत्यधिक कम तापमान पर मॉडल एक ही संरचना को अनंत रूप से दोहराना शुरू कर सकता है (चक्र में फँस सकता है), सबसे संभावित लेकिन हमेशा उचित न होने वाले अगले शब्दों पर "अटक" जाता है।

उच्च तापमान पर मॉडल अधिक साहसी व्यवहार करता है। यह न केवल सबसे संभावित, बल्कि कम स्पष्ट शब्दों को भी चुनने की अनुमति देता है। इसके कारण उत्तर अधिक विविध, जीवंत, अपरंपरागत और कभी-कभी अधिक मौलिक होते हैं। यह रचनात्मक कार्यों, विचार-मंथन, विचारों की जनरेशन, साहित्यिक टेक्स्ट या कई अलग-अलग शब्दावलियों की खोज में उपयोगी हो सकता है। लेकिन विविधता की वृद्धि के साथ जोखिम भी बढ़ता है: टेक्स्ट कम सुसंगत, कम सटीक हो सकता है, और चरम मामलों में — अजीब, अतार्किक या यादृच्छिक।

एक सुविधाजनक अंतर्ज्ञान यह है कि तापमान ज्ञान का नियामक नहीं, बल्कि शब्द चुनाव में जोखिम का नियामक है। कम तापमान मॉडल को लगभग हमेशा "सबसे सुरक्षित" विकल्प चुनने के लिए बाध्य करता है। उच्च तापमान उसे अधिक बार "जोखिम लेने" और कम स्पष्ट अगले शब्दों को आज़माने की अनुमति देता है।

एक और उपयोगी कल्पना: तापमान की तुलना इससे की जा सकती है कि कोई व्यक्ति किसी प्रश्न का उत्तर कैसे देता है। यदि एक औपचारिक, सटीक और सावधान उत्तर की आवश्यकता है, तो व्यक्ति, एक नियम के रूप में, सबसे तटस्थ और अपेक्षित शब्दावली चुनता है — यह कम तापमान के समान है। यदि कार्य एक असामान्य विचार, रूपक, कथानक मोड़ या कई गैर-मानक विकल्पों के साथ आने का है, तो शब्दावली अधिक स्वतंत्र और साहसी हो जाती है — यह उच्च तापमान के समान है।

इस प्रकार, तापमान जनरेशन के दो गुणों के बीच संतुलन के लिए उत्तरदायी है:

  • उत्तर की पूर्वानुमेयता और स्थिरता;
  • शब्दावली की विविधता और अप्रत्याशितता

तापमान जितना कम होगा, मॉडल सबसे संभावित और मानक अगले शब्द के उतना ही करीब होगा। तापमान जितना अधिक होगा, परिवर्तनशीलता के लिए उतनी ही अधिक जगह होगी, लेकिन परिणाम की कठोरता और सुसंगतता पर नियंत्रण उतना ही कमज़ोर होगा।

सैद्धांतिक परिभाषा

गणितीय रूप से, तापमान (T) को softmax फ़ंक्शन में एक भाजक के रूप में प्रस्तुत किया जाता है, जो मॉडल के आउटपुट logits (ui) को संभाव्यता वितरण (Pi) में बदलता है। सूत्र इस प्रकार है:

Pi(T)=eui/Tjeuj/T

जहाँ:

  • Pi(T) — तापमान T पर i-वें token की अंतिम संभावना।
  • uii-वें token के लिए मॉडल द्वारा दिया गया logit (गैर-सामान्यीकृत मूल्यांकन)।
  • T — तापमान parameter (कड़ाई से धनात्मक संख्या)। उदाहरण के लिए, OpenAI API में अधिकांश मॉडलों के लिए स्वीकार्य सीमा 0 से 2.0 है, जहाँ 0 greedy decoding का एक विशेष मामला है (नीचे देखें)। अन्य पुस्तकालयों (Hugging Face Transformers, llama.cpp) में तापमान कोई भी धनात्मक मान ले सकता है।

महत्वपूर्ण: तापमान आउटपुट को केवल sampling मोड में प्रभावित करता है। sampling के बिना वाले मोड में (greedy decoding, क्लासिकल beam search) तापमान parameter का कोई प्रभाव नहीं होता। उदाहरण के लिए, Hugging Face Transformers में तापमान को कार्य करने के लिए do_sample=True को सक्षम करना आवश्यक है।

तापमान मान का प्रभाव

  • T=1 (मानक मान): संभाव्यता वितरण अपरिवर्तित रहता है। यह मानक softmax है, जो मॉडल की मूल भविष्यवाणियों को दर्शाता है।
  • T<1 (कम तापमान, उदाहरण के लिए, 0.20.7): वितरण अधिक तीक्ष्ण या शिखर वाला हो जाता है। सबसे अधिक संभावित tokens की संभावनाएँ बढ़ जाती हैं, और कम संभावित tokens की घट जाती हैं। यह जनरेशन को अधिक निर्धारणवादी और पूर्वानुमेय बनाता है। मॉडल अधिक बार स्पष्ट, उच्च-आवृत्ति वाले शब्दों को चुनता है, जो टेक्स्ट की coherence और व्याकरणिक शुद्धता को बढ़ाता है, लेकिन इसकी विविधता को कम करता है।
  • T>1 (उच्च तापमान, उदाहरण के लिए, 1.11.5): वितरण अधिक सपाट या एकसमान हो जाता है। tokens की संभावनाओं के बीच का अंतर कम हो जाता है, जो कम संभावित (और अधिक "अप्रत्याशित") tokens को चुने जाने की संभावना बढ़ाता है। यह टेक्स्ट को अधिक रचनात्मक, विविध और अप्रत्याशित बनाता है, लेकिन असंगत या व्याकरणिक रूप से गलत वाक्यांशों की जनरेशन का जोखिम बढ़ाता है।

सीमान्त मामले

  • T0: सीमा में, जब तापमान शून्य की ओर जाता है, softmax फ़ंक्शन argmax में बदल जाता है। मॉडल हमेशा उच्चतम logit वाले token को चुनेगा। यह मोड लालची डिकोडिंग (greedy decoding) के समकक्ष है और पूरी तरह निर्धारणवादी है। यह अक्सर दोहराव वाले और साँचेबद्ध टेक्स्ट की ओर ले जाता है। टिप्पणी: T=0 का मान सूत्र में सीधे प्रतिस्थापित नहीं किया जा सकता (शून्य से विभाजन); कई कार्यान्वयनों में इसे greedy decoding के करीब, अधिकतम रूढ़िवादी चुनाव के विशेष मोड के रूप में संसाधित किया जाता है। साथ ही, सभी hosted API T=0 पर पूर्ण निर्धारणवादिता की गारंटी नहीं देते — उदाहरण के लिए, Anthropic API में शून्य तापमान पर भी परिणाम थोड़े भिन्न हो सकते हैं।
  • T: जब तापमान अनंत की ओर जाता है, संभाव्यता वितरण एकसमान हो जाता है। शब्दकोश के सभी tokens समान संभावना वाले हो जाते हैं, और मॉडल एक यादृच्छिक "चेतना की धारा" उत्पन्न करता है, जो पूरी तरह coherence खो देती है। व्यवहार में अनंत की आवश्यकता नहीं है: T>2.0 पर भी वितरण लगभग एकसमान हो जाता है, और टेक्स्ट असंगत tokens के समूह में बदल जाता है।

व्यावहारिक अनुप्रयोग और सिफारिशें

सही तापमान का चुनाव अत्यंत महत्वपूर्ण है और विशिष्ट कार्य पर निर्भर करता है। नीचे दी गई सीमाएँ मोटे अनुमानी नियम हैं — इष्टतम मान विशिष्ट मॉडल, डोमेन और कार्य के आधार पर काफी भिन्न हो सकते हैं।

  • रचनात्मक कार्यों के लिए (कहानियाँ, कविताएँ, विपणन नारे लिखना):
    • अधिक उच्च तापमान (T0.71.2) की सिफारिश की जाती है।
    • यह मॉडल को अधिक अप्रत्याशित और रचनात्मक विचार उत्पन्न करने, विविध शब्दावली का उपयोग करने और साँचेबद्ध वाक्यांशों से बचने के लिए प्रोत्साहित करता है।
  • सटीकता और तथ्यात्मकता की आवश्यकता वाले कार्यों के लिए (प्रश्नों के उत्तर, सारांश, कोड जनरेशन):
    • कम तापमान (T0.00.4) की सिफारिश की जाती है।
    • यह परिवर्तनशीलता को कम करता है और परिणाम की पुनरावृत्ति को बढ़ाता है, जिससे मॉडल टेक्स्ट के सबसे संभावित अगले शब्दों का पालन करता है। T=0 पर जनरेशन निर्धारणवादी हो जाती है (निश्चित seed और अन्य यादृच्छिकता के स्रोतों की अनुपस्थिति में), जो परीक्षण और debugging के लिए उपयोगी है, लेकिन केवल sampling के दौरान प्रकट होने वाली समस्याओं को छुपा सकता है। हालाँकि, कम तापमान अपने आप में तथ्यात्मक सटीकता की गारंटी नहीं देता — यदि मॉडल के पास आवश्यक ज्ञान नहीं है, तो वह आत्मविश्वास के साथ गलत उत्तर उत्पन्न कर सकता है। अधिकतम तथ्यात्मकता के लिए कम तापमान को ज्ञान आधार खोज विधियों (RAG) और बेहतर prompting के साथ संयोजित करने की सिफारिश की जाती है। OpenAI के दस्तावेज़ीकरण में डेटा निष्कर्षण और तथ्यात्मक उत्तरों के कार्यों के लिए T=0 की सिफारिश की जाती है।
  • Reasoning, गणित और कोड जनरेशन के कार्यों के लिए:
    • एक नियम के रूप में, अधिक कम तापमान का उपयोग किया जाता है, हालाँकि इष्टतम मान विशिष्ट मॉडल और कार्य पर काफी निर्भर करता है।
    • टिप्पणी: कुछ reasoning मॉडलों में (उदाहरण के लिए, OpenAI o1/o3 परिवार) sampling parameters प्रदाता की ओर से प्रतिबंधित या निश्चित हो सकते हैं। आंतरिक chain-of-thought को स्थिर वितरण की आवश्यकता होती है, इसलिए प्रदाता तापमान परिवर्तन को पूरी तरह अवरुद्ध कर सकते हैं या केवल एक संकीर्ण सीमा में उपयोगकर्ता मान स्वीकार कर सकते हैं।
  • संवादी प्रणालियों और chatbots के लिए:
    • मध्यम तापमान (T0.50.8) की सिफारिश की जाती है।
    • यह संतुलन खोजने की अनुमति देता है: उत्तर सुसंगत और विषय पर बने रहते हैं, लेकिन साथ ही बहुत शुष्क और एकरूप नहीं होते।

टिप्पणी: OpenAI API के दस्तावेज़ीकरण में या तो temperature, या top_p बदलने की सिफारिश की जाती है, लेकिन दोनों parameters को एक साथ नहीं — अन्यथा व्यवहार अनुमान लगाना कठिन हो जाता है। OpenAI API के संदर्भ उदाहरणों में डिफ़ॉल्ट मान के रूप में आमतौर पर T=1.0 का उल्लेख होता है।

Top-k और Top-p से तुलना

तापमान, Top-k और Top-p (nucleus sampling) जैसी कटौती विधियों के विपरीत, अलग तरह से काम करता है:

  • तापमान शब्दकोश के सभी tokens के बीच संभावनाओं को पुनर्वितरित करता है, लेकिन उनमें से किसी को भी नहीं काटता। बहुत कम तापमान पर भी, कम संभावित tokens को चुने जाने का एक नगण्य लेकिन शून्येतर मौका रहता है।
  • Top-k और Top-p कठोर कटौती लागू करते हैं, जो sampling के केंद्रक में शामिल न होने वाले tokens को पूरी तरह बाहर कर देते हैं। ऐसी कटौती पूँछ वाले tokens को चुने जाने के जोखिम को कम करती है, लेकिन यह स्वयं एक मोटा अनुमानी नियम है और शून्येतर "वास्तविक" संभावना वाले प्रशंसनीय अगले शब्दों को छोड़ सकती है।

व्यवहार में, इन parameters का अक्सर संयुक्त रूप से उपयोग किया जाता है। उदाहरण के लिए, सामान्य शैलीगत प्रभाव के लिए मध्यम तापमान (उदाहरण के लिए, T=0.8) सेट करना और वितरण की "पूँछ" को काटने और गंभीर त्रुटियों के जोखिम को कम करने के लिए Top-p (उदाहरण के लिए, p=0.9) जोड़ना संभव है। बहुत कम तापमान पर (T0) Top-p वास्तव में अर्थहीन हो जाता है, क्योंकि वितरण में वैसे भी केवल एक महत्वपूर्ण शिखर होता है।

तापमान और अन्य decoding parameters के साथ अंतःक्रिया

तापमान का उपयोग लगभग कभी अकेले नहीं किया जाता। व्यवहार में, इसे "रचनात्मकता ↔ विश्वसनीयता" के संतुलन को सूक्ष्म रूप से समायोजित करने के लिए अन्य hyperparameters के साथ संयोजित किया जाता है।

Parameters लागू करने का सामान्य क्रम

प्रचलित sampling कार्यान्वयनों में (विशेष रूप से, Hugging Face Transformers में) parameters आमतौर पर निम्नलिखित क्रम में लागू होते हैं:

  1. मॉडल कच्चे logits (ui) आउटपुट करता है।
  2. दोहराव के लिए दंड (repetition / frequency / presence penalty) लागू होते हैं — पहले से जनरेट किए गए tokens के आधार पर logits में परिवर्तन।
  3. तापमान logits को स्केल करता है: ui/T
  4. Softmax लागू होता है → नया संभाव्यता वितरण प्राप्त होता है।
  5. कटौती (truncation): पहले Top-k (यदि निर्धारित है), फिर Top-p या Min-p।
  6. शेष "केंद्रक" से यादृच्छिक चयन (sampling) होता है।

इस सामान्य योजना में, तापमान दोहराव दंड के आवेदन के बाद, लेकिन softmax और फ़िल्टरिंग के पहले वितरण का आकार बदलता है। इसलिए, वही top_p=0.9, T=0.2 पर और T=1.5 पर, पूरी तरह से अलग "केंद्रक" आकार देती है। दंड और तापमान अरेखीय रूप से परस्पर क्रिया करते हैं — parameters का चयन करते समय इसे ध्यान में रखना महत्वपूर्ण है। Hosted API (OpenAI, Anthropic) में आवेदन का आंतरिक क्रम इस स्तर के विवरण पर सार्वजनिक रूप से प्रलेखित नहीं है।

Top-p (nucleus sampling) और Min-p

Min-p (minimum probability sampling) — एक अपेक्षाकृत नई कटौती विधि है, जो सबसे संभावित token के सापेक्ष संभावना का निचला सीमा निर्धारित करती है (आमतौर पर 0.05–0.1)। Top-p के विपरीत, यह tokens को सापेक्ष सीमा के आधार पर काटती है (सर्वश्रेष्ठ token की संभावना से जुड़ी, न कि निश्चित संचयी द्रव्यमान से), जो उच्च तापमान (>0.8) पर विशेष रूप से प्रभावी है: विविधता का महत्वपूर्ण नुकसान किए बिना पूरी तरह अनुपयुक्त tokens के चयन को रोकता है। Min-p vLLM और llama.cpp सहित कई लोकप्रिय open-source inference स्टैक्स द्वारा समर्थित है।

Repetition / Frequency / Presence Penalty

Frequency_penalty और presence_penalty (OpenAI API) पहले से मिले tokens के दोहराव की संभावना को कम करते हैं। वे कम तापमान के एक नुकसान — साँचेबद्धता और चक्र में फँसने की प्रवृत्ति — की भरपाई कर सकते हैं।

Typical Sampling और Mirostat

Typical sampling (Meister et al., 2023) उन tokens को चुनता है जिनकी संभावना संदर्भ की "अपेक्षित" entropy के करीब होती है। Mirostat (v2) लक्षित perplexity को स्थिर बनाए रखने के लिए कटौती parameters को गतिशील रूप से समायोजित करता है — यह लंबे टेक्स्ट के लिए उपयोगी है जहाँ शैली की स्थिरता महत्वपूर्ण है।

उदाहरणात्मक सेटिंग के उदाहरण

नीचे विभिन्न प्रकार के कार्यों के लिए अनुमानित कॉन्फ़िगरेशन दिए गए हैं। ये मान सामान्य प्रयोजन की सिफारिशें नहीं हैं — इष्टतम parameters विशिष्ट मॉडल, कार्य और inference स्टैक पर निर्भर करते हैं।

कार्य तापमान संभावित संयोजन तर्क
Factual Q&A, सारांश 0.0–0.3 T + top_p=0.9 यादृच्छिक परिवर्तनशीलता का न्यूनीकरण
कोड जनरेशन, गणित 0.1–0.4 T + repetition_penalty स्थिरता + चक्र से बचाव
संवाद / chatbots 0.6–0.85 T + top_p=0.92 या min_p=0.1 स्वाभाविकता और सुसंगतता का संतुलन
रचनात्मकता (कहानियाँ, विपणन) 0.75–1.1 T + min_p=0.07–0.1 पूँछ फ़िल्टरिंग के साथ विविधता
Long-form / एजेंट 0.5–0.8 Mirostat या T + frequency_penalty लंबाई और सुसंगतता का नियंत्रण

सामान्य सलाह: temperature और top_p को एक साथ बहुत अधिक नहीं बदलना चाहिए। एक नियम के रूप में, truncation parameters में से एक को निश्चित करना और तापमान से रचनात्मकता को प्रबंधित करना अधिक सुविधाजनक है — यह मॉडल के व्यवहार को अधिक पूर्वानुमेय बनाता है।

आधुनिक aligned मॉडलों की विशेषता: अत्यधिक संरेखित मॉडलों में (RLHF / Constitutional AI / RLAIF से गुज़रे हुए) उच्च तापमान का प्रभाव आधार मॉडलों की तुलना में कमज़ोर होता है — T=1.2 पर भी मॉडल कम बार असंगत टेक्स्ट उत्पन्न करता है। विशिष्ट इष्टतम मान नए मॉडल पीढ़ियों के आगमन के साथ बदल सकते हैं; उपरोक्त सिफारिशें 2025–2026 की स्थिति के अनुसार प्रासंगिक हैं।

साहित्य

  • Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
  • Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
  • Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
  • Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
  • Hewitt, J.; Manning, C.; Liang, P. (2022). Truncation Sampling as Language Model Desmoothing. arXiv:2210.15191.
  • Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
  • O'Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
  • Finlayson, M. et al. (2023). Closing the Curious Case of Neural Text Degeneration. arXiv:2310.01693.
  • Shi, C. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
  • Ravfogel, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
  • Sen, J. et al. (2025). Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs. arXiv:2506.05387.
  • Basu, S. et al. (2021). Mirostat: A Perplexity-Controlled Neural Text Decoding Algorithm. arXiv:2007.14966.
  • Nguyen, M. N. et al. (2025). Turning Up the Heat: Min-p Sampling for Diverse and High-Quality Text Generation. arXiv:2407.01082.
  • Renze, M.; Guven, E. (2024). The Effect of Sampling Temperature on Problem Solving in Large Language Models. arXiv:2402.05201.
  • Zhang, S. et al. (2024). EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling. arXiv:2403.14541.
  • Li, L. et al. (2025). Exploring the Impact of Temperature on Large Language Models: Hot or Cold?. arXiv:2506.07295.

यह भी देखें

  • बड़े भाषा मॉडल