---
title: "Temperature (LLM) (TR)"
source: "https://systems-analysis.info/int/Temperature_(LLM)_(TR)"
wiki: "systems-analysis.info/int"
article: "Temperature_(LLM)_(TR)"
language: "tr"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 7861
wiki_created_at: 2026-09-07T01:08:05Z
wiki_modified_at: 2026-09-07T01:08:05Z
downloaded_at: 2026-09-07T23:21:14Z
---

# Temperature (LLM) (TR)

**Sıcaklık** (İng. Temperature), büyük dil modelleri (LLM) bağlamında, metin üretimi sırasında rastgelelik ve "yaratıcılık" düzeyini kontrol eden bir hiperparametredir. Kod çözme işleminin her adımında bir sonraki token için olasılık dağılımının "keskinliğini" ya da tersine "yumuşaklığını" düzenler. Sıcaklığı değiştirerek, üretilen metnin öngörülebilirliği (tutarlılık) ile çeşitliliği (yaratıcılık) arasındaki dengeyi yönetmek mümkündür.

## Basit Açıklama

**Sıcaklık**, modelin bir sonraki kelimeyi **ne kadar temkinli ya da aksine ne kadar özgürce seçeceğini** belirleyen bir parametredir. Büyük bir dil modelinin neredeyse hiçbir zaman yalnızca tek bir olası devamı yoktur: genellikle her adımda birden fazla uygun seçenek bulunur ve her birinin kendi olasılığı vardır. Sıcaklık, modelin bilgisini ya da "ne bildiğini" değil, üretim sırasında bu seçenekler arasında **nasıl seçim yaptığını** etkiler.

**Düşük sıcaklıkta** model daha tutucu davranır. En olası kelimelere daha fazla "güvenir" ve en beklenen devamdan daha az sapma gösterir. Sonuç olarak metin genellikle daha düzgün, öngörülebilir, biçimsel açıdan doğru ve tutarlı olur. Bu mod; formülasyonların doğruluğunun, yanıtın istikrarının, sonucun tekrarlanabilirliğinin ve gereksiz çeşitliliğin en aza indirilmesinin önem taşıdığı durumlarda kullanışlıdır. Ancak bu yaklaşımın olumsuz bir yanı da vardır: metin çok kalıplaşmış, kuru, tekdüze ve zaman zaman aşırı "temkinli" hale gelebilir. Aşırı düşük sıcaklıkta model, aynı yapıları süresiz tekrar etmeye (döngüye girmeye) başlayabilir; en olası ama her zaman uygun olmayan devamlara "takılıp" kalabilir.

**Yüksek sıcaklıkta** model daha cesaretli davranır. Yalnızca en olası kelimeleri değil, daha az belirgin kelimeleri de seçmesine daha sık izin verir. Bu sayede yanıtlar daha çeşitli, canlı, alışılmışın dışında ve zaman zaman daha özgün hale gelir. Bu durum; yaratıcı görevlerde, beyin fırtınasında, fikir üretiminde, edebi metinlerde ya da birkaç farklı formülasyon arayışında faydalı olabilir. Ancak çeşitlilik arttıkça risk de artar: metin daha az tutarlı, daha az doğru, aşırı durumlarda ise tuhaf, mantıksız veya rastgele hale gelebilir.

Kullanışlı bir sezgi şudur: sıcaklık **bir bilgi düzenleyicisi değil, kelime seçiminde risk düzenleyicisidir**. Düşük sıcaklık, modeli neredeyse her zaman "en güvenli" seçeneği tercih etmeye zorlar. Yüksek sıcaklık ise modelin daha sık "risk almasına" ve daha az belirgin devamları denemesine olanak tanır.

Bir diğer yararlı benzetme: sıcaklığı, bir insanın soruya nasıl yanıt verdiğiyle karşılaştırabilirsiniz. Resmi, doğru ve özenli bir yanıt gerekiyorsa kişi genellikle en yansız ve beklenen formülasyonları seçer — bu düşük sıcaklığa benzer. Görev alışılmışın dışında bir fikir, metafor, olay örgüsü ya da birkaç sıra dışı seçenek üretmekse formülasyonlar daha özgür ve cesur olur — bu da yüksek sıcaklığa benzer.

Böylece sıcaklık, üretimin iki özelliği arasındaki dengeyi yönetir:

- yanıtın **öngörülebilirliği ve istikrarı**;
- formülasyonların **çeşitliliği ve beklenmedikliği**.

Sıcaklık ne kadar düşükse, model en olası ve standart devama o kadar yaklaşır. Sıcaklık ne kadar yüksekse, çeşitlilik için alan o kadar büyür; ancak sonucun kesinliği ve tutarlılığı üzerindeki denetim o kadar zayıflar.

## Teorik Tanım

Matematiksel olarak sıcaklık ($T$), modelin çıkış logit'lerini ($u_{i}$) olasılık dağılımına ($P_{i}$) dönüştüren **softmax** işlevinde bir bölücü olarak eklenir. Formül şu şekildedir:

$P_{i}^{(T)} = \frac{e^{u_{i}/T}}{\sum\limits_{j}e^{u_{j}/T}}$

Burada:

- $P_{i}^{(T)}$ — $i$'ncı token'ın $T$ sıcaklığındaki nihai olasılığı.
- $u_{i}$ — model tarafından üretilen $i$'ncu token için logit (normalleştirilmemiş tahmin).
- $T$ — sıcaklık parametresi (kesinlikle pozitif bir sayı). Örneğin OpenAI API'sinde çoğu model için izin verilen aralık 0 ile 2.0 arasındadır; burada 0, greedy decoding için özel bir durumdur (aşağıya bakınız). Diğer kütüphanelerde (Hugging Face Transformers, llama.cpp) sıcaklık herhangi bir pozitif değer alabilir.

**Önemli:** sıcaklık çıktıyı yalnızca **sampling modlarında** etkiler. Sampling içermeyen modlarda (greedy decoding, klasik beam search) sıcaklık parametresinin herhangi bir etkisi yoktur. Örneğin Hugging Face Transformers'ta sıcaklığın çalışması için `do_sample=True` etkinleştirilmelidir.

### Sıcaklık Değerinin Etkisi

- **$T = 1$ (standart değer):** Olasılık dağılımı değişmeden kalır. Bu, modelin orijinal tahminlerini yansıtan standart softmax'tır.
- **$T < 1$ (düşük sıcaklık, örneğin $0.2$ – $0.7$):** Dağılım daha **keskin** veya **tepeli** hale gelir. En olası token'ların olasılıkları artar, düşük olasılıklıların olasılıkları ise azalır. Bu, üretimi daha deterministik ve öngörülebilir kılar. Model daha sık belirgin, yüksek frekanslı kelimeler seçer; bu da metnin tutarlılığını ve dilbilgisel doğruluğunu artırır ancak çeşitliliğini azaltır.
- **$T > 1$ (yüksek sıcaklık, örneğin $1.1$ – $1.5$):** Dağılım daha **düzgün** veya **tekdüze** hale gelir. Token'ların olasılıkları arasındaki fark azalır; bu da daha az olası (ve daha "beklenmedik") token'ların seçilme şansını artırır. Bu, metni daha yaratıcı, çeşitli ve öngörülemez kılar; ancak tutarsız veya dilbilgisel açıdan hatalı ifadeler üretme riskini artırır.

### Sınır Durumlar

- **$T \rightarrow 0$:** Sıcaklık sıfıra yaklaştığında softmax işlevi argmax'a dönüşür. Model her zaman en yüksek logit'e sahip token'ı seçer. Bu mod **açgözlü kod çözme (greedy decoding)** ile eşdeğerdir ve tamamen deterministiktir. Genellikle tekrarlayan ve kalıplaşmış metinlere yol açar. **Not:** $T = 0$ değeri formüle doğrudan yerleştirilemez (sıfıra bölme); pek çok uygulamada bu değer, greedy decoding'e yakın maksimum düzeyde tutucu seçim için özel bir mod olarak işlenir. Bununla birlikte tüm barındırılan API'ler $T = 0$ ile tam determinizm garantisi vermez — örneğin Anthropic API'sinde sıfır sıcaklıkta bile sonuçlar hafifçe değişkenlik gösterebilir.
- **$T \rightarrow \infty$:** Sıcaklık sonsuza yaklaştığında olasılık dağılımı **tekdüze** hale gelir. Sözcük dağarcığındaki tüm token'lar eşit olasılıklı hale gelir ve model tutarlılığını tamamen yitirerek rastgele bir "bilinç akışı" üretir. Pratikte sonsuzluğa gerek yoktur: $T > 2.0$ değerinde bile dağılım neredeyse tekdüze hale gelir ve metin birbirinden kopuk bir token dizisine dönüşür.

## Pratik Uygulama ve Öneriler

Doğru sıcaklık seçimi kritik öneme sahiptir ve belirli göreve göre değişir. Aşağıda belirtilen aralıklar **kaba sezgiseller** olup; optimum değerler belirli modele, alana ve göreve bağlı olarak önemli ölçüde farklılık gösterebilir.

- **Yaratıcı görevler için** (hikaye, şiir, pazarlama sloganı yazımı):
  - **Daha yüksek sıcaklık ($T \approx 0.7 - 1.2$)** önerilir.
  - Bu, modeli daha beklenmedik ve yaratıcı fikirler üretmeye, çeşitli sözcük dağarcığı kullanmaya ve kalıplaşmış ifadelerden kaçınmaya teşvik eder.

<!-- -->

- **Doğruluk ve olgusallık gerektiren görevler için** (soru yanıtlama, özetleme, kod üretimi):
  - **Düşük sıcaklık ($T \approx 0.0 - 0.4$)** önerilir.
  - Bu, değişkenliği azaltır ve sonucun tekrarlanabilirliğini artırır; modeli en olası metin devamlarına sadık kalmaya zorlar. $T = 0$ değerinde üretim deterministik hale gelir (sabit seed ve başka rastgelelik kaynağı yoksa), bu da test ve hata ayıklama için faydalıdır; ancak yalnızca sampling sırasında ortaya çıkan sorunları gizleyebilir. Bununla birlikte düşük sıcaklık başlı başına **olgusal doğruluğu garanti etmez** — model gerekli bilgiye sahip değilse yanlış bir yanıtı güvenle üretebilir. Maksimum olgusallık için düşük sıcaklığın bilgi tabanı arama yöntemleriyle (RAG) ve gelişmiş prompt tasarımıyla birleştirilmesi önerilir. OpenAI belgeleri, veri çıkarma ve olgusal yanıt görevleri için $T = 0$ değerini önermektedir.

<!-- -->

- **Akıl yürütme, matematik ve kod üretimi görevleri için:**
  - Genellikle **daha düşük sıcaklıklar** kullanılır; ancak optimum değer belirli modele ve göreve göre belirgin biçimde farklılık gösterir.
  - **Not:** bazı akıl yürütme modellerinde (örneğin OpenAI o1/o3 ailesi) sampling parametreleri sağlayıcı tarafında **kısıtlanmış veya sabitlenmiş** olabilir. Dahili chain-of-thought kararlı bir dağılım gerektirdiğinden sağlayıcılar sıcaklık değişikliğini tamamen engelleyebilir ya da kullanıcı değerlerini yalnızca dar bir aralıkta kabul edebilir.

<!-- -->

- **Diyalog sistemleri ve sohbet botları için:**
  - **Orta sıcaklık ($T \approx 0.5 - 0.8$)** önerilir.
  - Bu, bir denge bulmayı sağlar: yanıtlar tutarlı ve konuyla ilgili kalırken çok kuru ve tekdüze olmaktan da kaçınılır.

**Not:** OpenAI API belgelerinde temperature **ya da** top_p parametresini değiştirmeniz önerilir; ancak **ikisini aynı anda değiştirmemek** gerekir — aksi takdirde davranış öngörülmesi güç hale gelir. OpenAI API başvuru örneklerinde varsayılan değer olarak genellikle $T = 1.0$ kullanılır.

## Top-k ve Top-p ile Karşılaştırma

Sıcaklık, **Top-k** ve **Top-p (nucleus sampling)** gibi kesim yöntemlerinden farklı biçimde çalışır:

- **Sıcaklık**, sözcük dağarcığındaki tüm token'lar arasında olasılıkları **yeniden dağıtır**; ancak bunların hiçbirini **elemez**. Çok düşük sıcaklıkta bile düşük olasılıklı token'ların seçilme ihtimali son derece küçük ama sıfırdan farklıdır.
- **Top-k** ve **Top-p** ise **katı bir kesim** uygular; örnekleme çekirdeğine giremeyen token'ları tamamen dışlar. Bu kesim, uç token'ların seçilme riskini azaltır; ancak kendisi kaba bir sezgiseldir ve sıfırdan farklı "gerçek" olasılığa sahip mantıklı devamları dışlayabilir.

Pratikte bu parametreler çoğunlukla birlikte kullanılır. Örneğin genel stilistik için orta düzeyde bir sıcaklık (örneğin $T = 0.8$) ayarlayıp dağılımın "kuyruğunu" kesmek ve kaba hata riskini azaltmak için Top-p (örneğin $p = 0.9$) eklenebilir. Çok düşük sıcaklıkta ($T \rightarrow 0$) Top-p fiilen anlamını yitirir; çünkü dağılım zaten yalnızca tek bir belirgin tepeye sahiptir.

## Sıcaklığın Diğer Kod Çözme Parametreleriyle Etkileşimi

Sıcaklık neredeyse hiçbir zaman tek başına kullanılmaz. Pratikte "yaratıcılık ↔ güvenilirlik" dengesinin ince ayarı için diğer hiperparametrelerle birleştirilir.

### Parametrelerin Tipik Uygulama Sırası

Yaygın sampling uygulamalarında (özellikle Hugging Face Transformers'ta) parametreler genellikle şu sırayla uygulanır:

1.  Model **ham logit'leri** ($u_{i}$) üretir.
2.  **Tekrar cezaları** (repetition / frequency / presence penalty) uygulanır — önceden üretilmiş token'lara dayalı logit değişikliği.
3.  **Sıcaklık** logit'leri ölçekler: $u_{i}/T$.
4.  **Softmax** uygulanır → yeni olasılık dağılımı elde edilir.
5.  **Kesim (truncation):** önce Top-k (tanımlanmışsa), ardından Top-p veya Min-p.
6.  Kalan "çekirdekten" **rastgele örnekleme** (sampling) yapılır.

Bu tipik şemada sıcaklık, tekrar cezalarının uygulanmasından **sonra** ancak softmax ve filtrelemeden **önce** dağılımın biçimini değiştirir. Bu nedenle $top\_ p = 0.9$ ile $T = 0.2$ ve $T = 1.5$ arasında aynı değer tamamen farklı bir "çekirdek" boyutu sağlar. Cezalar ve sıcaklık doğrusal olmayan biçimde etkileşir — parametre ayarı sırasında bunu göz önünde bulundurmak önemlidir. Barındırılan API'lerin (OpenAI, Anthropic) dahili uygulama sırası bu ayrıntı düzeyinde kamuya açık olarak belgelenmemektedir.

### Top-p (Nucleus Sampling) ve Min-p

**Min-p** (minimum probability sampling — minimum olasılık örneklemesi), en olası token'ın olasılığına göreli bir alt eşik belirleyen görece yeni bir kesim yöntemidir (genellikle 0.05–0.1). Top-p'den farklı olarak, token'ları sabit bir kümülatif kütleye değil göreli bir eşiğe (en iyi token'ın olasılığına bağlı) göre keser. Bu yöntem, yüksek sıcaklıkta (\>0.8) özellikle etkilidir: çeşitliliği önemli ölçüde azaltmadan tamamen uygunsuz token'ların seçilmesini engeller. Min-p; vLLM ve llama.cpp dahil birçok popüler açık kaynaklı inference yığını tarafından desteklenmektedir.

### Repetition / Frequency / Presence Penalty

Frequency_penalty ve presence_penalty (OpenAI API), önceden kullanılmış token'ların tekrarlanma olasılığını azaltır. Bunlar, düşük sıcaklığın dezavantajlarından birini — kalıplaşma ve döngüye girme eğilimini — telafi edebilir.

### Typical Sampling ve Mirostat

Typical sampling (Meister ve ark., 2023), olasılığı bağlamın "beklenen" entropisine yakın olan token'ları seçer. Mirostat (v2) ise hedef perplexity değerinin sabit kalması için kesim parametrelerini dinamik olarak ayarlar — bu, stil kararlılığının kritik olduğu uzun metinlerde kullanışlıdır.

### Açıklayıcı Ayar Örnekleri

Aşağıda çeşitli görev türleri için **örnek** yapılandırmalar verilmektedir. Bu değerler genel amaçlı öneriler değildir — optimum parametreler belirli modele, göreve ve inference yığınına bağlıdır.

| Görev                              | Sıcaklık | Olası Kombinasyon                   | Mantık                               |
|------------------------------------|----------|-------------------------------------|--------------------------------------|
| Factual Q&A, özetleme              | 0.0–0.3  | T + top_p=0.9                       | Rastgele değişkenliği en aza indirme |
| Kod üretimi, matematik             | 0.1–0.4  | T + repetition_penalty              | Kararlılık + döngüden kaçınma        |
| Diyaloglar / sohbet botları        | 0.6–0.85 | T + top_p=0.92 veya min_p=0.1       | Doğallık ve tutarlılık dengesi       |
| Yaratıcılık (hikayeler, pazarlama) | 0.75–1.1 | T + min_p=0.07–0.1                  | Kuyruk filtrelemeli çeşitlilik       |
| Long-form / ajanlar                | 0.5–0.8  | Mirostat veya T + frequency_penalty | Uzunluk ve tutarlılık denetimi       |

**Genel öneri:** temperature ve top_p'yi aynı anda önemli ölçüde değiştirmek önerilmez. Kural olarak, kesim parametrelerinden birini sabit tutmak ve yaratıcılığı sıcaklıkla yönetmek daha uygundur — bu, modelin davranışını daha öngörülebilir kılar.

**Modern aligned modellerin özelliği:** güçlü biçimde hizalanmış modellerde (RLHF / Constitutional AI / RLAIF süreçlerinden geçmiş) yüksek sıcaklığın etkisi, temel modellere kıyasla zayıflamıştır — model $T = 1.2$ değerinde bile daha az tutarsız metin üretir. Belirli optimum değerler yeni nesil modellerin çıkmasıyla değişebilir; yukarıdaki öneriler 2025–2026 yılı itibarıyla günceldir.

## Ayrıca bakınız

- Büyük dil modelleri

## Kaynakça

- Holtzman, A. ve ark. (2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Caccia, M. ve ark. (2018). *Language GANs Falling Short*. arXiv:1811.02549.
- Fan, A. ve ark. (2018). *Hierarchical Neural Story Generation*. arXiv:1805.04833.
- Meister, C. ve ark. (2023). *Locally Typical Sampling*. arXiv:2202.00666.
- Hewitt, J.; Manning, C.; Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. arXiv:2210.15191.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. arXiv:2210.14140.
- O'Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. arXiv:2309.09117.
- Finlayson, M. ve ark. (2023). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Shi, C. ve ark. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. arXiv:2402.06925.
- Ravfogel, S. ve ark. (2023). *Conformal Nucleus Sampling*. arXiv:2305.02633.
- Sen, J. ve ark. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. arXiv:2506.05387.
- Basu, S. ve ark. (2021). *Mirostat: A Perplexity-Controlled Neural Text Decoding Algorithm*. arXiv:2007.14966.
- Nguyen, M. N. ve ark. (2025). *Turning Up the Heat: Min-p Sampling for Diverse and High-Quality Text Generation*. arXiv:2407.01082.
- Renze, M.; Guven, E. (2024). *The Effect of Sampling Temperature on Problem Solving in Large Language Models*. arXiv:2402.05201.
- Zhang, S. ve ark. (2024). *EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling*. arXiv:2403.14541.
- Li, L. ve ark. (2025). *Exploring the Impact of Temperature on Large Language Models: Hot or Cold?*. arXiv:2506.07295.
