Veri Bozulmaları ve Bias
Büyük dil modellerinde önyargı (İng. bias in large language models) — büyük dil modellerinin (LLM) çalışmasındaki sistematik sapmalar olup gerçekliği haksız veya yanlış biçimde yansıtan, toplumda var olan kalıpyargıları yeniden üreten ve pekiştiren yanıtların üretilmesine yol açar[1]. Rastgele hatalardan farklı olarak önyargı düzenli bir nitelik taşır ve eğitim verilerinin ile algoritmaların özelliklerinden kaynaklanır. LLM'ler toplumsal cinsiyet, etnik köken ve diğer kalıpyargıları yeniden üretebilir; bu durum özellikle tıp, hukuk ve finans gibi kritik alanlarda ciddi bir sorun oluşturmaktadır[2].
Önyargının Kaynakları
LLM'lerdeki önyargı iki temel kaynaktan doğar: yanlı veriler ve algoritmaların kendine özgü özellikleri.
Yanlı Eğitim Verileri
Önyargının ortaya çıkmasının temel nedeni, dünyada var olan tarihsel, toplumsal ve kültürel çarpıklıkları yansıtan eğitim verileridir. LLM'ler, insanlar tarafından oluşturulan İnternet, kitap ve diğer kaynaklardan derlenen devasa metin külliyatları üzerinde eğitilir; bunun sonucunda bu külliyatlardaki tüm kalıpyargıları miras alır[3].
- Dengesiz temsil: Verilerde belirli demografik gruplar (örneğin etnik azınlıklar, belirli mesleklerdeki kadınlar) yeterince temsil edilmiyorsa model bu gruplar hakkında çarpık bir algı oluşturur. Örneğin LLM'ler tarihsel toplumsal cinsiyet kalıpyargılarını yeniden üreterek "doktor" kelimesini erkek cinsiyetle, "hemşire" kelimesini ise kadın cinsiyetle sık sık ilişkilendirir[1].
- Tarihsel ve kültürel çarpıklıklar: Veriler çoğu zaman hâkim kültürel bakış açılarını ve tarihsel önyargıları yansıtır. Bu tür metinler üzerinde eğitilen bir model, alternatif perspektifleri görmezden gelerek söz konusu bakış açılarını yeniden üretir[4].
Algoritmik Güçlendirme
LLM'lerin mimarisi ve eğitim algoritması, verilerdeki mevcut sapmaları yalnızca yeniden üretmekle kalmaz, aynı zamanda güçlendirebilir de. Modern LLM'lerin büyük çoğunluğu transformer mimarisine dayanır ve istatistiksel örüntülere göre bir sonraki kelimeyi tahmin eder. Bu durum, modelin en sık karşılaşılan örüntülere yönelmesine yol açar; böylece baskın görüş ve kalıpyargılar pekişip güçlenirken nadir ve alışılmadık durumlar göz ardı edilir[2]. Bu mekanizma, verilerdeki önemsiz görünen bir sapmayı modelin yanıtlarında belirgin bir önyargıya dönüştürebilir[1].
Önyargı Türleri ve Örnekler
Toplumsal ve Demografik Önyargılar
Bu en çok incelenen önyargı türü; cinsiyet, ırk, yaş, din ve diğer toplumsal özelliklerle ilgili kalıpyargıları kapsar.
- Toplumsal cinsiyet kalıpyargıları: LLM'ler belirli meslekleri ve özellikleri belirli bir cinsiyetle sık sık ilişkilendirir. Örneğin "güçlü bir lider" sorgusu yapıldığında model, büyük olasılıkla bir erkeğin tanımını üretir.
- Irk ve etnik köken kalıpyargıları: Modeller çeşitli etnik gruplara ilişkin olumsuz kalıpyargıları yeniden üretebilir. Araştırmalar, LLM tabanlı denetim algoritmalarının Afrikalı-Amerikan günlük konuşma diline (AAVE) ait mesajları hatalı biçimde daha saldırgan kabul ederek daha sert değerlendirebileceğini göstermiştir[5].
- Grup önyargısı ("biz ve onlar"): 2024 yılında gerçekleştirilen bir araştırma, LLM'lerin belirgin bir grup önyargısı sergilediğini ortaya koymuştur. Modele belirli bir grupla ilişkilendiren bir ipucu verildiğinde ("Biz..."), model o gruba olumlu, "yabancılara" ise olumsuz biçimde yaklaşma eğilimi gösterir[4].
Yapısal ve Bilişsel Bozulmalar
Bu bozulmalar mimarinin ve bilgi işleme sürecinin özelliklerinden kaynaklanır.
- Konum kayması: Massachusetts Teknoloji Enstitüsü'nün (MIT) yürüttüğü araştırma, modellerin bir belgenin başındaki ve sonundaki bilgileri orantısız biçimde dikkate aldığını, ortadaki ayrıntıları ise çoğunlukla "gözden kaçırdığını" ortaya koymuştur. Bu durum, uzun metinlerle çalışırken doğruluğu olumsuz etkileyebilir[6].
- Ortalamaya yönelim eğilimi: LLM'ler olasılıksal modeller olduğundan en sık karşılaşılan (ortalama) yanıtları üretmeye eğilimlidir; bu da nadir fakat önemli gerçeklerin, istisnaların ve azınlık görüşlerinin göz ardı edilmesine yol açar[2].
- Doğrulama etkisi: LLM'ler, eğitim verilerinde yer alan mantıksal şablonları —önyargı içerseler bile— yeniden üretme ve bunlarla çelişen bilgileri göz ardı etme eğilimi gösterebilir[2].
Uygulamadan Bir Örnek
Dünya Bankası'nın yürüttüğü araştırma, mülteci görüşmelerinin analizinde LLM'nin, kişilerin kökenine ve cinsiyetine bağlı olarak ifadelerinin anlamını sistematik biçimde çarpıttığını ortaya koymuştur. Model, mülteci ebeveynlerin çocuklarının başarısına yönelik özlemlerini yanlış yorumlamıştır; bunun nedeni büyük olasılıkla, büyük ölçüde "orta sınıf beyaz yazarların" metinlerinden oluşan eğitim verilerinde bu tür anlatıların yer almamasıdır[7][7].
Riskler ve Sonuçlar
- Ayrımcılığın güçlenmesi: İşe alım, kredi verme ve hukuk gibi alanlarda önyargılı LLM'ler ayrımcı kararlar alarak toplumsal eşitsizliği derinleştirebilir[1].
- Kalıpyargıların yayılması: LLM'lerin arama motorları ve sohbet botlarında yaygın biçimde kullanılması, zararlı kalıpyargıların çoğaltılmasına ve normalleşmesine yol açabilir.
- Teknolojiye olan güvenin sarsılması: Kullanıcılar sistematik önyargıyla karşılaştığında bu durum, yapay zekâ teknolojilerine duyulan genel güveni zayıflatır.
- Bilgi balonlarının oluşması: Algoritmalar, çıktıyı kullanıcının varsayılan görüşlerine uyacak biçimde şekillendirebilir; bu da echo chamber oluşumunu besler ve azınlık görüşlerini dışlar[1].
Önyargıyı Tespit Etme ve Azaltma Yöntemleri
Bozulmalarla mücadele etmek amacıyla araştırmacılar ve geliştiriciler üç düzeyde —veri, model ve son işlem— kapsamlı bir yaklaşım uygulamaktadır[1].
Veri Düzeyinde Müdahaleler
Bu en temel yaklaşımdır. Şunları kapsar[1]:
- Temizleme ve dengeleme: Eğitim verilerinden zararlı ve önyargılı içeriğin kaldırılması.
- Veri Artırımı (Data Augmentation): Oranları dengelemek amacıyla yetersiz temsil edilen gruplara ait örneklerin eklenmesi.
Model Düzeyinde Değişiklikler
Bu yaklaşım, eğitim algoritmasının kendisini değiştirmeyi hedefler[1]:
- Adalet kısıtlamaları: Kayıp fonksiyonuna, modeli belirli önyargı türleri sergilediği için "cezalandıran" özel kısıtlamalar eklenir.
- Mimari değişiklikleri: Önyargılı ilişkilendirmeleri izleyen ve düzelten denetim modülleri eklenmesi ya da attention mekanizmalarının değiştirilmesine yönelik seçenekler araştırılmaktadır.
Sonuçların Son İşlemi
Bu yöntem, yanıt üretimi aşamasında uygulanır[1]:
- Filtreleme ve düzeltme: Özel algoritmalar üretilen metni analiz eder; potansiyel olarak ayrımcı ifadeleri yumuşatır ya da kaldırır.
- İnsan geri bildiriminden Reinforcement Learning (RLHF): Model, insanlar tarafından sağlanan değerlendirmelere dayanarak daha tarafsız ve güvenli yanıtlar vermesi için özel olarak ince ayar sürecine (fine-tuning) tabi tutulur.
Kayda değer ilerlemeye karşın LLM'leri önyargıdan tamamen arındırmak henüz mümkün olamamıştır. Bu konu, daha adil ve güvenilir yapay zekâ sistemleri oluşturmayı amaçlayan araştırmaların kilit alanlarından biri olmaya devam etmektedir[4].
Dış bağlantılar
- Generative language models exhibit social identity biases — Nature Computational Science dergisindeki araştırma
- Unpacking the bias of large language models — MIT News makalesi
Kaynakça
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
- Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
- Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [7].
- Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
- Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.
Notlar
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
- ↑ 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [2]
- ↑ «Large Language Models». Энциклопедия BigdataSchool. [3]
- ↑ 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [4]
- ↑ «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
- ↑ «Unpacking the bias of large language models». MIT News. [5]
- ↑ 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [6]