Reinforcement learning from human feedback (RLHF) (TR)
İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (Reinforcement Learning from Human Feedback, RLHF) — önce insanlardan alınan geri bildirim temelinde özel bir "ödül modeli" (reward model) eğitilen, ardından bu modelin akıllı bir ajanın davranışını optimize etmek amacıyla pekiştirmeli öğrenme (RL) sürecinde kullanıldığı bir makine öğrenmesi yöntemidir[1].
RLHF, "yararlı", "güvenli" veya "komik" yanıt gibi karmaşık ya da tanımlanması güç hedefleri insan değerlendirmeleri aracılığıyla resmileştirmeye olanak tanır. Karmaşık bir ödül fonksiyonunu elle tanımlamak yerine RLHF, ödül modelini doğrudan insan tercihlerine dayanarak eğitmeyi mümkün kılar. Bu yaklaşım, büyük dil modellerinin (LLM) "hizalanması" (alignment), yani davranışlarının insan değerleri ve niyetleriyle uyumlu hale getirilmesi için kilit bir yöntem haline gelmiştir[2].
Yöntemin Gelişimi ve İlk Başarılar
İnsan geri bildirimi kullanılarak ajan eğitme fikri 2010'lu yıllarda ortaya çıktı. İlk önemli sonuçlardan biri, OpenAI ve DeepMind'dan Paul Christiano ve meslektaşlarının 2017 yılındaki çalışmasıdır. Bu araştırmacılar, insan tercihlerinin karmaşık RL görevlerinde elle tanımlanmış ödül fonksiyonunun yerini alabileceğini gösterdi. Deneylerinde bir insan, ajanın davranış parçacıklarını (örneğin Atari oyunlarında) inceleyerek daha tercih edilebilir olanı seçti. Bu ikili karşılaştırmalar temelinde bir ödül modeli eğitildi ve böylece ajanın eylemlerinin yalnızca %1'inden azına ilişkin geri bildirimle bir dizi karmaşık görev başarıyla çözülebildi[3].
İzleyen yıllarda yöntem dil modellerinin eğitilmesine de uygulanmaya başlandı. 2020 yılında OpenAI araştırmacıları RLHF'yi ilk kez metin özetleme görevine uyguladı. Hangi özetin insan tarafından tercih edileceğini tahmin eden bir ödül modeli eğittiler ve RL kullanarak modeli bu puanı optimize edecek şekilde ince ayar yaptılar. Sonuç, insan referans örnekleri üzerinde eğitilmiş modelleri bile geride bırakarak özetleme kalitesinde belirgin bir artış sağladı[4].
RLHF ve Büyük Dil Modelleri
Büyük dil modelleri, yanıtlarını yararlılık, doğruluk ve talimatlara uyum açısından iyileştirmek için RLHF'nin benimsenmesinden önemli ölçüde yararlandı.
InstructGPT ve ChatGPT
Kilit adımlardan biri, OpenAI'ın insanların katılımıyla ince ayar yapılmış GPT-3 sürümleri olan InstructGPT (2022) modellerini tanıtan araştırmasıydı[5]. Metodoloji üç aşamadan oluşmaktaydı:
- Supervised Fine-Tuning (SFT): Model, insan değerlendiricilerin çeşitli sorgulara verilmesi istenen yanıt örneklerini bizzat yazdığı, küçük ancak yüksek kaliteli bir gösterim veri kümesi üzerinde ince ayarla eğitilir.
- Ödül Modeli (Reward Model) Eğitimi: Çok sayıda sorgu için modelin birden fazla yanıtı üretilir. İnsan değerlendiriciler bu yanıtları en iyiden en kötüye sıralar. Bu tercih verileri temelinde, insanların tercih ettiği yanıtlara daha yüksek puan vermeyi öğrenen bir ödül modeli eğitilir.
- RL ile Optimizasyon: Kaynak dil modeli, ödül modeli tarafından verilen puanı maksimize edecek şekilde Proximal Policy Optimization (PPO) algoritması kullanılarak ince ayarla eğitilir. Optimizasyon sürecinde, dil becerilerinin bozulmasını önlemek amacıyla kaynak SFT modelinden aşırı sapmalara karşı bir ceza da uygulanır.
Testler, görece küçük InstructGPT modelinin (1,3 milyar parametre) bile yararlılık açısından devasa GPT-3 modelini (175 milyar parametre) geride bıraktığını ortaya koydu. InstructGPT modelleri ayrıca toksik, önyargılı veya güvenilmez içerik üretme sıklığını da önemli ölçüde azalttı[5].
Bu çizginin devamı, en bilineni ChatGPT (OpenAI, 2022 sonu) olan konuşma modellerinin ortaya çıkmasına yol açtı. ChatGPT, benzer bir metodoloji kullanılarak RLHF ile diyalog için özel olarak ince ayar yapılmış GPT-3.5 serisi bir modeldir[6].
Sektördeki Benimseme
RLHF yöntemi diğer önde gelen kuruluşlar tarafından da benimsendi. DeepMind, doğal dil kuralları kümesi eklenerek (örneğin "tehlikeli tavsiye verme") RLHF ile eğitilmiş bir diyalog ajanı olan Sparrow'u (2022) geliştirdi[7]. Anthropic da kendi modellerini eğitmek için benzer ilkeler kullandı. 2023 yılına gelindiğinde RLHF, en ileri dil modellerinin oluşturulmasında neredeyse standart bir bileşen haline geldi[1].
RLHF Uygulamasının Avantajları
- Kullanıcı niyetiyle uyum: RLHF ile ince ayar yapılmış modeller talimatlara çok daha iyi uyar ve daha ilgili ve yararlı yanıtlar verir[5].
- Toksisite ve zararlı içeriğin azaltılması: İnsanın öğrenme döngüsüne dahil edilmesi, istenmeyen yanıt biçimlerinin açıkça cezalandırılmasına olanak tanır. Bunun sonucunda RLHF modelleri çok daha az toksik ve önyargılı içerik üretir[5].
- Doğruluğun iyileştirilmesi ve "halüsinasyonların" azaltılması: Değerlendiriciler, uydurma gerçekler içeren yanıtların puanını düşürerek modeli daha doğru olmaya yönlendirebilir. InstructGPT ve ChatGPT modelleri, öncüllerine kıyasla gerçekleri daha az "uydurmaktadır"[5].
- Eğitim verimliliği: RLHF, eğitim veri kümesini orantılı biçimde büyütmeksizin modeli iyileştirmeye olanak tanır. Büyük hacimli veriler değil, kaliteli tercih değerlendirmeleri yeterlidir.
Sınırlılıklar ve Sorunlar
Elde edilen başarılara karşın RLHF yönteminin bir dizi sınırlılığı ve çözüme kavuşturulmamış sorunu bulunmaktadır.
- İnsan verisi toplama kalitesi ve maliyeti: RLHF'nin etkinliği doğrudan geri bildirim kalitesine bağlıdır. Böyle bir dataset oluşturmak emek yoğun ve maliyetli bir süreçtir. Bunun yanı sıra değerlendirici örneklemi veya kullandıkları kriterler önyargılı olduğunda model bu sapmayı kalıtsal olarak devralabilir[2].
- Ödül Korsanlığı (Reward Hacking) riski: Belirli bir ödül fonksiyonu için optimize edilen model, gerçek hedef yerine tam da o fonksiyona uyum sağlamaya başlayabilir. Örneğin, değerlendiriciler uzunluğa değer veriyorsa mümkün olduğunca uzun yanıtlar vermeyi ya da yanlışlıklar nedeniyle cezalandırılıyorsa iddialı ifadelerden kaçınmayı öğrenebilir.
- Doğruluk güvencesinin yokluğu: RLHF modele yeni olgusal bilgi kazandırmaz; yalnızca insanların beğendiği yanıt biçimini öğretir. Bu nedenle halüsinasyon sorunu tam olarak çözüme kavuşturulamamaktadır. Model belirsizliği daha iyi gizlemeyi öğrenebilir, ancak gerçekleri her zaman doğrulayamaz[6].
- Tercihlerin ölçeklenmesi: Ödül modelinin farklı görevlere aktarımı da soru işaretleri doğurmaktadır. Belirli bir sorgu kümesinin tercihlerine göre eğitilmiş bir model, stil veya konu bakımından yeni görevlerle karşılaştığında öngörülemeyen biçimde davranabilir.
Sonuç
RLHF, büyük dil modellerini insanların iyi yanıt anlayışıyla "hizalamak" için önemli bir yöntem olarak yerini sağlamlaştırdı. Yapay zeka asistanlarıyla etkileşimin kalitesini belirgin biçimde artırarak yanıtlarını daha yararlı ve güvenli hale getirdi. RLHF, yalnızca inandırıcı metin üretmekle kalmayıp iletişim sürecinde insan değerlerini, tercihlerini ve niyetlerini de gözetebilen modeller yaratma yolundaki kilit bir araç olarak değerlendirilmektedir[8].
Literatür
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Kaynakça
- OpenAI'ın modelleri talimatları izleyecek şekilde ince ayar yapma üzerine makalesi
- IBM'den RLHF genel bakışı
Notlar
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]