Yi (01.AI) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — büyük dil modelleri (Large Language Model, LLM) ve görsel-dil modelleri (Vision-Language Model, VLM) ailesi olup Kai-Fu Lee liderliğinde 01.AI (零一万物) şirketi tarafından geliştirilmiştir. Modeller, 3,1 trilyon token hacminde yüksek kaliteli ikidilli bir korpus (İngilizce ve Çince) üzerinde sıfırdan eğitilmiş olup metin üretimi, uzun bağlam işleme (200 bin tokena kadar), çok modlu girdi (metin + görüntü), kod üretimi ve Mixture-of-Experts (MoE) mimarisine dayalı verimli çıkarım için çeşitli varyantlar içermektedir. Açık kaynaklı varyantlar, ticari kullanıma izin veren Apache 2.0 lisansı kapsamında dağıtılmaktadır; kapalı kaynaklı amiral gemi modelleri (Yi-Large, Yi-Lightning) ise API aracılığıyla erişilebilir durumdadır.[1][2][3]

Tarihçe ve Gelişim Kronolojisi

01.AI şirketi, Microsoft Research Asia ve Google China'nın eski başkanı Kai-Fu Lee tarafından Mart 2023'te Pekin merkezli olarak kurulmuştur. Şirketin odak noktası, veri kalitesi ve altyapı mühendislik optimizasyonuna önem vererek verimli LLM geliştirmektir. Kasım 2023'e kadar 01.AI, Alibaba'nın katılımıyla gerçekleştirilen bir finansman turunun ardından "unicorn" statüsüne (1 milyar dolar üzeri değerleme) ulaşmıştır.[4][5]

Birinci Nesil (2023–2024)

İlk açık kaynaklı modeller Yi-6B ve Yi-34B, 2 Kasım 2023 tarihinde tanıtılmıştır. Sonraki haftalar içinde ürün serisi, 200 bin tokenlik bağlam varyantları (5 Kasım 2023), sohbet varyantları ve kuantize modeller (23 Kasım 2023) ile genişletilmiştir. Ocak 2024'te çok modlu Yi-VL-6B ve Yi-VL-34B modelleri yayınlanmıştır. Mart 2024'te Yi-6B'den derinlik ölçeklendirme (depth upscaling) yöntemiyle elde edilen Yi-9B modeli tanıtılmış ve arXiv:2403.04652 teknik raporu yayımlanmıştır.[1][2]

Yi-1.5 ve Özelleştirilmiş Modeller (2024)

13 Mayıs 2024'te Yi-1.5 serisi (6B/9B/34B) yayınlanmıştır; bu seri ek 500 milyar token üzerinde sürekli ön eğitim ve 3 milyon talimat örneği üzerinde ince ayar yapılmasının ürünüdür. Mayıs–Haziran 2024'te, SOTA olarak konumlandırılan API erişimli kapalı kaynaklı tescilli model Yi-Large tanıtılmıştır. Eylül 2024'te ise 128 bin tokenlik bağlam ve 52 programlama dili desteği sunan kod üretimine özel Yi-Coder serisi (1.5B/9B) yayınlanmıştır.[1][6][7]

Yi-Lightning (2024)

Ekim 2024'te, hız ve çıkarım verimliliği için optimize edilmiş Mixture-of-Experts (MoE) mimarisine dayalı amiral gemi modeli Yi-Lightning tanıtılmıştır. Yi-Lightning, LMSYS Chatbot Arena genel sıralamasında 6. sıraya (Elo 1287), Çince kategorisinde 2. sıraya, matematik ve kodlamada ise 3–4. sıraya yerleşmiştir. Teknik rapor Aralık 2024'te yayımlanmıştır (arXiv:2412.01253).[8]

Strateji Değişikliği (2025)

Mart 2025'te 01.AI şirketi, yeni büyük dil modellerinin ön eğitimini durdurduğunu duyurmuş ve kurumsal uygulamalara, çok ajanlı sistemlere ve üçüncü taraf modellere (DeepSeek dahil) dayalı WorldWise LLM Platform 2.5 platformuna odaklanmaya başlamıştır.[4]

Özet Kronoloji

Tarih Olay
Kasım 2023 Yi-6B ve Yi-34B sürümü (base, chat, 200K varyantları)
Ocak 2024 Çok modlu Yi-VL-6B ve Yi-VL-34B
Mart 2024 Yi-9B (depth-upscaled); arXiv:2403.04652 teknik raporunun yayımlanması
Mayıs 2024 Yi-1.5 (6B/9B/34B); Yi-Large (kapalı kaynak, API)
Eylül 2024 Yi-Coder-1.5B/9B (kod özelleşmesi, 128K bağlam)
Ekim 2024 Yi-Lightning (MoE mimarisi, amiral gemi modeli)
Aralık 2024 Yi-Lightning teknik raporunun yayımlanması (arXiv:2412.01253)
Mart 2025 Yeni LLM ön eğitiminin durdurulması; kurumsal çözümlere odaklanma

Teorik Temeller ve Mimari

Temel Mimari

Yi ailesinin tüm modelleri, Vaswani ve diğerlerinin çalışmasında açıklanan yalnızca-çözücü Transformer (decoder-only Transformer) mimarisine dayanmaktadır.[9] Modeller sıfırdan eğitilmiş olup uygulama benzerliğine karşın LLaMA'dan türetilmemiştir.[1]

Çok başlı öz-dikkat (Multi-Head Self-Attention) mekanizmasının temel formülü şöyledir:

Attention(Q,K,V)=softmax(QKdk)V

burada Q, K, V sırasıyla sorgu (queries), anahtar (keys) ve değer (values) matrislerini; dk ise anahtarların boyutluluğunu temsil etmektedir.[9]

Yi'nin temel mimari modifikasyonları:[1]

  • Grouped-Query Attention (GQA) — sorgu başlarının ortak key/value başlarıyla gruplara ayrılması; bu yaklaşım kaliteyi korurken bellek tüketimini azaltır.
  • SwiGLU aktivasyon fonksiyonu — standart ReLU/GELU'nun yerini alır; aktivasyon boyutunu gizli katman boyutunun (hidden size) 8/3'üne düşürür.
  • Rotary Position Embedding (RoPE) — mimari değişiklik gerektirmeksizin bağlam genişletmeyi sağlayan uyarlanmış temel frekans (adjusted base frequency, ABF) ile birlikte kullanılır.
  • Sözcük dağarcığı (vocabulary): BPE (SentencePiece) tabanlı 64.000 token; sayılar basamaklara ayrılır ve nadir karakterler için unicode-byte fallback kullanılır.

Temel Model Yapılandırmaları

arXiv:2403.04652 teknik raporundan mimari parametreler:[1]

Parametre Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Katman sayısı 32 60
Ön eğitim uzunluğu (Pretrain Seq. Len) 4096 4096
Maks. öğrenme hızı (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Kaynak: arXiv:2403.04652, parametre tablosu.[1]

Yi-Lightning Mimarisi (MoE)

Yi-Lightning (2024), aşağıdaki özelliklere sahip geliştirilmiş bir Mixture-of-Experts (MoE) mimarisi kullanmaktadır:[8]

  • Fine-grained expert segmentation — uzmanlaşmayı artırmak amacıyla FFN bloklarının uzmanlar düzeyinde ayrıntılı bölümlere ayrılması.
  • Çok düzeyli yük dengeleme — tokenların uzmanlar arasında eşit dağılımı için Switch-Transformer (ST), Expert Parallel (EP) ve Partitioned EP (PEP) kayıplarının kombinasyonu.
  • Hibrit dikkat — 3 kayan pencere (sliding window) katmanı ile 1 tam dikkat (full attention) katmanının dönüşümlü kullanımı ve katmanlar arasında KV-önbelleğin yeniden kullanımı.
  • KV-önbellek bellek kullanımı, uzun dizilerin işlenmesinde standart yaklaşıma kıyasla %82,8 oranında azaltılmıştır.
  • Bağlam penceresi 64 bin tokena genişletilmiştir.

Yi-Lightning'deki uzman sayısı ve toplam parametre sayısı kamuya açık kaynaklarda açıklanmamıştır.[8]

Çok Modlu Varyantlar (Yi-VL)

Yi-VL çok modlu modellerinde dil modeli, MLP projeksiyonu aracılığıyla CLIP ViT-H/14 görsel kodlayıcısına bağlanmaktadır. I görüntüsü, görsel kodlayıcı tarafından {v1,,vK} embedding dizisine dönüştürülmekte ve metin tokenleriyle birlikte dil modeline beslenmektedir. Eğitim, 224×224 → 448×448 piksel çözünürlük artışıyla üç aşamada gerçekleştirilmektedir.[1]

Eğitim Hattı ve Hizalama

Ön Eğitim (Pre-training)

Yi-6B ve Yi-34B temel modelleri, 3,1 trilyon tokenlik ikidilli bir korpus üzerinde ön eğitime tabi tutulmuştur. Veriler, basamaklı bir filtreleme ve tekilleştirme hattından geçirilmektedir: sezgisel filtreler, eğitilmiş puanlayıcılar (perplexity, quality, coherence, safety), kümeleme ve MinHash tekilleştirme. Veri kaynakları Common Crawl, kitaplar ve akademik makalelerdir.[1]

Yi-1.5 için ek 500 milyar token yüksek kaliteli korpus üzerinde sürekli ön eğitim (continued pre-training) uygulanmıştır.[7]

Denetimli İnce Ayar (Supervised Fine-Tuning, SFT)

Birinci nesil sohbet varyantları, her biri makine öğrenmesi mühendisleri tarafından elle incelenmiş ve düzenlenmiş, 10 binden az çok turlu (multi-turn) örnekten oluşan küçük ama titizlikle seçilmiş bir veri kümesi üzerinde ince ayara tabi tutulmuştur. Yi-1.5 için SFT veri hacmi 3 milyon örneğe çıkarılmıştır.[1][7]

Pekiştirmeli Öğrenme ile Hizalama

Yi-Lightning için çok aşamalı bir hizalama süreci uygulanmaktadır: SFT'nin ardından RLHF/DPO. Sentetik veriler, Monte Carlo Tree Search (MCTS) kullanılarak üretilmektedir. RAISE güvenlik çerçevesi dört katmanlı koruma uygular: ön eğitim verisi filtreleme, safety fine-tuning, girdi prompt denetimi ve çıktı yanıt denetimi.[8]

Bağlam Genişletme

Bağlam penceresinin 200 bin tokena genişletilmesi, RoPE ABF tekniği kullanılarak 5 milyar token üzerinde (kitaplar + sentetik soru-cevap) hafif sürekli ön eğitim aracılığıyla gerçekleştirilmiştir. İnce ayarın ardından Needle-in-a-Haystack görevindeki (uzun metinde hedef parçanın bulunması) doğruluk %99,8'e ulaşmaktadır.[1][2]

Derinlik Ölçeklendirme (Depth Upscaling)

Yi-9B, Yi-6B temel modelinin 12–28. katmanlarının çoğaltılması ve ardından 800 milyar token üzerinde ön eğitim yapılmasıyla elde edilmiştir. Bu yöntem, sıfırdan eğitim gerektirmeksizin model kapasitesinin artırılmasını sağlamaktadır.[1]

Model Ailesi Bileşimi

Temel Dil Modelleri

Model Parametreler Tür Bağlam Yayın Tarihi Lisans Notlar
Yi-6B / Yi-34B 6 milyar / 34 milyar Base / Chat 4K (32K'ya genişletilmiş) Kasım 2023 Apache 2.0 Sıfırdan eğitilmiş temel modeller
Yi-6B-200K / Yi-34B-200K 6 milyar / 34 milyar Base 200K Kasım 2023 Apache 2.0 Uzun diziler üzerinde sürekli ön eğitim
Yi-9B 9 milyar Base 4K (200K'ya genişletilmiş) Mart 2024 Apache 2.0 Yi-6B'den Depth-upscale + 800 milyar token
Yi-1.5-6B/9B/34B 6 / 9 / 34 milyar Base / Chat 4K / 16K / 32K Mayıs 2024 Apache 2.0 +500 milyar token + 3 milyon SFT örneği
Yi-Large ~1 trilyon (MoE, aktif parametre sayısı açıklanmamış) LLM Açıklanmamış Mayıs 2024 Kapalı kaynak (API) SOTA olarak konumlandırılmış
Yi-Lightning MoE (uzman sayısı açıklanmamış) LLM 64K Ekim 2024 API LMSYS Chatbot Arena 6. sırası

Kaynaklar: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Özelleştirilmiş Modeller

Model Parametreler Modaliteler Bağlam Yayın Tarihi Notlar
Yi-VL-6B / Yi-VL-34B 6 / 34 milyar Metin + görüntü (448×448) Temel modelin standart bağlamı Ocak 2024 ViT kodlayıcı (CLIP ViT-H/14), üç aşamalı eğitim
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 milyar Metin (kod) 128K Eylül 2024 52 programlama dili

Kaynaklar: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

API Tanımlayıcıları

01.AI platformu ve üçüncü taraf sağlayıcılardaki örnekler: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Değerlendirme ve Benchmark Sonuçları

Temel Model Sonuçları

arXiv:2403.04652 teknik raporundan veriler (koşullar: benchmark'a bağlı olarak 0-shot / 5-shot):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Kaynak: arXiv:2403.04652, sonuç tabloları.[1]

Yi-34B, çoğu benchmark'ta Llama 2-70B'yi (iki kat daha küçük olmasına rağmen) geride bırakmış ve yayın anında C-Eval ile CMMLU'da açık modeller arasında lider konumuna gelmiştir.[1][12]

Yi-Lightning Sonuçları

arXiv:2412.01253 teknik raporundan veriler (koşullar: aksi belirtilmedikçe 0-shot):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Kaynak: arXiv:2412.01253.[8]

Kullanıcı Derecelendirmeleri

Yi-34B-Chat, Aralık 2023 – Ocak 2024 döneminde AlpacaEval'de 2. sıraya yerleşmiştir (%94,08, GPT-4 Turbo'nun ardından) ve LMSYS Chatbot Arena'da Elo ~1110 puanına ulaşmıştır. Yi-34B, yayın anında Hugging Face Open LLM Leaderboard ve C-Eval'de açık modeller arasında liderlik etmiştir.[2][1]

Yi-Lightning, LMSYS Chatbot Arena'da 6. genel sıraya (skor 1287) yerleşmiş; rapor yayımlandığı sırada Çince kategorisinde 2. sıraya, "matematik", "kodlama", "hard prompts" ve "multi-turn" alt kategorilerinde ise 3–4. sıraya konumlanmıştır.[8]

Not. Farklı sürümler ve yapılandırmalardan modellerin doğrudan karşılaştırılması, tutarlı test koşulları gerektirir (aynı benchmark sürümleri, aynı üretim parametreleri). Kitle kaynaklı platformlardaki öznel değerlendirmeler, katılımcıların bileşimine ve sistemdeki mevcut model havuzuna bağlıdır.[12]

Kullanım Alanları

Yi ailesi, doğal dil işleme ve çok modlu analiz görevlerinin geniş bir yelpazesinde uygulanmaktadır:[3][13]

  • Sohbet asistanları ve diyalog sistemleri — Yi-34B-Chat ve Yi-1.5 sohbet varyantları temelinde.
  • Kod üretimi ve analizi — Yi-Coder, 52 programlama dilini desteklemektedir.
  • Uzun belge analizi — hukuki, teknik ve analitik görevler için 200K bağlam varyantları.
  • Çok modlu analiz — Yi-VL aracılığıyla görüntü açıklama ve görsel soru-cevap.
  • Kurumsal ajanlar — 01.AI platformu üzerinden RAG sistemleri, bilgi arama ve veri sınıflandırma.
  • Yerel dağıtım — vLLM, llama.cpp, Hugging Face Transformers aracılığıyla; kuantize sürümler (AWQ/GPTQ 4/8-bit) tüketici GPU'larında dağıtım için kullanılabilir (örneğin Yi-34B-4bit için RTX 4090).

API varyantları (Yi-Large, Yi-Lightning), sohbet botları, çok dilli servisler ve düşük maliyetli çıkarım için kullanılmaktadır. 2024 itibarıyla Yi-Lightning'in çıkarım maliyeti milyon token başına 14 sent olarak belirtilmiştir.[8]

Kısıtlamalar ve Açık Sorunlar

  • Halüsinasyonlar. Modeller, özellikle karmaşık akıl yürütme ve uzun çıkarım zincirlerinde, LLM'lere özgü tipik olgusal hatalara eğilimlidir.[1]
  • Erken sürümlerde matematik ve kod. Temel Yi-34B modelleri, özelleşmiş frontier modellerle karşılaştırıldığında (örneğin Yi-34B MATH 4-shot'ta 14,4) karmaşık kodlama ve matematikte daha zayıf sonuçlar sergilemektedir. Bu sorun Yi-1.5 ve Yi-Lightning'de kısmen giderilmiştir.[1][8]
  • Uzun bağlam. 200K'ya genişletme, ek ön eğitim ve hesaplama kaynakları gerektirmektedir; kısa bağlamda küçük bir performans düşüşü görülebilir.[1]
  • Kapalı kaynaklı modeller. Yi-Large ve Yi-Lightning, ağırlıklarını indirmeye sunmamaktadır; bu durum mimari ve verinin bağımsız doğrulanmasını kısıtlamaktadır.[8]
  • Arena ile benchmark arasındaki uçurum. Yi-Lightning, kullanıcı değerlendirmelerinde (Chatbot Arena) güçlü sonuçlar sergilemekte ancak statik akademik benchmark'larda bazı rakiplerin gerisinde kalmaktadır; bu durum metrik uyumsuzluğunun genel sorununu yansıtmaktadır.[8]
  • Yeniden üretilebilirlik. Eğitimin tüm ayrıntıları (veri kümesinin kesin bileşimi, alan dağılımı, hiper parametreler) tam olarak açıklanmamıştır.[13]
  • Prompt'a duyarlılık. Diğer LLM'ler gibi Yi modelleri de prompt ifadesine duyarlıdır; bu durum çıkarım tutarlılığını etkilemektedir.[1]

Sürüm yayınlarından sonra ciddi bir gerileme bildirilmemiştir; topluluk, kuantize sürümlerin kararlılığını olumlu bulmaktadır.[2]

Etik ve Düzenleyici Yönler

Yi-Lightning'e, dört katmanlı koruma uygulayan RAISE güvenlik çerçevesi entegre edilmiştir:[8]

  • Ön eğitim aşamasında toksik içerik, kişisel tanımlayıcı bilgi (PII) ve zararlı materyallerin filtrelenmesi.
  • Hassas sorgulara doğru yanıt örnekleriyle safety fine-tuning.
  • Girdi denetimi (prompt sınıflandırma).
  • Çıktı denetimi (yanıt filtreleme).

Açık kaynaklı modellere yönelik Apache 2.0 lisansı ticari kullanıma izin vermektedir; bazı barındırma hizmetleri ek gereksinimler öne sürebilir. Modeller, kurumsal çözümler için Çin yapay zeka düzenleyici normlarına (CAICT sertifikasyonu) uymaktadır.[1][3]

Beklentiler ve Araştırma Yönleri

Yi serisi, veri kalitesini parametre hacminin önüne koyan yaklaşımın yanı sıra hafif ölçeklendirme yöntemlerinin (continual pretraining, depth upscaling, MoE optimizasyonları) etkinliğini ortaya koymaktadır.[1]

2025 sonrasında 01.AI'nin odağı uygulamalı çözümlere kaymıştır:[4]

  • Çok ajanlı sistemler ve kurumsal platform WorldWise LLM Platform 2.5.
  • Üçüncü taraf modellerin (DeepSeek dahil) kurumsal iş akışlarına entegrasyonu.
  • Dağıtım maliyetini düşürmek için çıkarım optimizasyonu (kuantizasyon, FP8).

Açık kaynaklı modeller, araştırma, fine-tuning ve distilasyon için topluluk tarafından kullanılmaya devam etmektedir.[6]

Dış bağlantılar

Kaynakça

Notlar

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms