Chinchilla (language model) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — یہ ایک بڑا لسانی ماڈل (LLM) ہے جسے DeepMind کی تحقیقی ٹیم نے تیار کیا اور مارچ 2022 میں پیش کیا[1]۔ اس ماڈل میں تقریباً 70 ارب پیرامیٹرز ہیں اور اسے 1.4 ٹریلین tokens کے متنی مجموعے پر تربیت دی گئی۔

Chinchilla کی بنیادی خصوصیت اس کا تربیت کے لیے حساب کتاب کے لحاظ سے بہترین (compute-optimal) طریقہ کار ہے۔ پچھلے ماڈلز کے برعکس، جن میں بنیادی زور پیرامیٹرز کی تعداد بڑھانے پر تھا، Chinchilla کو اس مفروضے پر بنایا گیا کہ ماڈل کے حجم اور تربیتی ڈیٹا کی مقدار دونوں کو متناسب طور پر بڑھانا ضروری ہے۔ اس طریقہ کار کی بدولت Chinchilla نے زبان کے وسیع کاموں میں Gopher (280 ارب پیرامیٹرز) اور GPT-3 (175 ارب) جیسے نمایاں طور پر بڑے ماڈلز پر برتری ثابت کی[2]۔

پس منظر اور تخلیق کی تاریخ

Chinchilla کی ترقی DeepMind میں Gopher ماڈلز کے خاندان کی بنیاد پر کیے گئے LLM کے پیمانہ کاری (scaling) کے مطالعے کا نتیجہ تھی[3]۔ 2021 میں پیش کیا گیا Gopher ماڈل 280 ارب پیرامیٹرز کا حامل تھا، لیکن اسے نسبتاً چھوٹے 300 ارب tokens کے مجموعے پر تربیت دی گئی تھی۔ اس وقت صنعت میں یہ طریقہ کار غالب تھا کہ ماڈلز کی کارکردگی بنیادی طور پر ان کے حجم (پیرامیٹرز کی تعداد) میں اضافے سے بہتر ہوتی ہے، جبکہ ڈیٹا کی مقدار نسبتاً مستقل رہتی تھی۔

حساب کتاب کے لحاظ سے بہترین تربیت کا مفروضہ

DeepMind کے محققین نے یہ مفروضہ پیش کیا کہ Gopher سمیت بہت سے بڑے ماڈلز اپنے حجم کے مقابلے میں کم تربیت یافتہ (undertrained) تھے۔ وہ دیے گئے حسابی بجٹ میں بہترین ممکنہ معیار تک نہیں پہنچ سکے کیونکہ ان کے پاس تربیتی ڈیٹا کی کمی تھی[2]۔

اس مفروضے کا خلاصہ یہ تھا کہ حسابی وسائل کے بہترین استعمال کے لیے ماڈل کے حجم اور تربیتی ڈیٹا کی مقدار کو ایک دوسرے کے متناسب بڑھانا چاہیے۔ دوسرے الفاظ میں، ماڈل کے پیرامیٹرز کی تعداد دوگنی کرنے پر تربیتی tokens کی تعداد بھی تقریباً دوگنی کرنی چاہیے[1]۔ یہ نتیجہ پچھلے مطالعات سے مختلف تھا، جو ڈیٹا کی مقدار ثابت رکھتے ہوئے کیے گئے تھے اور ماڈل کے حجم بڑھانے کی قدر کو زیادہ اہمیت دیتے تھے۔

اس مفروضے کی جانچ کے لیے DeepMind کی ٹیم نے وسیع تجربات کیے اور 5 سے 500 ارب tokens کے datasets پر مختلف حجم کے 400 سے زیادہ ماڈلز کو تربیت دی۔ نتائج نے تصدیق کی کہ متوازی پیمانہ کاری (parallel scaling) بہترین حکمت عملی ہے۔ انہی نتائج کی بنیاد پر Chinchilla ماڈل کو نئے اصول کی عملی جانچ کے طور پر تیار کیا گیا[4]۔

آرکیٹیکچر اور تربیت

آرکیٹیکچرل خصوصیات

Chinchilla خود کار تراجع (autoregressive) transformers کے خاندان سے تعلق رکھتا ہے اور آرکیٹیکچر کے لحاظ سے GPT-2/GPT-3 ماڈلز سے قریب ہے[3]۔ اس نے Gopher سے بہت سے حل ورثے میں لیے، لیکن ان میں اہم فرق یہ ہے کہ نیٹ ورک کی گہرائی برقرار رکھتے ہوئے حجم کم کیا گیا:

  • پیرامیٹرز: 80 تہوں میں تقسیم ~70 ارب پیرامیٹرز۔
  • ماڈل کی چوڑائی: Self-attention heads کی تعداد کم کر کے 64 کی گئی (Gopher میں 128 کے مقابلے)، اور تہوں کا اندرونی حجم 8192 تک گھٹایا گیا (Gopher میں ~16384 کے مقابلے)۔
  • Optimizer: Adam کی بجائے AdamW استعمال کیا جاتا ہے، جو بڑے datasets پر convergence بہتر بناتا ہے[3]۔

اس آرکیٹیکچر نے Chinchilla کو Gopher جتنی نیٹ ورک گہرائی برقرار رکھنے کی اجازت دی، لیکن پیرامیٹرز کی نمایاں طور پر کم تعداد کے ساتھ، جس سے میموری اور حسابی وسائل کی ضروریات کم ہو گئیں۔

پیمانہ کاری اور تربیتی ڈیٹا

مفروضے کی جانچ کے لیے Chinchilla کو Gopher جتنے ہی حسابی بجٹ سے تربیت دی گئی، لیکن وسائل کو ڈیٹا کے حق میں دوبارہ تقسیم کیا گیا۔ 70 ارب پیرامیٹرز والے ماڈل کو 1.4 ٹریلین tokens کے مجموعے پر تربیت دی گئی، جو Gopher کے لیے استعمال کیے گئے ڈیٹا کے حجم سے تقریباً 4 گنا زیادہ ہے[1]۔

یہ تناسب، تقریباً ہر پیرامیٹر پر 20 tokens، Chinchilla Point کے نام سے مشہور ہوا اور جدید LLMs کی حساب کتاب کے لحاظ سے بہترین تربیت کے لیے ایک رہنما اصول بن گیا[5]۔ تجربے نے تصدیق کی کہ Chinchilla، اس بہترین حد کے قریب تربیت یافتہ ہونے کی وجہ سے، کم تربیت یافتہ لیکن بڑے ماڈلز کی نسبت اپنی صلاحیت کو زیادہ مکمل طور پر حاصل کر سکی۔

نتائج اور کارکردگی

معیاری ٹیسٹوں کے وسیع مجموعے پر Chinchilla نے پچھلے ماڈلز پر نمایاں برتری ظاہر کی۔ اس نے نہ صرف Gopher کو پیچھے چھوڑا بلکہ اس وقت کے دیگر جدید LLMs کو بھی، جن میں OpenAI GPT-3 (175 ارب پیرامیٹرز) اور Megatron-Turing NLG (530 ارب پیرامیٹرز) شامل ہیں[1]۔

سب سے نمایاں نتیجہ جامع benchmark MMLU (Measuring Massive Multitask Language Understanding) پر سامنے آیا، جو سینکڑوں متنوع کاموں میں علم اور استدلال کا جائزہ لیتا ہے۔ Chinchilla نے 67.5% کی اوسط درستگی حاصل کی، جو اس درجے کے ماڈلز کے لیے نیا ریکارڈ تھا اور Gopher کے نتیجے سے 7 فیصد نکات زیادہ تھا[4]۔

اعلیٰ کارکردگی کے علاوہ، Chinchilla نے استعمال میں اقتصادیت بھی ظاہر کی۔ ماڈل کا چھوٹا حجم (70 ارب بمقابلہ ہم پلہ ماڈلز کے 175+ ارب) کا مطلب ہے کہ logical inference اور fine-tuning کے لیے نمایاں طور پر کم حسابی وسائل درکار ہیں، جو اس کے عملی استعمال کو آسان بناتا ہے۔

اہمیت اور اثرات

Chinchilla کی تحقیق نے بڑے لسانی ماڈلز کی تربیت کے طریقوں پر بنیادی اثر ڈالا۔

  • Chinchilla Scaling Laws: ماڈل کے حجم اور ڈیٹا کی مقدار کے درمیان دریافت کیا گیا بہترین تناسب صنعت میں عملی معیار اور بعد کی ترقیوں کے لیے رہنما اصول بن گیا۔
  • حجم سے ڈیٹا کی طرف توجہ کا منتقل ہونا: اس تحقیق نے صنعت کو محض بے تکے طور پر پیرامیٹرز بڑھانے کی بجائے تربیتی مجموعوں کی تخلیق، تصفیہ اور توسیع پر زیادہ توجہ دینے کی ترغیب دی۔
  • کثیر طریقہ (multimodal) نظاموں میں اطلاق: Chinchilla کو DeepMind کے کثیر طریقہ ماڈل Flamingo میں بنیادی لسانی جزو کے طور پر استعمال کیا گیا، جو تصاویر اور متن کو سمجھنے کی صلاحیت رکھتا ہے[6]۔

اگرچہ Chinchilla ماڈل خود عوام کے لیے جاری نہیں کیا گیا، لیکن اس کے تصورات اور سائنسی تحقیق میں شائع نتائج نے LLM کے پورے میدان کی سمت بدل دی اور مصنوعی ذہانت کی صلاحیتوں کی زیادہ موثر اور متوازن نشوونما کا راستہ دکھایا۔

کتابیات

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

حوالہ جات

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.