Jais (language model) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (ออกเสียงว่า «เจส») — คือกลุ่มโมเดลภาษาขนาดใหญ่ (LLM) แบบเปิดที่พัฒนาขึ้นในสหรัฐอาหรับเอมิเรตส์ และได้รับการปรับให้เหมาะสมกับภาษาอาหรับเป็นพิเศษ[1] ชื่อของโมเดลนี้ตั้งตามภูเขาเจเบล เจส ซึ่งเป็นยอดเขาที่สูงที่สุดในสหรัฐอาหรับเอมิเรตส์[2]

โครงการนี้สร้างขึ้นจากความร่วมมือระหว่างบริษัทวิจัย Inception (บริษัทในเครือของกลุ่มเทคโนโลยี G42), มหาวิทยาลัยปัญญาประดิษฐ์โมฮาเหม็ด บิน ซายิด (MBZUAI) และบริษัทผลิตชิป AI จากแคลิฟอร์เนียชื่อ Cerebras Systems[2] Jais ได้รับการเผยแพร่อย่างเปิดเผยภายใต้ใบอนุญาตเสรี ซึ่งมุ่งกระตุ้นการพัฒนาระบบนิเวศ AI สำหรับภาษาอาหรับ โดยอนุรักษ์มรดกทางวัฒนธรรมและภาษา และทำให้เทคโนโลยี AI สมัยใหม่เข้าถึงได้มากขึ้นสำหรับโลกที่ใช้ภาษาอาหรับ[1]

ประวัติการพัฒนาและการเผยแพร่

โครงการ Jais ริเริ่มขึ้นในปี 2023 ท่ามกลางข้อจำกัดของ LLM ที่มีอยู่สำหรับภาษาที่มีทรัพยากรน้อย นักพัฒนาพบว่าขาดแคลนโมเดลสองภาษาที่มีคุณภาพซึ่งสามารถประมวลผลทั้งภาษาอาหรับและภาษาอังกฤษได้ดีพอๆ กัน[2]

Jais-13B: เวอร์ชันแรก

เวอร์ชันแรก Jais-13B เผยแพร่เมื่อ 30 สิงหาคม 2023 และมี 13 พันล้านพารามิเตอร์[1] โมเดลนี้ได้รับการฝึกบน corpus ผสมจากข้อความภาษาอังกฤษและภาษาอาหรับที่มีปริมาณ 395 พันล้าน token[3] ในขณะที่เผยแพร่ได้รับการขนานนามว่าเป็น «LLM ภาษาอาหรับที่มีคุณภาพสูงที่สุด»[1]

Jais-30B: การขยายขนาด

เมื่อ 8 พฤศจิกายน 2023 หรือไม่ถึงสามเดือนต่อมา กลุ่มพันธมิตรได้นำเสนอเวอร์ชันที่สองซึ่งปรับปรุงอย่างมีนัยสำคัญ คือ Jais-30B ที่มี 30 พันล้านพารามิเตอร์[4] การขยายขนาดเกิดจากความจำเป็นในการแก้ปัญหาการประยุกต์ใช้งานที่ซับซ้อนมากขึ้น เช่น การสรุปความและการแปลภาษา โมเดลนี้ได้รับการฝึกบน dataset ที่ขยายและผ่านการคัดกรองแล้วซึ่งมีปริมาณ 1.63 ล้านล้าน token[4]

Jais-70B และกลุ่มโมเดล

เมื่อ 6 สิงหาคม 2024 Inception (G42) ประกาศเปิดตัวโมเดลหลัก Jais-70B (70 พันล้านพารามิเตอร์) และกลุ่มโมเดลที่เกี่ยวข้องทั้งหมด[5] Jais-70B กลายเป็น LLM แบบเปิดที่ใหญ่ที่สุดที่มุ่งเน้นภาษาอาหรับ ในการพัฒนาโมเดลนี้มีการนำวิธี continuous training มาใช้ กล่าวคือ แทนที่จะฝึกจากศูนย์ ได้นำโมเดล Llama 2 70B ของ Meta มาเป็นพื้นฐาน แล้ว fine-tune ต่อด้วย 330 พันล้าน token ในภาษาอาหรับ วิธีนี้ช่วยถ่ายทอดความรู้ภาษาอังกฤษจาก Llama 2 ได้อย่างมีประสิทธิภาพ และทำให้สามารถมุ่งทรัพยากรไปที่การเรียนรู้ภาษาอาหรับได้[5]

สถาปัตยกรรมและคุณลักษณะทางเทคนิค

Jais จัดอยู่ในประเภทโมเดล transformer แบบ autoregressive ที่อิงสถาปัตยกรรม GPT-3 (decoder-only) คุณลักษณะสำคัญของโมเดลคือความเชี่ยวชาญสองภาษาในภาษาอาหรับและภาษาอังกฤษ ซึ่งแตกต่างจาก LLM หลายภาษาทั่วไปที่ภาษาอังกฤษมีอิทธิพลเหนือกว่า สิ่งนี้ช่วยให้สามารถบรรลุความเข้าใจภาษาอาหรับและสำเนียงท้องถิ่นในระดับลึก[3]

ในการสร้าง Jais ได้บูรณาการโซลูชันทางเทคนิคขั้นสูงไว้ด้วยกัน[3]:

  • ALiBi positioning: รูปแบบ positional embedding พิเศษที่ช่วยให้โมเดลประมวลผล context ที่ยาวกว่าที่ใช้ฝึกได้
  • SwiGLU activation: ฟังก์ชัน activation ที่เพิ่มคุณภาพการฝึกและความสามารถในการแสดงออกของชั้น neural
  • Maximal Update Parametrization (µP): เทคนิคการปรับแต่ง hyperparameter ที่ทำให้การฝึกมีเสถียรภาพเมื่อขนาดโมเดลเพิ่มขึ้น
  • Tokenizer เฉพาะทาง: พัฒนาขึ้นโดยคำนึงถึงคุณลักษณะของภาษาอาหรับและภาษาอังกฤษ ซึ่งช่วยลดจำนวน token สำหรับข้อความภาษาอาหรับลง 3–4 เท่าเมื่อเทียบกับ tokenizer ทั่วไป และเพิ่มความเร็วในการประมวลผล[6]

นอกจาก foundation model แล้ว ยังได้เผยแพร่เวอร์ชัน Jais-chat ซึ่ง fine-tune เพิ่มเติมบนคู่คำถาม-คำตอบ 9.6 ล้านคู่ เพื่อปรับให้เหมาะกับงาน chatbot และผู้ช่วย[3]

การฝึกและชุดข้อมูล

หนึ่งในภารกิจหลักของโครงการคือการเตรียม corpus ข้อความภาษาอาหรับที่มีคุณภาพสูงและมีขนาดใหญ่ ชุดข้อมูลฝึกสุดท้ายสำหรับ Jais-13B มีทั้งหมด 395 พันล้าน token โดยประกอบด้วย:

  • 116 พันล้าน token (29%) — ข้อความภาษาอาหรับ
  • 279 พันล้าน token (71%) — ข้อความภาษาอังกฤษและซอร์สโค้ด

ส่วนประกอบภาษาอาหรับถูกตั้งใจให้มีสัดส่วนสำคัญ (ประมาณ 30%) เพื่อให้มั่นใจว่าโมเดลมีทักษะทางภาษาในระดับสูง[3] ข้อมูลรวมถึงหนังสือ บทความข่าว หน้าเว็บ และซอร์สโค้ด สำหรับการเพิ่มปริมาณข้อความภาษาอาหรับที่มีคุณภาพ ได้มีการใช้การแปลด้วยเครื่องจากแหล่งข้อมูลภาษาอังกฤษ[3]

การฝึกโมเดลดำเนินการบนซูเปอร์คอมพิวเตอร์ Condor Galaxy 1 (CG-1) ในอาบูดาบี ซึ่งพัฒนาร่วมกันโดย G42 และ Cerebras Systems ด้วยโครงสร้างพื้นฐานนี้ การฝึก Jais-13B ใช้เวลาสุทธิเพียงประมาณ 3.5 วัน[2]

การประยุกต์ใช้งานและความสำคัญ

Jais ได้รับการวางตำแหน่งให้เป็นก้าวสำคัญในการพัฒนา AI เชิงสร้างสรรค์สำหรับภาษาอาหรับและชุมชนภาษาอื่นๆ ที่ยังมีการนำเสนอไม่เพียงพอใน LLM สมัยใหม่ การเข้าถึงโมเดลแบบเปิดมุ่งกระตุ้นการนำเทคโนโลยีการประมวลผลภาษาธรรมชาติมาใช้ในภูมิภาคตะวันออกกลางและแอฟริกาเหนือ

นับตั้งแต่เปิดตัว โครงการดึงดูดความสนใจจากหน่วยงานภาครัฐและเชิงพาณิชย์ของสหรัฐอาหรับเอมิเรตส์ กระทรวงการต่างประเทศสหรัฐอาหรับเอมิเรตส์ บริษัทน้ำมันและก๊าซ ADNOC สายการบิน Etihad Airways และธนาคาร First Abu Dhabi Bank ได้รับสิทธิ์เข้าถึงโมเดลในช่วงแรก[1] ในปี 2024 Microsoft ประกาศบูรณาการ Jais เข้ากับแพลตฟอร์มคลาวด์ Microsoft Azure ทำให้เข้าถึงได้สำหรับผู้ใช้ทั่วโลก[6]

ผู้สร้าง Jais เน้นย้ำบทบาทของมันในการอนุรักษ์มรดกทางวัฒนธรรมและภาษาอาหรับ ตามคำกล่าวของ Andrew Jackson ประธานเจ้าหน้าที่บริหารของ Inception โครงการนี้มุ่งหมายที่จะ «ทำให้แน่ใจว่าภาษาอาหรับพร้อมมรดกอันอุดมสมบูรณ์จะมีเสียงของตนเองในภูมิทัศน์ของ AI»[1] ประสบการณ์ที่สะสมได้มีแผนนำไปใช้สร้าง LLM ที่คล้ายกันสำหรับภาษาและวัฒนธรรมอื่นๆ[1]

เอกสารอ้างอิง

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

หมายเหตุ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]