---
title: "Jais (language model) (TH)"
source: "https://systems-analysis.info/int/Jais_(language_model)_(TH)"
wiki: "systems-analysis.info/int"
article: "Jais_(language_model)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 3327
wiki_created_at: 2026-09-06T23:19:02Z
wiki_modified_at: 2026-09-06T23:19:02Z
downloaded_at: 2026-09-07T22:56:22Z
---

# Jais (language model) (TH)

**Jais** (ออกเสียงว่า «เจส») — คือกลุ่มโมเดลภาษาขนาดใหญ่ (LLM) แบบเปิดที่พัฒนาขึ้นในสหรัฐอาหรับเอมิเรตส์ และได้รับการปรับให้เหมาะสมกับภาษาอาหรับเป็นพิเศษ<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup> ชื่อของโมเดลนี้ตั้งตามภูเขาเจเบล เจส ซึ่งเป็นยอดเขาที่สูงที่สุดในสหรัฐอาหรับเอมิเรตส์<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-reuters-launch-2)</sup>

โครงการนี้สร้างขึ้นจากความร่วมมือระหว่างบริษัทวิจัย **Inception** (บริษัทในเครือของกลุ่มเทคโนโลยี G42), ***มหาวิทยาลัยปัญญาประดิษฐ์โมฮาเหม็ด บิน ซายิด (MBZUAI)*** และบริษัทผลิตชิป AI จากแคลิฟอร์เนียชื่อ Cerebras Systems<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-reuters-launch-2)</sup> Jais ได้รับการเผยแพร่อย่างเปิดเผยภายใต้ใบอนุญาตเสรี ซึ่งมุ่งกระตุ้นการพัฒนาระบบนิเวศ AI สำหรับภาษาอาหรับ โดยอนุรักษ์มรดกทางวัฒนธรรมและภาษา และทำให้เทคโนโลยี AI สมัยใหม่เข้าถึงได้มากขึ้นสำหรับโลกที่ใช้ภาษาอาหรับ<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup>

## ประวัติการพัฒนาและการเผยแพร่

โครงการ Jais ริเริ่มขึ้นในปี 2023 ท่ามกลางข้อจำกัดของ LLM ที่มีอยู่สำหรับภาษาที่มีทรัพยากรน้อย นักพัฒนาพบว่าขาดแคลนโมเดลสองภาษาที่มีคุณภาพซึ่งสามารถประมวลผลทั้งภาษาอาหรับและภาษาอังกฤษได้ดีพอๆ กัน<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-reuters-launch-2)</sup>

### Jais-13B: เวอร์ชันแรก

เวอร์ชันแรก **Jais-13B** เผยแพร่เมื่อ **30 สิงหาคม 2023** และมี **13 พันล้านพารามิเตอร์**<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup> โมเดลนี้ได้รับการฝึกบน corpus ผสมจากข้อความภาษาอังกฤษและภาษาอาหรับที่มีปริมาณ **395 พันล้าน token**<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-jais-paper-3)</sup> ในขณะที่เผยแพร่ได้รับการขนานนามว่าเป็น «LLM ภาษาอาหรับที่มีคุณภาพสูงที่สุด»<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup>

### Jais-30B: การขยายขนาด

เมื่อ **8 พฤศจิกายน 2023** หรือไม่ถึงสามเดือนต่อมา กลุ่มพันธมิตรได้นำเสนอเวอร์ชันที่สองซึ่งปรับปรุงอย่างมีนัยสำคัญ คือ **Jais-30B** ที่มี **30 พันล้านพารามิเตอร์**<sup>[\[4\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-computerweekly-30b-4)</sup> การขยายขนาดเกิดจากความจำเป็นในการแก้ปัญหาการประยุกต์ใช้งานที่ซับซ้อนมากขึ้น เช่น การสรุปความและการแปลภาษา โมเดลนี้ได้รับการฝึกบน dataset ที่ขยายและผ่านการคัดกรองแล้วซึ่งมีปริมาณ **1.63 ล้านล้าน token**<sup>[\[4\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-computerweekly-30b-4)</sup>

### Jais-70B และกลุ่มโมเดล

เมื่อ **6 สิงหาคม 2024** Inception (G42) ประกาศเปิดตัวโมเดลหลัก **Jais-70B** (70 พันล้านพารามิเตอร์) และกลุ่มโมเดลที่เกี่ยวข้องทั้งหมด<sup>[\[5\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-mediaoffice-70b-5)</sup> Jais-70B กลายเป็น LLM แบบเปิดที่ใหญ่ที่สุดที่มุ่งเน้นภาษาอาหรับ ในการพัฒนาโมเดลนี้มีการนำวิธี *continuous training* มาใช้ กล่าวคือ แทนที่จะฝึกจากศูนย์ ได้นำโมเดล **Llama 2** 70B ของ Meta มาเป็นพื้นฐาน แล้ว fine-tune ต่อด้วย **330 พันล้าน token** ในภาษาอาหรับ วิธีนี้ช่วยถ่ายทอดความรู้ภาษาอังกฤษจาก Llama 2 ได้อย่างมีประสิทธิภาพ และทำให้สามารถมุ่งทรัพยากรไปที่การเรียนรู้ภาษาอาหรับได้<sup>[\[5\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-mediaoffice-70b-5)</sup>

## สถาปัตยกรรมและคุณลักษณะทางเทคนิค

Jais จัดอยู่ในประเภทโมเดล transformer แบบ autoregressive ที่อิงสถาปัตยกรรม GPT-3 (*decoder-only*) คุณลักษณะสำคัญของโมเดลคือความเชี่ยวชาญสองภาษาในภาษาอาหรับและภาษาอังกฤษ ซึ่งแตกต่างจาก LLM หลายภาษาทั่วไปที่ภาษาอังกฤษมีอิทธิพลเหนือกว่า สิ่งนี้ช่วยให้สามารถบรรลุความเข้าใจภาษาอาหรับและสำเนียงท้องถิ่นในระดับลึก<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-jais-paper-3)</sup>

ในการสร้าง Jais ได้บูรณาการโซลูชันทางเทคนิคขั้นสูงไว้ด้วยกัน<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-jais-paper-3)</sup>:

- **ALiBi positioning**: รูปแบบ positional embedding พิเศษที่ช่วยให้โมเดลประมวลผล context ที่ยาวกว่าที่ใช้ฝึกได้
- **SwiGLU activation**: ฟังก์ชัน activation ที่เพิ่มคุณภาพการฝึกและความสามารถในการแสดงออกของชั้น neural
- **Maximal Update Parametrization (µP)**: เทคนิคการปรับแต่ง hyperparameter ที่ทำให้การฝึกมีเสถียรภาพเมื่อขนาดโมเดลเพิ่มขึ้น
- **Tokenizer เฉพาะทาง**: พัฒนาขึ้นโดยคำนึงถึงคุณลักษณะของภาษาอาหรับและภาษาอังกฤษ ซึ่งช่วยลดจำนวน token สำหรับข้อความภาษาอาหรับลง 3–4 เท่าเมื่อเทียบกับ tokenizer ทั่วไป และเพิ่มความเร็วในการประมวลผล<sup>[\[6\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-microsoft-azure-blog-6)</sup>

นอกจาก foundation model แล้ว ยังได้เผยแพร่เวอร์ชัน **Jais-chat** ซึ่ง fine-tune เพิ่มเติมบนคู่คำถาม-คำตอบ 9.6 ล้านคู่ เพื่อปรับให้เหมาะกับงาน chatbot และผู้ช่วย<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-jais-paper-3)</sup>

## การฝึกและชุดข้อมูล

หนึ่งในภารกิจหลักของโครงการคือการเตรียม corpus ข้อความภาษาอาหรับที่มีคุณภาพสูงและมีขนาดใหญ่ ชุดข้อมูลฝึกสุดท้ายสำหรับ Jais-13B มีทั้งหมด **395 พันล้าน token** โดยประกอบด้วย:

- **116 พันล้าน token (29%)** — ข้อความภาษาอาหรับ
- **279 พันล้าน token (71%)** — ข้อความภาษาอังกฤษและซอร์สโค้ด

ส่วนประกอบภาษาอาหรับถูกตั้งใจให้มีสัดส่วนสำคัญ (ประมาณ 30%) เพื่อให้มั่นใจว่าโมเดลมีทักษะทางภาษาในระดับสูง<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-jais-paper-3)</sup> ข้อมูลรวมถึงหนังสือ บทความข่าว หน้าเว็บ และซอร์สโค้ด สำหรับการเพิ่มปริมาณข้อความภาษาอาหรับที่มีคุณภาพ ได้มีการใช้การแปลด้วยเครื่องจากแหล่งข้อมูลภาษาอังกฤษ<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-jais-paper-3)</sup>

การฝึกโมเดลดำเนินการบนซูเปอร์คอมพิวเตอร์ **Condor Galaxy 1 (CG-1)** ในอาบูดาบี ซึ่งพัฒนาร่วมกันโดย G42 และ Cerebras Systems ด้วยโครงสร้างพื้นฐานนี้ การฝึก Jais-13B ใช้เวลาสุทธิเพียงประมาณ 3.5 วัน<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-reuters-launch-2)</sup>

## การประยุกต์ใช้งานและความสำคัญ

Jais ได้รับการวางตำแหน่งให้เป็นก้าวสำคัญในการพัฒนา AI เชิงสร้างสรรค์สำหรับภาษาอาหรับและชุมชนภาษาอื่นๆ ที่ยังมีการนำเสนอไม่เพียงพอใน LLM สมัยใหม่ การเข้าถึงโมเดลแบบเปิดมุ่งกระตุ้นการนำเทคโนโลยีการประมวลผลภาษาธรรมชาติมาใช้ในภูมิภาคตะวันออกกลางและแอฟริกาเหนือ

นับตั้งแต่เปิดตัว โครงการดึงดูดความสนใจจากหน่วยงานภาครัฐและเชิงพาณิชย์ของสหรัฐอาหรับเอมิเรตส์ กระทรวงการต่างประเทศสหรัฐอาหรับเอมิเรตส์ บริษัทน้ำมันและก๊าซ ADNOC สายการบิน Etihad Airways และธนาคาร First Abu Dhabi Bank ได้รับสิทธิ์เข้าถึงโมเดลในช่วงแรก<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup> ในปี 2024 Microsoft ประกาศบูรณาการ Jais เข้ากับแพลตฟอร์มคลาวด์ Microsoft Azure ทำให้เข้าถึงได้สำหรับผู้ใช้ทั่วโลก<sup>[\[6\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-microsoft-azure-blog-6)</sup>

ผู้สร้าง Jais เน้นย้ำบทบาทของมันในการอนุรักษ์มรดกทางวัฒนธรรมและภาษาอาหรับ ตามคำกล่าวของ Andrew Jackson ประธานเจ้าหน้าที่บริหารของ Inception โครงการนี้มุ่งหมายที่จะ «ทำให้แน่ใจว่าภาษาอาหรับพร้อมมรดกอันอุดมสมบูรณ์จะมีเสียงของตนเองในภูมิทัศน์ของ AI»<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup> ประสบการณ์ที่สะสมได้มีแผนนำไปใช้สร้าง LLM ที่คล้ายกันสำหรับภาษาและวัฒนธรรมอื่นๆ<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_note-cerebras-launch-1)</sup>

## เอกสารอ้างอิง

- Shazeer, N.; et al. (2020). *GLU Variants Improve Transformer*. arXiv:2002.05202.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Yang, G.; et al. (2022). *Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer*. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). *A Large and Diverse Arabic Corpus for Language Modeling*. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). *Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models*. arXiv:2308.16149.
- Inception AI (2024). *JAIS 30B Whitepaper*. Online whitepaper.
- Koto, F.; et al. (2024). *ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic*. arXiv:2402.12840.
- Qian, Z.; et al. (2024). *CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks*. arXiv:2409.12623.
- Blake, C.; et al. (2024). *u‑μP: The Unit‑Scaled Maximal Update Parametrization*. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). *Jais Family Model Card*. Hugging Face.

## หมายเหตุ

1.  <span id="cite_note-cerebras-launch-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-cerebras-launch_1-6)</sup> «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». *Cerebras Systems*. <a href="https://www.cerebras.ai/press-release/meet-jais-the-worlds-most-advanced-arabic-large-language-model-open-sourced-by-g42s-inception" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reuters-launch-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-reuters-launch_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-reuters-launch_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-reuters-launch_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-reuters-launch_2-3)</sup> «UAE's G42 launches open source Arabic language AI model». *Reuters*. <a href="https://www.reuters.com/technology/uaes-g42-launches-open-source-arabic-language-ai-model-2023-08-30/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-jais-paper-3">↑ <sup>[3.0](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-jais-paper_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-jais-paper_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-jais-paper_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-jais-paper_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-jais-paper_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-jais-paper_3-5)</sup> «\[2308.16149\] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2308.16149" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-computerweekly-30b-4">↑ <sup>[4.0](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-computerweekly-30b_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-computerweekly-30b_4-1)</sup> «Upgraded Arabic large language model is twice as big». *Computer Weekly*. <a href="https://www.computerweekly.com/news/366567153/Arabic-LLM-Jais-gets-a-new-version-thats-twice-as-large" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mediaoffice-70b-5">↑ <sup>[5.0](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-mediaoffice-70b_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-mediaoffice-70b_5-1)</sup> «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». *Abu Dhabi Media Office*. <a href="https://www.mediaoffice.abudhabi/en/technology/g42-launches-jais-70b-and-20-other-ai-models-to-advance-arabic-natural-language-processing/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-microsoft-azure-blog-6">↑ <sup>[6.0](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-microsoft-azure-blog_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Jais_(language_model)_(TH)#cite_ref-microsoft-azure-blog_6-1)</sup> «Introducing JAIS: Arabic-centric Large Language Model on Azure». *Microsoft Tech Community*. <a href="https://techcommunity.microsoft.com/blog/aiplatformblog/introducing-jais-arabic-centric-large-language-model-on-azure/4137329" class="external autonumber" rel="nofollow">[6]</a></span>
