Grok (xAI) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

Grok — คือตระกูล LLM มัลติโมดัลขนาดใหญ่และแชทบอตที่พัฒนาโดยบริษัท xAI ซึ่งก่อตั้งโดย Elon Musk Grok ถูกวางตำแหน่งให้เป็น \"frontier model\" ที่มุ่งสู่ \"การทำความเข้าใจธรรมชาติที่แท้จริงของจักรวาล\" และเป็นทางเลือกแทนระบบ AI ที่มีอยู่ซึ่ง Musk มองว่า \"มีความถูกต้องทางการเมืองมากเกินไป\"[1][2]

คุณสมบัติหลักของ Grok ได้แก่ การผสานรวมอย่างลึกซึ้งกับโซเชียลเน็ตเวิร์ก X เพื่อรับข้อมูลแบบเรียลไทม์ รวมถึงลักษณะการตอบสนองแบบ \"กบฏ\" ที่มีองค์ประกอบของอารมณ์ขันและการเสียดสี ซึ่งทำให้แตกต่างจากคู่แข่งที่ระมัดระวังกว่า[3] รากฐานทางเทคโนโลยีของ Grok ประกอบด้วยสถาปัตยกรรม Mixture-of-Experts (MoE) สำหรับเวอร์ชันแรก และการฝึกบนซูเปอร์คอมพิวเตอร์ที่ใหญ่ที่สุดแห่งหนึ่งในโลกอย่าง Colossus สำหรับเวอร์ชันถัดมา

ประวัติและพัฒนาการ

การพัฒนาตระกูล Grok มีลักษณะของความเร็วที่รวดเร็วอย่างยิ่ง — ใช้เวลาน้อยกว่าสองปีในการก้าวจากต้นแบบสู่โมเดลเรือธงที่แข่งขันกับผู้นำตลาด

  • กรกฎาคม–ตุลาคม 2023: การก่อตั้ง xAI และการพัฒนาต้นแบบอย่างเร่งด่วน ตามคำกล่าวของ Musk การฝึกเวอร์ชันแรกใช้เวลาเพียงสองเดือน[4]
  • พฤศจิกายน 2023: เปิดตัว Grok-1 เบต้าในระยะเริ่มต้น ผู้ที่ได้รับสิทธิ์เข้าถึงคือสมาชิก X Premium+ ระดับสูงสุด โมเดลถูกวางตำแหน่งเป็น \"ผลิตภัณฑ์ที่ยังอยู่ในระยะต้น\" ที่มีรูปแบบการตอบสนองที่ไม่ธรรมดา[5]
  • มีนาคม 2024: xAI เผยแพร่ซอร์สโค้ดและน้ำหนักของ Grok-1 ภายใต้ใบอนุญาต Apache 2.0 ทำให้เป็น LLM แบบเปิดที่ใหญ่ที่สุดในขณะนั้นด้วย 314 พันล้านพารามิเตอร์[6] ปลายเดือนเดียวกัน มีการประกาศ Grok-1.5 พร้อมการ reasoning ที่ปรับปรุงแล้วและ context window ที่เพิ่มขึ้นถึง 128,000 token[7]
  • เมษายน 2024: เปิดตัวเวอร์ชันมัลติโมดัลแรก — Grok-1.5 Vision ที่สามารถวิเคราะห์รูปภาพและเอกสารได้ โมเดลนี้แสดงผลเหนือกว่า GPT-4V ใน benchmark RealWorldQA แต่ไม่ได้เปิดให้ใช้งานสาธารณะ[8]
  • สิงหาคม 2024: เปิดตัว Grok-2 และเวอร์ชันที่เบาลงคือ Grok-2 mini นวัตกรรมหลักคือการสร้างภาพด้วยโมเดล FLUX.1 ผู้ใช้สังเกตว่า Grok-2 สร้างภาพด้วยข้อจำกัดที่น้อยกว่าคู่แข่ง (เช่น สามารถวาดภาพนักการเมืองจริงได้)[9][10]
  • ฤดูใบไม้ร่วง 2024: Grok-2 ได้รับการอัปเดตหลายครั้ง ได้แก่ การทำความเข้าใจรูปภาพ (ตุลาคม) การค้นหาเว็บ (พฤศจิกายน) และการวิเคราะห์ไฟล์ PDF (พฤศจิกายน) ในเดือนธันวาคม xAI นำโมเดลสร้างภาพ Aurora ของตัวเองมาใช้งาน[8] การเข้าถึงบอทกลายเป็นแบบฟรีบางส่วนสำหรับผู้ใช้ X ทุกคน[11]
  • กุมภาพันธ์ 2025: เปิดตัวโมเดลเรือธง Grok-3 ที่ฝึกบนซูเปอร์คอมพิวเตอร์ Colossus ซึ่ง xAI อ้างว่าเหนือกว่า GPT-4 ในการทดสอบที่ยากหลายรายการ (เช่น AIME 2025) มีโหมดเฉพาะปรากฏขึ้น เช่น \"Think\" (การ reasoning เชิงลึก) และ DeepSearch (การค้นหาเว็บขั้นสูง)[12]
  • ฤดูใบไม้ผลิ 2025: xAI ขยายความพร้อมใช้งานของ Grok-3 โดยเปิด API สำหรับนักพัฒนาและประกาศการผสานรวมเข้ากับแพลตฟอร์มคลาวด์ Microsoft Azure และแอปส่งข้อความ Telegram[13][14]

คุณสมบัติทางเทคนิคและสถาปัตยกรรม

สถาปัตยกรรมและพารามิเตอร์

เวอร์ชันแรก Grok-1 ถูกสร้างบนสถาปัตยกรรม Mixture-of-Experts (MoE) ที่มีขนาดรวม 314 พันล้านพารามิเตอร์ โมเดลประกอบด้วยผู้เชี่ยวชาญ 8 คน โดยมี 2 คนที่ถูกเปิดใช้งานสำหรับแต่ละ token ซึ่งทำให้มีประสิทธิภาพในการคำนวณสำหรับขนาดของมัน[15] context สูงสุดของโมเดลเริ่มต้นอยู่ที่ 8,192 token

เวอร์ชันถัดมา Grok-1.5 และ Grok-3 มีการพัฒนาอย่างมีนัยสำคัญ context window ถูกขยายเป็น 128,000 token ใน Grok-1.5 และเป็น 1 ล้าน token ใน Grok-3 ซึ่งเป็นหนึ่งในตัวเลขที่ใหญ่ที่สุดในอุตสาหกรรม[16] จำนวนพารามิเตอร์ที่แน่นอนของ Grok-3 ไม่ได้รับการเปิดเผย แต่ตามบางการประมาณการ อาจสูงถึง 2.7 ล้านล้าน[17]

มัลติโมดัลลิตี้และการ Reasoning

เริ่มต้นจาก Grok-1.5V โมเดลต่างๆ กลายเป็น มัลติโมดัล Grok-3 รองรับวงจรเต็มรูปแบบของการโต้ตอบด้านภาพ ได้แก่ การทำความเข้าใจรูปภาพ การแก้ไขตามคำอธิบายข้อความ และการสร้างภาพใหม่

xAI ให้ความสำคัญเป็นพิเศษกับการปรับปรุง reasoning (การอนุมานเชิงตรรกะ) ใน Grok-2 มีการนำกลไกสำหรับค้นหาข้อมูลที่ขาดหายไปอย่างอิสระมาใช้ ใน Grok-3 แนวทางนี้ได้รับการพัฒนาเป็นโหมด "Think" (หรือที่เรียกว่า Big Brain Mode) เมื่อเปิดใช้งาน โมเดลจะใช้การคำนวณเพิ่มเติม สร้างตัวเลือกวิธีแก้ปัญหาหลายแบบ ใช้ Chain-of-Thought ที่ยาวกว่า และตรวจสอบความขัดแย้งในตัวเอง ทำให้ผู้ใช้สามารถเลือกระหว่างคำตอบที่รวดเร็วและคำตอบที่แม่นยำกว่าแต่ช้ากว่าได้[18]

การฝึกและข้อมูล

Grok ถูกฝึกบนชุดข้อมูลที่ผสมผสานระหว่างข้อมูลสาธารณะ (อินเทอร์เน็ต โค้ด วรรณกรรม) และข้อมูลเฉพาะจากระบบนิเวศของ Elon Musk องค์ประกอบสำคัญคือกระแสข้อมูลต่อเนื่องจาก X (Twitter) ซึ่งทำให้โมเดลมีความทันสมัยและตระหนักถึงเหตุการณ์ปัจจุบัน นอกจากนี้ยังมีการรวมข้อความทางกฎหมายและวิทยาศาสตร์เข้าใน dataset[8] แนวทางนี้ในด้านหนึ่งให้ข้อได้เปรียบแก่ Grok และในอีกด้านหนึ่งก็ก่อให้เกิดคำถามจากหน่วยงานกำกับดูแลเกี่ยวกับความเป็นส่วนตัวของข้อมูลผู้ใช้[19]

การเปรียบเทียบกับคู่แข่ง

การเปรียบเทียบ Grok กับคู่แข่งหลัก (ต้นปี 2025)
คุณลักษณะ Grok (xAI) GPT (OpenAI) Claude (Anthropic) Gemini (Google)
ข้อได้เปรียบหลัก การผสานรวมกับ X ความทันสมัย สไตล์ \"กบฏ\" คุณภาพและความเสถียรของการตอบสนองสูง ระบบนิเวศที่พัฒนาแล้ว ความปลอดภัย context ขนาดใหญ่ โฟกัสด้านจริยธรรม การผสานรวมกับระบบนิเวศ Google มัลติโมดัลลิตี้
Context สูงสุด 1,000,000 token (Grok-3) 128,000 token (GPT-4o) 200,000+ token (Claude 3) 2,000,000 token (Gemini 2.0 Pro)
การสร้างภาพ ใช่ (ในตัว โมเดล Aurora) ใช่ (ผ่าน DALL·E 3) ไม่ ใช่ (โมเดล Imagen)
ใบอนุญาต แบบผสม (Grok-1 เปิด เวอร์ชันใหม่ — เป็นกรรมสิทธิ์) เป็นกรรมสิทธิ์ เป็นกรรมสิทธิ์ เป็นกรรมสิทธิ์
การเข้าถึงแบบเรียลไทม์ ใช่ (โดยกำเนิดผ่าน X และการค้นหาเว็บ) ใช่ (ผ่านปลั๊กอิน/การท่องเว็บ) ไม่ (พื้นฐาน) ใช่ (โดยกำเนิดผ่านการค้นหาของ Google)

การผสานรวมและระบบนิเวศ

กลยุทธ์ของ xAI คือการทำให้ Grok เป็น AI assistant ที่อยู่ทุกหนทุกแห่ง

  • แพลตฟอร์ม X: สถานที่หลักที่ Grok ถูกใช้สำหรับการตอบคำถาม การสรุปข่าว และการกลั่นกรองเนื้อหา
  • Telegram: ในปี 2025 มีการประกาศการผสานรวม Grok อย่างเต็มรูปแบบเข้ากับแอปส่งข้อความ ซึ่งจะให้ผู้ใช้มากกว่าหนึ่งพันล้านคนสามารถเข้าถึง AI ได้ ข้อตกลงนี้มีมูลค่า 300 ล้านดอลลาร์บวก 50% ของกำไร[20]
  • Tesla: มีแผนจะผสานรวม Grok เป็น "Smart Voice Assistant" ในรถยนต์ Tesla ทุกคัน ผู้ช่วยจะสามารถเข้าถึงระบบของรถยนต์และดำเนินการคำสั่งที่ซับซ้อน เข้าใจภาษาธรรมชาติ และให้ข้อมูลจากอินเทอร์เน็ต[21]
  • API และความร่วมมือ: Grok-3 พร้อมใช้งานผ่าน API สำหรับนักพัฒนาและผสานรวมเข้ากับเครื่องมือสำหรับนักพัฒนายอดนิยม (Vercel, Cursor) และแพลตฟอร์มอัตโนมัติ (Zapier, Albato)[22]

ลำดับเวลาการเปิดตัว (ตาราง)

ลำดับเวลาการเปิดตัวและคุณสมบัติหลักของโมเดล Grok
โมเดล วันที่เปิดตัว พารามิเตอร์ของโมเดล คุณสมบัติหลัก ความพร้อมใช้งานและใบอนุญาต
Grok-1 3 พ.ย. 2023
(เปิดเผย 17 มี.ค. 2024)
314 พันล้าน (MoE) เวอร์ชันแรก สถาปัตยกรรม MoE context 8k token เข้าถึงก่อนสำหรับ X Premium+ ต่อมาเปิดเผยภายใต้ Apache 2.0
Grok-1.5 ประกาศ: 29 มี.ค. 2024
(เข้าถึงได้ตั้งแต่ 15 พ.ค. 2024)
~314 พันล้าน การ reasoning ที่ปรับปรุงแล้ว context 128,000 token คะแนนสูงใน GSM8K (90%) เป็นกรรมสิทธิ์ เข้าถึงได้สำหรับสมาชิก X Premium
Grok-1.5 Vision ประกาศ: 12 เม.ย. 2024 ~314 พันล้าน + โมดูลภาพ เวอร์ชันมัลติโมดัลแรก การทำความเข้าใจรูปภาพและแผนภูมิ ไม่ได้เปิดให้ใช้งานสาธารณะ นำผลงานไปใช้ใน Grok-2
Grok-2 14 ส.ค. 2024 ไม่เปิดเผย การแชทและการเขียนโค้ดที่ปรับปรุงแล้ว การสร้างภาพ (ผ่าน Flux.1 จากนั้น Aurora) มัลติโมดัลลิตี้ที่ปรับปรุงแล้ว เป็นกรรมสิทธิ์ เข้าถึงได้สำหรับ X Premium+ ต่อมาบางส่วนฟรี
Grok-3 17 ก.พ. 2025 ~2.7 ล้านล้าน (ประมาณการ) โมเดลเรือธง context 1 ล้าน token โหมด \"Think\" และ \"DeepSearch\" ฟังก์ชันแก้ไขรูปภาพ เป็นกรรมสิทธิ์ เข้าถึงได้ผ่าน X Premium+, SuperGrok และ API

เอกสารอ้างอิง

  • Shazeer, N. et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Wei, J. et al. (2022). Chain‑of‑Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Li, K. et al. (2024). MME‑RealWorld: Could Your Multimodal LLM Challenge High‑Fidelity Real‑World Data?. arXiv:2408.13257.
  • Batifol, S. et al. (2025). FLUX.1 Kontext: Flow Matching for In‑Context Image Generation and Editing in Latent Space. arXiv:2506.15742.
  • Tran, P. et al. (2025). Search Arena: Analyzing Search‑Augmented Large Language Models. arXiv:2506.05334.
  • Suzuki, T.; Ozawa, K. (2025). Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision‑Language Models. arXiv:2504.09979.

หมายเหตุ

  1. «What is Elon Musk's Grok 3?». LinkedIn. [1]
  2. «"Grok, это правда?": насколько можно доверять чат-ботам с ИИ». Deutsche Welle. [2]
  3. «Grok, an AI chatbot from Elon Musk’s xAI, is coming to X». TechCrunch. [3]
  4. «Маск признался, что на тренировку нейросети Grok ушло два месяца». РБК. [4]
  5. «Grok (chatbot)». Wikipedia. [5]
  6. «Grok open release». GitHub. [6]
  7. «xAI анонсировала ИИ-модель Grok-1.5». Habr. [7]
  8. 8.0 8.1 8.2 «Grok (чат-бот)». Википедия. [8]
  9. «xAI releases Grok-2, adds image generation on X». TechCrunch. [9]
  10. «Grok-2's image generator has no content rules, for now». Mashable. [10]
  11. «Grok-3: Everything you need to know about this new LLM by xAI». Daily.dev. [11]
  12. «Grok-3 Release». xAI News. [12]
  13. «Grok 3, xAI's latest model, is now available on the API». xAI Blog. [13]
  14. «Дуров и Маск договорились о полной интеграции Grok в Telegram». РБК. [14]
  15. «GitHub - xai-org/grok-1: Grok open release». GitHub. [15]
  16. «Grok-3». xAI. [16]
  17. «Visual Reasoning Evaluation of Grok, Deepseek's Janus, Gemini, Qwen, Mistral, and ChatGPT». arXiv. [17]
  18. «Grok-3 Functions». xAI Blog. [18]
  19. «Irish DPC probes X and xAI over Grok training data». TechCrunch. [19]
  20. «Telegram и xAI Илона Маска заключили стратегическое партнерство». Sostav.ru. [20]
  21. «All Tesla Vehicles to Receive Grok Smart Voice Assistant According to Musk». Not a Tesla App. [21]
  22. «Grok by xAI Integrations». Zapier. [22]