IBM Granite (language model) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — คือชุดของโมเดลภาษาขนาดใหญ่ (LLM) ที่พัฒนาโดยบริษัท IBM สำหรับการใช้งานในสภาพแวดล้อมองค์กร โมเดล Granite เป็น autoregressive transformer ที่มีสถาปัตยกรรมแบบ decoder-only ซึ่งสามารถสร้างข้อความตามบริบทที่กำหนด[1]

ตระกูลโมเดลนี้ได้รับการเปิดตัวอย่างเป็นทางการเมื่อวันที่ 7 กันยายน 2023 ในกรอบของการเปิดตัวแพลตฟอร์มคลาวด์ IBM watsonx.ai[2] IBM วางตำแหน่ง Granite ในฐานะโซลูชันที่เปิดเผย มีประสิทธิภาพ และเชื่อถือได้สำหรับองค์กร โดยเน้นความโปร่งใสของข้อมูลการฝึก การควบคุมความเสี่ยง และการออกใบอนุญาตที่อนุญาตให้ใช้งานเชิงพาณิชย์[3]

ประวัติการพัฒนา

ตระกูลโมเดล Granite เป็นส่วนหนึ่งของกลยุทธ์ของ IBM ในการมอบโมเดล generative ของตนเองแก่ธุรกิจ ควบคู่ไปกับโมเดลจากพันธมิตร

  • กันยายน 2023: การประกาศอย่างเป็นทางการและการเปิดตัวโมเดลชุดแรกบนแพลตฟอร์ม watsonx.ai รุ่นแรก ได้แก่ Granite.13b.instruct และ Granite.13b.chat มีพารามิเตอร์ประมาณ 13 พันล้านตัว และมุ่งเน้นงานด้านการประมวลผลภาษาหลัก[2]
  • พฤษภาคม 2024: IBM ประกาศการเผยแพร่โอเพนซอร์สของโมเดล Granite Code หลายรุ่น (ตั้งแต่ 3 ถึง 34 พันล้านพารามิเตอร์) ภายใต้ใบอนุญาต Apache 2.0 น้ำหนักของโมเดลได้รับการเผยแพร่บนแพลตฟอร์ม Hugging Face ซึ่งถือเป็นก้าวสำคัญในการสนับสนุนระบบนิเวศ AI แบบเปิด[4]
  • ฤดูใบไม้ร่วง 2024: IBM เปิดตัวการอัปเดต Granite 3.0 ซึ่งรวมถึงโมเดลขนาดเล็กลง (2 และ 8 พันล้านพารามิเตอร์) และฟีเจอร์ใหม่ ยืนยันแนวทางการขยายตระกูลโมเดล[5]

สถาปัตยกรรมและการฝึก

สถาปัตยกรรม

โมเดล IBM Granite สร้างขึ้นตามสถาปัตยกรรม decoder ของ transformer (decoder-only) คล้ายกับโมเดล GPT โมเดลพื้นฐาน Granite.13b ใช้กลไก multi-query attention และมีหน้าต่างบริบทสูงสุด 8,000 token[6] โมเดลได้รับการฝึกด้วย self-supervised learning

ข้อมูลการฝึกและ AI Governance

คุณลักษณะสำคัญของ Granite คือการใช้คลังข้อมูลที่ดูแลเองโดยเฉพาะ ซึ่งคัดเลือกมาเพื่อตอบสนองความต้องการขององค์กร แตกต่างจาก LLM หลายตัวที่ฝึกบนชุดข้อมูลเว็บที่ไม่ผ่านการกรอง Granite ได้รับการฝึกบนข้อมูลคุณภาพสูง (enterprise-quality) ที่ครอบคลุมโดเมนต่อไปนี้[6]:

  • ข้อมูลวิชาการและวิทยาศาสตร์: วรรณกรรมทางวิทยาศาสตร์ สิ่งพิมพ์ทางเทคนิค
  • โค้ดโปรแกรม: ชุดโค้ดในภาษาโปรแกรมมิงหลายภาษา
  • นิติศาสตร์: คำพิพากษา รายงานสาธารณะ
  • การเงิน: รายงานทางการเงินของบริษัท
  • อินเทอร์เน็ต: ข้อความทั่วไปที่ไม่มีโครงสร้างซึ่งผ่านการกรองแล้ว

IBM เน้นย้ำว่าการพัฒนาดำเนินตามหลักการ AI Governance ที่เข้มงวด (จริยธรรมและการกำกับดูแลข้อมูล) ข้อมูลแต่ละส่วนผ่านกระบวนการตรวจสอบความสอดคล้องกับนโยบายองค์กร สำหรับการลบเนื้อหาที่ไม่พึงประสงค์ ใช้ตัวตรวจจับภายในที่เรียกว่า «HAP» (Hate and Profanity) รวมถึงรายการบล็อกอัตโนมัติสำหรับแหล่งข้อมูลเว็บ[1] IBM ได้เผยแพร่รายงานทางเทคนิคโดยละเอียดพร้อมรายชื่อแหล่งข้อมูล ซึ่งถือเป็นก้าวที่หายากสำหรับบริษัทเทคโนโลยีขนาดใหญ่และสร้างความโปร่งใสในระดับสูง

ตระกูลโมเดล Granite

ตระกูล IBM Granite ครอบคลุมหลายหมวดหมู่ของโมเดลสำหรับงานธุรกิจต่าง ๆ:

  • โมเดลภาษา (Granite Language Models): โมเดลพื้นฐานและโมเดลที่ผ่านการ fine-tuning ตามคำสั่ง สำหรับงานประมวลผลข้อความ ได้แก่ การสร้างข้อความ การสรุปความ การจำแนกประเภท และอื่น ๆ
  • โมเดลสำหรับโค้ด (Granite Code Models): LLM เฉพาะทางที่ฝึกบนภาษาโปรแกรมมิงกว่า 100 ภาษา สำหรับการเติมโค้ดอัตโนมัติ การสร้างโค้ด และการแก้ไขโค้ด มีให้เลือกในขนาดตั้งแต่ 3 ถึง 34 พันล้านพารามิเตอร์[4]
  • โมเดลด้านการมองเห็น (Granite Vision Models): เครือข่ายประสาทสำหรับการวิเคราะห์รูปภาพและเอกสาร การรู้จำข้อความ และการทำความเข้าใจเนื้อหา
  • โมเดลด้านเสียงพูด (Granite Speech Models): โมเดลขนาดกะทัดรัดสำหรับการรู้จำและแปลเสียงพูด
  • โมเดลสำหรับอนุกรมเวลา (Granite for Time Series): โมเดลเฉพาะทางสำหรับการพยากรณ์บนพื้นฐานของอนุกรมเวลา
  • โมเดลภูมิสารสนเทศ (Granite for Geospatial): พัฒนาร่วมกับ NASA สำหรับการวิเคราะห์ภาพถ่ายดาวเทียมและข้อมูลภูมิสารสนเทศอื่น ๆ
  • โมเดล embedding (Granite Embedding Models): โมเดลสำหรับงานค้นหาเชิงความหมายและการสร้างระบบ RAG
  • Granite Guardian: โมดูลเฉพาะทางสำหรับการรักษาความปลอดภัย ออกแบบมาเพื่อกรองคำขอที่ไม่พึงประสงค์และตรวจสอบเนื้อหา

โอเพนซอร์สและการออกใบอนุญาต

IBM ให้ความสำคัญอย่างมากกับความเปิดเผยของตระกูล Granite โดยวางตำแหน่งเป็นทางเลือกที่โปร่งใสแทน LLM แบบปิดที่เป็นกรรมสิทธิ์ ในเดือนพฤษภาคม 2024 บริษัทได้มอบโมเดล Granite Code ต้นฉบับให้แก่ชุมชนโอเพนซอร์สภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งาน ดัดแปลง และเผยแพร่ได้อย่างอิสระ[4]

ก้าวนี้ ควบคู่กับการเผยแพร่ข้อมูลโดยละเอียดเกี่ยวกับข้อมูลการฝึก ทำให้ IBM ได้รับการประเมินสูงจากชุมชนนักวิจัย ในปี 2024 โมเดลดังกล่าวครองอันดับต้น ๆ ใน ดัชนีความโปร่งใสของ Foundation Model ของมหาวิทยาลัยสแตนฟอร์ด[3]

การประยุกต์ใช้

โมเดล Granite ได้รับการผสานรวมเข้ากับแพลตฟอร์มคลาวด์ IBM watsonx และใช้งานในสถานการณ์องค์กรต่าง ๆ

  • การวิเคราะห์กีฬา (US Open): โดยความร่วมมือกับสมาคมเทนนิสสหรัฐอเมริกา (USTA) IBM ใช้ Granite เพื่อสร้างรายงานแมตช์และคำบรรยายเสียงโดยอัตโนมัติหลังแต่ละแมตช์ในทัวร์นาเมนต์ US Open โซลูชันนี้สร้างบทวิจารณ์แมตช์แบบละเอียดภายในไม่กี่นาทีหลังสิ้นสุดการแข่งขัน[7]
  • การช่วยเหลือโปรแกรมเมอร์: โมเดล Granite Code เป็นรากฐานของ IBM watsonx Code Assistant ซึ่งเป็นชุดเครื่องมือที่สามารถ เช่น แปลงโค้ดเก่าในภาษา COBOL ให้เป็น microservice สมัยใหม่สำหรับ IBM Z โดยอัตโนมัติ[4]
  • แอปพลิเคชัน AI เฉพาะอุตสาหกรรม: Lockheed Martin ผสานรวมโมเดล Granite เข้ากับแพลตฟอร์ม AI Factory ของตนสำหรับงานด้านความมั่นคงแห่งชาติ ESPN ใช้ Granite เพื่อสร้างคำบรรยายส่วนบุคคลในกีฬา fantasy[3]

เอกสารอ้างอิง

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

หมายเหตุ

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
  3. 3.0 3.1 3.2 «Granite». IBM. [3]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]