---
title: "Gemini (Google) (TH)"
source: "https://systems-analysis.info/int/Gemini_(Google)_(TH)"
wiki: "systems-analysis.info/int"
article: "Gemini_(Google)_(TH)"
language: "th"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 2538
wiki_created_at: 2026-09-06T23:05:47Z
wiki_modified_at: 2026-09-06T23:05:47Z
downloaded_at: 2026-09-07T22:51:58Z
---

# Gemini (Google) (TH)

**Google Gemini** — คือตระกูลของโมเดลภาษาขนาดใหญ่ (LLM) แบบมัลติโมดัลที่พัฒนาโดยหน่วยวิจัย Google DeepMind โมเดล Gemini ซึ่งเปิดตัวครั้งแรกในเดือนธันวาคม 2023 สร้างบนสถาปัตยกรรม Transformer แบบ Neural Network ที่รองรับการประมวลผลและการสร้างข้อมูลหลายรูปแบบโดยกำเนิด ทั้งข้อความ รูปภาพ เสียง วิดีโอ และโค้ดโปรแกรม

ณ เดือนกุมภาพันธ์ 2026 รุ่นปัจจุบันคือสายผลิตภัณฑ์ **Gemini 3.x** ทิศทางการพัฒนาสถาปัตยกรรมมุ่งไปที่การผสานกลไก inference-time scaling และการปรับโมเดลให้เหมาะสมสำหรับใช้งานในระบบ Agentic AI แบบอิสระ แอปพลิเคชัน Gemini มีผู้ใช้งานที่ใช้งานอยู่มากกว่า 750 ล้านคนต่อเดือน

## ชื่อและปรัชญา

ชื่อ **"Gemini"** (จากภาษาละติน — *คู่แฝด*) เป็นสัญลักษณ์แทนการรวมกันของทีมวิจัยชั้นนำสองทีมของ Google — Google Brain และ DeepMind — เพื่อสร้างโครงการนี้ Jeff Dean ผู้ร่วมนำด้านเทคนิคของ Google DeepMind ยืนยันเรื่องนี้ในบล็อกทางการ (พฤษภาคม 2024) ว่า «The twins here are the folks in the legacy Brain team and the legacy DeepMind team» โครงการนี้เดิมมีชื่อรหัสว่า «Titan» ส่วนชื่อ «Gemini» ถูกเสนอโดย Dean ในเดือนเมษายน 2023 — เดือนเดียวกับที่มีการรวม Google Brain และ DeepMind อย่างเป็นทางการ ชื่อนี้ยังอ้างอิงถึงโครงการอวกาศ NASA «Gemini» (1965–1968) ซึ่งบทบาทของโครงการดังกล่าวในการเตรียมการสำหรับโครงการ Apollo ได้สร้างแรงบันดาลใจให้กับทีมพัฒนา

คุณลักษณะสำคัญและรากฐานเชิงปรัชญาของ Gemini คือ **ความเป็นมัลติโมดัลโดยกำเนิด (native multimodality)** ต่างจากโมเดลก่อนหน้าหลายตัวที่เพิ่มความสามารถมัลติโมดัลบนพื้นฐานข้อความที่มีอยู่เดิม Gemini ได้รับการออกแบบตั้งแต่ต้นเพื่อทำความเข้าใจ จัดการ และผสมผสานข้อมูลประเภทต่าง ๆ พร้อมกัน รายงานเทคนิค Gemini 1.0 (arXiv:2312.11805) ยืนยันว่าโมเดล «trained jointly across image, audio, video, and text data» ซึ่งทำให้โมเดลไม่เพียงแค่แปลงข้อมูลระหว่างรูปแบบต่าง ๆ แต่สามารถสร้างความเข้าใจที่ลึกซึ้งและองค์รวมมากขึ้น

## สถาปัตยกรรมและเทคโนโลยีหลัก

ความสำเร็จและความสามารถของโมเดล Gemini ถูกกำหนดโดยการตัดสินใจเชิงสถาปัตยกรรมพื้นฐานหลายประการ Google ไม่ได้เปิดเผยการออกแบบระดับต่ำทั้งหมดของส่วนประกอบภายในของ Gemini แต่แหล่งข้อมูลเปิดช่วยให้สามารถระบุประเภทสถาปัตยกรรมได้ว่า โมเดลทุกตัวในตระกูล 1.5 และสูงกว่าคือ **sparse mixture-of-experts transformer-based models** ที่รองรับมัลติโมดัลโดยกำเนิด (ยืนยันโดย model card ของ Gemini 2.5 Flash)

### สถาปัตยกรรมมัลติโมดัลโดยกำเนิด

สถาปัตยกรรมของ Gemini อิงตามแนวคิด **early fusion** (การรวมกันในระยะต้น) โดย pixel patches ของรูปภาพ เฟรมวิดีโอตามเวลา audiogram และ token ข้อความถูกฉายลงในพื้นที่แฝง (latent space) เดียวกัน รายงานเทคนิคของ Gemini 2.5 อธิบายแนวทางนี้ว่าเป็น «Unified Multimodal Token Interleaving» เนื่องจาก token ทุกประเภทถูกประมวลผลในลำดับเดียวกัน กลไก self-attention มาตรฐานจึงรับประกันการผสานข้อมูลข้ามรูปแบบบนทุกชั้นอย่างเป็นธรรมชาติ สัญญาณเสียงถูกประมวลผลโดย encoder เฉพาะทางโดยตรงจาก waveform เสียง ซึ่งรักษาคุณลักษณะทางอะคูสติก (น้ำเสียง โทนเสียง เสียงพื้นหลัง) ที่สูญหายเมื่อใช้ระบบ Speech-to-Text กลางในการแปลงเสียง

สำหรับคลาส transformer การดำเนินการพื้นฐานคือกลไก attention:

$$
{Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{o}p}{\sqrt{d_{k}}} \right)V
$$

โดยที่ $Q$ — เมทริกซ์คำถาม (queries), $K$ — คีย์ (keys), $V$ — ค่า (values) และ $d_{k}$ — มิติของคีย์

### Sparse Mixture of Experts (Sparse MoE)

ตั้งแต่เวอร์ชัน 1.5 โมเดล Gemini ใช้สถาปัตยกรรม **Sparse Mixture-of-Experts (MoE)** โดย Gemini 1.0 ใช้ transformer แบบ dense (หนาแน่น) และการเปลี่ยนไปสู่ MoE ได้รับการอธิบายอย่างชัดเจนในรายงานเทคนิค 1.5 ว่า «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture»

ในสถาปัตยกรรม MoE ชั้น Feed-Forward Networks แบบเชื่อมต่อเต็มรูปแบบมาตรฐานถูกแทนที่ด้วยชุดของ subnetwork เฉพาะทางที่เรียกว่า «experts» สำหรับ token อินพุต $x \in {\mathbb{R}}^{d}$ เอาต์พุต $y$ ถูกสร้างเป็นผลรวมเชิงน้ำหนักของเอาต์พุต $k$ ของ expert ที่ใช้งานอยู่ ($k \ll E$ โดยที่ $E$ คือจำนวน expert ทั้งหมด):

$$
y = \sum\limits_{i \in \mathcal{T}_{k}(x)}g_{i}(x)\, E_{i}(x)
$$

โดยที่ $E_{i}(x)$ — ฟังก์ชันไม่เชิงเส้นของ expert ที่ $i$, $\mathcal{T}_{k}(x)$ — ชุดดัชนีของ $k$ subnetwork ที่เลือก และน้ำหนักการจัดเส้นทาง $g_{i}(x)$ คำนวณโดย learned routing function โดยใช้ Softmax บนค่าสูงสุด $k$ ค่า

แนวทางนี้ช่วยให้สามารถเพิ่มความจุพารามิเตอร์โดยรวมของโมเดลได้อย่างมีนัยสำคัญ ขณะที่รักษาต้นทุนการคำนวณ (FLOPs) ให้อยู่ในระดับต่ำ เนื่องจากสำหรับแต่ละ token จะมีเพียงบางส่วนของพารามิเตอร์เท่านั้นที่ถูกเปิดใช้งาน Google ไม่ได้เปิดเผยจำนวนพารามิเตอร์จริงของโมเดล Gemini

### บริบทยาวและ \\การเรียนรู้ในบริบท\\

Gemini 1.5 สร้างความก้าวหน้าครั้งสำคัญโดยเพิ่มขนาด context window เป็น **1 ล้าน token** ในโหมด production (พร้อมการทดสอบเชิงทดลองถึง 10 ล้าน token) ซึ่งมากกว่าโมเดลก่อนหน้าหลายเท่า (เช่น GPT-4 Turbo ที่มี 128,000 token) Google ประกาศผลลัพธ์ 99% ในการทดสอบ Needle In A Haystack ที่ความยาวบริบท 1 ล้าน token สำหรับรุ่นถัดไป long context ได้กลายเป็นหนึ่งในคุณลักษณะสำคัญของสายผลิตภัณฑ์ บริบทขนาดใหญ่เช่นนี้ช่วยให้โมเดล:

- วิเคราะห์หนังสือทั้งเล่ม วิดีโอยาวหลายชั่วโมง (สูงสุด 3 ชั่วโมง) หรือโค้ดเบสขนาดใหญ่ภายในคำขอเดียว
- ดำเนินการ in-context learning บนข้อมูลปริมาณมหาศาลที่ระบุไว้ใน prompt ซึ่งช่วยให้ได้คำตอบที่ปรับแต่งสูงโดยไม่ต้องทำ fine-tuning

### \\โมเดลที่คิด\\ และการขยายขนาดการคำนวณระหว่าง inference

ตั้งแต่ Gemini 2.5 Google ได้แยก **thinking** ออกเป็นโหมดการทำงานเฉพาะของโมเดล เอกสารทางการระบุว่าเป็นกระบวนการคำนวณภายในที่ช่วยปรับปรุงการวางแผนหลายขั้นตอนและการใช้เหตุผล โมเดลเวอร์ชัน 2.5 (ที่อธิบายว่าเป็น «thinking models») สามารถสร้างและประเมินขั้นตอนการให้เหตุผลกลางๆ ภายในได้ก่อนที่จะให้คำตอบสุดท้าย ซึ่งช่วยเพิ่มความแม่นยำในงานที่ต้องใช้ตรรกะและคณิตศาสตร์ที่ซับซ้อนได้อย่างมีนัยสำคัญ

สิ่งสำคัญคือต้องแยกแยะกลไกสองประการ:

- **Thinking แบบในตัว (Built-in Thinking)**: โหมดพื้นฐานสำหรับโมเดล 2.5 และซีรีส์ 3 ที่สร้าง Chain-of-Thought แบบซ่อน API อาจส่งคืน **thought summaries** — สรุปย่อของการใช้เหตุผลภายใน ไม่ใช่กระแส \\ความคิดดิบ\\ ทั้งหมด ตั้งแต่โมเดล 3.1 Pro เป็นต้นไป งบประมาณการคิดสามารถปรับได้ผ่านพารามิเตอร์ `thinking_level` ด้วยค่าตั้งแต่ Low ถึง Max
- **Deep Think**: **โหมดการให้เหตุผลขยายแบบเชิงทดลองแยกต่างหาก** ที่ใช้การสร้างสมมติฐานแบบขนานและต้องการทรัพยากรการคำนวณมากขึ้นอย่างมีนัยสำคัญ ประกาศในงาน Google I/O เมื่อ 20 พฤษภาคม 2025 และเปิดให้ผู้สมัครสมาชิก AI Ultra เมื่อ 1 สิงหาคม 2025 Deep Think ไม่ควรนำไปเทียบกับกลไก thinking พื้นฐาน

### ความสามารถเชิงตัวแทน (Agentic Capabilities)

ตั้งแต่เวอร์ชัน 2.0 Gemini สามารถโต้ตอบกับโลกภายนอกได้ ไม่ว่าจะเป็นการเรียกใช้เครื่องมือ การค้นหาใน Google การรันโค้ด และการจัดการองค์ประกอบ UI Google ระบุอย่างชัดเจนว่า Gemini 2.0 เป็นโมเดลสำหรับ «agentic era» (ยุคตัวแทน) ที่รองรับ tool use โดยกำเนิด

ถึงเดือนกุมภาพันธ์ 2026 Gemini API ประกอบด้วยชั้นความสามารถเชิงตัวแทนที่กำหนดอย่างเป็นทางการพร้อมการรองรับเครื่องมือ ได้แก่: **Google Search**, **Google Maps**, **Code Execution**, **URL Context**, **Computer Use**, **File Search** รวมถึง **Live API** สำหรับการโต้ตอบแบบสองทิศทางในเวลาจริง

## วิวัฒนาการของโมเดล Gemini

ตระกูล Gemini พัฒนาอย่างรวดเร็วมาก: ในช่วงเดือนธันวาคม 2023 ถึงกุมภาพันธ์ 2026 มีการเปิดตัวรุ่นหลักสี่รุ่น

### Gemini 1.0 (ธันวาคม 2023)

รุ่นแรกที่วางรากฐานของความเป็นมัลติโมดัลโดยกำเนิด เปิดตัวต่อสาธารณะเมื่อ 6 ธันวาคม 2023

- **เวอร์ชัน:** **Ultra** (รุ่นเรือธงสำหรับงานที่ซับซ้อนที่สุด), **Pro** (โมเดลอเนกประสงค์) และ **Nano** (รุ่นขนาดเล็กสำหรับอุปกรณ์มือถือ แบ่งเป็น Nano-1 ที่มี 1.8 พันล้านพารามิเตอร์ และ Nano-2 ที่มี 3.25 พันล้านพารามิเตอร์)
- **Context window:** **32,768 token** สำหรับทุกเวอร์ชัน
- **ความสำเร็จ:** Gemini 1.0 Ultra กลายเป็นโมเดลแรกที่บรรลุและเกินระดับผู้เชี่ยวชาญมนุษย์บน benchmark MMLU ด้วยคะแนน **90.04%** (โดยใช้เทคนิค CoT@32 — Chain-of-Thought ที่มี 32 samples พร้อม majority voting; ด้วย 5-shot prompting มาตรฐานผลลัพธ์อยู่ที่ประมาณ 83.7%) และแสดงผลลัพธ์ SOTA บน 30 จาก 32 benchmark ทางวิชาการ
- **การยุติการสนับสนุน:** Gemini 1.0 Pro ถูกประกาศว่าล้าสมัยเมื่อ 18 กุมภาพันธ์ 2025

### Gemini 1.5 (กุมภาพันธ์ — พฤษภาคม 2024)

ความก้าวหน้าด้านความยาวบริบทและประสิทธิภาพ

- **สถาปัตยกรรม:** การเปลี่ยนจาก dense transformer เป็น Mixture-of-Experts (MoE)
- **Context window:** สูงสุด **1 ล้าน token** ใน production (2 ล้านตาม waitlist สำหรับ 1.5 Pro ประกาศในเดือนพฤษภาคม 2024 ที่ Google I/O)
- **เวอร์ชัน:** **1.5 Pro** (ประกาศในเดือนกุมภาพันธ์ 2024 มีคุณภาพเทียบเท่า 1.0 Ultra ด้วยต้นทุนที่ต่ำกว่าอย่างมีนัยสำคัญ) และ **1.5 Flash** (เวอร์ชันที่เบาและรวดเร็วกว่า เพิ่มในเดือนพฤษภาคม 2024)
- **การยุติการสนับสนุน:** โมเดล Gemini 1.5 ทั้งหมด (Pro, Flash, Flash-8B) ถูกยกเลิกการใช้งาน **29 กันยายน 2025**

### Gemini 2.0 (ธันวาคม 2024 — กุมภาพันธ์ 2025)

การเปลี่ยนผ่านสู่ «ยุคตัวแทน (agentic era)»

- **ลำดับเวลา:** 11 ธันวาคม 2024 — ประกาศ **2.0 Flash Experimental** (อินพุตมัลติโมดัล เอาต์พุตข้อความ); 5 กุมภาพันธ์ 2025 — ความพร้อมใช้งานทั่วไป (GA) ของ 2.0 Flash, การเปิดตัว **2.0 Pro Experimental** และ **2.0 Flash-Lite**
- **นวัตกรรมหลัก:** ความสามารถเชิงตัวแทนในตัว (tool use), การสร้างรูปภาพและเสียงโดยกำเนิด (เริ่มแรกในโหมดจำกัดสำหรับพันธมิตร early-access), มุ่งเน้นสถานการณ์การใช้งานเชิงตัวแทน
- **Context window:** สูงสุด 2 ล้าน token (2.0 Pro); สูงสุด 1 ล้าน token (2.0 Flash-Lite)
- **การยุติการสนับสนุน:** โมเดล 2.0 Flash และ Flash-Lite กำหนดยกเลิกการใช้งาน **1 มิถุนายน 2026**

### Gemini 2.5 (มีนาคม — มิถุนายน 2025)

«โมเดลที่คิด (thinking model)» รุ่นแรกที่มีงบประมาณการให้เหตุผลที่ปรับได้

- **ลำดับเวลา:** 25 มีนาคม 2025 — ประกาศ **2.5 Pro Experimental**; 17 เมษายน — **2.5 Flash** (โมเดล reasoning แบบ hybrid เต็มรูปแบบรุ่นแรกที่สามารถสลับโหมดการคิดได้); 20 พฤษภาคม (Google I/O) — อัปเดต 2.5 Pro และ Flash, ประกาศ Deep Think; **17 มิถุนายน 2025** — GA พร้อมกันสำหรับ 2.5 Pro และ 2.5 Flash; ในวันเดียวกัน — preview ของ **2.5 Flash-Lite** (GA 22 กรกฎาคม) 1 สิงหาคม — Deep Think เปิดสำหรับผู้สมัครสมาชิก AI Ultra
- **นวัตกรรมหลัก:** กลไก thinking ในตัวพร้อมงบประมาณที่ปรับได้; Deep Think เป็นโหมดขยายแยกต่างหาก ผลลัพธ์ SOTA บน benchmark คณิตศาสตร์ ตรรกะ และโปรแกรมที่ซับซ้อน (AIME 2025 — 86.7%, GPQA Diamond — 84.0%, Humanity's Last Exam — 18.8% โดยไม่มีเครื่องมือ)
- **Context window:** **1 ล้าน token** สำหรับอินพุต สูงสุด 64,000 token สำหรับเอาต์พุต การขยายที่สัญญาไว้เป็น 2 ล้าน token สำหรับ 2.5 Pro ไม่ได้รับการยืนยันว่าดำเนินการแล้วตลอดวงจรชีวิตของโมเดล
- **เวอร์ชันเฉพาะทาง:** **Gemini 2.5 Flash Image** (ชื่อรหัส «Nano Banana» ปรากฏตัวอย่างไม่เปิดเผยตัวตนบน Arena เมื่อ 12 สิงหาคม เปิดตัวอย่างเป็นทางการ 26 สิงหาคม 2025 — กลายเป็นไวรัลจาก «ฟิกเกอร์ 3D» แบบ photorealistic ดึงดูดผู้ใช้ใหม่ 10 ล้านคน); **Computer Use Preview** (7 ตุลาคม 2025 บนพื้นฐาน 2.5 Pro); โมเดล Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS)
- **รายงานเทคนิค:** รายงานรวม **Gemini 2.X** เผยแพร่บน arXiv เมื่อ 7 กรกฎาคม 2025 (arXiv:2507.06261) มีผู้เขียนมากกว่า 3,300 คน และครอบคลุมโมเดล 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite

### Gemini 3.x (พฤศจิกายน 2025 — กุมภาพันธ์ 2026)

รุ่นที่สามถือเป็นการเปลี่ยนผ่านจากการสร้างพื้นฐานไปสู่กระบวนการตัวแทนระยะยาว (agentic workflows) และการแก้ปัญหาทางวิทยาศาสตร์แบบสหสาขาวิชา

- **Gemini 3 Pro (18 พฤศจิกายน 2025):** ประกาศโดย CEO ของ Alphabet Sundar Pichai และหัวหน้า DeepMind Demis Hassabis ว่าเป็น «โมเดลที่ฉลาดที่สุดของ Google» เป็นโมเดล Gemini รุ่นแรกที่ถูกนำไปใช้ใน Google Search ในวันเปิดตัว กลายเป็นโมเดลแรกที่ทำลายเกณฑ์ **1500 Elo บน LMArena** (1501 ณ เวลาเปิดตัว) ผลลัพธ์: GPQA Diamond — 91.9%; SWE-bench Verified — 76.2%; Humanity's Last Exam — 37.5% (โดยไม่มีเครื่องมือ); SimpleQA — 72.1%
- **Gemini 3 Flash (17 ธันวาคม 2025):** กลายเป็นโมเดลเริ่มต้นในแอปพลิเคชัน Gemini ด้วยราคา \$0.50 / 1M token อินพุต แซงหน้า 3 Pro บน SWE-bench Verified (78%) ขณะใช้ token น้อยกว่า 30% ในงานที่ต้องใช้การให้เหตุผล GPQA Diamond — 90.4%; HLE — 33.7%
- **Gemini 3.1 Pro (19 กุมภาพันธ์ 2026):** โมเดลเรือธงในวันที่เผยแพร่บทความนี้ เป็น release «เพิ่มทีละน้อย» รุ่นแรก (.1 แทน .5 เดิม) ผลลัพธ์หลัก — **ARC-AGI-2: 77.1%** (มากกว่าสองเท่าของ 31.1% ของ 3 Pro) AIME 2025 — 91.2%; GPQA Diamond — 94.3%; SWE-bench Verified — 80.6% มีการนำระดับการคิดใหม่ MEDIUM ผ่านพารามิเตอร์ `thinking_level` มา endpoint เฉพาะทาง `gemini-3.1-pro-preview-customtools` สำหรับการทำงานกับ bash terminal และฟังก์ชันที่กำหนดเอง แก้ไขปัญหาการตัดทอนเอาต์พุตระหว่างการสร้างข้อความยาว ช่องทาง: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM
- **Gemini 3 Deep Think (อัปเดต 12 กุมภาพันธ์ 2026):** อัปเดตหลักสำหรับโหมด «thinking» เฉพาะทาง ก้าวข้ามคณิตศาสตร์และการเขียนโปรแกรม: ผลลัพธ์ระดับเหรียญทองในโอลิมปิกฟิสิกส์ (IPhO) และเคมี (IChO) นานาชาติประจำปี 2025; **ARC-AGI-2 — 84.6%**; **Humanity's Last Exam — 48.4%**; CMT-Benchmark (ฟิสิกส์ทฤษฎีสสารควบแน่น) — 50.5%; Codeforces Elo — 3455 บนพื้นฐาน Deep Think ได้สร้างตัวแทนวิจัย **Aletheia** ที่แก้ปัญหาเปิดหลายข้อจากฐานข้อมูลของ Erdős อย่างอิสระ (รวมถึงปัญหา Erdős-1051)

## ตารางสรุปรุ่น Gemini

| รุ่น             | ปีที่เปิดตัว   | เวอร์ชันหลัก                             | Context window สูงสุด                     | นวัตกรรมสถาปัตยกรรมหลักและการปรับปรุง                                                                            |
|----------------|-----------|---------------------------------------|-----------------------------------------|-------------------------------------------------------------------------------------------------------------|
| **Gemini 1.0** | 2023      | Ultra, Pro, Nano                      | 32,768 token                            | ความเป็นมัลติโมดัลโดยกำเนิดตั้งแต่ต้น; dense transformer; เหนือกว่ามนุษย์บน MMLU (90.04% CoT@32)                         |
| **Gemini 1.5** | 2024      | Pro, Flash                            | 1,000,000 token (2 ล้านตาม waitlist)     | สถาปัตยกรรม Mixture-of-Experts (MoE); การขยายบริบทแบบก้าวกระโดด; 99% Needle In A Haystack                      |
| **Gemini 2.0** | 2024–2025 | Pro, Flash, Flash-Lite                | 1,000,000 — 2,000,000 token             | ยุค «agentic AI»: การผสานเครื่องมือโดยกำเนิด, การสร้างรูปภาพและเสียง, Live API                                      |
| **Gemini 2.5** | 2025      | Pro, Flash, Flash-Lite                | 1,000,000 token (อินพุต), 64,000 (เอาต์พุต) | «โมเดลที่คิด (thinking model)»; งบประมาณการให้เหตุผลที่ปรับได้; Deep Think; การสร้างรูปภาพ (Nano Banana); Computer Use |
| **Gemini 3.x** | 2025–2026 | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1,000,000 token                         | Agentic workflows; พารามิเตอร์ thinking_level; ความก้าวหน้าบน ARC-AGI-2 และโอลิมปิกวิทยาศาสตร์; Aletheia            |

วิวัฒนาการของคุณลักษณะสำคัญของโมเดล Gemini

## ผลลัพธ์หลักและ benchmark

เนื่องจาก benchmark คลาสสิก (เช่น MMLU) อิ่มตัวแล้ว การประเมินประสิทธิภาพของโมเดล Gemini จึงเปลี่ยนไปสู่งานการให้เหตุผลเชิงนามธรรม การสร้างแบบจำลองทางวิทยาศาสตร์ และการเขียนโปรแกรมอัตโนมัติ ผลลัพธ์อ้างอิงจากข้อมูลที่ Google รายงานเอง (self-reported) และการเปรียบเทียบจะถูกต้องเฉพาะเมื่อโหมด inference, การมี/ไม่มี tool use, วิธีการสุ่มตัวอย่าง (single-attempt vs. majority voting) และ model-id ที่ระบุตรงกัน

| Benchmark                | คำอธิบายงาน                          | Gemini 2.5 Pro (มิ.ย. 2025) | Gemini 3 Pro (พ.ย. 2025) | Gemini 3.1 Pro (ก.พ. 2026) | Gemini 3 Deep Think (ก.พ. 2026) |
|--------------------------|-------------------------------------|----------------------------|--------------------------|----------------------------|---------------------------------|
| **MMLU**                 | ความเข้าใจภาษาหลายงาน                | —                          | —                        | —                          | —                               |
| **GPQA Diamond**         | คำถามวิทยาศาสตร์ระดับปริญญาเอก          | 84.0%                      | 91.9%                    | **94.3%**                  | ไม่มีข้อมูล                         |
| **Humanity's Last Exam** | ความรู้เชิงลึกสาขาแนวหน้า                | 18.8%                      | 37.5%                    | 44.4%                      | **48.4%**                       |
| **ARC-AGI-2**            | ปริศนาตรรกะเชิงนามธรรม                | 4.9%                       | 31.1%                    | 77.1%                      | **84.6%**                       |
| **SWE-bench Verified**   | การแก้ปัญหาอัตโนมัติใน repository GitHub | 63.8%\*                    | 76.2%                    | **80.6%**                  | ไม่มีข้อมูล                         |
| **AIME 2025**            | โจทย์คณิตศาสตร์ระดับโอลิมปิก              | 86.7%                      | —                        | **91.2%**                  | —                               |
| **Codeforces (Elo)**     | คะแนนในการเขียนโปรแกรมแข่งขัน          | —                          | —                        | 2887                       | **3455**                        |

ผลลัพธ์ของโมเดล Gemini บน benchmark หลัก (ข้อมูล ณ กุมภาพันธ์ 2026)

\* ผลลัพธ์ของ 2.5 Pro บน SWE-bench ได้รับด้วย custom agent setup

### อันดับบน LMArena (ข้อมูล ณ ปลายเดือนกุมภาพันธ์ 2026)

LMArena (เดิมชื่อ Chatbot Arena) — แพลตฟอร์มอิสระที่ใช้การโหวตแบบ blind pair ค่าคะแนนจะถูกคำนวณใหม่แบบไดนามิก ค่า ณ เวลาเปิดตัวโมเดลอาจแตกต่างจากค่าปัจจุบัน

| โมเดล                      | คะแนน    | อันดับ | จำนวนโหวต | หมายเหตุ     |
|----------------------------|----------|------|-----------|-------------|
| **Gemini 3.1 Pro Preview** | 1500 ± 9 | \#3  | 4,060     | Preliminary |
| **Gemini 3 Pro**           | 1486 ± 4 | \#5  | 37,854    |             |
| **Gemini 3 Flash**         | 1473 ± 5 | \#7  | 28,847    |             |
| **Gemini 2.5 Pro**         | 1464 ± 3 | \#9  | 97,296    |             |
| **Gemini 2.5 Flash**       | 1411 ± 3 | \#64 | 96,163    |             |

Overall (ข้อมูล 24 กุมภาพันธ์ 2026)

เมื่อเปิดตัวในวันที่ 18 พฤศจิกายน 2025 Gemini 3 Pro ได้คะแนน 1501 Elo กลายเป็นโมเดลแรกที่ทำลายเกณฑ์ 1500 บน LMArena

## ระบบเฉพาะทางและตัวแทน

ระบบนิเวศของ Gemini ได้รับการขยายด้วยโมเดลและแพลตฟอร์มที่สามารถดำเนินการหลายขั้นตอนในสภาพแวดล้อมดิจิทัลและทางกายภาพ

### ตัวแทนอิสระ

- **Jules** — ตัวแทนการเขียนโค้ดอิสระที่ทำงานแบบอะซิงโครนัสใน virtual machine บนคลาวด์ที่ปลอดภัย สร้าง branch และ pull request ใน GitHub เปิดตัวสู่ open beta ในงาน Google I/O เมื่อ 20 พฤษภาคม 2025 (มีการปรับปรุงโค้ดมากกว่า 140,000 รายการในช่วงทดสอบ beta), GA — 6 สิงหาคม 2025 ในช่วงปลายปี 2025 กลายเป็นหนึ่งใน contributor ที่ใหญ่ที่สุดใน repository ภายในของ Google
- **Project Mariner** — ต้นแบบการวิจัยของตัวแทนเบราว์เซอร์สำหรับงานเว็บหลายขั้นตอน ย้ายไปยัง virtual machine บนคลาวด์พร้อมรองรับงานคู่ขนานสูงสุด 10 งานและฟีเจอร์ «Teach & Repeat» บรรลุ 83.5% บน benchmark WebVoyager ความสามารถ Computer Use ถูกย้ายไปยัง Gemini API
- **Google Antigravity** — สภาพแวดล้อมพัฒนาซอฟต์แวร์ (IDE) แบบบูรณาการสำหรับการจัดการตัวแทน AI ที่เปิดตัวในเดือนพฤศจิกายน 2025 ตัวแทนแก้ไขโค้ดอัตโนมัติ โต้ตอบกับ terminal และเบราว์เซอร์ในตัว โดยส่งคืน artifact ที่ตรวจสอบได้ (code diff) เพื่อให้นักพัฒนาอนุมัติ
- **ตัวแทน Aletheia** — ตัวแทนวิจัยคณิตศาสตร์เฉพาะทางที่สร้างบนพื้นฐาน Gemini 3 Deep Think มีเครื่องมือตรวจสอบภาษาธรรมชาติและเครื่องมือค้นหาเว็บสำหรับการตรวจสอบวรรณกรรม ในช่วงต้นปี 2026 แก้ปัญหาคณิตศาสตร์เปิดหลายข้อจากฐานข้อมูลของ Erdős อย่างอิสระ และเป็นผู้ร่วมเขียนผลงานทางวิชาการ

### ตัวแทน AI สำหรับผู้บริโภค

- **Phone Automations** — การผสานตัวแทนอิสระในระดับระบบปฏิบัติการ Android (เวอร์ชัน beta สำหรับ Pixel 10 และ Samsung Galaxy S26) ทำงานในสภาพแวดล้อมแบบ secure sandbox สามารถนำทางในแอปพลิเคชันของบุคคลที่สามโดยอาศัยการวิเคราะห์ GUI แบบภาพ
- **Gemini in Chrome (Auto Browse)** — ตัวแทนเบราว์เซอร์สำหรับการทำงานอัตโนมัติในงานเว็บหลายขั้นตอน ให้บริการแก่ผู้ใช้ Chrome ทุกคนตั้งแต่เดือนกันยายน 2025 (อัปเดตเป็น Gemini 3 ในเดือนมกราคม 2026)

### Computer Use

โมเดล **Gemini 2.5 Computer Use** ได้รับการปรับให้เหมาะสมสำหรับการจัดการกราฟิกอินเตอร์เฟซผู้ใช้ (UI) ระบบรับ screenshot และประวัติการกระทำเป็นอินพุต และสร้างพิกัด $(x,y)$ สำหรับการจำลองเคอร์เซอร์ด้วยโปรแกรม พร้อมคำสั่งป้อนข้อมูลจากคีย์บอร์ด

### Gemini Robotics

โมเดลประเภท Vision-Language-Action (VLA) และ Embodied Reasoning (ER) ที่เปิดตัวในเดือนมีนาคม 2025 สถาปัตยกรรมเหล่านี้ประมวลผลข้อมูลเชิงพื้นที่-เวลาและทำนายวิถีการเคลื่อนที่ 3 มิติของแขนกลหุ่นยนต์เป็นรูปแบบเอาต์พุตโดยกำเนิด (arXiv:2503.20020)

### โมเดล generative เฉพาะทาง (ต้นปี 2026)

- **Nano Banana 2 (Gemini 3.1 Flash Image)** — เปิดตัว 26 กุมภาพันธ์ 2026 เป็นโมเดลภาพที่ผสมผสานความเร็วของสถาปัตยกรรม Flash กับคุณภาพของ Pro รับประกันการรักษาความสอดคล้องของตัวละคร (character consistency) การสร้าง typography ภายในรูปภาพโดยกำเนิด และการผสานลายน้ำดิจิทัลแบบ SynthID พร้อมข้อมูลเมตา C2PA
- **Lyria 3** — โมเดลดนตรีที่ผสานเข้ากับแอปพลิเคชัน Gemini เมื่อ 18 กุมภาพันธ์ 2026 สร้างเพลงความยาว 30 วินาที (รวมถึงเสียงร้องและเสียงดนตรี) จาก prompt ข้อความ รูปถ่าย หรือวิดีโอ
- **Veo 3.1** — โมเดลสร้างวิดีโอ รองรับการสร้างคลิปโดยใช้รูปภาพอ้างอิงสูงสุดสามภาพ («Ingredients to Video»), การสร้าง transition ระหว่างเฟรมแรกและสุดท้ายที่กำหนดไว้, การเรนเดอร์วิดีโอแนวตั้ง (9:16) โดยกำเนิด และการ upscaling เป็นความละเอียด 4K
- **Med-Gemini** — โมเดลเฉพาะโดเมนสำหรับงานทางการแพทย์ (arXiv:2404.18416, arXiv:2405.03162)

## การประยุกต์ใช้และระบบนิเวศ

Google ผสาน Gemini อย่างลึกซึ้งในผลิตภัณฑ์สำหรับผู้บริโภคและนักพัฒนา

### ผลิตภัณฑ์สำหรับผู้บริโภค

- **แอปพลิเคชัน Gemini**: Chatbot (เดิมชื่อ Bard เปลี่ยนชื่อเมื่อ 8 กุมภาพันธ์ 2024) ที่ใช้โมเดลในตระกูล Gemini เป็น AI assistant อเนกประสงค์ ณ เดือนกุมภาพันธ์ 2026 มีผู้ใช้งานที่ใช้งานอยู่มากกว่า 750 ล้านคน การ rollout ปัจจุบันรวมถึงโมเดล 3.1 Pro การสมัครสมาชิก: **Google AI Pro** (\$19.99/เดือน แทนที่ Google One AI Premium) และ **Google AI Ultra** (\$249.99/เดือน พร้อมการเข้าถึง Deep Think, Veo 3 และฟีเจอร์ที่มีลำดับความสำคัญสูง)
- **Google Workspace**: การผสาน Gemini ใน Gmail, Docs, Sheets, Meet สำหรับช่วยเขียน วิเคราะห์ข้อมูล และสร้างเนื้อหา (รีแบรนด์จาก Duet AI)
- **Google Search**: ฟีเจอร์ **AI Overviews** สร้างคำตอบสรุปสำหรับคำถามซับซ้อนโดยอิงโมเดล Gemini เฉพาะทาง **AI Mode** ที่เปิดตัวในงาน Google I/O 2025 ให้การค้นหาเชิงลึกพร้อมความสามารถตัวแทน (การจอง, การซื้อสินค้า)
- **Android และ Pixel**: **Gemini Nano** (v3 บน Pixel 10 พร้อมชิป Tensor G5, สิงหาคม 2025) ทำงานในเครื่องบนสมาร์ทโฟน ให้การตอบสนองอัจฉริยะ การสรุปข้อความ การตรวจจับการโทรหลอกลวง และการช่วยเหลือการเข้าถึง โดยรักษาความเป็นส่วนตัวของข้อมูล ML Kit GenAI API สำหรับนักพัฒนารองรับการสรุป การตรวจทาน และการรู้จำเสียงพูดบนอุปกรณ์
- **NotebookLM**: พัฒนาจากเครื่องมือจดบันทึกไปสู่แพลตฟอร์มสร้างสรรค์ที่สมบูรณ์ เข้าร่วม Google Workspace ในเดือนมีนาคม 2025 รองรับ Audio Overviews, Video Overviews, Mind Maps, สไลด์ และอินโฟกราฟิกแบบโต้ตอบ อัปเดตเป็น Gemini 3 ในเดือนธันวาคม 2025; context window เต็ม 1 ล้าน token สำหรับการสนทนา — ตั้งแต่กุมภาพันธ์ 2026
- **Gemini Live**: ฟีเจอร์กล้องและการแชร์หน้าจอจาก Project Astra กลายเป็นบริการฟรีสำหรับผู้ใช้ Android และ iOS ทุกคน

### แพลตฟอร์มสำหรับนักพัฒนา

- **Google AI Studio และ Gemini API**: อินเตอร์เฟซหลักสำหรับการเข้าถึงโมเดล Gemini ผ่าน API ณ เดือนกุมภาพันธ์ 2026 รองรับ capability block ได้แก่: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API)
- **Vertex AI**: แพลตฟอร์มองค์กรพร้อมความสามารถด้านความปลอดภัยและการจัดการขั้นสูง
- **Google Gen AI SDK**: บรรลุ GA สำหรับ Python, JavaScript/TypeScript, Go และ Java ภายในเดือนพฤษภาคม 2025 ให้การเข้าถึง Gemini Developer API และ Vertex AI แบบรวมศูนย์ รองรับ **Model Context Protocol (MCP)**
- **Gemini CLI**: เครื่องมือ command line สำหรับการเขียนโค้ดด้วย AI ในเทอร์มินัล (เปิดตัวในเดือนมิถุนายน 2025)
- **Interactions API**: อินเตอร์เฟซรวมสำหรับโมเดลและตัวแทน (beta ตั้งแต่ธันวาคม 2025)

### วงจรชีวิต API และการจัดการเวอร์ชัน

โมเดล Gemini ใน API แบ่งเป็นประเภท **stable**, **preview**, **latest** และ **experimental** `model_id` เฉพาะและตระกูลโมเดลไม่ใช่สิ่งเดียวกัน สำหรับสถานการณ์ production การยึดมั่นกับเวอร์ชันที่ระบุและกำหนดการสิ้นสุดการสนับสนุนถือเป็นสิ่งสำคัญ ในเอกสาร API มีการเก็บรักษาทะเบียน deprecation พร้อมวันที่สิ้นสุดการสนับสนุน

เพื่อรองรับงานอิสระระยะยาวได้มีการนำมาใช้: **Session Resumption** (การจัดเก็บสถานะ session บนเซิร์ฟเวอร์นานสูงสุด 24 ชั่วโมง) และ **Context Compression** (กลไก sliding window สำหรับการบีบอัดบริบทอัตโนมัติเมื่อเกินขีดจำกัด)

ในเดือนธันวาคม 2025 Google ลด quota ของ API ระดับฟรีลงประมาณ 92% (โดยไม่มีการแจ้งล่วงหน้า) ซึ่งทำให้ชุมชนนักพัฒนาตอบสนองอย่างรุนแรง ในขณะเดียวกัน ต้นทุนการให้บริการโมเดล Gemini ลดลง 78% ตลอดปี 2025 อันเนื่องมาจากการปรับปรุงประสิทธิภาพ

## ข้อจำกัดและปัญหาที่เปิดอยู่

- **ภาพหลอนและการสร้างเนื้อหาที่ไม่ถูกต้อง (Hallucinations และ Confabulations):** โมเดลยังคงมีแนวโน้มสร้างข้อมูลที่ไม่ถูกต้องตามข้อเท็จจริง โดยเฉพาะเมื่อปิดฟีเจอร์การยึดโยง (Search Grounding) Gemini 3.1 Pro ลดระดับภาพหลอนบน benchmark SimpleQA เมื่อเทียบกับเวอร์ชันก่อนหน้า แต่ปัญหานี้ยังคงเป็นปัญหาเชิงระบบสำหรับ LLM ทุกตัว
- **การลอกเลียนแบบโดยไม่รู้ตัว (Subconscious Plagiarism):** ในการทดลองกับตัวแทน Aletheia พบปัญหาการทำซ้ำหลักฐานที่ซับซ้อนจากชุดข้อมูลการฝึก โดยนำเสนอเป็นการค้นพบอิสระ ซึ่งทำให้การตรวจสอบความแปลกใหม่ของการวิจัย AI มีความซับซ้อนมากขึ้น
- **การเสื่อมสภาพในบริบทยาว (Degradation in Long Context):** เมื่อประมวลผลบริบทขนาด 1 ล้าน token โมเดลมีความเสี่ยงต่อผลกระทบ «Lost in the Middle» — การลดความแม่นยำในการดึงข้อเท็จจริงจากตรงกลางของเอกสาร
- **ต้นทุนการคำนวณสูง:** การ inference ด้วยการตั้งค่า Deep Think สูงสุดต้องใช้เวลาและทรัพยากร (TPU) มากกว่าอย่างมีนัยสำคัญ ซึ่งจำกัดการใช้งานในแอปพลิเคชันแบบ synchronous ที่ต้องใช้เวลาจริง
- **การปฏิเสธที่เกินจริง (Over-refusals):** เนื่องจากอัลกอริทึม alignment ที่เข้มงวด โมเดลสำหรับการให้เหตุผลที่ซับซ้อนมีแนวโน้มปฏิเสธคำขอที่ถูกต้องโดยจำแนกผิดว่าเป็นอันตราย (โดยเฉพาะในบริบทของการวิเคราะห์โค้ดและความปลอดภัยของข้อมูล) model card ยังระบุถึงปัญหาโทนการปฏิเสธที่ «สั่งสอน» (preachy) มากเกินไป
- **ข้อจำกัดด้านการให้เหตุผล:** Model card ของซีรีส์ 2.5 และ 3 ระบุข้อจำกัดใน causal understanding, complex logical deduction, counterfactual reasoning รวมถึงความสามารถในการทำนายการปฏิบัติตามงบประมาณการคิดที่ไม่สมบูรณ์

## ด้านจริยธรรมและความปลอดภัย

การใช้งานโมเดล Gemini มาพร้อมกับระบบมาตรการความปลอดภัยหลายชั้น

### กรอบการทำงานทั่วไป

**Secure AI Framework (SAIF)** — แนวทาง Google โดยรวมสำหรับความปลอดภัยของระบบ AI (ประกาศในเดือนมิถุนายน 2023) ซึ่งเป็นบริบทของการพัฒนา แต่ไม่ใช่มาตรฐานเฉพาะของ Gemini **Frontier Safety Framework v3** (กันยายน 2025) ครอบคลุมโดเมน CBRN, ความปลอดภัยไซเบอร์, ML R&D, ผลกระทบจากการบิดเบือน และแนวทางเชิงทดลองต่อความเสี่ยงจาก misalignment

### มาตรการเฉพาะของ Gemini

- **Model cards** — แหล่งข้อมูลหลักเกี่ยวกับข้อจำกัดและความปลอดภัยของโมเดลเฉพาะ มีหัวข้อ Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety Model card ของ Gemini 3 Pro ยืนยันว่าโมเดลไม่ได้บรรลุระดับความสามารถวิกฤต (Critical Capability Level) ในโดเมน CBRN และความปลอดภัยไซเบอร์
- **การทดสอบอคติและความเป็นพิษ:** การวิเคราะห์และลดอคติในข้อมูลการฝึกและการสร้างเนื้อหา
- **Red Teaming:** การจำลองการโจมตีเพื่อระบุช่องโหว่และพฤติกรรมที่ไม่พึงประสงค์ การทดสอบอิสระด้าน misalignment พบ «การเพิ่มขึ้นบ้างของความตระหนักรู้ในสถานการณ์» แต่ไม่พบความเสี่ยงวิกฤต

### Safety Probes

เพื่อป้องกันการสร้างเนื้อหาที่เป็นอันตราย มีการใช้การจำแนกการ activation ที่ซ่อน เพื่อแก้ปัญหาการสูญเสียสัญญาณในบริบทยาวใช้สถาปัตยกรรม **MultiMax**: probe ดึงค่าสูงสุดจากทุกชั้น $H$ สำหรับแต่ละ token $j$ ในลำดับ $n_{i}$:

$$
f_{ext{MultiMax}}(S_{i}) = \sum\limits_{h = 1}^{H}\max\limits_{j \in \lbrack n_{i}\rbrack}\lbrack v_{h}^{o}py_{i,j}\rbrack
$$

Probe ถูกรวมกับโมเดลพื้นฐานในตัวจำแนกแบบ cascade เพิ่มความแม่นยำของการกรองด้วยต้นทุนการคำนวณต่ำ (arXiv:2601.11516)

### การทำเครื่องหมายดิจิทัล (SynthID)

ข้อมูลเสียงที่สร้างผ่าน Live API และรูปภาพ (จากโมเดล Nano Banana / Flash Image) ผ่านการทำเครื่องหมายด้วยอัลกอริทึม **SynthID** ลายน้ำที่มองไม่เห็นถูกฝังที่ระดับ pixel หรือสเปกตรัมเสียง เพื่อให้เครื่องจักรรู้จำเนื้อหาที่สร้างขึ้น โมเดล Nano Banana 2 (กุมภาพันธ์ 2026) ผสาน SynthID กับข้อมูลเมตา C2PA

### Thinking และคำถามด้านความโปร่งใส

โมเดลที่มีโหมดการคิด (ซีรีส์ 2.5/3) อาจส่งคืน **thought summaries** — สรุปย่อของการใช้เหตุผลภายใน ไม่ใช่กระแส token กลางทั้งหมด ซึ่งให้ความโปร่งใสในระดับหนึ่ง แต่ถูกวิจารณ์เนื่องจากซ่อนสาย «ความคิดดิบ» จริงๆ ไว้หลังสรุปที่ง่ายกว่า

### ด้านกฎระเบียบ

ภายใต้กรอบ **EU AI Act** (พระราชบัญญัติปัญญาประดิษฐ์ของสหภาพยุโรป) Google ได้ลงนามใน EU Code of Practice on AI (เผยแพร่ 10 กรกฎาคม 2025) ร่วมกับ OpenAI และ Anthropic Gemini ถูกจำแนกเป็นโมเดล AI วัตถุประสงค์ทั่วไป (GPAI) ที่มีความเสี่ยงเชิงระบบ ซึ่งนำมาซึ่งภาระผูกพันด้านความปลอดภัยเพิ่มเติม (มีผลบังคับใช้ตั้งแต่ 2 สิงหาคม 2025)

## สภาพแวดล้อมการแข่งขัน

ช่วงพฤศจิกายน — ธันวาคม 2025 กลายเป็นรอบการแข่งขันที่หนาแน่นที่สุดในประวัติศาสตร์ AI: Gemini 3 Pro (18 พฤศจิกายน), Claude Opus 4.5 จาก Anthropic (24 พฤศจิกายน) และ GPT-5.2 จาก OpenAI (11 ธันวาคม) ถูกเปิดตัวภายใน 24 วัน ณ เดือนกุมภาพันธ์ 2026 ไม่มีโมเดลใดครองความเป็นเจ้าในทุกหมวดหมู่: Gemini 3 Pro นำหน้าบน LMArena ด้านข้อความ ภาพ การค้นหา และหลายภาษา; GPT-5.2 นำหน้าด้านคณิตศาสตร์ล้วน (100% AIME 2025 โดยไม่มีเครื่องมือ) และ SWE-bench Pro; Claude Opus 4.5 แข่งขันบน SWE-bench Verified ในด้านราคา API Gemini ถูกกว่า GPT-5 ประมาณ 42% ในการเรียกใช้งานที่เทียบกันได้

## ตัวชี้วัดทางธุรกิจ

ตามรายงานของ Alphabet สำหรับ Q4 2025 (เผยแพร่ 4 กุมภาพันธ์ 2026): รายได้ Google Cloud — 17.7 พันล้านดอลลาร์สหรัฐต่อไตรมาส (+48% เทียบปีต่อปี); อัตรากำไรจากการดำเนินงาน — 29.9%; พอร์ตคำสั่งซื้อ Cloud — 240 พันล้านดอลลาร์สหรัฐ (เพิ่มขึ้นสองเท่าในหนึ่งปี) มากกว่า 120,000 องค์กรใช้งาน Gemini ในเดือนมกราคม 2026 Apple ประกาศแผนการผสาน Gemini เข้ากับ Siri Google ประมวลผลมากกว่า 10 พันล้าน token ต่อนาทีผ่าน API ตัวแทน AI ภายในของ Google สร้างโค้ดของบริษัทเองประมาณ 50% รายจ่ายทุน (capital expenditure) สำหรับปี 2026 วางแผนไว้ที่ 175–185 พันล้านดอลลาร์สหรัฐ (เพิ่มขึ้นเกือบสองเท่าจาก 91.45 พันล้านดอลลาร์สหรัฐในปี 2025)

## ลิงก์ภายนอก

- ดัชนีโมเดล Google DeepMind
- เอกสาร Gemini API สำหรับนักพัฒนา
- แคตาล็อกโมเดล Gemini API
- เอกสาร Gemini Thinking
- ทะเบียน deprecation โมเดล Gemini
- ดัชนี model card ของ Google DeepMind

## เอกสารอ้างอิง

### รายงานเทคนิคหลักของ Gemini

- Gemini Team, Google (2023). *Gemini: A Family of Highly Capable Multimodal Models*. arXiv:2312.11805.
- Gemini Team, Google (2024). *Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context*. arXiv:2403.05530.
- Comanici, G. et al. (2025). *Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities*. arXiv:2507.06261.

### โมเดลเฉพาะทางและการประยุกต์ใช้

- Saab, K. et al. (2024). *Capabilities of Gemini Models in Medicine*. arXiv:2404.18416.
- Yang, L. et al. (2024). *Advancing Multimodal Medical Capabilities of Gemini*. arXiv:2405.03162.
- Gemini Robotics Team (2025). *Gemini Robotics: Bringing AI into the Physical World*. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). *Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems*. arXiv:2601.22401.
- DeepMind Research Team (2026). *Building Production-Ready Probes For Gemini*. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). *Deep Think with Confidence*. arXiv:2508.15260.

### เอกสารอ้างอิง (ภาพรวมและวิธีการ)

- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. arXiv:2201.11903.
- Zhang, Z. et al. (2022). *Automatic Chain of Thought Prompting in Large Language Models*. arXiv:2210.03493.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Cai, W. et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Dai, Z. et al. (2019). *Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context*. arXiv:1901.02860.
- Ding, J. et al. (2023). *LongNet: Scaling Transformers to 1,000,000,000 Tokens*. arXiv:2307.02486.
- Yin, S. et al. (2024). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.
- Wang, X. et al. (2023). *Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey*. arXiv:2302.10035.
- Chen, Q. et al. (2025). *Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models*. arXiv:2503.09567.

### บล็อกโพสต์ทางการของ Google

- Google (2023). *Introducing Gemini: Google's most capable AI model yet*. The Keyword, 06.12.2023.
- Google DeepMind (2024). *Introducing Gemini 1.5*. The Keyword, 15.02.2024.
- Google (2024). *Introducing Gemini 2.0: A new AI model for the agentic era*. The Keyword, 11.12.2024.
- Google DeepMind (2025). *Gemini 2.0 model updates*. The Keyword, 05.02.2025.
- Google DeepMind (2025). *Gemini 2.5: Our newest Gemini model with thinking*. The Keyword, 25.03.2025.
- Google DeepMind (2025). *Google I/O 2025: Updates to Gemini 2.5*. The Keyword, 20.05.2025.
- Google (2025). *Gemini 3: Introducing the latest Gemini AI model*. The Keyword, 18.11.2025.
- The Deep Think Team (2026). *Gemini 3 Deep Think: Advancing science, research and engineering*. Google Blog, 12.02.2026.
- The Gemini Team (2026). *Gemini 3.1 Pro: A smarter model for your most complex tasks*. Google Blog, 19.02.2026.
