Gemma (Google) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Gemma — là một họ các mô hình ngôn ngữ có sẵn tự do, được phát triển và phát hành bởi công ty Google (bộ phận Google DeepMind). Các mô hình Gemma được xây dựng trên cùng nền tảng nghiên cứu và công nghệ với họ Gemini hàng đầu, và được định vị là các phiên bản nhẹ hơn, hiệu suất cao hơn của chúng[1]. Tên gọi xuất phát từ từ Latin gemma, có nghĩa là «đá quý»[2].

Gemma thuộc danh mục open models (mô hình mở): Google công bố trọng số của các mô hình, cho phép các nhà nghiên cứu và nhà phát triển tự do sử dụng, fine-tuning và phân phối chúng, kể cả trong các dự án thương mại, với điều kiện tuân thủ các điều khoản sử dụng có trách nhiệm[2]. Đây là điểm khác biệt chính so với các mô hình Gemini, vốn chỉ có thể truy cập thông qua các API đám mây. Các mô hình Gemma có thể chạy cục bộ trên phần cứng tiêu dùng (máy tính xách tay, máy tính để bàn có GPU), chứ không chỉ trong các trung tâm dữ liệu[3].

Phát triển và các phiên bản

Họ Gemma bao gồm nhiều thế hệ mô hình, mỗi thế hệ mang lại những cải tiến về kiến trúc, hiệu suất và khả năng.

Thế hệ đầu tiên: Gemma 1

Phiên bản đầu tiên của Gemma được phát hành vào ngày 21 tháng 2 năm 2024[4]. Nó bao gồm hai mô hình văn bản dựa trên kiến trúc transformer chỉ giải mã:

  • Gemma 2B (2 tỷ tham số)
  • Gemma 7B (7 tỷ tham số)

Tại thời điểm ra mắt, Google tuyên bố rằng các mô hình này vượt trội hơn các mô hình tương tự lớn hơn đáng kể trên các benchmark chính[2]. Các mô hình gốc chủ yếu hỗ trợ tiếng Anh, nhưng được huấn luyện trên dữ liệu đa dạng, bao gồm tài liệu web, mã nguồn và bài toán toán học[1]. Cả hai mô hình đều được phát hành dưới hai dạng: cơ sở (pre-trained) và đã được fine-tuning theo hướng dẫn (instruction-tuned) để tuân theo lệnh của người dùng tốt hơn[2].

Thế hệ thứ hai: Gemma 2

Gemma 2 được công bố vào ngày 27 tháng 6 năm 2024 và mang lại những cải tiến đáng kể[1].

  • Kích thước mô hình: Các mô hình với 9 và 27 tỷ tham số đã được phát hành. Các biến thể nhỏ hơn được huấn luyện bằng phương pháp chắt lọc kiến thức từ mô hình lớn hơn để nâng cao chất lượng[5].
  • Cửa sổ ngữ cảnh: Được mở rộng đáng kể lên 80 000 token (so với 8192 trong phiên bản đầu tiên)[6][7].
  • Cải tiến kiến trúc: Các cơ chế grouped-query attention và sơ đồ attention cục bộ và toàn cục xen kẽ đã được tích hợp để xử lý ngữ cảnh dài hiệu quả[1].

Thế hệ thứ ba: Gemma 3

Gemma 3 được giới thiệu vào tháng 3 năm 2025 như bước phát triển tiếp theo của họ mô hình, với trọng tâm là tính đa phương thức và phạm vi nhiệm vụ mở rộng[6].

  • Đa phương thức: Các mô hình đã được bổ sung khả năng nhận hình ảnh và video làm dữ liệu đầu vào cùng với văn bản.
  • Kích thước và ngôn ngữ: Dòng mô hình bao gồm bốn kích thước (1B, 4B, 12B, 27B) và hỗ trợ tới 140 ngôn ngữ[6].
  • Cửa sổ ngữ cảnh: Tăng lên 128 000 token[6].

Theo dữ liệu của Google, Gemma 3 27B cho thấy kết quả ngang tầm với các mô hình mở tốt nhất thời điểm đó, chỉ đứng sau các mô hình chuyên biệt như DeepSeek-R1 trong các bảng xếp hạng[6].

Kiến trúc và đặc điểm kỹ thuật

Các mô hình Gemma dựa trên kiến trúc transformer theo cấu hình «chỉ giải mã» (decoder-only), tương tự như các mô hình GPT[7]. Điều này có nghĩa là mô hình tạo ra văn bản theo kiểu tự hồi quy, dự đoán token tiếp theo dựa trên tất cả các token trước đó. Các giải pháp kỹ thuật chính bao gồm:

  • Rotary Positional Embedding (RoPE): Thay vì sử dụng embedding vị trí tuyệt đối, RoPE được sử dụng, cho phép mã hóa thông tin vị trí một cách hiệu quả.
  • Multi-query và Grouped-query attention: Để tăng tốc và tiết kiệm bộ nhớ trong các mô hình nhỏ hơn (ví dụ: Gemma 2B), multi-query attention được sử dụng (một key/value duy nhất cho tất cả các đầu attention). Trong Gemma 2, cơ chế grouped-query attention được tích hợp, trong đó các query được chia thành các nhóm, đây là sự cân bằng giữa tốc độ và chất lượng[1][7].
  • Sơ đồ attention xen kẽ: Trong Gemma 2, một sơ đồ được triển khai trong đó các lớp với self-attention toàn cục xen kẽ với các lớp có «cửa sổ trượt» hạn chế, cho phép xử lý hiệu quả các ngữ cảnh dài[1].

Họ mô hình và các biến thể

Ngoài các mô hình cơ sở đa năng, Google đã phát hành một số phiên bản dẫn xuất của Gemma được tối ưu hóa cho các nhiệm vụ cụ thể.

  • CodeGemma: Mô hình dùng để tạo và bổ sung mã nguồn, hỗ trợ C++, C#, Go, Java, JavaScript, Python, Rust và các ngôn ngữ khác[1].
  • DataGemma: Họ các mô hình được fine-tuning để tích hợp với dữ liệu bên ngoài bằng các kỹ thuật RAG. Mô hình có khả năng thực hiện các truy vấn tìm kiếm vào cơ sở dữ liệu (ví dụ: Google Data Commons) để nâng cao độ chính xác thực tế của câu trả lời[1].
  • PaliGemma: Mô hình đa phương thức có khả năng nhận hình ảnh và văn bản làm đầu vào. Nó được thiết kế cho các nhiệm vụ hỏi đáp trực quan, chẳng hạn như mô tả hình ảnh và nhận dạng đối tượng[1].
  • RecurrentGemma: Biến thể thử nghiệm với kiến trúc hybrid Griffin, kết hợp attention cục bộ và các kết nối hồi quy tuyến tính. Điều này cho phép tăng tốc đáng kể việc tạo các chuỗi dài[7].
  • MedGemma: Phiên bản chuyên biệt của Gemma 3 dành cho lĩnh vực y tế. Bao gồm các mô hình đa phương thức (4B) và văn bản (27B) để phân tích hình ảnh y tế (phim X-quang, lát cắt) và tài liệu lâm sàng. Các mô hình được phân phối dưới dạng mở, nhưng không được thiết kế để sử dụng lâm sàng trực tiếp mà không qua xác nhận bổ sung[8].
  • DolphinGemma: Dự án nghiên cứu về việc ứng dụng công nghệ Gemma để giải mã giao tiếp của cá heo. Mô hình được huấn luyện trên nhiều năm ghi âm và được sử dụng để xác định các mẫu trong ngôn ngữ động vật[9].

Khả năng tiếp cận và ứng dụng

Các mô hình Gemma có sẵn trên các nền tảng KaggleHugging Face, đồng thời được tích hợp vào các dịch vụ Google ColabVertex AI Model Garden[2]. Để tăng tốc inference, Google hợp tác với NVIDIA đã thực hiện điều chỉnh các mô hình cho TensorRT. Các điều khoản cấp phép của Gemma cho phép sử dụng thương mại và chỉnh sửa mô hình, điều này phân biệt chúng với một số dự án mở khác. Việc phân phối được điều chỉnh bởi giấy phép Responsible AI License, đặt ra các hạn chế đối với việc sử dụng trong một số lĩnh vực nhất định (ví dụ: phát triển vũ khí) và yêu cầu các sản phẩm dẫn xuất tuân thủ các nguyên tắc sử dụng AI an toàn và có đạo đức[3].

Bảo mật và trách nhiệm

Các nhà phát triển đã chú trọng nhiều đến các vấn đề bảo mật, xét đến tính chất mở của các mô hình.

  • Lọc dữ liệu: Trong quá trình chuẩn bị các dataset huấn luyện, dữ liệu cá nhân và thông tin nhạy cảm khác đã được lọc tự động để giảm nguy cơ rò rỉ[2].
  • Alignment (Căn chỉnh): Các phiên bản instruction của mô hình đã trải qua quá trình căn chỉnh nhiều giai đoạn sử dụng các phương pháp Supervised Fine-Tuning (SFT) và RLHF (học tăng cường dựa trên phản hồi của con người) để củng cố các phong cách phản hồi ưa thích[1].
  • Red Teaming (Kiểm thử đối nghịch): Trước khi phát hành, các mô hình đã được kiểm tra chuyên sâu về khả năng chịu đựng các yêu cầu độc hại. Các chuyên gia đã cố gắng kích thích việc tạo ra nội dung nguy hiểm hoặc không mong muốn để xác định các lỗ hổng[3].
  • Bộ công cụ Responsible AI Toolkit: Cùng với các mô hình, Google đã phát hành một bộ công cụ để hỗ trợ triển khai an toàn, bao gồm tiện ích Gemma Debugger để phân tích các trạng thái nội tại của mô hình và các bộ phân loại nội dung không mong muốn[2].
  • ShieldGemma: Mô hình lọc chuyên biệt được thiết kế để ngăn chặn việc tạo ra nội dung không an toàn trong các phiên bản đa phương thức của Gemma[6].

Liên kết

  • Trang chính thức của Gemma trên trang web Google AI
  • Các mô hình Gemma trên Hugging Face

Tài liệu tham khảo

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Chú thích

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]