English | Español | Português | 日本語 | 한국어 | Deutsch | Français | Türkçe | 繁體中文 | 简体中文 | Русский | العربية
Google Gemma 4 於 2026 年 4 月 2 日正式發布,是 Gemma 系列迄今最大的一次世代躍升。 這一代首次採用 Apache 2.0 開源授權(先前 Gemma 系列均使用限制性授權),提供 4 個模型尺寸(E2B、E4B、26B MoE、31B Dense),原生支援文字、圖像、影片和音訊四種模態,上下文視窗最大擴展至 256K tokens。在 AIME 2026 數學基準上,31B 模型從 Gemma 3 的 20.8% 飆升至 89.2%,程式編寫能力(LiveCodeBench)從 29.1% 躍至 80.0%,標誌著 Gemma 從「堪用」進入了「可與頂級大型模型競爭」的新階段。發布僅 48 小時內 Ollama 拉取量超 20.7 萬次,截至 4 月 10 日累計下載量已突破 4 億次。
理解 Gemma 4 的意義,需要先回溯整個系列的發展脈絡。Google 自 2024 年初開始以約半年至一年的節奏迭代 Gemma 系列,每一代都在架構、模態和開放程度上進行顯著升級。
Gemma 1(2024 年 2 月 21 日) 是 Google 首個面向開發者的開放權重模型系列,提供 2B 和 7B 兩個參數規模,採用與 Gemini 相同的技術基底。兩個月後的 4 月 9 日,專注程式碼生成的 CodeGemma 發布(2B/7B)。
Gemma 2(2024 年 6 月 27 日) 在 Google I/O 2024(5 月 14 日)上預告後正式發布,參數規模擴展至 9B 和 27B,引入分組查詢注意力(GQA)和 8 萬 token 上下文視窗。7 月 31 日補充了 2B 變體和安全評估模型 ShieldGemma。同年稍後,視覺語言模型 PaliGemma 及其升級版 PaliGemma 2 相繼發布。
Gemma 3(2025 年 3 月 12 日) 實現了多個關鍵突破:首次引入多模態能力(文字+圖像輸入),上下文視窗從 8K 大幅提升至 128K tokens,支援 140+ 種語言,提供 1B、4B、12B、27B 四個尺寸。在 LMArena 上達到 1338 Elo,效能超越許多更大的模型。同年 5 月 22 日的 Google I/O 2025 上,Google 發布了面向邊緣裝置最佳化的 Gemma 3n(E2B/E4B),引入了後來在 Gemma 4 中發揮重要作用的 Per-Layer Embeddings(PLE) 技術創新。
| 世代 | 發布日期 | 距上一代間隔 | 關鍵突破 |
|---|---|---|---|
| Gemma 1 | 2024-02-21 | — | 首個開放權重模型 |
| Gemma 2 | 2024-06-27 | ~4 個月 | 27B 參數、GQA |
| Gemma 3 | 2025-03-12 | ~8.5 個月 | 多模態、128K 上下文 |
| Gemma 3n | 2025-05-22 | ~2 個月(子版本) | 邊緣裝置最佳化、PLE |
| Gemma 4 | 2026-04-02 | ~12.5 個月 | Apache 2.0、MoE、256K、音訊 |
Gemma 4 的正式發布前約一週,一系列洩漏和暗示就已在社群中引發波瀾。
2026 年 3 月 28-29 日,LMSYS Chatbot Arena 上出現了一個代號為 "significant-otter" 的匿名模型。當使用者追問其身分時,該模型直接回答:"I am Gemma 4, a large language model developed by Google DeepMind." Reddit r/LocalLLaMA 社群使用者最先發現了這一洩漏,注意到該模型回應速度快、通過了基線能力測試,且並非推理專用模型。洩漏資訊還暗示存在 2B、4B Dense 變體和一個 120B/15B-active 的 MoE 模型(該大型模型至今尚未正式發布)。這一事件被 barnacle.ai、KuCoin 新聞、多個 AI 電子報和 Reddit 討論廣泛報導。
3 月底至 4 月初,Hugging Face 上 Google 的 "Gemma models family" 合集出現了更新——這與 Gemma 2 和 Gemma 3 發布前的模式完全一致,被社群模型觀察者標記為即將發布的訊號。
4 月 2 日凌晨(發布前數小時),Google DeepMind CEO Demis Hassabis 在 X 上發布了四顆鑽石 emoji(💎💎💎💎),隨後 Google AI Studio 和 Gemini API 負責人 Logan Kilpatrick 僅發了一個單字貼文:"Gemma." 這兩則貼文被社群廣泛解讀為發布倒數訊號,引發了一波熱烈的預發布討論。
Gemma 4 是一個基於 Transformer 的模型家族,源自 Gemini 3 的研究成果,採用混合注意力機制(交替使用局部滑動視窗注意力和全域全上下文注意力),並引入了多項前沿架構創新。
模型規格總覽:
| 模型 | 架構 | 總參數 | 有效/活躍參數 | 層數 | 上下文視窗 | 模態 |
|---|---|---|---|---|---|---|
| E2B | Dense + PLE | 5.1B | 2.3B | 35 | 128K | 文字、圖像、影片、音訊 |
| E4B | Dense + PLE | 8B | 4.5B | 42 | 128K | 文字、圖像、影片、音訊 |
| 26B A4B | MoE | 25.2B | 3.8B | 30 | 256K | 文字、圖像、影片 |
| 31B | Dense | 30.7B | 30.7B | 60 | 256K | 文字、圖像、影片 |
其中 26B A4B 是 Gemma 系列首個 MoE(混合專家)模型,每層包含 128 個專家,每 token 啟動 8 個專家加 1 個共用專家,實際推理時僅啟動約 3.8B 參數,執行速度接近 4B Dense 模型。
核心架構創新包括: Per-Layer Embeddings(PLE)為每個解碼器層提供獨立的 token 級條件訊號,而非將所有資訊前置到單一嵌入中;Shared KV Cache 讓後 N 層複用前層的鍵值狀態以節省記憶體;雙 RoPE 配置在滑動視窗層使用標準 RoPE、在全域層使用比例 RoPE(p-RoPE)以支援更長上下文;統一鍵值(Unified Keys and Values)最佳化長上下文記憶體。視覺編碼器支援可變寬高比和可配置的 token 預算(70 至 1120 tokens/圖像),音訊編碼器(僅 E2B/E4B)基於 USM 風格的 Conformer 架構,支援最長 30 秒音訊輸入。詞彙表大小為 262K tokens,支援 140+ 種語言(開箱即用 35+ 種),啟動函數為 GeGLU,正規化為 RMSNorm。
特色功能方面,Gemma 4 支援可配置的思維模式(透過 <|think|> token 可生成 4000+ token 的內部推理鏈)、原生函式呼叫與工具使用、結構化 JSON 輸出、原生系統提示(Gemma 系列首次支援 system 角色)、多步規劃的 Agent 工作流程、目標偵測與定位(原生回傳 JSON 格式邊界框座標)、文件/PDF 解析、多語言 OCR、圖表理解和手寫辨識等。
Gemma 4 在各項主流基準測試中的表現堪稱驚豔,尤其是與 Gemma 3 27B 的對比,幾乎每項指標都實現了翻倍甚至更大幅度的提升。以下為官方模型卡片公布的指標(指令微調版本,啟用思維模式):
| 基準測試 | 31B | 26B A4B | E4B | E2B | Gemma 3 27B |
|---|---|---|---|---|---|
| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% |
| AIME 2026 | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% |
| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% |
| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% |
| Codeforces ELO | 2150 | 1718 | 940 | 633 | 110 |
| MMMU Pro(視覺) | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% |
| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% |
| τ2-bench(Agent) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% |
| Arena AI 文字 Elo | 1452(#3) | 1441(#6) | — | — | 1365 |
其中幾項提升尤為突出:數學能力(AIME)從 20.8% 飆升至 89.2%,提升 68.4 個百分點;程式編寫能力(LiveCodeBench)提升 50.9 個百分點;Agent 能力(τ2-bench)提升超 60 個百分點;Codeforces ELO 從 110 躍至 2150,約 20 倍成長。31B 模型在 Arena AI 文字排行榜上位列開放模型第 3 名(美國開放模型第 1 名)。
值得注意的是,官方模型卡片使用的是 MMLU Pro(而非經典 MMLU)和 LiveCodeBench/Codeforces ELO(而非 HumanEval)作為主要評估指標,經典 MMLU 和 HumanEval 分數未在官方材料中報告。一篇第三方比較論文(arXiv 2604.07035,2026 年 4 月 8 日)對 Gemma 4、Phi-4 和 Qwen3 進行了 Dense 與 MoE 推理語言模型的精度-效率權衡分析。截至目前,Google 尚未發布 Gemma 4 的正式技術報告。
Gemma 4 的發布策略在開源模型歷史上堪稱罕見——幾乎所有主流 AI 工具和平台在 4 月 2 日同一天實現了支援,這反映出 Google 在發布前與生態夥伴進行了深度協調。
4 月 2 日首日即上線的平台和工具:
- Hugging Face:
google/gemma-4-*命名空間下上傳全部變體;截至 4 月 10 日,31B 模型下載量達 133 萬+,26B 達 105 萬+,社群已建立 1,156+ 個 gemma4 標籤模型 - Google AI Studio / Gemini API:31B 和 26B MoE 即日可用於實驗和 API 呼叫
- Vertex AI:支援自行部署端點和微調,Cloud Run 可在 NVIDIA RTX PRO 6000 GPU 上部署
- Kaggle:模型權重即日可下載,同步發起 "Gemma 4 Good Challenge"
- Ollama:以
gemma4命名提供 17 個模型標籤,截至 4 月 10 日拉取量達 180 萬+ - LM Studio:專屬模型頁面 lmstudio.ai/models/gemma-4,四個變體全部可用
- NVIDIA NIM/NeMo:免費原型設計 + NeMo Automodel 微調支援 + NVFP4 量化檢查點
- llama.cpp、vLLM、MLX、SGLang、Unsloth、Baseten、Keras、Docker:全部首日支援
4 月 2-3 日跟進上線的第三方 API 服務商: OpenRouter(31B 定價 $0.14/M 輸入、$0.40/M 輸出 tokens)、Together AI、Fireworks AI、Replicate,以及透過 Hugging Face 推理提供商接入的 Featherless AI、Scaleway、OVHcloud 等。
截至 4 月 10 日仍未支援 Gemma 4 的重要平台: Groq(4 月 3 日社群已提交功能請求但尚未實現)、AWS Bedrock(僅列出 Gemma 3,Gemma 4 需透過 SageMaker 自行託管部署)、Azure AI Foundry(同樣僅支援 Gemma 3,需手動部署)。
Gemma 4 的社群媒體熱度呈現出一條清晰的 「洩漏預熱 → 發布爆發 → 深度評測」 三階段曲線。
第一階段:預熱期(3 月 28 日—4 月 1 日)。 "significant-otter" 在 LMSYS Arena 上的洩漏首先在 r/LocalLLaMA 引發討論,隨後擴散至 X/Twitter 和 AI 新聞電子報。Demis Hassabis 的四顆鑽石 emoji 和 Logan Kilpatrick 的單字貼文進一步點燃期待。
第二階段:爆發期(4 月 2-4 日)。 發布當天,Hacker News 主帖 "Google releases Gemma 4 open models" 獲得 1306+ 點讚,多次登上首頁。AINews 追蹤的 12 個子版塊和 544 個 Twitter 帳號的活躍度評分達到 3,412 分。48 小時內 Ollama 拉取量超 20.7 萬次。llama.cpp 創始人 Georgi Gerganov(@ggerganov) 發布的 Gemma 4 26B A4B Q8_0 在 M2 Ultra 上即時影片處理達到 300 t/s 的展示成為最具病毒傳播力的技術示範。
第三階段:深度評測期(4 月 4-10 日)。 社群轉入實際部署和對比測試階段。r/LocalLLaMA 湧現大量實作文章,包括 "Gemma 4 for 16 GB VRAM" 的量化參數推薦、TurboQuant KV 快取量化實驗、Apple Silicon 上的多模態微調工具(在 HN 獲得 152 點讚)等。一個在 M3 Pro 上用 Gemma E2B 實現即時音視訊 AI 的展示在 Reddit 和 HN 同時引發關注。
中文社群方面,知乎上多個高熱帖子對 Gemma 4 進行了深入討論。新智元以 "31B 爆殺 20 倍巨頭" 為標題進行了報導。一位「大型模型話題優秀答主」的測試結論是:31B 品質與 DeepSeek V3.2 相當,僅用 Qwen3.5-27B 65% 的 token 即可達到同等輸出品質,但推理穩定性顯著低於 Qwen3.5(僅 1/全部測試題在 3 次輸出中保持一致,而 Qwen3.5 為 8 個)。此外,Gemma 4 發布 90 分鐘即被 Heretic v1.2.0 越獄(KL 散度僅 0.1522,幾乎無能力損失)的事件在知乎引發了關於 AI 安全根本侷限性的廣泛討論。
社群高度認可的五個面向: Apache 2.0 授權被普遍視為「最重要的單一變化」,消除了困擾 Gemma 1-3 的企業法律摩擦;參數效率令人印象深刻——31B 與 200B+ 模型競爭,26B MoE 僅 3.8B 活躍參數即接近 31B 品質,被稱為「可用的最佳智慧/參數比」;邊緣部署能力讓 E2B 在 2GB 記憶體中執行成為可能,「第一次讓 VRAM 不足的使用者也能在本機執行日常可用的模型」;首日生態覆蓋的廣度前所未有;與 Gemma 3 相比的效能提升被社群評價為「這不是漸進式改善,這是一個完全不同的模型」。
主要批評集中在以下幾點: MoE 推理速度慢於預期——26B A4B 在 RTX 5060 Ti 上僅約 11 t/s,而 Qwen 3.5 35B-A3B 可達 60+ t/s,MoE 路由開銷顯著;發布初期的微調工具鏈存在問題——PEFT 無法處理 Gemma4ClippableLinear 層,純文字資料需要 mm_token_type_ids 等;社群對傳聞中更大的 120B MoE 模型未能面世表示失望;音訊模態僅限小模型(E2B/E4B)而非 26B/31B 被認為是疏漏;推理穩定性和幻覺問題——一項植物學基準測試中即使啟用搜尋增強也僅獲 2.5/5 分。Redis 創始人 antirez 在 HN 上的批評引發廣泛討論:「以 ELO 分數作為主要基準指標展示是非常誤導性的。大型 Dense Gemma 4 模型在大多數基準上似乎並未超過 Qwen 3.5 27B Dense。」
與主要競品的對比共識: 與 Qwen 3.5 的比較是討論最多的話題——基準測試上兩者接近,Qwen 3.5 在 MMLU Pro(86.1% vs 85.2%)和 GPQA Diamond 上略微領先,Gemma 4 在 AIME 和 Codeforces 上領先,但 Qwen 推理速度更快、Agent 任務更可靠,一位 HN 評論者總結為「Gemma 4 感覺更好,Qwen 3.5 用起來更好」。與 Llama 4 相比,Gemma 4 在授權開放度(Apache 2.0 vs Llama 的 700M MAU 限制)和部署靈活性(從手機到工作站 vs Llama 僅伺服器級)上具有明顯優勢。與 DeepSeek V3.2 相比,知乎測試者認為 Gemma 4 31B 品質「相當」但參數成本更低。值得注意的是,31B 模型以遠少於對手的總參數量,與 Kimi K2.5(744B-A40B)和 GLM-5(1T-A32B)並列為全球頂級開放模型。
Gemma 4 不僅是一次技術升級,更是 Google 開源 AI 策略的根本轉向。從限制性授權到 Apache 2.0、從純文字到四模態、從單一 Dense 架構到 Dense+MoE 雙線並進,這些變化的疊加效應讓 Gemma 4 成為 2026 年迄今最受關注的開放模型發布事件。真正的創新不在於任何單一架構技術,而在於將 PLE、共用 KV 快取、p-RoPE、128 小專家 MoE 等已知技術的精妙組合,正如知乎一位技術分析者所言:「每個技巧單獨看都不新,但組合起來確實強。」Sebastian Raschka 的分析也印證了這一點——31B 的架構與 Gemma 3 幾乎未變,效能飛躍主要來自訓練配方和資料的改進。
展望未來,社群仍在等待三件事:傳聞中更大的 120B+ MoE 模型是否會發布、微調工具鏈的穩定性何時改善、以及 AWS Bedrock 和 Azure 等主流雲端平台的原生整合何時到位。Nathan Lambert 的判斷或許最為精準:「Gemma 4 的成敗完全取決於易用性……不是基準分數。」 距離發布剛過一週,生態尚在成熟中,但方向已經清晰——Google 終於在開放模型領域找到了自己的節奏。