精華筆記

· @aihub.tw

AI

Gemini 3.7 Flash 完整解析:跑分、定價與對手比較

原片講者:Google DeepMind

Gemini 3.7 Flash 完整解析:跑分、定價與對手比較

Gemini 3.7 Flash

Google DeepMind 在 2026 年 8 月 13 日推出了 Gemini 3.7 Flash,距離上一代 3.6 Flash 只隔了短短三週。它不是一次重新預訓練的大改版,而是在 3.6 Flash 的基礎上做「演算法層級的微調」,卻把寫程式、知識工作與網頁開發的表現一口氣拉高一截,而且價格壓在同級對手的三分之一左右。這篇文章把官方公布的規格、跑分、定價,以及和主要對手的差異,一次整理清楚。

Gemini 3.7 Flash 是什麼?

Flash 系列在 Gemini 家族裡的定位一直很明確:又快、又便宜、又夠聰明的「主力幹活型」模型。它不是拿來挑戰最頂規推理的旗艦,而是要你能整天掛著跑、批次處理大量任務也不心疼。

3.7 Flash 把重點放在三個地方:

  • 軟體工程與寫程式:更高的一次通過率(first-pass accuracy),debug、修 issue、產出可上線的程式碼都更穩。
  • 文件密集的知識工作:法律、金融、生技這類需要讀長文件並推理的場景,準確度明顯提升。
  • 網頁開發:從需求直接生出可運作的前端,表現往上跳。

值得注意的是,官方明講這一版是「3.6 Flash 的精修」——沒有重練底模,而是改進了核心推理的演算法。三週就能端出這種進步幅度,也反映出目前低成本模型的迭代速度有多快。

核心規格

項目 規格
上線日期 2026-08-13
輸入 context 100 萬 tokens
輸出上限 64K tokens
支援輸入 文字、圖片、影片、音訊、PDF
工具能力 Function calling、Search as a tool、Computer use
定位 低成本、高吞吐的 coding / agent 主力模型

Gemini 3.7 Flash 能力

跑分表現

以下數字皆為 Google 官方模型頁與發表資料所公布:

Benchmark 測的是什麼 Gemini 3.7 Flash
FrontierCode 1.1 程式碼品質 43.6%(3.6 Flash 為 34.4%)
DeepSWE v1.1 軟體工程 65.3%(3.6 Flash 為 49.0%)
Terminal-bench 2.1 agentic 終端操作 85.8%
GDM-MRCR v2 128k 長文脈檢索 97.0%
Harvey LAB-AA 法律工作流 90.7%
LVBench 長影片理解 85.4%
OSWorld-2.0 電腦操作 47.9%
WebDev Arena 網頁開發對戰 1588 Elo

和前一代對照,進步最明顯的是程式與自動化:FrontierCode 從 34.4% → 43.6%、DeepSWE 從 49.0% → 65.3%、讀 PDF 的 GDP.pdf 從 22.0% → 34.0%、AutomationBench 更是從 17.0% 翻倍到 30.4%。長文脈的檢索準確率則維持在 97% 的高水準。

定價:真正的殺手鐧

Flash 這次最有感的其實是價格。Google 祭出年底前的限時導入價:

方案 輸入(每百萬 tokens) 輸出(每百萬 tokens)
限時導入價(至 2026-12-31) $0.75 $3.75
標準價(2027-01-01 起) $1.50 $7.50

換算下來,若以常見的 80% 輸入 / 20% 輸出比例估算,限時價的混合成本約為 每百萬 tokens $1.35。也就是說,年底前用等於打了對折——但明年就會恢復成兩倍,想省成本的要趁早。

Gemini 3.7 Flash 實測

和主要對手的比較

把 3.7 Flash 放進同級戰場,價格優勢就很明顯了:

模型 輸入 / 百萬 tokens 輸出 / 百萬 tokens
Gemini 3.7 Flash(限時價) $0.75 $3.75
Claude Sonnet 5 $2.00 $10.00
GPT-5.6 Terra $2.00 $12.00

在混合成本上,Gemini 3.7 Flash 大約只有這兩個對手的三分之一。當然,跑分不是全部——在部分終端操作與電腦操作(computer use)類的任務上,它仍落後給更頂規的模型;但對「大量、重複、要控成本」的工作流來說,這個 CP 值很難被忽視。

怎麼開始用?

  • Google AI Studio / Gemini API:直接在 API 指定 gemini-3.7-flash 這一型號即可呼叫,適合開發者接進自己的產品或 agent。
  • 多模態輸入:因為原生支援文字、圖片、影片、音訊、PDF,很適合拿來做「丟一份長 PDF 進去問答」「讀影片做摘要」這類知識工作。
  • agent / 工具串接:內建 function calling、search、computer use,可以組成會查資料、會操作的自動化流程。
  • 成本控管:搭配它 100 萬 token 的 context 與便宜的價格,特別適合需要長時間、大批次跑的任務,例如整包文件審閱、程式碼庫掃描、客服自動化。

老實說的幾個提醒(Caveats)

  • 限時價會到期:$0.75 / $3.75 只到 2026 年底,明年 1 月起變成 $1.50 / $7.50,做成本估算時要把這點算進去。
  • 不是全能冠軍:它強在 coding、知識工作與 CP 值;在電腦操作(OSWorld-2.0 約 47.9%)等任務上還不是頂尖,需要極致能力時仍要評估旗艦級模型。
  • 命名有點反直覺:據 Axios 報導,3.7 Flash 竟然比 Gemini 3.5 Pro 更早問世——Google 的版本號這幾代跳得很快,別被數字大小誤導,實際要看官方跑分與你自己的場景測試。
  • 精修而非重練:這代是在 3.6 上做演算法優化,底層能力的天花板不一定同步拉高,最好還是拿你自己的真實任務跑一輪再決定。

小結

Gemini 3.7 Flash 的意義,不只是「又一個新模型」,而是把「夠聰明」和「夠便宜」這兩件事同時往前推:程式與自動化的分數大幅提升、100 萬 token 的長 context、原生多模態,加上只有對手三分之一的價格。對每天要靠 AI 大量幹活、又想控成本的人來說,它很可能就是接下來一段時間的預設主力型號——只是別忘了,那個漂亮的價格是有期限的。

#Gemini#Google DeepMind#AI 模型#coding#LLM#Gemini 3.7 Flash

原片來源:https://deepmind.google/models/gemini/flash/

← 回所有文章