Gemini 3.7 Flash 完整解析:跑分、定價與對手比較
原片講者:Google DeepMind
Google DeepMind 在 2026 年 8 月 13 日推出了 Gemini 3.7 Flash,距離上一代 3.6 Flash 只隔了短短三週。它不是一次重新預訓練的大改版,而是在 3.6 Flash 的基礎上做「演算法層級的微調」,卻把寫程式、知識工作與網頁開發的表現一口氣拉高一截,而且價格壓在同級對手的三分之一左右。這篇文章把官方公布的規格、跑分、定價,以及和主要對手的差異,一次整理清楚。
Gemini 3.7 Flash 是什麼?
Flash 系列在 Gemini 家族裡的定位一直很明確:又快、又便宜、又夠聰明的「主力幹活型」模型。它不是拿來挑戰最頂規推理的旗艦,而是要你能整天掛著跑、批次處理大量任務也不心疼。
3.7 Flash 把重點放在三個地方:
- 軟體工程與寫程式:更高的一次通過率(first-pass accuracy),debug、修 issue、產出可上線的程式碼都更穩。
- 文件密集的知識工作:法律、金融、生技這類需要讀長文件並推理的場景,準確度明顯提升。
- 網頁開發:從需求直接生出可運作的前端,表現往上跳。
值得注意的是,官方明講這一版是「3.6 Flash 的精修」——沒有重練底模,而是改進了核心推理的演算法。三週就能端出這種進步幅度,也反映出目前低成本模型的迭代速度有多快。
核心規格
| 項目 | 規格 |
|---|---|
| 上線日期 | 2026-08-13 |
| 輸入 context | 100 萬 tokens |
| 輸出上限 | 64K tokens |
| 支援輸入 | 文字、圖片、影片、音訊、PDF |
| 工具能力 | Function calling、Search as a tool、Computer use |
| 定位 | 低成本、高吞吐的 coding / agent 主力模型 |
跑分表現
以下數字皆為 Google 官方模型頁與發表資料所公布:
| Benchmark | 測的是什麼 | Gemini 3.7 Flash |
|---|---|---|
| FrontierCode 1.1 | 程式碼品質 | 43.6%(3.6 Flash 為 34.4%) |
| DeepSWE v1.1 | 軟體工程 | 65.3%(3.6 Flash 為 49.0%) |
| Terminal-bench 2.1 | agentic 終端操作 | 85.8% |
| GDM-MRCR v2 | 128k 長文脈檢索 | 97.0% |
| Harvey LAB-AA | 法律工作流 | 90.7% |
| LVBench | 長影片理解 | 85.4% |
| OSWorld-2.0 | 電腦操作 | 47.9% |
| WebDev Arena | 網頁開發對戰 | 1588 Elo |
和前一代對照,進步最明顯的是程式與自動化:FrontierCode 從 34.4% → 43.6%、DeepSWE 從 49.0% → 65.3%、讀 PDF 的 GDP.pdf 從 22.0% → 34.0%、AutomationBench 更是從 17.0% 翻倍到 30.4%。長文脈的檢索準確率則維持在 97% 的高水準。
定價:真正的殺手鐧
Flash 這次最有感的其實是價格。Google 祭出年底前的限時導入價:
| 方案 | 輸入(每百萬 tokens) | 輸出(每百萬 tokens) |
|---|---|---|
| 限時導入價(至 2026-12-31) | $0.75 | $3.75 |
| 標準價(2027-01-01 起) | $1.50 | $7.50 |
換算下來,若以常見的 80% 輸入 / 20% 輸出比例估算,限時價的混合成本約為 每百萬 tokens $1.35。也就是說,年底前用等於打了對折——但明年就會恢復成兩倍,想省成本的要趁早。
和主要對手的比較
把 3.7 Flash 放進同級戰場,價格優勢就很明顯了:
| 模型 | 輸入 / 百萬 tokens | 輸出 / 百萬 tokens |
|---|---|---|
| Gemini 3.7 Flash(限時價) | $0.75 | $3.75 |
| Claude Sonnet 5 | $2.00 | $10.00 |
| GPT-5.6 Terra | $2.00 | $12.00 |
在混合成本上,Gemini 3.7 Flash 大約只有這兩個對手的三分之一。當然,跑分不是全部——在部分終端操作與電腦操作(computer use)類的任務上,它仍落後給更頂規的模型;但對「大量、重複、要控成本」的工作流來說,這個 CP 值很難被忽視。
怎麼開始用?
- Google AI Studio / Gemini API:直接在 API 指定
gemini-3.7-flash這一型號即可呼叫,適合開發者接進自己的產品或 agent。 - 多模態輸入:因為原生支援文字、圖片、影片、音訊、PDF,很適合拿來做「丟一份長 PDF 進去問答」「讀影片做摘要」這類知識工作。
- agent / 工具串接:內建 function calling、search、computer use,可以組成會查資料、會操作的自動化流程。
- 成本控管:搭配它 100 萬 token 的 context 與便宜的價格,特別適合需要長時間、大批次跑的任務,例如整包文件審閱、程式碼庫掃描、客服自動化。
老實說的幾個提醒(Caveats)
- 限時價會到期:$0.75 / $3.75 只到 2026 年底,明年 1 月起變成 $1.50 / $7.50,做成本估算時要把這點算進去。
- 不是全能冠軍:它強在 coding、知識工作與 CP 值;在電腦操作(OSWorld-2.0 約 47.9%)等任務上還不是頂尖,需要極致能力時仍要評估旗艦級模型。
- 命名有點反直覺:據 Axios 報導,3.7 Flash 竟然比 Gemini 3.5 Pro 更早問世——Google 的版本號這幾代跳得很快,別被數字大小誤導,實際要看官方跑分與你自己的場景測試。
- 精修而非重練:這代是在 3.6 上做演算法優化,底層能力的天花板不一定同步拉高,最好還是拿你自己的真實任務跑一輪再決定。
小結
Gemini 3.7 Flash 的意義,不只是「又一個新模型」,而是把「夠聰明」和「夠便宜」這兩件事同時往前推:程式與自動化的分數大幅提升、100 萬 token 的長 context、原生多模態,加上只有對手三分之一的價格。對每天要靠 AI 大量幹活、又想控成本的人來說,它很可能就是接下來一段時間的預設主力型號——只是別忘了,那個漂亮的價格是有期限的。