Gemini 3.5 Transcribe 完整解析:Google 新一代語音轉文字,自動刪贅字、分講者、85 種語言
原片講者:Google DeepMind
更新日期:2026-08-28
如果你每天都在做會議記錄、剪 Podcast、上字幕,或是任何需要「把聲音變成文字」的工作,這篇你會想看完——因為 Google DeepMind 在 2026 年 8 月 26 日推出了新一代語音轉文字模型 Gemini 3.5 Transcribe,而它最大的突破,是不再把語音當成單純的「訊號處理」,而是用推理去理解你到底在說什麼。
換句話說,它不只是把聲音一個字一個字打出來,而是會自動幫你刪掉「嗯…」「那個…」「啊…」這些贅字、修正你講到一半改口的句子,直接輸出一份乾淨、可讀的逐字稿。這篇文章會完整拆解它的規格、能力、兩個版本差異、開放平台,以及跟老牌開源方案 Whisper 的比較,最後給你一份實務上手指南與誠實的注意事項。
Gemini 3.5 Transcribe 是什麼?
Gemini 3.5 Transcribe 是 Google DeepMind「Gemini Audio」系列底下、專門做語音轉文字(Speech-to-Text,STT)的最新模型。它建立在 Gemini 的音訊理解能力之上,主打「精準」與「智慧」——不只是聽得準,還要聽得懂。
傳統的語音辨識模型,本質上是把一段聲波對應到最可能的文字序列;遇到你口誤、重複、夾雜語助詞,它就照實打出來,你事後還得自己整理。Gemini 3.5 Transcribe 的做法不一樣:它會像一個懂上下文的助理一樣,推理出你真正想表達的內容——自我更正的地方幫你修好、填充詞(filler words)幫你拿掉、格式幫你排好,甚至能在辨識的同時,透過函式呼叫(function calling)把後續任務(例如產生圖片、分析檔案)交給其他 Gemini 模型接手。
這也是它跟 Google 前一代語音模型 Chirp 3 最大的差別:從「轉錄工具」升級成「能理解語意的轉錄代理」。
核心功能一次看
- 智慧轉錄(Smart transcription):自動去除贅字與口誤、修正自我更正的句子,輸出乾淨可讀的文字。
- 85+ 種語言自動偵測:以句子為單位偵測語言,支援多語言之間的「語碼轉換」(一句話中英夾雜也能處理)。
- 講者分離(Speaker diarization):能區分並標註不同的講者是誰,適合會議、訪談、多人對話。
- 字級時間戳(Word-level timestamps):每個字都標上時間,方便做字幕與精準定位。
- 自訂詞彙(Custom vocabulary / speech biasing):可以事先給它品牌名、專業術語、人名,避免打錯。
- 數字與代碼精準辨識:電話號碼、郵遞區號、帳號 ID 這類英數混合內容也抓得準。
兩個版本:即時串流 vs 錄音檔
Gemini 3.5 Transcribe 提供兩個介面,對應兩種常見情境:
| 版本 | 模型名稱 | 適用情境 | 特性 |
|---|---|---|---|
| 即時串流 | gemini-3.5-transcribe-live |
直播、即時字幕、語音助理 | 低延遲(次秒級),透過 Live API 串流回傳 |
| 錄音檔處理 | gemini-3.5-transcribe |
會議錄音、Podcast、訪談逐字稿 | 支援講者標註與時間戳,處理已錄好的音檔 |
簡單記:要當下就要字,用 live 版;要把一段錄音變成完整逐字稿,用一般版。
效能:準確度與延遲
根據 Google DeepMind 官方公布的數字,Gemini 3.5 Transcribe 在 FLEURS 多語言基準(主要語系)上的字錯率(WER,Word Error Rate,越低越好)表現如下:
| 指標 | 數值(FLEURS 主要語系) |
|---|---|
| 即時串流 WER | 約 5.50% |
| 非串流(錄音)WER | 約 5.04% |
延遲方面,根據多家外媒報導,官方稱其延遲較前一代 Chirp 3 降低約 70%,這對即時字幕、語音互動這類需要「話音剛落、字就出來」的應用非常關鍵。
需要提醒的是:WER 會因語言、口音、錄音品質、專有名詞密度而有明顯差異,上面的數字是特定基準測試下的結果,不代表你在任何場景都能拿到同樣的準確度——這也是為什麼「自訂詞彙」功能很重要。
Gemini 3.5 Transcribe vs OpenAI Whisper:怎麼選?
在開源世界,OpenAI 的 Whisper(large-v3)一直是語音轉文字的參考標竿。兩者定位其實不同,這張表幫你快速判斷:
| 面向 | Gemini 3.5 Transcribe | OpenAI Whisper large-v3 |
|---|---|---|
| 授權 | 閉源、雲端 API | 開源、可本地部署(MIT 授權) |
| 語言數 | 85+ 種自動偵測 | 99 種 |
| 即時串流 | 原生支援(live 版) | 原生不支援,需外掛工具 |
| 講者分離 | 原生內建 | 不內建,需搭 WhisperX / pyannote 等 |
| 智慧修正贅字 | 內建(用推理去除口誤、填充詞) | 無,照實轉錄 |
| 資料落地/隱私 | 走 Google 雲端 | 可完全本地執行,資料不出機 |
| 費用 | 依 Gemini API 計費 | 模型免費,自負算力成本 |
怎麼選? 如果你要的是開箱即用、原生就有講者分離與即時串流、還能自動整理口語,Gemini 3.5 Transcribe 省下大量後處理工。如果你在意資料隱私、要完全本地執行、或想零 API 費用自己養一套,Whisper(搭配 WhisperX 補上時間戳與講者分離)仍是很強的開源選擇。
哪裡可以用?
Gemini 3.5 Transcribe 已陸續在多個 Google 平台上線,包含:
- Google AI Studio:開發者可直接試用與串接。
- Gemini API:以
gemini-3.5-transcribe/gemini-3.5-transcribe-live兩個模型提供。 - Gemini App(含 macOS 版)。
- Gboard:Android 輸入法的語音輸入(Rambler)已開始採用它。
- Google Workspace / Enterprise Agent Platform 等企業產品線。
換句話說,你不一定要寫程式才能享受到它——用 Gboard 打字、用 Gemini App 的人,體感上就會發現語音輸入變聰明了。
實務上手:三個常見用法
- 會議 / 訪談逐字稿:用錄音檔版本,開啟講者分離,直接得到「誰說了什麼」的結構化逐字稿,省去手動標人。
- 影片字幕:靠字級時間戳,自動生成時間軸精準的字幕,再稍微校對即可。
- 即時字幕 / 語音助理:用 live 版接 Live API,做直播即時字幕或語音互動介面,延遲低到體感順暢。
搭配「自訂詞彙」,先把你這一集會出現的人名、產品名、專業術語餵進去,準確度會再上一個台階。
誠實的注意事項
- 這是雲端服務:音訊會送到 Google 處理,對隱私、合規要求高的內容(醫療、法律、機敏會議)要先評估資料政策,必要時考慮可本地執行的 Whisper。
- 準確度非絕對:重口音、吵雜環境、大量專有名詞仍可能出錯,正式用途務必人工校對。
- 費用會累積:API 依用量計費,長時間、大量音檔的成本要先估算。
- 定價未逐項公開:本文撰寫時,官方未單獨公布每分鐘/每 token 的細部價格,實際費用請以 Gemini API 官方定價頁為準——不要照抄任何來路不明的數字。
小結
Gemini 3.5 Transcribe 把語音轉文字從「聽寫」推進到「聽懂」:85+ 語言自動偵測、原生講者分離、字級時間戳、自訂詞彙,再加上會自動整理口語的智慧修正,讓它在會議記錄、字幕、Podcast、即時互動這些場景幾乎是即插即用。如果你重視隱私與本地部署,開源的 Whisper 仍是好選擇;但如果你要的是省事、準確、又能即時,這顆新模型很值得排進你的工具箱。
資料來源:Google DeepMind(Gemini Audio / AI transcription 官方頁面)、Google AI for Developers(Gemini API 文件)、9to5Google、The Decoder 等公開報導。所有數字以官方頁面為準。
原片來源:https://deepmind.google/models/gemini-audio/ai-transcription/