精華筆記

· @aihub.tw

AI

Fish Audio S2.1 Pro 限時免費開放!SOTA 級 TTS 語音模型,API 直接免費打到 7 月底

原片講者:Fish Audio

Fish Audio S2.1 Pro 限時免費開放!SOTA 級 TTS 語音模型,API 直接免費打到 7 月底

更新日期:2026-07-03

如果你正在做 AI 口播、有聲書、Podcast 配音,或是任何需要「把文字變成擬真人聲」的專案,這篇你一定要看完——因為現在有一個號稱業界頂尖(SOTA)的文字轉語音(TTS)模型,API 完全免費,而且期限就在眼前。

Fish Audio 最新一代語音模型 S2.1 Pro 目前開放了一個叫做 s2.1-pro-free 的免費版本,和付費版同樣的模型品質,但你一毛錢都不用付。官方公告的免費開放期原本設在 2026 年 7 月 24 日,後續延長到 7 月底(2026 年 7 月結束)。換句話說,現在你有大概一個月不到的時間,可以把這顆頂級 TTS 引擎整進你的產品裡,先跑起來、先驗證、先做出 demo,而且成本是零。

過去做 AI 配音最痛的兩件事:一是好聲音要付費,ElevenLabs 那種按字元計費的方案,量一大帳單很嚇人;二是要嘛便宜但機械感重,要嘛自然但很貴,很難兩全。這次 Fish Audio 直接把「頂級品質」和「零成本」放在同一個模型上,雖然有一些免費版的限制(下面會誠實講清楚),但對想試水溫的開發者和內容創作者來說,這是一個非常划算的窗口。

Fish Audio S2.1 Pro 免費 API 公告

這是什麼?Fish Audio S2.1 Pro 是誰

Fish Audio 是專注在語音生成的 AI 團隊,他們的前一代模型 S1 曾經在 TTS-Arena2 這個公開的語音競技排行榜上拿過世界第一,字錯率(WER)只有 0.8%、字元錯誤率(CER)只有 0.4%,實力有一定口碑。

S2 世代則做了架構升級,採用所謂的 Dual-AR(雙自迴歸) 架構,搭配上百萬小時、涵蓋 80 多種語言的訓練資料,主打「最有表現力的語音 AI」——不只是把字念出來,而是能做出笑聲、嘆氣、耳語、停頓、語氣強調這些細膩的情緒層次。

而這次的主角 S2.1 Pro,是 S2 世代的精進版本,重點在品質、延遲、吞吐量三方面全面超越前一代 S2 Pro。官方最有說服力的數據是:在真人盲測的兩兩比較(head-to-head listening evaluations)中,S2.1 Pro 對上前代 S2 Pro,拿下了 61% 的勝率——也就是聽眾在不知道哪個是哪個的情況下,超過六成的時候更偏好 S2.1 Pro 的輸出。

s2.1-pro-free 這個免費版,官方明講是「與付費版 S2.1 Pro 完全相同的模型品質」,差別只在於免費版沒有服務等級保證(SLA),定位在測試、原型開發、以及中小型團隊的場景。

規格與優勢一次看

以下把官方公布的關鍵數字整理成表格,方便你和其他 TTS 服務比較:

項目 Fish Audio S2.1 Pro 前代 S2 Pro
支援語言 83 種語言(自動偵測) 80+ 種語言
首字延遲(TTFA) 約 70ms(單一請求),標準 API 約 90ms 約 100ms
吞吐量 高併發下 2 倍以上提升,單張 H200 逾 8,000 tokens/秒 3,000+ tokens/秒
盲測勝率 對前代 61% 勝率
聲音克隆 支援(參考音檔,涵蓋全部 83 語言) 支援
情緒/語氣控制 自然語言 [bracket] 標記語法,不限固定集合 標記語法
多人對話 支援 支援

幾個值得特別點出的優勢:

  • 83 種語言、自動偵測:中文、英文、日文都在高品質梯隊,不用手動指定語言,模型自己判斷。對做多語內容的創作者很友善。
  • 約 70ms 的首字延遲(Time-to-First-Audio):這是「你按下去到第一個聲音出來」的時間,越低越適合做即時對話、AI 客服、語音助理這種需要即時反應的場景。
  • 2 倍以上吞吐量:在高併發(很多人同時打)的情況下,S2.1 Pro 的處理量比前代多一倍以上,代表批次生成有聲書、大量配音時速度更快。
  • 聲音克隆(Voice Cloning):只要提供一段參考音檔,就能克隆出該音色,而且跨全部 83 種語言都能保持自然的韻律和說話者一致性——這在免費版一樣可以用。
  • [bracket] 自然語言控制:用中括號直接寫指令來控制情緒、語氣,而且官方強調「不限於固定的一組標籤」,彈性很大。

怎麼免費用?API 實作(附程式碼)

重點來了:s2.1-pro-free 就是一個標準的 API 呼叫,你不需要改用什麼特殊端點,只要在打 Fish Audio 的 TTS API 時,把 HTTP header 裡的 model 指定成 s2.1-pro-free 就行了。

步驟大致是:

  1. fish.audio 註冊帳號,取得你的 API Key。
  2. (選用)如果要用聲音克隆,先在平台上建立/上傳你的參考音色,拿到一個 reference_id
  3. POST https://api.fish.audio/v1/tts,header 帶上你的 API Key 和 model: s2.1-pro-free

以下是官方文件提供的 Python 範例(用 httpx):

import httpx

body = {
    "text": "Hello, world!",
    "reference_id": "your_model_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <YOUR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

如果你是前端/Node.js 環境,官方也有對應的 JavaScript 版本:

import { writeFile } from "fs/promises";

const body = {
  text: "Hello, world!",
  reference_id: "your_model_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <YOUR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

可以看到重點就三個:text(要念的文字)、reference_id(要用的音色)、format(輸出格式,這裡是 mp3),然後在 header 指定 models2.1-pro-free。跑完就會拿到一個音檔寫進 output.mp3。就這麼簡單。

注意事項:免費版的限制(誠實說)

天下沒有白吃的午餐,免費一定有代價。官方對 s2.1-pro-free 的限制講得算清楚,這裡幫你如實整理,別踩雷:

  • 沒有 SLA、沒有延遲保證:免費版不提供上線時間(uptime)和首字延遲(TTFA)的保證,定位就是給你做「實驗和原型」。它是 best-effort(盡力而為),不是合約承諾。也就是說,尖峰時段可能變慢或偶爾不穩,你不能拿它當正式產品的生產環境後端。
  • 你的請求可能被留存用於改善模型:官方明說「Requests may be used to improve model quality」——你送進去的文字內容,可能會被拿來優化模型。牽涉隱私或敏感資料的內容,不要丟免費版,這點務必留意。
  • 公平使用政策(Fair Use):沒有硬性的字元上限,但官方保留對「濫用行為」進行限流(throttling)的權利。正常使用沒問題,但別想著拿它當免費的無限量生產管線狂打。
  • 商業規模限制:官方提到,年營收(ARR)超過 100 萬美元的產品,應該要聯繫官方(走付費/商業方案),免費版主要照顧的是測試者、開發者和中小型團隊。
  • 免費是限時的:目前開放到 2026 年 7 月底(原公告為 7 月 24 日,後延長)。之後要不要繼續用,就得評估付費版 S2.1 Pro——付費版才有 TTFA 和 DPA(資料處理協議)等生產級保證。

簡單講:免費版拿來測試、做 demo、驗證產品點子超棒;要正式上線、要穩定度、要資料隱私保證,就升級到付費版。 兩者模型品質一樣,你不會因為先用免費版驗證,之後正式版聲音就變差。

能拿來做什麼?

對台灣的 AI 工具愛好者、開發者和內容創作者,這波免費窗口有不少玩法:

  • 有聲書 / 電子書朗讀:83 種語言、可克隆音色,適合把長文章、小說批次轉成有聲版。2 倍吞吐量在大量生成時特別有感。
  • AI 口播 / 短影音配音:做 IG Reels、YouTube Shorts、TikTok 的旁白,不用真人進錄音室,先用免費版把整批稿子配出來。
  • Podcast / 多人對話:S2.1 Pro 支援多人對話與自然切換,可以做雙人對談形式的 AI Podcast,或把單稿變成問答對談。
  • 語音助理 / AI 客服原型:約 70ms 的低延遲,適合拿來做即時語音互動的 prototype——雖然正式上線要走付費版,但驗證階段免費用剛剛好。
  • 個人音色克隆實驗:錄一段自己的聲音當參考,做出「你的 AI 分身口播」,測試品質再決定要不要投產。

搭配你現有的內容生產流程(例如腳本先用 LLM 生成、再丟 Fish Audio 配音、最後上字幕),整條 AI 內容管線的「聲音」這一環,這個月幾乎可以零成本跑通。

結語

Fish Audio S2.1 Pro 這波 s2.1-pro-free 免費開放,對開發者和創作者來說是一個明確的時間窗口:一顆對前代盲測勝率 61%、支援 83 種語言、約 70ms 首字延遲的 SOTA 級 TTS,現在 API 直接免費打,而且免費版和付費版模型品質完全一樣

當然,免費版有它的取捨——沒有 SLA、沒有延遲保證、請求可能被留存用於訓練、且限時到 7 月底。這些限制決定了它適合「驗證與原型」而非「正式生產」。但反過來說,對於「先做出來看看效果」的階段,這幾乎是零風險、零成本的最佳選擇。

建議做法:這個月先把它接起來、跑幾個真實案例、聽聽中文/多語的實際效果,覺得好用再評估要不要在期限後轉付費版。畢竟能免費用到頂級模型的機會不多,錯過這波,下次可能就要按字元計費了。


資料來源:Fish Audio 官方部落格與開發者文件(fish.audio/blog、docs.fish.audio)。所有規格數據以官方最新公告為準,免費期限可能調整,實際使用前請至官網確認。

#AI工具#語音AI#TTS#免費資源

原片來源:https://fish.audio/blog/s2-1-pro-free-api/

← 回所有文章