Wan 3.0 完整解析:阿里巴巴 30 秒 AI 影片模型的規格、定價與比較
原片講者:Alibaba Cloud

阿里巴巴在 2026 年 8 月 24 日正式推出新一代 AI 影片生成模型 Wan 3.0(通義萬相第三代),這一天剛好是它在香港完成約 102 億美元股份配售、宣布把資金投入 AI 的隔天。Wan 3.0 早在 8 月初就開放公開測試(public beta),這次是正式上線。它最受矚目的能力,是單次生成長達 30 秒的影片——是前一代 Wan2.7 的兩倍,也把「AI 影片只能做幾秒短片」這件事往前推了一大步。
這篇會完整整理 Wan 3.0 的規格、定價、和主要對手的比較、怎麼開始用,以及使用前你該知道的限制。
Wan 3.0 是什麼?
Wan(通義萬相,Tongyi Wanxiang)是阿里雲旗下的視覺生成模型家族,涵蓋文生圖、圖生圖、文生影片、圖生影片。Wan 3.0 是影片線的第三代,主打三件事:更長的單次生成、更真實的畫面與聲音、以及能吃更多種類的「參考」輸入。
和前代最大的差別,是它把「一鏡到底」變成賣點——過去要拍長片段得分好幾段再拼接,鏡頭容易斷。Wan 3.0 單次就能連續生成到 30 秒,讓連續運鏡、一鏡到底的鏡頭語言變得可行。
核心功能
- 30 秒單次生成:單次最長 30 秒(前代 Wan2.7 上限 15 秒),並支援「智慧時長建議」,會依你的提示詞推薦適合的長度。
- 最多 20 個參考(omni-reference):可同時放入最多 20 個參考素材,涵蓋圖片、影片、音訊,甚至 PDF、PPT、Excel、Word、Markdown 等文件與網頁——這是 Wan 家族第一次能把簡報、試算表直接當成影片素材。人物、場景、風格會在整支片裡保持一致。
- 多種生成模式:文生影片、圖生影片、首尾幀控制(first-and-last-frame)、參考生影片。
- 同一次生成聲音:支援音訊與多語配音同步生成,臉部微表情自然、口型與情緒對得上。
- 畫質到 1080p:輸出支援 480p、720p、1080p(目前沒有 4K)。
- 精準影片編輯:可用指令式的方式局部重繪、微調畫面。
定價
Wan 3.0 走 API 計費,依解析度按秒計價(美元):
| 解析度 | 每秒價格 | 一支 30 秒約 |
|---|---|---|
| 480p | $0.05 | $1.5 |
| 720p | $0.10 | $3.0 |
| 1080p | $0.20 | $6.0 |
也就是說,最高畫質、跑滿 30 秒的一支片,成本大約 6 美元。此外它也上架到 Pika API Club,透過該平台使用會比其他聚合服務更便宜(官方稱在 Pika API Club 上比同級競品便宜達三成左右)。
和主要對手比較
Wan 3.0 最明顯的優勢是單次生成長度。下表整理各家「單次生成」的常見上限——請注意這些數字會隨版本更新變動,且多數超長片仍需靠多鏡頭模式或後製拼接:
| 模型 | 單次生成上限 | 備註 |
|---|---|---|
| Wan 3.0 | 約 30 秒 | 文件/簡報可當參考、同步生成聲音 |
| Sora 2 | 約 25 秒 | 敘事型長片段 |
| Runway Gen-4.5 | 約 16 秒 | 多模型平台整合強 |
| Seedance 2.0 | 約 15 秒 | 主打多鏡頭序列 |
除了長度,Wan 3.0 的「文件轉影片」和「20 個 omni-reference」在同級模型裡也算少見——多數對手的參考輸入以圖片、影片為主,較少直接吃簡報或試算表。
怎麼開始用
- 到 阿里雲 Model Studio(國際站) 或 Qwen Cloud 申請 API 存取,模型 ID 為
wan3.0-video。 - 目前部署在新加坡(ap-southeast-1)與北京節點,API 採申請制、尚未完全開放。
- 準備你的參考素材(最多 20 個,可混合圖片、影片、音訊、文件、網頁),寫好提示詞,選擇解析度與長度後送出。
- 不想自己接阿里雲,也可以透過 Pika API Club 一個 API 呼叫 Wan 3.0(順便共用它上面 100+ 個其他模型)。
使用前該知道的限制
- 不開源、無公開權重:Wan 3.0 目前只提供雲端 API,沒有釋出可自行部署的模型權重,和前幾代 Wan 有開源版本的做法不同。
- API 尚未完全開放:採申請制,不是註冊就能立刻無限量呼叫。
- 沒有 4K:最高到 1080p,對要求超高畫質的商用需求可能還不夠。
- 成本要算清楚:按秒計費,1080p 跑滿 30 秒約 6 美元,量大時要注意預算。
- 地區節點:目前以新加坡、北京為主,延遲與資料落地可依需求評估。
結語
Wan 3.0 把「單次 30 秒、一鏡到底、還能拿簡報當素材」變成現實,加上同步生成聲音與多語配音,等於一個模型就能包辦不少過去要好幾套工具才做得到的事。它不開源、也還沒 4K,但在「長片段 + 多元參考」這條路上,中國模型的追趕速度確實很有感。想做長一點、鏡頭連貫的 AI 影片,Wan 3.0 值得放進口袋名單。
原片來源:https://dataconomy.com/2026/08/24/alibaba-launches-wan30-a-30-second-ai-video-generation-model/