精華筆記

· @aihub.tw

AI

Wan 3.0 完整解析:阿里巴巴 30 秒 AI 影片模型的規格、定價與比較

原片講者:Alibaba Cloud

Wan 3.0 完整解析:阿里巴巴 30 秒 AI 影片模型的規格、定價與比較

Wan 3.0

阿里巴巴在 2026 年 8 月 24 日正式推出新一代 AI 影片生成模型 Wan 3.0(通義萬相第三代),這一天剛好是它在香港完成約 102 億美元股份配售、宣布把資金投入 AI 的隔天。Wan 3.0 早在 8 月初就開放公開測試(public beta),這次是正式上線。它最受矚目的能力,是單次生成長達 30 秒的影片——是前一代 Wan2.7 的兩倍,也把「AI 影片只能做幾秒短片」這件事往前推了一大步。

這篇會完整整理 Wan 3.0 的規格、定價、和主要對手的比較、怎麼開始用,以及使用前你該知道的限制。

Wan 3.0 是什麼?

Wan(通義萬相,Tongyi Wanxiang)是阿里雲旗下的視覺生成模型家族,涵蓋文生圖、圖生圖、文生影片、圖生影片。Wan 3.0 是影片線的第三代,主打三件事:更長的單次生成、更真實的畫面與聲音、以及能吃更多種類的「參考」輸入。

和前代最大的差別,是它把「一鏡到底」變成賣點——過去要拍長片段得分好幾段再拼接,鏡頭容易斷。Wan 3.0 單次就能連續生成到 30 秒,讓連續運鏡、一鏡到底的鏡頭語言變得可行。

核心功能

  • 30 秒單次生成:單次最長 30 秒(前代 Wan2.7 上限 15 秒),並支援「智慧時長建議」,會依你的提示詞推薦適合的長度。
  • 最多 20 個參考(omni-reference):可同時放入最多 20 個參考素材,涵蓋圖片、影片、音訊,甚至 PDF、PPT、Excel、Word、Markdown 等文件與網頁——這是 Wan 家族第一次能把簡報、試算表直接當成影片素材。人物、場景、風格會在整支片裡保持一致。
  • 多種生成模式:文生影片、圖生影片、首尾幀控制(first-and-last-frame)、參考生影片。
  • 同一次生成聲音:支援音訊與多語配音同步生成,臉部微表情自然、口型與情緒對得上。
  • 畫質到 1080p:輸出支援 480p、720p、1080p(目前沒有 4K)。
  • 精準影片編輯:可用指令式的方式局部重繪、微調畫面。

定價

Wan 3.0 走 API 計費,依解析度按秒計價(美元):

解析度 每秒價格 一支 30 秒約
480p $0.05 $1.5
720p $0.10 $3.0
1080p $0.20 $6.0

也就是說,最高畫質、跑滿 30 秒的一支片,成本大約 6 美元。此外它也上架到 Pika API Club,透過該平台使用會比其他聚合服務更便宜(官方稱在 Pika API Club 上比同級競品便宜達三成左右)。

和主要對手比較

Wan 3.0 最明顯的優勢是單次生成長度。下表整理各家「單次生成」的常見上限——請注意這些數字會隨版本更新變動,且多數超長片仍需靠多鏡頭模式或後製拼接:

模型 單次生成上限 備註
Wan 3.0 約 30 秒 文件/簡報可當參考、同步生成聲音
Sora 2 約 25 秒 敘事型長片段
Runway Gen-4.5 約 16 秒 多模型平台整合強
Seedance 2.0 約 15 秒 主打多鏡頭序列

除了長度,Wan 3.0 的「文件轉影片」和「20 個 omni-reference」在同級模型裡也算少見——多數對手的參考輸入以圖片、影片為主,較少直接吃簡報或試算表。

怎麼開始用

  1. 到 阿里雲 Model Studio(國際站) 或 Qwen Cloud 申請 API 存取,模型 ID 為 wan3.0-video。
  2. 目前部署在新加坡(ap-southeast-1)與北京節點,API 採申請制、尚未完全開放。
  3. 準備你的參考素材(最多 20 個,可混合圖片、影片、音訊、文件、網頁),寫好提示詞,選擇解析度與長度後送出。
  4. 不想自己接阿里雲,也可以透過 Pika API Club 一個 API 呼叫 Wan 3.0(順便共用它上面 100+ 個其他模型)。

使用前該知道的限制

  • 不開源、無公開權重:Wan 3.0 目前只提供雲端 API,沒有釋出可自行部署的模型權重,和前幾代 Wan 有開源版本的做法不同。
  • API 尚未完全開放:採申請制,不是註冊就能立刻無限量呼叫。
  • 沒有 4K:最高到 1080p,對要求超高畫質的商用需求可能還不夠。
  • 成本要算清楚:按秒計費,1080p 跑滿 30 秒約 6 美元,量大時要注意預算。
  • 地區節點:目前以新加坡、北京為主,延遲與資料落地可依需求評估。

結語

Wan 3.0 把「單次 30 秒、一鏡到底、還能拿簡報當素材」變成現實,加上同步生成聲音與多語配音,等於一個模型就能包辦不少過去要好幾套工具才做得到的事。它不開源、也還沒 4K,但在「長片段 + 多元參考」這條路上,中國模型的追趕速度確實很有感。想做長一點、鏡頭連貫的 AI 影片,Wan 3.0 值得放進口袋名單。

#Wan 3.0#通義萬相#阿里巴巴#AI影片#文生影片#AI video

原片來源:https://dataconomy.com/2026/08/24/alibaba-launches-wan30-a-30-second-ai-video-generation-model/

← 回所有文章