NVIDIA GPC:把動作當文字來預測的『動作版 GPT』
原片講者:NVIDIA
你有沒有想過,ChatGPT 到底在做什麼?說穿了,它做的事其實很單純:看著前面一串字,猜下一個字最可能是什麼。就靠這個「預測下一個字」的把戲,反覆練上幾千億次,它學會了寫程式、翻譯、聊天。
那問題來了——如果「預測下一個字」可以讓機器學會語言,那能不能用同一招,讓機器學會「動作」?看著前面一連串的肢體動作,猜下一個動作該怎麼接?
NVIDIA 和 Simon Fraser University 的一篇新論文,就是在認真回答這個問題。它叫做 GPC(Generative Pretrained Controllers),你可以直接把它理解成「動作版的 GPT」。
![]()
它到底做了什麼
先講清楚定位,免得後面誤會:這是一篇 研究論文,發表在 SIGGRAPH 2026,arXiv 在 2026 年 6 月 28 日上線。作者是 Yi Shi、Yifeng Jiang、Chen Tessler、Xue Bin Peng,來自 NVIDIA 與 Simon Fraser University。它 不是 一個你現在可以下載來用的產品。
GPC 想解決的,是動作控制領域一個很老的痛點。過去在做「物理模擬角色」——想像遊戲裡那種會跑會跳、還要遵守重力和碰撞的虛擬人——的動作時,做法通常是「一個動作,訓一個模型」。你想要角色會走路,訓一個走路的控制器;想要它會後空翻,再訓一個後空翻的控制器。每個技能各自為政,彼此不通,做十個動作就是十份工。
GPC 反過來想:能不能訓「一個」模型,一次把所有動作都學會,而且之後想加新動作,直接微調就好,不用從頭來過?
結果是:可以。他們用了 超過 600 小時 的人類動作資料去做大規模預訓練,訓出來的模型在「動作追蹤/還原」上,成功率高達 99.98%。也就是說,你丟一段動作給它,它幾乎能百分之百精準地把那個動作在物理模擬裡重現出來。
把動作變成 token 是什麼意思
這裡是整篇論文最關鍵、也最像 GPT 的地方。
GPT 能處理文字,是因為文字天生就是一顆一顆離散的「詞」(token),可以一個接一個地預測。但「動作」是連續的——關節角度、速度、力道,全都是平滑變化的數字,沒有天然的「一顆一顆」。
GPC 的做法,是先用一個叫 FSQ(Finite Scalar Quantization,有限純量量化) 的技術,把連續的人類動作「切」成一格一格離散的 動作 token。你可以想像成:原本像水一樣流動的動作,被壓縮進一本有限的「動作字典」裡,每個瞬間的姿態都對應到字典裡的某一個「字」。
一旦動作變成了 token,剩下的就跟訓 GPT 幾乎一模一樣了:用 GPT 風格的 transformer,去 預測下一個動作 token。前面接了「起跳、騰空」,下一個 token 該是「翻轉」還是「落地」?模型就這樣學會了動作之間的銜接邏輯。
最後,他們再疊上 強化學習(RL) 來訓練,讓這個控制器不只是「模仿」資料,而是真的能在物理環境裡把動作穩穩做出來、還能在被推、被干擾時撐住不跌倒。整套組合下來,你就得到一個「可重用、可微調」的通用動作控制器。
為什麼這是個大突破
如果你這幾年有在追 AI,會發現一個很強的規律:凡是能套上「大規模預訓練 + 預測下一個 token」這個範式的領域,幾乎都被重寫了一遍。語言是這樣,後來圖片、語音、程式碼也都被這招吃了下來。
GPC 的意義,就是它把這個「LLM 範式」很漂亮地搬進了 動作 / motor control 這個過去被認為很吃專門技術、很難通用化的領域,而且效果好到不像實驗性質(99.98% 追蹤成功率)。
這帶來的是思維上的轉變:動作學習,也可以走「先大規模預訓練出一個什麼都會一點的底模型,再針對特定需求微調」這條路。這對遊戲角色動畫、虛擬人、物理模擬都是實打實的好消息——工作室不用再為每個新動作養一整條訓練流程,而是站在一個通用底模上做加法。
往更遠看,這種「把動作當語言來學」的思路,對未來機器人怎麼學動作,也是很有啟發性的參考。畢竟,如果動作真的能被 token 化、被預訓練,那機器人學新技能的成本,理論上也有機會被大幅壓低。
一個重要澄清:這還不是機器人
這段我要特別講,因為網路上已經有不少報導把 GPC 講成「NVIDIA 做出了會學動作的機器人」——這是延伸和誤讀。
GPC 的主戰場是「物理模擬裡的虛擬角色」(physics-based character animation),不是實體的人形機器人。 論文裡那些會後空翻、被推了還能站穩的,是跑在模擬環境裡的數位角色,不是一台你能在現實中摸到、會摔在地上的機器。
這個區別很重要。模擬環境是乾淨、可控的,沒有真實世界那些惱人的感測雜訊、馬達延遲、材質摩擦的意外。從「模擬角色能做」到「實體機器人能做」,中間還隔著一條業界公認很難跨的鴻溝(所謂的 sim-to-real gap)。
所以誠實地說:GPC 是一個「動作學習範式」上很重要的研究突破,它證明了 LLM 那套方法在動作領域行得通;但它 還不是 一個實體機器人產品,把它當成「機器人已經學會這些」來理解,是跳太快了。這種「研究很酷,但別急著把它當已上市能力」的分辨力,反而是現在資訊爆炸下最值錢的判斷。
收尾
把「動作」當成「文字」來預測——GPC 用一個聽起來有點瘋、實際上很自然的想法,把 GPT 的成功配方複製到了動作控制上,還做出了近乎完美的還原率。它不是明天就會出現在你生活裡的產品,但它很可能是「AI 學會控制身體」這條長路上,一塊被記住的里程碑。
想看它到底能讓角色做出多離譜的動作?官方專案頁有一堆影片:https://yi-shi94.github.io/gpc-page/
如果你喜歡這種「把硬核 AI 研究拆白話」的內容,想第一時間收到新的解析,留言「我要」我把整理好的重點懶人包私訊給你。