跳至主要內容
科技前沿

李飛飛不等了

大語言模型的紅利期進入後半段,物理世界成了巨頭們共同看中的下一個方向。資本入場比概念更早,僅今年一季度,全球物理AI領域的融資就超過64億美元,資金明顯向世界模型和基礎模型集中。

讓AI在“腦子裏”預演物理世界、再到現實裏執行,被視作通向機器人、自動駕駛和下一代計算的必經之路。這條路上最早也最響亮的布道者是李飛飛,她那句“宇宙並非由文字構成,而是由真實的事物構成”,幾乎成了整個賽道的開場白。

這條路線剛起步,創辦它的李飛飛就帶着公司投靠了AMD。

AI的下一步,從預演世界開始

交易以約82億美元的全股票方式進行,完成後,她將出任AMD執行副總裁兼首席科學家,直接向蘇姿豐匯報。這家公司成立不過兩年多,今年2月剛完成一輪10億美元融資,投後估值約54億美元,短短七個月後,AMD開出的價格又高出了五成多。

這是AMD史上第二大收購,僅次於2022年約500億美元的賽靈思。但和賽靈思不同,World Labs沒有成熟的產品線,也沒有披露過收入數字。它的第一款商業產品Marble去年11月才正式上線,新一代模型Atlas更是在交易宣布前不到一個月才亮相。

交易宣布前不到一個月,英偉達剛剛籤約以約129億美元收購開源模型社區Hugging Face,兩大芯片巨頭在同一個月裏,先後把手伸向了模型層。

2012年,一個叫AlexNet的神經網絡在ImageNet圖像識別競賽中大幅領先,它是用英偉達GPU訓練的。那場比賽被普遍視爲深度學習時代的起點,也間接成就了英偉達此後十幾年的AI霸業。而ImageNet的創造者,正是李飛飛。如今,她選擇了AMD。

消息在美股收盤後傳出,AMD官方數據顯示,盤後股價僅微漲0.40%,隨後三個交易日累計漲幅也不到2%。一家被寄予厚望的明星公司,一筆創下紀錄的收購,資本市場的態度卻相當平靜,世界模型這條賽道,眼下還撐不起一個確定的估值。

然而,撐不起估值的一部分原因恰恰出在“世界模型”這四個字上。大語言模型擅長的是語言,它能把物理講得頭頭是道,卻未必真的“懂”我們所在的物理世界。而世界模型的核心想法,是讓AI在“腦子裏”先把世界預演一遍,再決定怎麼行動。

世界模型和遊戲引擎、物理引擎的區別也很直觀:後者是工程師一行行“寫”出來的規則,前者是AI從海量視頻和傳感器數據裏“學”出來的規律。規則精確、可驗證,但寫不完現實世界的復雜。學出來的規律理論上可以泛化到沒見過的場景,代價是不夠精確,時不時會“幻覺”。

天氣預報提供了一個現成的參照,傳統的數值天氣預報是把大氣切成網格,一格一格地解流體力學方程。過去幾年,谷歌DeepMind的GraphCast、華爲的盤古氣象等AI模型不再解方程,而是直接從幾十年的氣象數據裏學習天氣如何演變,在不少指標上已經能與傳統方法比肩,速度還快得多。AI氣象模型,本質上就是一個“只管天氣”的世界模型。

世界模型公司想做的,是把這件事從天氣推廣到整個物理世界。

不一樣的世界模型

李飛飛今年6月發文承認,計算機視覺、機器人、強化學習和生成式AI各自都說自己在做世界模型,但說的根本不是同一件事。這篇文章給出了一個分類,大致可以把市面上的世界模型分成三個層次。

渲染器根據條件生成逼真的畫面或3D場景,本質上離視頻生成和3D生成並不遠。模擬器給定一個動作,預測世界會怎麼變化,比如“機器人手往左移5釐米,杯子會不會倒”。規劃器用內部對世界的理解,直接決定下一步該怎麼做,這才是世界模型最初的學術含義。

落到具體玩家身上,騰訊混元的HY-World和World Labs的Marble主要停留在第一層,生成可以走進去、可以導出的3D世界。谷歌的Genie 3和昆侖萬維的Matrix-Game往前多走了一些,畫面會隨着用戶的操作實時變化,介於第一層和第二層之間。

以色列公司Decart則兩頭下注,Lucy實時改寫視頻畫面,偏向渲染。Oasis面向機器人和自動駕駛,偏向模擬。英偉達的Cosmos是一整套產品線,從畫面生成到物理推演都有覆蓋,重心落在機器人和自動駕駛上。Waymo和Wayve的駕駛模型,則是第二層最典型的代表。楊立昆創辦的AMI Labs直奔第三層,幹脆不生成畫面,只在抽象空間裏學習“世界如何運轉”。

不過,當前大多數商業化的“世界模型”,主要做的是第一層。昆侖萬維的Matrix-Game團隊曾把世界模型拆成三步,理解當前狀態、預測下一狀態、渲染呈現。

多數模型其實跳過了前兩步,直接去做了渲染。昆侖萬維董事長方漢倒是早在7月的世界人工智能大會上就宣布,2026年是“世界模型元年”。連AMI Labs的CEO勒布倫今年3月都對TechCrunch說過,“世界模型”會是下一個熱詞,六個月之內,每家公司都會自稱世界模型公司去融資。市場常常在用第三層的願景,給第一層的產品定價。

落地的用法有了,還都很樸素

說世界模型還停留在PPT階段,並不公平。它已經有了真實的用戶,只是用法比宣傳中樸素得多。

今年2月,Waymo發布了基於谷歌Genie 3改造的Waymo World Model,能模擬龍卷風、被淹沒的街道,甚至公路上出現一頭大象這類車隊從未真正遇到過的場景。英國自動駕駛公司Wayve 8月發布的GAIA-4,已經能把駕駛AI放進閉環:AI做出不同的決策,它“看到”的路況就隨之改變。自動駕駛之所以先行一步,原因在於數據最豐富,需求最明確,而極端場景在現實中根本沒法反復測試。

機器人領域則把它當成“數據工廠”。Agility Robotics、Figure AI、Skild AI等公司都是英偉達Cosmos的早期用戶,用它批量生成真實世界難以採集的訓練數據。內容創作端,Decart稱已有超過10萬名開發者基於其模型做產品,主要集中在電商和直播。騰訊開源的HY-World 2.0,直接瞄準遊戲地圖和關卡原型的制作。

“用不完美的數據訓練機器人”,是外界最常見的質疑:模型自己都不太懂物理,拿它生成的數據去訓練機器人,等於在教錯東西。業內人士的看法恰恰相反,合成數據的價值從來不在於“真”,而在於便宜、多樣、可控。飛行員在模擬器裏反復練習發動機失效,模擬器的手感和真飛機並不完全一樣,但這些情況在真飛機上根本不敢練。機器人也一樣,它們最缺的,恰恰是現實中採集不到的數據。

這類做法已有實證,今年ICLR上的Ctrl-World研究顯示,僅用世界模型生成的合成數據做後訓練,機器人在陌生物體和新指令上的成功率就從38.7%提升到83.4%。企業對合成數據的用法也相當清醒,英偉達的Cosmos Transfer讓傳統仿真引擎負責保證物理和幾何的準確,世界模型只負責把畫面變得逼真多樣。

大語言模型有整個互聯網的文本可以學,世界模型面對的卻是一塊空白,世上沒有一個現成的“物理互聯網”,普通視頻裏沒有力反饋、碰撞和物體交互的真實數據,而這些恰恰是機器人最需要的。

中科院院士周志華在今年7月的世界人工智能大會上點出了第二重麻煩:世界模型多步推演的誤差不是線性累加,而是按平方級放大,推得越遠,崩得越徹底。哈佛、MIT等機構聯合發布的MemoBench測的正是這類基本功,“物體恆存”,東西離開視野再回來,還在不在原處。這對人類來說近乎常識,但據報道,十個主流世界模型在這項測試中集體不及格,滿分1分,最高只拿到0.58分。

算力的賬更難算,據業內估算,世界模型所需的GPU算力是同等規模大語言模型的數倍乃至數十倍,實時生成高清畫面往往需要多卡並行。

商業閉環的難題排在最後,World Labs、Decart等頭部公司都沒有公開過營收數據,技術能跑通,不等於客戶願意持續買單。所以,今天的世界模型,更像是嵌在自動駕駛、機器人和內容生產流程裏的一項能力,而不是一個能單獨撐起一家公司的產品。這一點,也是理解AMD這筆收購的鑰匙。

蘇姿豐出手,李飛飛點頭

World Labs這邊,兩年多累計融資約12億美元,放在任何一個軟件賽道都是天文數字,但放在前沿模型賽道,並不寬裕。世界模型要處理視頻、多視角、三維幾何和實時交互,訓練和推理都比大語言模型更喫算力。

商業化同樣現實,Marble是一款相當不錯的工具,能把幾張照片變成可以漫遊、編輯、導出到Unreal和Unity的3D場景,用戶主要是遊戲、影視和VR團隊。但它屬於“渲染器”這一層,做的是一門工具生意。而李飛飛真正想做的“空間智能”,需要的是長期、不計短期回報的投入。

李飛飛在公告裏說,推進下一代AI,“需要在模型研究、系統和計算之間緊密協作”。世界模型離不開算力,與其排隊買卡,不如直接“加入”。她在官宣當天發布的公開信題爲《去尋找一個更新的世界》,取自丁尼生長詩《尤利西斯》裏那位拒絕靠岸、執意再度遠航的老水手。

“隨着公司的發展,我們的雄心也在不斷擴大”,而雄心的擴大帶來的是對算力需求的擴大,李飛飛說,“如果我們能夠與AMD攜手合作,就真的能爲我們自己、AMD以及整個生態系統,創造一個加速軟件和硬件開發之間飛輪效應的機會”。

在物理AI這件事上,AMD一直是追趕者。英偉達的Omniverse仿真平臺和Isaac機器人工具鏈經營多年,2025年初推出的Cosmos世界模型如今也已迭代到第三代。反觀AMD,此前公開發布的主要是文本和視頻模型,自己在世界模型上只做過零星嘗試,更多是以投資人的身份押注World Labs、Odyssey這樣的公司。

AMD今年連着做了四筆收購:6月買下做內存優化的MEXT,7月收編端側推理軟件團隊FastFlowLM,8月收購推理芯片公司Taalas,9月拿下World Labs。前三筆都是在推理效率和系統層面補課,World Labs是第一次押注一個連英偉達都還沒完全佔住的方向。

Taalas的做法是把AI模型直接“刻”進芯片,按它自己的說法,從拿到模型到做出芯片只需兩個月左右。現在AMD手裏又有了一個前沿模型團隊,理論上具備了一種新的可能,不再只是讓硬件去適配模型,而是由模型來定義硬件。只是世界模型幾個月就迭代一代,而芯片一旦定型就難以更改,這條路能否走通,還要打一個問號。

AMD買的不只是“看清需求的能力”

不少分析認爲,AMD花82億美元,買的是提前幾年看清AI算力需求的能力。芯片從定義到量產要三到五年,理解未來的工作負載當然重要。但如果只是想看清需求,合作就夠了:雙方從2025年起就在AMD GPU上聯合優化模型訓練和推理,李飛飛今年初還登上了AMD的CES舞臺。

花82億美元全資買下,AMD要的首先是排他性。英偉達同樣是World Labs的投資人,收購之後,這支團隊只屬於AMD。其次是補齊對標英偉達Cosmos的拼圖。更長遠看,是要拿到定義需求的話語權。

蘇姿豐在採訪中說:“你對整個端到端流程了解得越深入,就越能打造出更好的系統。這就是我們收購World Labs的原因”。談到目標,她直言:“你將同時擁有開源模型和專有模型”,而AMD的雄心,是“定義AI計算的未來”。

當年英偉達的護城河不是預測出來的,而是在AlexNet、CUDA和一代代研究者手裏“養”出來的。AMD想復制的,正是這個過程:讓下一代AI負載,從一開始就生長在自己的芯片和軟件上。

這筆交易全部用股票支付,是後來者以小博大的打法,也讓AMD的擴張高度依賴自身股價。

收購完成後,世界模型賽道的主要力量,幾乎都和一家算力巨頭綁在了一起。英偉達自研Cosmos,同時投資了World Labs、AMI Labs、Decart和Odyssey等一衆初創公司。谷歌有Genie,並已在Waymo落地。亞馬遜則用自研的Trainium芯片,把Decart和Odyssey籤成了AWS的客戶。

現在,AMD擁有了World Labs。

仍然獨立的頭部公司,如AMI、Decart、Odyssey和General Intuition,大多也已經通過融資或合作,和某個算力陣營產生了關聯。“中立”的世界模型公司,正在變成稀缺品。

對研究本身,這筆交易或許會帶來一些變化,蘇姿豐和李飛飛在交易當天的聯合受訪中都表示,AI仍處在非常早期階段,未來的競爭在於軟件與硬件的協同進化。模型與芯片的協同設計會加速,世界模型的計算特徵與大語言模型差異很大,它要同時處理大規模視頻、多視角空間信息、三維幾何和低延遲交互,當世界模型團隊第一次能直接參與定義芯片,算力這道坎有可能從硬件端得到緩解。

3D路線也拿到了“長期飯票”,李飛飛在公開信中承諾,要在AMD內部建立一個可持續數十年的前沿研究組織,並堅持提供廣泛可訪問的開放模型,不必再按融資周期趕進度,World Labs可以做更長線的研究。

About Us · 關於我們