tradingkey.logo
搜尋

熱鬧的世界模型與背後的鏡花水月

證券之星2026年6月30日 05:50
facebooktwitterlinkedin

2026年6月,斯坦福的李飛飛教授發了一篇長文。這位AI界舉足輕重的學者,花了整整一篇文章的篇幅,只爲回答一個最樸素的問題——世界模型,到底是什麼。

差不多同一時間,大洋彼岸的黃仁勳正站在聚光燈下,皮衣鋥亮,嗓門洪亮。他向全世界宣佈:物理AI的時代來了。世界模型,就是打開這個時代的鑰匙——它能讓AI理解物理規律,讓機器人自主操作,讓自動駕駛汽車真正上路。

一個在臺上喊口號,一個在臺下翻字典。一個已經把世界模型講成了下一場工業革命的發動機,另一個還在爲這個詞究竟指什麼而犯愁。

這畫面,有點荒誕。但荒誕的背後,藏着一個更荒誕的事實——世界模型,大概是這兩年整個AI領域最熱鬧、也最混亂的一個詞。

命名狂歡:人人都是世界模型

世界模型熱鬧,熱鬧在它是個筐,什麼都能往裏裝。

一個能生成火焰視頻的模型,叫世界模型。一個能憑空生成可玩遊戲的語言模型,也叫世界模型。一個能精確模擬燃燒過程的物理引擎,還是叫世界模型。只要跟"世界"沾點邊,跟"模型"沾點邊,往自己腦門上貼這塊金字招牌,好像都沒毛病。

這倒也不奇怪。每一波技術浪潮來臨的時候,都會經歷這麼一段"搶帽子"的混戰。區塊鏈火的時候,白皮書裏不寫個"去中心化",都不好意思發幣;元宇宙火的時候,但凡能渲染個3D界面的,都自稱元宇宙公司。世界模型如今走的,也是這條老路。帽子先搶到手,內涵以後再填——反正聽的人也未必分得清。

李飛飛倒是想給這場混亂立個規矩。她在那篇長文裏,把市面的世界模型分成三類:渲染器只管"看起來像",生成漂亮的像素和視頻,物理對不對另說;模擬器追求結構精確,輸出的不是畫面,而是幾何數據、材質參數、碰撞網格這類東西;規劃器則負責在感知和行動之間搭橋,讓智能體行動前能預判世界的變化。

分得挺清楚。但這個分類本身,就泄露了天機——如果連"世界模型是什麼"都得用一整篇文章來釐清,那這個領域,離技術收斂還遠着呢。

智源研究院院長王仲遠從另一個角度又切了一刀。他把當前的技術路線歸爲四類:以語言爲中心的(像VLA)、以像素爲中心的(像視頻生成)、以三維結構爲中心的(像3D重建)、以視覺表徵爲中心的(像JEPA系列)。每一類都自稱世界模型,每一類離真正能理解、預測、交互物理世界的"基座模型",都還差着十萬八千里。更要命的是,這四條路之間不存在清晰的優劣排序,更不存在一個公認的"正確方向"。

大家都在趕路,但沒人知道目的地長什麼樣,也沒人知道彼此是不是在往同一個地方趕。

數據天塹:想走也沒路

概念混亂,是"不知道往哪走"。數據匱乏,則是"想走也沒路"。

訓練一個能理解物理世界的模型,需要的數據,和訓練大語言模型的數據,完全是兩碼事。大語言模型的燃料,是互聯網上幾乎無限的文本——網頁、書籍、論文、論壇帖子,抓過來就能用,幾乎白撿。可物理世界的數據呢?

一個杯子從桌邊掉下來會碎。這件事,人看一眼就懂。但要讓AI學會這個因果關係,需要的是帶有精確幾何、物理標註、動作標籤的多模態交互數據。這種東西,比互聯網視頻稀缺好幾個數量級。文本是撿來的,物理數據得一個一個去採——成本之差,天壤之別。

更麻煩的是,就算有了數據,也未必是對的數據。王仲遠坦言,真實物理世界的多模態交互數據極度匱乏,而不同技術路線對數據的需求又各不相同。以具身智能爲例,機器人在流水線上能完成特定任務,但不具備泛化性——原因就在於,它缺的是對世界常識、物理規律的通用理解。眼下世界模型所謂"成功"的應用,還侷限在自動駕駛、電子遊戲這些特定領域。而這些領域的數據規模和多樣性,遠遠撐不起一個通用世界模型。

合成數據一度被當成解藥。用物理仿真引擎和遊戲引擎生成大量虛擬數據,成本比採集真實數據低得多,聽起來挺美。但這條路,坑也不少。各種物理仿真工具固然能模擬世界,可人類自己掌握的物理知識、引擎規則、算法都還不夠完備,仿真始終到不了百分之百的真實。仿真環境裏物體的運動規律,跟真實世界之間始終隔着一層——業內管這叫"仿真到現實的鴻溝"。

AI生成的幾何體,看着沒問題,暗地裏面重疊、尺寸不對,一旦送進物理引擎一算,結果就荒謬了。用有缺陷的數據訓練模型,模型學到的也只能是個有缺陷的世界。垃圾進,垃圾出——這句計算機科學的老話,在世界模型這兒,一個字都沒過時。

架構迷思:三條路,各說各話

數據和概念之外,還橫着一道更深的問題:就算有了正確的數據、清晰的定義,世界模型該用什麼架構去搭,誰也說不準。這不只是技術選型的事,而是整個領域在根本假設上就談不攏。

眼下幾條代表性路線,各有各的算盤。

谷歌的Genie3走的是"世界模擬器"的路子,造出一個像電子遊戲般、能根據用戶輸入實時演進的交互式視頻環境。你一聲令下"下雨",整個世界就動態響應。畫面和用戶雙向奔赴,支持長時間連貫探索。聽着挺玄乎。可說到底,它的內核還是視頻生成的邏輯——它"演"得像,並沒有真正"懂"背後的物理因果。一個會畫雨的畫家,和一個懂水循環的氣象學家,終究不是一回事。

李飛飛的World Labs團隊走的是另一條——以三維結構爲中心,不妨叫它"空間路線"。他們搞出的Marble模型,能生成持久的、可下載的3D環境,用戶一句提示就能生成一個可導出的3D世界。但批評者不客氣:Marble看起來更像一條3D渲染流水線,而不是機器人的大腦。它捕捉的是"表面是什麼樣子",並沒有內置"這個世界爲什麼會這樣運轉"的物理規律。人看到斜坡上的球,知道它會滾下來;機器人要做同樣的判斷,還得知道質量、摩擦、速度這些參數。會畫球,不等於會算球。

還有一條更"哲學"的路——楊立昆主導的JEPA架構,不妨叫它"認知路線"。老爺子的核心思想是:預測下一個表徵,而不是預測下一個數據。模型沒必要浪費算力去生成像素,只需專注於捕捉那些能用於決策的世界狀態。這條路在理論上最接近認知科學裏的"心智模型"概念——大腦並不存儲世界的每一個像素,而是存一個抽象的內部表徵,用來推理和預測。想法漂亮。但漂亮的想法和能落地的工程之間,往往隔着一整個太平洋。從抽象表徵到實際行動,中間的工程鴻溝,還長着呢。

三條路,三種哲學。一條相信"看得見的就是世界",一條相信"搭得起來的就是世界",一條相信"想得到的就是世界"。誰對誰錯?現在沒人敢拍這個板。

離世界還有多遠

世界模型離世界有多遠?這問題,給不了一個簡單的數字答案。

從概念看,它還隔着一層"定義之霧"——所有人都在用同一個詞說不同的事,共識本身就遙不可及。從數據看,它還隔着一片"數據之海"——真實物理世界的交互數據,稀缺到讓最樂觀的研究者都皺眉。從架構看,它還隔着一道"範式之牆"——視頻生成、三維重建、潛空間預測,每條路都有自己的理論支撐,也都有自己的致命軟肋。

但世界模型這關,可能比當年的深度學習更難過。深度學習處理的是模式識別——從數據裏找統計規律。世界模型要處理的是因果推理——理解爲什麼物體會這樣運動、爲什麼事件會這樣發生。這兩種能力之間,隔着的也許不是幾年的技術迭代,而是某種根本性的認知範式轉換。從"找規律"到"懂因果",這一步,邁起來比想象的難得多。

(文章來源:公衆號退一步看看)

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有