2026世界人工智能大會(WAIC)在上海召開。具身智能首次升格為核心賽道,200余家企業、208款終端、300余臺真機同臺競技。在人形機器人從"空翻跳舞"轉向"拆垛上料"的行業拐點,一位華人創業者的亮相引發了格外多的關注。
【資料圖】
姜旭,OpenAI前研究員,InstructGPT、ChatGPT及GPT-4等基礎模型的核心貢獻者,2023年離開OpenAI,2024年回國在深圳創辦亮源新創。他是少數完整經歷ChatGPT關鍵技術演進周期的華人科學家之一。
"2023年離開OpenAI時,大模型的發展已經進入高度確定性的階段。大語言模型、多模態模型未來幾年的演進方向在當時已經清晰。"姜旭在WAIC期間的兩場公開分享中回顧了自己的轉向邏輯,"但我也在思考:如果人工智能要繼續發展,下一階段最大的機會在哪里?"
他的答案是具身智能。原因很簡單——人類世界由數字世界和物理世界兩部分組成。過去幾十年,互聯網積累了海量文本數據,讓基礎模型學會了理解數字世界;而物理世界中的智能,還沒有被真正釋放。
世界模型的真實瓶頸:理解與生成難以兼得
WAIC主論壇的圓桌討論中,姜旭拋出了一個行業尚未充分共識的判斷:僅有世界模型,不足以實現通用具身智能。
"過去幾年,無論是大語言模型、代碼模型,還是智能駕駛,真正實現突破都經歷了三個共同的階段——可規模化的預訓練、可規模化的對齊,以及可規模化的部署。世界模型不會是例外。具身智能本質上仍然是一個新的大模型問題。"
他進一步拆解了世界模型的核心任務。第一,預測世界的下一個狀態,對于視頻生成模型來說就是預測下一幀;第二,也是更重要的,預測下一個動作。
"如果必須在兩者之間做取舍,預測動作比預測狀態更加重要。因為我們訓練世界模型的最終目的,不是為了生成視頻,而是為了控制機器人。"
這一判斷直指當前行業的一個深層矛盾:今天主流世界模型架構,還沒有很好地同時完成"理解"與"生成"兩件事。理解本質上是一種感知能力,而生成本質上是一種重建能力。過去幾年,多模態大模型領域曾希望通過統一架構同時完成兩者,但行業已逐漸形成共識——兩者很難通過同一種表征統一完成。
"今天很多世界模型往往采用統一方式去處理狀態預測和動作預測,因此很難同時兼顧兩種能力。最終模型要么更偏向生成,要么更偏向理解。"姜旭表示,這也是亮源新創重點攻克的方向——通過架構創新和數據創新,更好地統一狀態理解和動作預測。
數據路徑:互聯網視頻是唯一具備規模化潛力的答案
具身智能領域目前面臨的最大挑戰,是數據稀缺。
大語言模型的發展路徑看起來順理成章:互聯網文本數據→規模化預訓練→模型能力提升→強化學習對齊→產品應用。但姜旭提醒,很多重大技術突破在發生之前都并非顯而易見。
"我2019年加入OpenAI時,使用互聯網規模文本數據進行預訓練本身就是一個非常具有爭議的想法。很多人并不相信,僅僅通過一個通用模型學習海量數據,就能夠超過傳統專用模型。GPT-3發布之后已經在大量NLP任務上取得突破,但整個行業真正形成共識,還是等到ChatGPT出現之后。"
類似的情況也發生在強化學習對齊領域。今天RLHF(基于人類反饋的強化學習)被視為大模型不可或缺的一部分,但在早期,這同樣是一個充滿爭議的方向——很多人認為強化學習應該主要用于機器人和游戲領域,而不是語言模型。
"所以回到具身智能,它也會經歷類似的發展過程。"姜旭的判斷是,未來實現真正通用機器人,首先需要解決規模化預訓練的問題。而互聯網視頻,可能是唯一具備規模化潛力、能夠支撐通用機器人發展的數據來源。
據估算,互聯網視頻數據規模達到百億小時級別,而通過機器人采集獲得的數據通常只有百萬小時級別,兩者之間存在數量級差距。更重要的是,互聯網視頻覆蓋了人類在各種環境、各種任務中的行為——"你能想到的人類在任何場景下完成的任何動作,都有很大概率能夠在互聯網視頻中找到。"
"預訓練本身能夠容忍大量噪聲。對于預訓練來說,噪聲并不是關鍵問題。"姜旭表示,這也是亮源新創自成立以來重點投入的技術路線。
商業化落地:高容錯場景先行
技術路線之外,落地場景的判斷同樣關鍵。
姜旭認為,具身智能本質上是大模型向物理世界的延伸,其商業化規律應該參考過去幾年大模型應用的發展路徑。AI時代最大的紅利,本質上是智能供給的紅利——它并不是因為突然出現了新的需求,而是因為過去幾十年互聯網積累了海量數據,再結合近年來算法突破,把這些數據轉化成了智能。
"因此,具身智能最先發生能力躍遷的領域,一定是互聯網已經積累了大量數據的領域。"
互聯網規模最大的數據是視頻數據,約100億小時,主要來自人們日常生活。這意味著,具身智能最早實現能力躍遷的,也更可能是日常生活場景。
但僅有能力突破還不足以實現商業成功。姜旭提出了另一個約束條件:高容錯率。
"大模型天然具有很強的泛化能力,它可以在很多場景都"做一點",但在早期往往不具備足夠高的精確性和可靠性。"
他舉了幾個例子:早期AI做PPT存在明顯幻覺,但定位是助手;代碼模型負責提供建議,由程序員最終確認;今天的視頻生成模型,很多時候也是一種創意工具。過去幾年真正成功的大模型應用,幾乎都率先落地于高容錯場景。
"具身智能也很可能遵循類似規律,首先在高容錯場景實現商業突破。"姜旭同時提醒,大模型的訓練路徑已經越來越清晰,但真正找到適合模型能力的產品形態和商業場景,并不比訓練模型本身更容易,"OpenAI在ChatGPT成功之前,也經歷了大量產品探索,其中很多都沒有成功。"
因此,對于具身智能公司而言,一個更現實、成功率更高的策略,是保持開放心態,持續探索豐富的應用場景,而不是過早假設唯一正確的商業化方向。
亮源新創的路線圖:12到18個月閉環
按照亮源新創的研發節奏,姜旭給出了一個相對具體的時間表:未來12至18個月左右,實現第一次較強的通用具身智能能力突破。
這個突破包含幾個重要環節:首先,完成一次具有一定規模的具身智能基礎模型預訓練;在此基礎上進一步開展規模化的強化學習和對齊;最后,通過規模化部署,推動數萬臺甚至十萬臺級別的部署規模。
"我們的目標是在未來一年到一年半左右,實現從規模化預訓練、規模化對齊到規模化部署的完整閉環。"姜旭表示,智能才是真正的產品,機器人只是智能進入物理世界的重要載體。真正重要的,是讓基礎模型能夠持續進入物理世界,在真實環境中學習、進化,并在規模化部署過程中持續獲取真實世界數據,形成基礎模型持續學習的數據飛輪。