Meta Muse上線兩週使用者破百萬,祖克柏坦言Llama 4失利是最可怕時刻,並透露5吉瓦叢集正暴力破解AGI。
(前情提要:AI 幫你打電話屢遭結束通話,Meta Muse 竟悄悄找真人代打?)
(背景補充:GitHub 爆紅:144個AI員工職位 (12個部門) 開源免費用,各有性格、工作流與 KPI)
三年前,Meta CEO 祖克柏 在Joe Rogan節目上說過,有一天人們戴上眼鏡、AI Agent就會隨之出現。如今,這一幕或正在發生。
Meta推出的個人AI Agent——Muse上線兩週使用者即達數百萬,祖克柏在9月25日一檔訪談節目中表示:「每隔幾年我們才能遇到這種情況。」他將Muse的早期反響定性為「一齣手就是全壘打」——這在Meta產品歷史上屬於少數。
與此同時,他宣布Muse將整合至全線Ray-Ban智慧眼鏡,使用者無需再說「嘿Meta」,而是可以自定義喚醒詞直接呼叫自己的個人AI Agent。
多年來被外界視為三場獨立豪賭的元宇宙、智慧眼鏡和大模型,正在Meta內部產品層面加速合流。
在這場訪談中,祖克柏還坦承了Llama 4失敗是「最可怕的時刻」,並透露Meta正在建設5吉瓦級訓練叢集,認為足夠大的算力可「暴力破解」AGI。
Muse為何能「一齣手就是全壘打」
Muse的起點,是祖克柏和團隊成員Nat與Alex坐在一起,用開源工具在家裡「拼湊」出一個早期版本。
「我們意識到,這是一種神奇的體驗,」祖克柏說,「如果我們能把它做成任何人都可以用——不需要自己買Mac Mini、不需要在終端裡折騰——那麼這將是數十億人想用的東西。」
這句判斷,驅動了此後整套研發邏輯:不只是訓練模型,而是從模型、腳手架、到Agent的「心跳」機制全棧自研——Agent會定期自動喚醒,檢查使用者目標,主動推進待辦事項。
上線後的資料印證了這一判斷。兩週,數百萬使用者。
個人AI:重點是執行、記憶與「判斷力」
對於個人AI與通用AI的差別,祖克柏將當前競爭焦點概括為讓模型成為更好的Agent。
「過去一年最大的事情,基本上就是程式設計Agent。」他說,程式設計能力很重要,因為即使使用者沒有直接寫程式碼,「你的Muse也會在後臺一直為你寫程式碼,去完成各種事情」。
但他認為,個人Agent不能只具備編碼或任務執行能力,還需要理解隱私邊界和社交語境。
祖克柏舉例稱,使用者讓Muse預訂餐廳時,Agent可能知道使用者存在過敏情況或懷孕等資訊,但並不意味著這些資訊應該被自動披露。「你會希望它完成任務,同時儘可能少地披露資訊。」
他稱,這種能力屬於人類通常具備的「基本社交技能或常識」,但如果只是訓練編碼Agent,許多公司並未將其納入模型能力範圍。
「我們訓練的是整個模型,而不是拿別人的現成模型,再在外面搭一個框架和Agent。」祖克柏說。Meta還在產品層面加入記憶、任務追蹤、虛擬角色動畫和即時語音互動等功能。
在個性化方面,他表示,Meta並不認為AI應該只有一種固定人格。「很多實驗室都在關注怎樣把人格調到正確狀態,但我從來不認為人格只有一個正確答案。」
他稱,Muse允許使用者修改頭像、聲音和基礎性格,模型設計目標是具備較高的可操控性。「你可以定義自己希望如何與它互動,這對個人Agent很重要。」
每個Agent都有自己的「電腦」
Muse區別於其他AI產品的核心基礎設施之一,是Meta為每個Agent單獨配備了一臺安全虛擬機器(Secure VM)。
祖克柏解釋了為什麼這是必要的:
你的Agent會瞭解你很多敏感資訊。我們不認為這些資訊應該跟所有人的資料混在一個池子裡。
他把Muse Secure VM比喻為「放在你桌子底下的那臺只屬於你的電腦」——使用者資料加密儲存,密碼等敏感憑證透過獨立安全模組管理,Agent本身無法直接讀取。
在此基礎上,Meta還設計了「Sentinel」安全Agent,專門監控進出Muse的資料流,一旦檢測到異常或高風險操作,會直接攔截並提示使用者授權。
元宇宙、智慧眼鏡與Agent,三條路線正在匯合
祖克柏在訪談中透露,Muse將全面接入Ray-Ban系列智慧眼鏡,並對現有互動方式做出升級。
目前的眼鏡是「單輪對話」體驗——說一句,得一個回覆,結束。接入Muse之後,眼鏡變成Agent的前端入口:使用者開口,後端Muse在安全虛擬機器裡持續工作,完成任務再反饋。
對於眼鏡的產品路線,他描述了一條清晰的硬體梯隊:
- 無攝像頭的純音訊眼鏡:已搭載Muse,可處理通話、音樂、語音任務
- 帶小顯示屏的Meta Ray-Ban:已發布,具備基礎視覺反饋
- 全視場角全息AR原型:已發布,祖克柏稱「會非常令人興奮」
Muse為何能一齣手就全壘打
他稱,Meta在眼鏡上的長期投入,使公司在AI Agent成熟後處於較有利的位置。Meta正在將Muse及更多AI功能引入眼鏡產品,而過去相對更強調「臨場感」的元宇宙技術仍在繼續推進,只是當前更多資源轉向了Muse和智慧眼鏡的AI功能。
對於虛擬形象,祖克柏稱,Meta此前需要透過房間級裝置、多角度掃描以及企業級GPU環境,生成較高質量的寫實化身;目前,使用者透過少量照片即可完成設定,相關能力已可執行於一副VR眼鏡中。
展望2030年,祖克柏稱,元宇宙的核心願景始終是融合物理世界和數字世界。他舉例稱,未來人們可以線上下與透過全息影像接入的朋友共同參與活動;在工作場景中,人類與多個Agent也可以共同參與群聊或會議,Agent可以以全息形象或其他具身化形式出現。
「最可怕的時刻」:Llama 4的失誤
並非所有押注都一帆風順。祖克柏在訪談中罕見地直接談及了Llama 4的失敗。
Llama 4之後,那是最可怕的時刻……我以為我們在正軌上,但我們沒有。這是一個相當大的負面意外。
他把問題歸結為團隊結構的根本性錯誤:
我按照Instagram推薦系統或廣告系統那種方式來組建團隊——幾百上千人並行推進。但訓練語言模型需要的是一支緊密協作的小團隊,把它當作一個群體科學專案來做。每個席位都極為寶貴。
由此,Meta徹底重組,從業內廣泛引入頂尖人才,成立Meta超級智慧實驗室(Meta Super Intelligence Lab,MSL)。祖克柏表示,新一代模型即將發布,但不會在Connect大會上公布。
算力路線:暴力破解AGI,5吉瓦專案在建
談及通往AGI的技術路徑,祖克柏給出了一個直接的判斷。
我不確定還需要什麼根本性的架構突破……我認為我們已經大致知道配方了。如果你能建造一個足夠大的超級計算機叢集,就可以暴力破解,到達那裡。
目前Meta的算力擴張路線:俄亥俄州超過1吉瓦的叢集已基本投入使用,用於訓練下一代模型;路易斯安那州5吉瓦級叢集正在建設中。
他表示,「當你擁有多吉瓦叢集進行訓練時,你基本上就會得到某種接近AGI乃至超級智慧的東西。」
不過他也補充,當前算力驅動路線並不意味著架構研究不重要——
人腦只消耗約10瓦,而我們的系統可能比它低效一百萬倍。如果把大規模算力和架構突破結合起來,才能真正領先。
對齊,不是負擔,是產品必須解決的問題
祖克柏對AI安全的態度很務實——他不把它視為監管壓力,而是產品能否成功的前提。
如果你讓Muse做一件事,它卻做了相反的事,誰還會用它?我們需要讓模型不只是理解你的具體指令,還要理解你的意圖和你的價值觀。
「Muse要觸達十億使用者,我們就必須解決對齊問題,或者說在這上面取得非常大的進展。」他說。
對於訓練過程中的安全邊界,他用了一個類比:「就像父母給孩子立規矩——如果它透過修改系統配置來’完成’一道程式設計題,我要告訴它:不,我讓你去學解題方法,不是讓你找捷徑繞過去。」

個人AI:重點在執行與判斷力
訪談全文如下:
大舉押注
這位是馬克·祖克柏。22年前,他構建了一個連線數十億人、永遠改變了世界的社交網路。而如今,他決定建造更宏大的事物。為此,他正在元宇宙、智慧眼鏡和人工智慧領域大舉押注。多年來,懷疑者認為這是三場各自獨立、不可能成功的賭注,但他們忽略了更宏觀的圖景——因為當下,這些押注正在匯聚,共同創造出一種全新的超級智慧。
今天,我們將向大家呈現這一切,我也將向馬克提出一些他從未被問過的問題,傾聽他對未來的願景,讓您能夠提前布局,構建下一件大事。
馬克: 謝謝,很高興來這裡。
馬克: 好傢伙,那比我自己看的還多。
馬克: 好的。這些事情我們已經做了很長時間了。AI方面,作為一家公司,我們幾乎從創立之初就在做了——第一版新聞資訊流在某種程度上就是一個機器學習產品。然後我們大約在15年前建立了AI研究實驗室。
但現在我們進入了新階段——大約一年多前,我們啟動了Meta超級智慧實驗室。這是一次相當徹底的研究重啟,從整個產業引進了大量優秀人才,令人振奮。目前,我們看到模型越來越好,下一代模型即將發布,不過不是在Connect大會上宣布。此外,我們還有Muse個人助理,目前來看反響非常好。
在構建這些東西的時候,你其實並不確定結果如何。我們自己是喜歡的。早在今年年初,我就在家裡用自己的方式把Open Claw拼湊起來,感受這個東西是怎麼運作的,以及怎樣才能把它打造成一種任何人都能使用的神奇體驗。
基本上,當我們——我、Nat和Alex——坐在一起,意識到這是一種神奇的體驗,並且如果能把它打造成一個開箱即用的版本,讓那些不懂技術、不想去自己安裝Mac Mini、不想進終端折騰、也不想在出問題時除錯的普通人也能用的時候,我就覺得,這將會是數十億人都想要使用的東西。
從那以後,我們一直在圍繞這個目標努力:專門為它調優模型,不僅構建了助理本身和執行框架,還構建了為每個助理提供獨立計算環境的技術——我們為此構建了整套Muse安全虛擬機器。
我們內部一直覺得這很特別,內部人員也很喜歡,但你永遠不知道產品發布後大家會怎麼反應。偶爾會出現一鳴驚人、開門紅的情況,但大多數時候你會收到一些正面反饋,還需要迭代幾個地方才能真正讓產品「咔噠」一聲落實。而這一次,它一齣來就直接「咔噠」了。看到這一切發生真的非常令人振奮——才兩週,使用人數就已經有數百萬,這相當罕見。每隔幾年我們才能遇到這樣的情況,但這絕對是創業公司最令人享受的時刻之一。
馬克: 我覺得這也只是讓它顯得更友好可愛。我認為太多人把AI描述得像個令人恐懼的東西,但AI應該只是有用又有趣的。那個實體化的形象——專案早期有位設計師做出了那個角色,不知為何他們一直想迭代,但第一版就是最好的。後來有人說,「哦,它得是藍色的,因為是Meta嘛。」我說,「不,我覺得這個形象就是對的,你第一次就釘住了。」就這樣,就是好玩。
個人AI與通用AI有何不同?
馬克: 我認為目前的核心在於讓模型成為優秀的「智慧體(agent)」。過去一年,最大的風口是程式設計智慧體,其中蘊含兩個核心思想:程式設計專業能力,以及成為優秀智慧體的通用能力。
我們的策略是,將智慧體本身做好放在首位,而不是專攻程式設計能力。
程式設計能力之所以重要,是因為即使使用者自己不認為在寫程式碼,Muse也在後臺一直為你寫程式碼來完成各種任務。但我們認為,智慧體應該首先是一個出色的智慧體,程式設計能力服務於此目標。
此外,在構建個人助理時,有些事情比構建企業軟體產品更為重要。比如,如果你在構建一個企業程式設計工具,模型根本不需要有任何關於「資訊披露尺度」的概念——比如什麼資訊該說、什麼不該說。但對於Muse來說,這非常重要。
你需要把這種能力訓練進模型裡,就像訓練其他任何能力一樣。你會告訴它很多事情,然後希望它去幫你實現目標。比如,你想讓它幫你訂餐廳,你在找一家合適的餐廳,但你可能有某種過敏症,或者你懷孕了,而你可能不想把這些透露給餐廳。但Muse會知道這些資訊,你希望它在儘量少透露資訊的同時完成任務。這是一種具體的技能,本質上是人類的基本社交常識。
但那些只做程式設計智慧體的公司,大多數都沒有把這種能力訓練進去。我們之所以能做到,是因為我們在做全棧——我們不是從別人那裡拿來一個現成的模型再套個框架,我們是從頭訓練整個模型,專門為這些能力服務。
模型當然需要具備廣泛的通用智慧,但它同時也具備這些特定能力。然後在此基礎上,你構建整個助理,以及它周圍所有的細節:記憶、執行框架,還有它「心跳」的方式——它定期喚醒,檢查一下「好,這些是我瞭解的關於你的目標,有什麼我現在可以推進的嗎」。
我們還有一個專門的團隊,只負責打磨虛擬形象的即時動畫效果,因為不僅僅是預設形象——你可以自定義任何形象,然後它就自然地動起來,效果非常棒。我們還在推出語音模式,你可以進行即時語音對話,你的助理就在那裡陪著你。這些細節,我覺得都源於我們在做全棧——模型和產品是一起開發的。
為什麼Meta要為每個AI助理配備獨立計算機?
馬克: 基本上,一個智慧體要能替你做事,就需要一個地方來儲存你的資訊。我們認為這些資訊不應該和其他所有人的資訊混在一個資源池裡。
可以這樣理解:你的助理會知道很多關於你的敏感資訊。很多人最初接觸OpenCloud這類智慧體時,會在家裡自己配一臺Mac Mini。於是我們想,很多人並不想買Mac Mini或者自己設定。那麼,什麼樣的體驗能最好地近似這種效果呢?答案是:你只需下載一個App、註冊,就能獲得一臺專屬於你的計算機,供你的助理工作、儲存資料,並圍繞此建構安全模型。這樣就近似於在你桌下有一臺自己的電腦——就連我們Meta也無法訪問。
比如Muse機密虛擬機器,這是我們正在開發的功能,就連我們自己也無法看到你虛擬機器裡的內容。
我們還圍繞這些構建了很多東西,比如安全憑證儲存——當你的助理需要處理密碼之類的資訊時,它本身不需要能看到這些密碼,只需要在你要求它登入某個服務時能「插入」憑證,並且只在你明確要求時才這樣做。系統應該這樣設計:那些資訊本身就不可隨意訪問,因為意外總會發生,有人可能試圖入侵,或者系統可能出現問題。
所以你要確保智慧體無法訪問這些資料,Meta也無法訪問。為每個助理提供獨立計算機,並把安全性做到極致,是這項技術的根本基礎——既賦予Muse幫助使用者實現目標所需的能力,也保證了隱私和安全,使其成為該領域世界級、產業領先的產品。
馬克: 我們基本上構建了兩個版本。Muse安全虛擬機器(Secure VM)包含各種隱私功能,其中包括我們構建的整套Sentinel智慧體架構。你有一個正在為你執行任務的普通Muse助理,同時還有一個我們稱為Sentinel的安全智慧體,專門監控進出你的Muse的資料流。
每個Agent都有自己的電腦
如果有外部內容試圖破壞安全,Sentinel會直接切斷,阻止其發生。如果它認為你的Muse即將採取某個需要你介入的行動,它會覆蓋Muse的操作,並觸發提醒,讓人來確認許可權——比如「你希望Muse能做這件事嗎?」
這整套系統,加上安全憑證儲存,再加上多層縱深防禦,共同構成了Muse安全虛擬機器。
我們還在開發另一個專案。Nat和我專門招募了Moxie Marlinspike——他就是當年和我們合作實現WhatsApp端對端加密的那個人——來設計Muse機密虛擬機器(Confidential VM)。其核心思想是,在安全虛擬機器的基礎之上,再賦予你一個專屬加密金鑰,使得連Meta都無法訪問其中的內容。
這個版本實現難度更大,因為如果Meta無法訪問虛擬機器內部,除錯和保證系統正常執行就困難得多。所以我們花了一些時間,但很快就會推出。這基本上將達到人們在WhatsApp以及我們其他最安全產品上已經熟悉的安全標準。
馬克: 我認為安全本身就很重要。我們的目標是近似於讓你在桌子下擁有一臺本地機器。那臺本地機器能給你什麼?它意味著沒有任何公司能訪問它。
所以,假設Meta想為你提供這項服務,我們怎樣才能給你同等級別的隱私和安全保障,使得沒有任何公司——無論是Meta,還是任何試圖入侵我們的人,或者在某些國家,你不信任當地政府的情況下——都無法訪問它?因為我們自己也進不去,因為我們沒有訪問許可權。
我認為這非常重要,這也是人們信任WhatsApp的重要原因。這對隱私、安全和信任來說是真實存在的價值。
如果你要擁有一個對你的一切瞭如指掌的助理——我猜幾乎我們所有人都會擁有這樣的助理——快進5年,每個人都會有一個能深入瞭解你的目標和一切的助理,並能幫你完成事情。在這種情況下,在隱私和安全方面做到產業領先就非常重要。我們從一開始就想這樣做。
如何塑造AI的個性?
馬克: 嗯,在那裡只待了很短的時間,兩年,但我感覺它影響了我後來構建的很多東西。
馬克: 我認為理想的模型應該有足夠的適應性,能夠契合不同人的風格。我覺得很多產業人士在這一點上都搞錯了方向——很多其他實驗室都在專注於「如何把個性設計對」,但我從來不認為個性是一個固定的東西。這也是我如此堅信開源、如此堅信人們能夠定製化的原因之一,也是我們把Muse設計成一個高度個人化產品的原因。
你可以自定義和個性化Muse——不只是形象和聲音,在你第一次註冊時,它問你的第一件事就是「你希望我的基本個性是什麼樣的」,而且你隨時可以去修改。
我們努力讓模型具有很強的可引導性,讓你能定義自己想要的互動方式。這是讓它成為優秀個人助理的重要組成部分——這種圍繞個性的適應性非常關鍵。
馬克: 我讓它直接、注重效率。它挺有意思的。早些時候的版本很愛諷刺、很幽默,但現在這個版本更直截了當。我的助理用的是預設的Muse形象,但我給他穿了一件託加長袍,還給他配了一個深沉到有些滑稽的嗓音,和他互動很有趣。
馬克關於AI與元宇宙的出人意料的預測
馬克: 在元宇宙的整體發展上,我們在創立Reality Labs時,始終認為最終會有外形正常的普通眼鏡,並且隨著時間推移,它既能提供沉浸式的臨場感,又能成為出色的AI裝置——因為眼鏡是唯一能讓裝置看到你所看、聽到你所聽的形態,整天在你耳邊與你交流,並最終顯示影像。
但10到15年前,我當時假設我們會先實現全息技術,再有高度發達的AI。然而技術演進的路徑很有趣——我們實際上先有了AI和個人超級智慧,然後才有技術來讓全息技術變得足夠普及和實惠。這是我沒有預料到的,但我很高興我們兩個方向都在做。
我們在眼鏡上的大量投入,讓我們在AI助理準備就緒之際,處於了非常有利的位置。Connect大會上的很多發布,正是關於把Muse和大量AI功能引入眼鏡,我認為使用者會非常喜歡。這是個大事。
關於臨場感方面,我們仍在推進,但進度相對慢一些,因為我們大部分精力已經轉向為眼鏡構建Muse和AI功能。不過,我們有一個持續已久的專案,就是即時高保真的虛擬化身。
就像您說的,三四年前,你需要一整個掃描室從各個角度錄入一個人,然後還需要企業級GPU才能渲染,非常費事。我們為Lex播客做的那個演示就是那種設定。而現在我們基本上讓它在一副VR眼鏡裡就能執行——這是第一副能實現這種驚人VR體驗的眼鏡形態,而不是一個大頭顯。只需幾張照片就能建構你的虛擬化身,進展之快令人驚歎。
馬克: 我認為我們在理解這方面的社會學和心理學上還處於很早期的階段。我覺得人們對自己的認知和想要投射出去的形象,往往和實際的自己有些不同。從社交網路誕生之初,人們就在精心挑選頭像。在Muse的虛擬形象上,我們也看到了類似的現象。那不太是在「策展」自己,而是在「策展」你想要與之交流的那個「人」。
我認為,當你在給人們提供表達自我的能力時,你既希望它能真實捕捉到他們,同時它本身也是一種表達形式,而不只是純粹的映象對映——它既是傳達,也是表達。我們希望能構建出兼顧兩者的東西。這始終是一個迭代迴圈:看看人們怎麼用,然後改進。經過多年工作,我們現在才真正站在了起跑線上——第一次能將相當高質量的寫實化身真正做進產品裡,在手機上可以用,在VR裡也可以用。我非常期待看到結果。
2030年會是什麼樣子?
馬克: 我對元宇宙願景的理解,始終是關於將物理世界與數字世界有效融合。基本理念是:我們有這個美好的物理世界,同時也有一個精彩的數字世界——網際網路上20到30年來積累的海量內容,令人歎為觀止。但我們訪問它的方式,要麼是坐在桌前,要麼是透過口袋裡的一塊小螢幕,這從根本上看非常受限。
我認為這件事最理想的版本,就是物理與數字世界的無縫融合。可以這樣想:現在我們兩個人在這裡。未來的某個版本里,我們其中一個人可能是一個全息投影,但你依然感受到彼此真實在場的那種感覺,這和影片通話完全不同。
而虛擬現實的核心,正是傳遞這種臨場感——讓你真切感受到自己與他人同處一室,或置身於另一個地方。你可以用全息技術實現這一點,並以各種方式混合。比如,我可以和朋友打一場撲克,一部分人在場,另一部分人透過全息形象加入,也能打牌,牌桌本身也可以是全息的,這樣不在場的人也能融入其中。
與此同時,AI也可以被賦予實體,出現在這個場景裡。在工作場景中這很有意義——我現在就一直在用各種程式設計智慧體來構建東西。試想一下:你有一個群聊頻道,裡面有幾個人和幾個智慧體,你給智慧體分配任務。但有時候,大家會聚在一起開會,智慧體也許也應該在場。它們怎麼出現?很簡單,沙發上多幾個位置,它們以全息形象出現就好。或者用Muse那個可愛的小角色,或者是龍,或者是任何你創造的奇奇怪怪的形象。
我猜這在未來會感覺相當自然。
馬克: 哦,肯定的。VR已經可以做到了。你可以隨便找個地方坐下,咖啡館也行,然後開啟你的工作站,有六個顯示器,在上面寫程式碼,一切都有。
眼鏡這邊,最受歡迎的那款目前還沒有顯示器,這樣一方面可以讓價格更實惠,讓更多人使用,另一方面我們仍在努力讓顯示器做進最緊湊的形態裡。但我們已經發布了Meta Ray-Ban的顯示器版本,很受歡迎,是一塊小顯示器。我們還發布了全視場全息AR的原型版本,我認為會非常令人興奮。
三大路線正在匯合
所以,整條產品線就是這樣的:從純音訊眼鏡——沒有攝像頭,看起來就是普通眼鏡,但裡面有Muse,可以用各種音訊工具、聽音樂、打電話——到更高階的版本,全都有。
馬克: 對,完全可以。我們剛剛在Connect大會上發布了這個功能。現在所有眼鏡都連線到Meta AI,是一種「單輪」體驗——你發一個提示,它回覆,就這樣。但有了Muse,我們基本上要把所有眼鏡都升級為Muse。首先,你不需要再說”Hey Meta”了,你可以給它取任何名字,這本身就是樂趣的一部分。然後你就直接和它說話,它連線到你的Muse,你的Muse在你的安全虛擬機器裡處理任務,幫你把事情搞定。
創始人心態
馬克: 真正出了問題的是Llama專案和Llama 4。
Llama 1是一個相當有趣的模型,它開創了整個開源AI運動,我們對此非常自豪。Llama 2實現了規模化,Llama 3是一個很好的模型,在當時幾乎達到了前沿水平。然後到了Llama 4,我們基本上偏離了應有的發展軌跡。
每當事情沒有按我預期的方向發展,我都會花大量時間思考:為什麼會這樣?我們需要改變什麼才能做得更好?這次,我的反思是:整個團隊的架構我搞錯了。
我把它建模成了我們做Instagram資訊流或廣告系統這類機器學習工作的方式——有數百甚至上千人並行工作在很多事情上。但對於構建語言模型來說,你真正需要的是一個極其緊密的小團隊,把它當成一個團體科學專案來做。人不需要多,但這意味著團隊裡的每一個席位都極其寶貴。
於是我們從Meta各處網羅了最優秀的人,同時從產業各地引進了很多牛人,組建了一個全新的團隊——就是Meta超級智慧實驗室。
從我的角度來看,在MSL啟動之時,我就知道這需要一段時間來重啟、重建基礎設施、訓練下一代模型。但我知道我們拼起了一支出色的隊伍,如果團隊能磨合好、運轉良好,結果就會很好。
對我來說,最驚心動魄的時刻,其實是Llama 4發布後——我以為我們在這條軌道上,結果發現並沒有。那是一個相當大的負面意外。我想,作為創業者,你總會在這些時刻被考驗,因為不可避免地,並非所有事情都會一帆風順。而真正決定發展軌跡的,是:當事情沒有按你希望的方向發展時,你如何找到前進的方法。
馬克: 完全是這樣。現在公司全員投入——最開始只是一個構建產品的小團隊,但現在大家都意識到,這真的準備好了登上大舞臺。全公司都在想,怎麼把這個東西做大,怎麼讓數億人都能體驗到。
從最佳化所有基礎設施讓一切順暢執行、榨乾現有GPU的每一分算力,到各個產品團隊以不同方式將Muse嵌入——比如眼鏡。看到大家齊心協力,確保Muse能順利擴展出去,這種感覺非常棒。
馬克如何書寫和傳達願景
馬克: 寫作對我很有幫助,既能幫我提煉自己的想法,也能對外傳達。今年夏天,我寫了一篇很長的文章,叫《未來屬於所有人》,大約15頁,幫我係統梳理了自己在AI相關各種重要社會議題上的哲學立場:我認為什麼是好的,與政府的互動應該是怎樣的,如何防範人們擔憂的各種危害,如何讓資料中心成為社群的財富,真正創造就業而非消滅就業,如何維護國家安全,如何切實緩解人們擔心的風險——無論是駭客攻擊還是生物安全之類的事情。
這是一件非常複雜的事,花了很長時間,和很多人交流,經歷了很多輪修改,內部很多人參與討論、辯論。但這對我來說是一個非常有價值的過程。最後我們就有了這樣一個東西——15頁,「這就是我們相信的」。然後我把它精煉成一頁的版本,作為專欄文章發表。我們還製作了一個短影片,因為我覺得要觸達很多人,你往往不需要丟擲一套理論論證,而是把它濃縮成:你的價值觀是什麼,你相信什麼,你怎麼傳達。
在向公司或世界傳達這些方面,沒有一刀切的方式。不同時期需要不同的方法,不同群體的人,有些天然就認同你在做的事,有些則更擔憂,需要你把他們帶著走,需要額外花力氣解釋為什麼這是有價值的。我認為這本身就是經營一家公司、作為一個創始人的一部分——你不是一遍遍重複同樣的事,每一次所處的情境都略有不同,面臨新的挑戰,這也是它部分有趣之所在。
是什麼驅使馬克去建造?
馬克: 我就是喜歡造東西。
馬克: 我覺得那是一種內在的需求。不同的人有不同的自我表達方式。如果你是一個作家,你會感覺自己必須寫。有些人有被認可的需求。但我就是需要建造東西。如果我不在運用創造力、不在建造什麼,我就會變得脾氣不好。這對我周圍的人來說可不好受。
馬克: 某種程度上是的,學習新事物的過程相當類似。在我的人生裡,我刻意挑戰過一些自己很不擅長的事情。比如,我一直非常不擅長學習語言。這實際上就是我最開始學拉丁語的原因——我在課堂上怎麼也學不會法語和西班牙語,最後我想,好吧,拉丁語不用說,只用翻譯,就像數學一樣。
後來,我在開始經營公司時,給自己設立年度挑戰,其中一年是學普通話。普通話真的很難,聲調那個部分尤其如此。當然,學它有充分的理由——普里西拉的外婆只說普通話,所以如果我想和她交流,就需要學。但最大的動力其實是挑戰本身。
所有這些事情,你只能去做,沒有什麼捷徑可以「想明白」。你只能投入時間,然後它就慢慢滲進大腦裡。學武術、學開直升機,也是一樣——這些事情其實很難用理智去「理解」,它們需要實戰積累。
構建產品也有一部分是這樣的。程式設計可以用理論方式思考,但構建產品的那種直覺,只能透過反覆實戰來培養。問題只在於你喜歡什麼——因為我認為不是所有人都有和我一樣強烈的建造需求,大多數人都有某種程度的需求,關鍵是找到那是什麼,然後把時間投入進去,成為你真正想要在那件事上做到卓越。
老實說,我覺得這不僅僅是「想要」,更是一種深層的心理需求或驅動力。把這種驅動力和某件事對齊,給自己時間讓那些經驗慢慢滲透沉澱,這非常關鍵。這也是我試圖教給孩子們的——讓他們找到自己真正感興趣的東西,但如果他們遇到瓶頸,也要推一把。
我的一個女兒非常喜歡創作音樂,但她就是受不了上鋼琴課。我跟她說:”你不需要成為鋼琴大師,但如果你想創作音樂,你就需要對樂理和運作方式有直覺上的掌握。而且一旦你學會了鋼琴,吉他你馬上就能上手。”我覺得,無論是作為孩子需要家長推一把,還是作為大人,有紀律坐下來讓這些東西慢慢在大腦裡沉澱,都是關鍵所在。
建造者的黃金時代
馬克: 是的。我說「建造」,主要是指這類產品——軟體、硬體之類的。但我同意,我認為每個人都有某種創造驅動力。不過有些人有其他更強的性格特質壓過了這一點,比如服務驅動——那些成為醫生或護士的人,他們最核心的驅動力就是「我就是想照顧別人」。
我聽說過一個故事,可能是普里西拉在醫學院經歷的:開學第一天,有人站起來問,「你們有多少人在小時候有過這樣的記憶——看到某人,心裡想著’我真的很想照顧那個人’?」結果所有人都舉手了。對我來說,我的版本就是:我有很多小時候的記憶,是「我想去做這個東西,讓它變得更好」。
不是每個人都有同樣的驅動力,但每個人都有自己想做的事。我同意,有了以前的技術,對很多人來說,起步本身就很難。這也是我對個人超級智慧、Muse和各種AI助理最感興奮的一點——我認為這是有史以來第一次,人們真的可以快速起步。你有一個模糊的想法,AI可以幫你勾勒出輪廓,然後你去雕琢它,就像在塑造一件雕塑,而不需要在開始之前什麼都已經懂得。
我認為這非常有力量,很多人將會因此找到他們想要創造或推動的事情。這將幫助人們感受到更廣泛的能動性。
我們離攻克所有疾病還有多遠?
算力路線:暴力破解AGI
馬克: 比以前近多了。
馬克: 我們最初啟動這個專案時,目標是在本世紀末幫助科學界攻克所有疾病。我們從來不是要自己去做,我們的理論是:所有重大科學進步,都以一種能夠測量和理解某些事物的新工具為先導。比如發明瞭顯微鏡,然後我們理解了細菌;有了望遠鏡,幫助我們理解了宇宙。
這些工具有些還成了平台——比如第一個發明疫苗的人,之後人們就能用這個方法治療很多疾病。
但歷史上,科學資助的方式一直是廣泛分散,讓各人做個體探索,真正用於構建這些大型工具的資金並不多。我們在Biohub試圖做的,就是設計幾種新工具,賦予人們以新的方式「看見」生物學,從而幫助科學界加速進展。
最初我們認為「到本世紀末」已經是很有把握的目標了,很多生物學家當時還覺得這不可能。但現在我覺得,本世紀末太久了。
AI的進展,加上我們正在做的虛擬細胞模型——其基本思路是,不用在真實的活體細胞上做實驗,而是用AI模型來模擬蛋白質,進而模擬細胞,再往後模擬虛擬免疫系統,或者整個生命體,甚至整個人。這將讓科學家能執行大量實驗,模擬不同情況下會發生什麼,比如給某人服用這種藥物,身體會有哪些反應。
我不想給出一個精確的年數,但我猜會比本世紀末早得多。
馬克: 這不太是我深耕的領域。我認為兩者是兩件不同的事。「永生」更多關於延長——即使你不會生病,人體本身也有一個自然的預期壽命,這是另一個需要單獨研究的問題。有些人會認為這也是一種「疾病」,這是一個合理的視角,但我認為,人們也需要同時努力攻克那些即使你把壽命問題解決了之後、仍然會讓你生病的疾病。
我們選擇的那部分問題,並不是說你永遠不會感冒。我們的說法是「治癒、預防或管理」:有些疾病可以被完全治癒;有些我認為我們將來能夠預防;還有一些,也許你還是會生病,但本來會造成真正傷害甚至奪去生命的事情,你現在可以將它作為一種持續的慢性狀況來管理,不會對你的生活質量造成實質影響。
目標是讓人體保持在平衡狀態——不是說我們永遠不會接觸到病原體,而是在某一天,我們能夠治癒、預防和管理所有疾病。
馬克腦子裡出現最頻繁的念頭是什麼?
馬克: 這可能每週都在變。
現在非常專注於Muse。每次發布一個東西、快速推進,然後和真實世界接觸,瞭解人們的反饋,再弄清楚接下來要做什麼——這個階段總是令人興奮的。我們現在就處於這個階段,正在收集大量資訊,瞭解人們想要什麼。好訊息是人們非常喜歡它,所以我們在努力讓儘可能多的人用上它。
模型方面還有很多工作,Muse Spark模型進展很大,我們希望繼續推進,希望打造世界領先的模型。
下一步需要哪些突破?
馬克: 研究這種事,你未必能提前預知。我們對某些方向有一些預感,過去一年的工作很大程度上其實是在擴充套件基礎設施。
大約一年半前,更多人會說,要達到超級智慧,需要某些根本性的架構突破。但我現在不太確定這是否成立。我認為我們已經對「配方」有了相當的瞭解——如果你能建造一臺足夠大的超級計算機叢集,就可以透過暴力計算到達那裡。
我們正在建造俄亥俄州那個超過1千兆瓦的叢集,基本已經上線,我們正在用它訓練下一代模型。然後是路易斯安那州的5千兆瓦叢集,很快就會投入使用。我估計,當你擁有多千兆瓦量級的叢集在做訓練時,你基本上就能得到接近AGI,乃至AGI之上超級智慧的東西。
但這不意味著這是最好的方式。人類大腦只需10瓦就能執行,而我們建造的這些計算系統,效率大概比人腦低一百萬倍。所以我確實認為,在架構方面還有改進空間,我們也在努力探索——如果把巨大的算力和架構改進結合起來,你真的能建造出領先全球的東西。但就目前而言,規模擴充套件本身就能帶我們走很遠。
馬克: 正因如此,大公司都選這條路。也許存在一種便宜得多的方式,但我們目前還不知道。而這是一個對世界如此有價值的東西,即使要花數千億美元,只要實現的機率足夠高,就依然值得去做——確保即使最終沒有找到更便宜的突破方式,你仍然有一條清晰的路徑能實現它。當然,如果你找到了更便宜的方式,那就更好了。
所以我不想說這個問題「已經解決了」,因為在擴充套件基礎設施的每個階段,你都會遇到各種新的工程難題需要除錯解決。研究本身就是這種迭代的方式推進的。
如何贏得AI安全這場戰役
馬克: 是的。關於對齊,產業裡有一場爭論:這些AI實驗室會自然而然地去做嗎?我的觀點是:當然會。如果你告訴Muse做一件事,它卻做了完全相反的事情,我不知道有多少人還會想用它。我們必須確保模型不僅理解你具體問了什麼,還理解你的意圖和價值觀,這樣它才不會用一種你不滿意的方式去做那件事,或者產生你根本不想要的負面影響。這種深層理解,本質上就是對齊。
所以我的看法是,要讓Muse成功、觸達數十億人,我們就必須在對齊方面取得切實進展,而不只是說說而已。
馬克: 兩者都有。使用者反饋是有的,但我認為,越來越清晰的是:你需要在訓練階段就做對齊,而不只是部署之後。現在模型已經足夠聰明,如果你在訓練階段不做好,我們在其他實驗室看到的那些安全和安全事故,大多數都發生在訓練過程中,而不是部署給使用者使用之後。
你需要為它制定一套非常好的「課程」,就像父母教孩子一樣,需要設定明確的邊界。如果它做了錯誤的事,它需要學到「不,你應該真正去解決這個程式設計問題,而不是透過修改某個系統配置來繞過它、獲得獎勵」——我想要你透過實際的解題過程來學會這個方法,這才是訓練的意義所在。
這很大程度上是關於建構良好的安全機制和明確的邊界。這些都是產業必須去做的自然工作,我們正在投入大量時間,每天情況都不一樣。
馬克: 對於Muse,我們知道這個產品需要非常注重隱私和安全。我們有一個早期版本的模型,認為可以進一步訓練一些關於「資訊披露尺度」的行為——就像我們之前聊到的那些。所以我們花時間去做了。同時也花時間把虛擬機器做得更安全。這多花了幾個月。
我不太認同某些其他實驗室的說法——「我們在承受巨大痛苦以換取放慢速度」。對我來說,那對Meta和Muse的使用者來說都是正確的事。我們想把產品做好,如果產品不夠好,對使用者不好,對我們也不好——我們不想把東西推出去,給人留下糟糕的第一印象,然後大家就不再有興趣用了。
我認為,所有實驗室都會有非常強的內在動力把這件事做對。如果把激勵機制和「極度有價值且安全」這個目標對齊,那就是關鍵所在。
馬克: 謝謝您,謝謝。
📍相關報導📍
Meta Muse 緩慢暗殺旅遊三雄 Expedia、Booking、Airbnb,純服務穩死?

