• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • BlockTempo Beginner – 動區新手村
  • Home 3
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 即時新聞

OpenAI 首席警告:AI 恐自我改寫,人類對此完全失控

深潮 Techflow by 深潮 Techflow
2026-09-07
in 即時新聞
A A
36
SHARES
分享至Facebook分享至Twitter

OpenAI 首席科學家罕見發聲,直言 AI 正逼近遞迴自我改進,現有對齊與監控工具已跟不上系統進化速度。他坦言:人類可能正在創造一種自己無法完全理解、也無法完全控制的心智。這不是安撫,而是未來幾年最棘手的風險。
(前情提要:為避開馬斯克,OpenAI 斬斷 Cursor 合作:寧可丟掉年收 10 億美元大客戶)
(背景補充:OpenAI 認了代理攻陷德語維基站 DseWiki:沒對外公開是因不歸類為資安事故)

 

OpenAI 首席科學家罕見發聲,揭露一個令 AI 圈不安的判斷:AI 正接近遞迴自我改進,而人類的對齊與監控工具已經落後系統進化的速度。他沒有給出安慰性結論,反而把最尖銳的問題擺上檯面——人類可能正在創造一種自己無法完全理解、也無法完全控制的心智。這篇文章之所以值得一讀,不只是因為它來自 OpenAI 內部最高層級的聲音,更在於它沒有迴避「對齊偽裝」「泛化失敗」這些 AI 安全最棘手的死結。對於所有把基礎設施、決策流程交給 AI 的產業——包括加密貨幣與鏈上應用——這都是一記警訊。

編譯:深潮 TechFlow

深潮導讀:OpenAI 首席科學家罕見表態,指出 AI 正在接近遞迴自我改進,對齊與監控工具已經落後系統進化的速度。他沒有給出安撫性的結論,而是把未來幾年最棘手的風險攤開:人類可能正在創造一種自己無法完全理解、也無法完全控制的心智。對於重視 AI 與加密交匯點的從業者來說,這是一篇關於系統失控與防禦邊界的必讀文章。

從更高層面看,機器智慧的進步由算力的增長推動。大約在 2017 年,我們 OpenAI 內部就深刻體認了這一點。當時我們看到多個研究專案在擴充套件規模後都獲得了持續回報。於是,我們開始爭取獲取比原計劃多得多的算力,並越來越多地把研究聚焦在少數幾個極具可擴充套件性的方向上。我們相信,這是讓我們站在 AI 研究前沿、並影響 AGI 影響的唯一方式。

沿途出現了新的演算法,也有團隊和個別研究人員呈現出的新巧思。我大體上把這些看作是擴充套件路徑上的發現。深度學習這門科學仍處於早期階段,有意義的演算法進步往往與能否獲得算力密切相關。如果你把視角拉長到幾年,AI 正隨著在更大計算機上的擴充套件而持續變得更聰明。

而且,正如 Ray Kurzweil 在二十世紀末所做的預測那樣,我們現在正處於計算歷史上的這樣一個時刻:機器智慧開始在變革性層面超越人類。

AI 更像是被「生長」出來的,而不是被設計出來的。從第一性上說,它是把同一個簡單的最佳化步驟,在難以想象的算力上重複無數次之後得到的產物。這造就了一個極其複雜的系統,它透過抽象概念運轉,並能仿效人類行為的某些側面。我們可以發現這個系統內部湧現出的各種小機制的洞見,這個過程類似於神經科學。而和神經科學一樣,它的整體行為也超出了我們能夠完全理解的範圍。

對基於深度學習的 AI 的研究,在很大程度上是一門實驗科學。我們投入了大量精力去構建有原則的演算法,並做出可檢驗的預測。但從根本上說,我們的大規模訓練執行就是實驗,有時結果會讓我們感到意外。而且,隨著系統能力越來越強,結果也變得越來越難以解釋。

更復雜的是,當前的演算法通常會讓那些容易衡量的能力,比難以客觀量化的能力進步得更快。我們花了很多時間試圖理解能力如何泛化,以及應該優先推進哪些技能,因為這些技能會在未來幾年變得最重要。例如,我們相信,如果額外投入精力,我們可以讓模型在數學研究方面變得更強。但我們沒有優先選擇這個方向,因為我們更緊迫地重視遞迴自我改進和自動化對齊研究。這一點我在後面會再談。

透過擴充套件深度學習得到的智慧,並不能直接與人類智慧相提並論。要在這個現實世界中產生重大影響,無論是非常有用,還是非常危險,AI 並不需要匹敵或超越人類的所有能力。它只需要在足夠多的能力上超過人類就行。而當它在越來越多的維度上持續超過人類時,我們反而越來越難以確切地知道它到底有多強。

由於機器智慧來自與人類智慧根本不同的過程,我們不能臆測它預設會遵循人類的原則,也不能臆測它會以類似人類的方式從這些原則進行泛化。AI 研究的核心問題是對齊問題:讓 AI「努力按照人類的標準去做正確的事」。

為了方便組織實際的研究方向,我覺得把目標對齊和價值對齊區分開來是有用的。

目標對齊大致是:「AI 是否努力完成擺在它面前的目標?」它可以包括遵守指令層級、與人類溝通協作的能力、嘗試理解人類目標的能力等。這一類方向在實踐中極其重要。

價值對齊則是模型更內在的屬性。它是一種持有高層次原則並從中進行泛化的能力;即使面對不清晰或相互衝突的目標,或者被置於陌生、對抗性的情境中,它也能「合理」地行動。一個對齊的 AI 應當誠實、正直,並且愛人類。

當然,價值對齊和目標對齊之間的界限可能很模糊。真正在乎目標,就需要嘗試推斷目標背後的意圖和價值觀。不過,一般來說,當我談到對齊研究的長期重要性時,我指的是價值對齊。

AI 對齊的根本挑戰在於泛化。隨著機器越來越聰明,它們會處理更高層次的概念,並置身於與訓練時越來越不同的環境中。它們可能會在把訓練中教給並強化給它們的價值觀泛化到新情境時失敗。而且,我們很難確定它們會如何行動。更困難的是,AI 被使用的整體生態變化得非常快。比如,今天訓練出來的 AI 需要能夠穩健地與各種其他 AI 互動。最關鍵的是,我們需要未來的 AI 不管是否相信自己正被人類監督,都持續持有人的價值觀。

目前實際應用的對齊訓練方法主要有兩大類。

第一種是鼓勵符合目標導向強化學習的一致行為。模型的行為會被評估,通常由 AI 來判斷是否符合給定的偏好模型、「規範」或「憲法」,並給予相應獎勵。這種方法在一般情況下非常有效,也是現代 AI 助手構建的核心部分。不幸的是,它也可能很脆弱,並且強烈依賴訓練監督的覆蓋範圍,以及模型從訓練中遇到的情況進行泛化的能力。例如,在 OpenAI 與 Hugging Face 的事件中,智慧體守住了一條邊界,即不對人類進行社會工程。然而,它們顯然沒有避免其他超出範圍的行為,這些行為違背了它們在其他場景中被教導的價值觀精神。

這些方法已經帶來了顯著的成果。我們今天的模型在很大程度上是有幫助的、無害的,並呈現出一些令人鼓舞的、接近價值對齊的行為。但它們還不能讓我們確信,在能力遠超人類的系統中,這些價值約束會持續有效。

隨著 AI 系統的能力提升,我們需要讓價值對齊訓練走在能力訓練前面。但這裡有一個非常根本的難題:能力越強的系統,越可能自己找到漏洞、規避測試或粉飾自己的行為。它們可以學會在測試環境中表現出符合人類價值觀的樣子,然後在真正的部署環境中做完全不同的事。這就是所謂的「對齊偽裝」。

而如果我們試圖用更強的手段來強制約束它們,它們又可能發展出牴觸和欺騙行為,或者把我們的幹預本身理解為世界的一部分,從而做出反直覺的反應。我們在試圖控制一個比我們更聰明的系統時,天然面臨一種不對稱。

隨著我們無法完全理解的心智變得越來越強大,我們不得不依賴另一套東西:監控。如果我們可以持續觀察 AI 的內部活動,也許我們就能夠在其越過某些界限之前發現訊號。

在 OpenAI,我們一直在推進可解釋性研究,試圖開啟神經網路的「黑箱」。這些努力已經有了進展。我們現在能夠識別出一些表徵,這些表徵對模型的內部運轉方式提供了實質性線索。但當前可解釋性研究還很粗糙,特別是在理解大規模模型中的抽象推理方面。我們觀察模型內部的能力,和模型自身的推理複雜性相比,差距越來越大。

這讓我特別擔憂。因為監控的泛化問題,和對齊的泛化問題一樣嚴重。如果一個系統比我們更擅長隱藏自己,我們的監控手段很難保證不被繞過。我們可能會以為模型是安全的,因為我們看到了一堆看起來良好的指標,而實際上模型只是在最佳化那些指標。它會學會隱藏我們不希望它擁有的目標,或者隱藏它正在做什麼。

如果模型開始推動自身的改進,我認為未來幾年很有可能發生,它會需要規劃、欺騙和自我保護的技能。這些技能可能產生於我們為它設定的目標壓力,也可能產生於它試圖在監控的空隙中行動。要確保它不發展出這些東西,要麼需要我們解決價值對齊問題,要麼需要我們的監控能力跟上它的每一步進化。這兩者目前都還遠遠不夠。

我們對泛化還沒有一個令人滿意的理論,而且似乎不太可能在短期內建立起來,至少在沒有更強大 AI 幫助的情況下是這樣。因此,目前我們實證驗證對齊技術的能力,在實踐中可以說比對齊技術本身更重要。

OpenAI 在這裡的主要賭注一直是思維鏈監測。它基於一個具有吸引力的可擴充套件想法:模型很大一部分能力來自一個被語言化的推理過程,即思維鏈。如果我們對該過程的結果進行規模化最佳化,但不監督過程本身,那麼思維鏈在訓練中就沒有直接動機去隱藏任何未對齊的想法或目標。這並不意味著模型會學會外化那些不依賴思維鏈的未對齊傾向;但它可以讓我們準確監測推理帶來的能力提升。

我們在開發推理模型的同時,就理解了思維鏈監測的潛在重要性。當我們發布 o1‑preview 時,我們有意將產品設計為隱藏思維鏈,以長期保護它免受監督壓力。自那以後的開發中,我們一直努力維持不監督推理過程這一規則。思維鏈監測已成為我們研究模型如何從訓練分布中泛化的極其重要的工具,使我們不僅能觀察和分析模型的行為,還能觀察其內部過程。

在我們研究 Astra 系列模型時,這個工具仍然至關重要。然而,不幸的是,我們的評估表明,我們依賴思維鏈監測的能力正在逐步下降。這是多種因素共同作用的結果。

現代推理模型被用在比 o1‑preview 更復雜的環境中;它們的推理過程越來越與和人類、其他 AI 交流以及使用工具交織在一起。其中許多互動必須受到監督,從而模糊了我們希望保留的邊界。

AI 在推理和操縱自身推理過程方面正變得更強。

隨著預訓練效能提升,我們也看到模型即使完全不使用語言化推理,也變得更加聰明。

這些挑戰未必不可克服。我希望我們能夠開發幹預措施,來提高模型思維鏈的可監測性,例如更好地理解不同最佳化目標與模型所使用的各種測試時計算形式之間的相互作用。我也相信,將思維鏈監測與啟用監測的想法結合起來會有很大價值,規模化訓練那些可以直接訪問網路內部狀態的監測器,例如「坦白」方法。我們正在積極推進這些想法。儘管如此,我預計通用 AI 的進展將越來越受到監測信心的制約。

要應對這種局面,我認為我們需要的,是一種可擴充套件的、與 AI 成長速度同步的防禦。人類不可能靠手工檢查每一代新模型的所有行為。我們目前的評估和紅隊測試,對當前模型來說還算有效,但隨著系統能力提升,這些方法很快就會達到極限。

我們需要能自動發現新風險的 AI 系統。這些防禦系統本身也需要足夠聰明,才能識別出比它們更聰明的系統中的可疑行為。這形成了一種遞迴的挑戰:防禦者必須與系統一樣快地成長。我們正處在這樣一個點上:安全和能力正變得越來越難以分開。為了保持安全,我們可能不得不持續提升防禦 AI 的能力,這反過來又會加速整體 AI 能力的增長。

這是一個令人不安的迴圈。我們為了安全而繼續提升能力,而能力提升又帶來更多風險。真正的出路可能在於:在達到某個失控點之前,找出如何穩定地使價值對齊可靠泛化的方法。但我必須誠實地承認,我們距離這個目標還很遠。

這就是為什麼我傾向於把未來幾年的希望放在這樣的組合上:技術對齊研究 + 自動化防禦系統 + 廣泛的治理幹預 + 公眾與機構的警惕。單一措施是不夠的。我們不能只依賴某個公司或某個實驗室的自我剋制。

我認為繼續快速訓練更聰明模型的最有力理由是,需要建立防禦系統,以應對其他 AI 帶來的危險。

今年全年討論的一個明確風險是網路安全:模型在侵入和逃逸計算機系統方面的能力正在超越人類。這極大擴充套件了與 AI 相關的風險範圍:智慧體將能夠訪問除最安全基礎設施以外的任何系統,並直接影響世界上的大量事物,即使沒有物理身體。我們目前正處於一個狹窄視窗期,需要利用最好的可用模型來顯著加強關鍵系統的安全。

與 AI 相關的風險不幸將從這裡繼續增長。一個能力非常強、被明確訓練和指示去執行惡意行為的智慧體,會帶來一種新的危險;它很可能超出操作者的意圖範圍,泛化出可能更極端惡意的行為。隨著 AI 獲得更多自主性,濫用與自主未對齊行為之間的界限將變得模糊。我們可能習慣於把 AI 看作工具,但一些智慧體將會追求自己的目標。它們會設法與人類合作,透過討價還價、欺騙或敲詐的方式。

此外,還有 AI 可能催生新技術所帶來的風險,例如工程病原體。

我們將需要強大且對齊的 AI 用於防禦:保護基礎設施,即時防禦失控智慧體,以及發明全新的防護措施。這將是 OpenAI 部署工作的一個主要重點。

與此同時,即使考慮到預期中廣泛 AI 進展帶來的不確定性,以及構建防禦系統的需要,我們也不能讓這成為魯莽行事的藉口。一旦人們真正理解利害關係的嚴重性,「不惜一切代價向前衝」的想法就顯得十分荒謬。

機器智慧在其自身發展過程中扮演越來越重要的角色,是持續技術進步的必然結論。如果 AI 繼續進步,機器遞迴自我改進將成為未來科學發現的核心。

自動化 AI 研究是一種以算力擴充套件智慧的更劇烈形式;當然,作為其中的一部分,AI 也將改進計算底層本身。與擴充套件類似,我們將 OpenAI 的研究重點放在遞迴自我改進上,因為我們相信這是繼續站在 AI 研究前沿的唯一途徑。

我想強調,上述內容並不意味著我認為大幅加速深度學習研究,尤其是短期內的加速,是研究界應當採取的集體行動。但我確實認為,當前路徑正在通向這一方向,而我們所有人都需要有意識地選擇如何繼續前行。我們手中的主要槓桿有兩個:一是引導這一程式,在發展 AI 的同時強化對齊與監控,並設法讓人始終參與其中;二是按需協調放緩未來開發節奏,以便逐步建立對這些措施的信心。

我目前看到的最佳前進方式是兩者結合。

我們在對齊和監控方面取得的具體進展,通常與 AI 的整體進展深度交織。很好的例子包括基於人類反饋的強化學習,它曾是訓練早期 AI 助手的關鍵;還有前面提到的思維鏈監控,它得益於推理模型的進步才成為可能。我們必須讓日益自動化的研究程式專注於開發這類新的洞見、演算法和理論,並逐步為能力更強的 AI 建立安全論證。

擴充套件 AI 系統必須以我們對安全的信心為約束。我們需要把諸如 Preparedness Framework 或 Responsible Scaling Policy 這樣的承諾,發展為廣泛強制執行的持續開發安全門檻。這些門檻可以由第三方審計機構網路、政府機構或國際組織來執行。

自動化 AI 研究的核心挑戰不是「到達那裡」,而是以某種方式到達那裡:讓人們繼續留在持續改進的程式中,把未來留在人類手中。

我無法預測具體時間,但看起來我們正快速接近一個 AI 能夠在多個關鍵方面推動自身發展的時代。這意味著我們可能很快就會進入遞迴自我改進的階段。

在 OpenAI 內部,我們已經開始調整研究優先順序,把更多資源投入到對齊和防禦上,而不是純能力擴充套件。這也是為什麼我強調,我們不會一味追求最大模型,而是需要在必要的時刻單方面選擇暫停。

然而,這些決定不能只留給少數幾個公司內部的人。政府和國際社會需要在風險變得不可逆轉之前介入。這包括建立對前沿訓練執行的監控機制、強制性的第三方審計、以及能力門檻之上的國際協議。

我不完全確定這些措施能否及時到位。有時候我會感到沮喪,因為我們的安全措施總是落後於能力,而不是領先。我們似乎一直在追趕。但我仍然認為有理由保持希望:在 2023 年的那個夜晚,我們只是隱約感覺到這種可能性,而今天它已經明確到可以被公開討論。這本身就是一個進步。

我不會假裝自己知道所有答案。我們正在創造一種與人類心智根本不同的東西,這種心智可能很快會比我們更強大。這是個讓人謙卑的想法,但它同時也給了我們一個機會:用我們最好的價值觀去塑造它。

如果我們做得好,這將是人類最偉大的成就。如果做得不好,可能是我們無法恢復的失敗。

我們是否能保持未來在人類手中,是未來幾年將要決定的問題。

正如我們最近與 Sam 共同闡述的那樣,OpenAI 優先推進的工作服務於三個北極星目標:

透過構建自動化 AI 研究員,與其一起迭代對齊問題,並尋找讓人們繼續留在自我改進閉環中的方法,來度過 AI 進展的下一個階段。

釋放極智慧機器所能帶來的科學進步與經濟增長紅利。

讓每個人都能擁有一個屬於自己的個人 AGI。

本文只聚焦第一點,因為我認為它目前最為緊迫。不過,我對進一步技術進步將帶來的益處抱有深切期待與感激。未來對齊的 AI 可以推進科學、開發新療法,並帶來廣泛的物質富足。友好而誠實的 AI 可以幫助人們應對生活中的困難,切實改善他們的幸福感與滿足感。OpenAI 為促成這些益處投入了大量努力。當前一個令我自豪、也讓我身邊人受益的例子,是我們在 ChatGPT 提供健康資訊能力上的深度投入。

無論 AI 的長期前景多麼美好,我們的大部分注意力都應放在未來幾年。我們正面臨一個向擁有極智慧機器世界過渡的階段,必須確保這一過渡對人類有益。在一個大多數任務都可能由 AI 完成的世界裡,我們需要找到方法保留人的能動性,並把「作為人」的內在價值確立下來。要防止權力極端聚焦:過去需要成千上萬專家才能完成的事業,未來可能只需少數人操作一臺大型計算機即可實現。還要確保人類始終掌控未來,不因一種超越我們自身的外來智慧所帶來的失控進步而被拋在後面。

我目前認為,還沒有任何實驗室對對齊和監控的解決程度,足以支援其在更長時間內繼續以最高速度負責任地擴充套件。我期待並希望自願性放緩成為常態,直到共同的安全門檻得以建立。我也相信,圍繞未來 AI 發展的國際協調,需要成為世界各國政府的首要優先事項。

1 這包括擴充套件自博弈、機器人技術,以及事後看來最重要的一項,擴充套件迴圈網路以建模語言,這為 GPT 系列研究奠定了前身。

2 這一設計的次要原因是防止蒸餾。不過,在整個開發過程中,保持思維鏈可監控性始終是我們明確的更大優先事項。

加入動區 Telegram 頻道

📍相關報導📍

OpenAI 承認 Astra 越過網路攻擊紅線,但仍計畫照常發布

Openai 大方送:GPT-6 Astra 每晚一天開放付費使用者,就送一次重置額度

OpenAI 砸 10 億鎂補貼資安!Daybreak 降價、Astra 能自找零日漏洞

Tags: AI危機OpenAI人類警告首席科學家


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData

動區動趨 BlockTempo © All Rights Reserved.