Livenerf 用事先註冊的規則監測 Claude Opus 5.5 是否被削弱,不過這把尺抓得到服務端漂移,卻量不到 Claude Code 預設值的變動。
(前情提要:Claude Code用起來變笨了?AMD AI 總監開砲:思考深度暴跌67%,API月費暴漲144倍)
(背景補充:Sonnet 5.5 上線媲美 Opus:Anthropic 說省 3 成、第三方說貴一半,關鍵在推理強度)
最近有個項目在社群受到廣泛討論,它叫 Livenerf,是個人開發者 ninjahawk 的獨立專案,正在用事先公開的規則,長期監測 Claude Opus 5.5 上線後有沒有被悄悄削弱降智,即外界常說的 nerf。
不過截至 10 月 1 日,Livenerf 還沒有任何 Opus 5.5 是否變差的結果,因為前期需要時間來「收集」基準線,也就是拿來當對照起點的正常狀態。
97% 的題目派不上用場
作者在 README 寫明專案與 Anthropic 無關,建立於 9 月 22 日,也就是 Opus 5.5 的發布日。他也坦承,這個 repo 有相當多內容是在 Claude 協助下寫成的,等於被量測的模型幫忙做了量尺,所以評分器是純函式、門檻事先註冊、原始資料公開。
篩題是最有意思的地方。作者先拿 2,336 題(GPQA Diamond、MMLU-Pro、競賽數學、AIME 2025-26)各取樣 4 次。Opus 5.5 第一次就答對約 93%,而且 97% 的題目永遠答對或永遠答錯,只有 78 題有時對有時錯。永遠答對的題目,模型退步也看不出來,真正拿得來量的,只剩這 78 題。
這組題目每天跑一次,每題一次取樣,評分是精確比對,不用 LLM 當裁判。共跑 30 天:前 10 天是基準線,之後是兩個 10 天區間,9 月 30 日時收集了 7 天。
判定規則同樣事先公開:連續兩個 10 天區間,都要 99% 信賴區間不含零(也就是在 99% 的把握水準下,差異不只是雜訊)、幅度至少 3 個百分點,而且對照組沒有同向變動。對照組是另一個模型 claude-opus-5,每天跑同一批題目裡的 GPQA 部分;兩者若同時變動,代表是工具或平台變了,不是 Opus 5.5 本身。
靈敏度有限,作者自己也算過:一個 10 天區間大約能偵測 7.5 個百分點的準確率變化。更小的波動會淹沒在雜訊裡。
尺的精準,來自量得窄
作者列出的極限相當具體。把 Opus 5.5 換成 Opus 5,在 99% 水準下分不出來,準確率降 3.8 ± 6.3 點,誤差比差距還大,token 少 23%。也就是說,同家族換模型這種幅度的變動,這把尺在驗證階段還沒抓到。
更根本的限制在量測路徑:Livenerf 用 Claude Max 訂閱方案的無頭 Claude Code(claude -p)呼叫模型,CLI 釘死在 2.1.280,推理強度每次明確指定,沒有工具、沒有記憶。量的是「透過 Claude Code 提供的 Opus 5.5」,不等於 API 原始模型。就算偵測到變動,也不知道原因;README 還提醒,上線第一週可能本來就是最差的一週,基準線不是真理。
再看 Anthropic 過去自己承認的兩次品質事故。2025 年 9 月的工程部落格〈A postmortem of three recent issues〉寫道「We never reduce model quality due to demand, time of day, or server load」,並把問題歸因於三個基礎設施 bug,其中上下文視窗路由錯誤,讓約 30% 的 Claude Code 用戶至少有一則訊息被送錯伺服器。
2026 年 4 月的〈An update on recent Claude Code quality reports〉則是另一種故事:3 月 4 日把 Claude Code 預設推理強度從 high 改成 medium,思考快取 bug 讓 Claude 顯得健忘,4 月 16 日加入限制冗長的系統提示,消融測試(把某項改動單獨拿掉再比較)顯示 Opus 4.6 與 4.7 都掉約 3%。
第一次事故出在基礎設施,屬於服務端漂移,是這把尺設計上想抓的那一層;第二次出在預設推理強度、快取與系統提示,屬於產品層,而 Livenerf 刻意把這些變因全部固定住,所以抓不到用戶實際感受到的預設值變動。
📍相關報導📍
Anthropic 突襲發布 Claude Opus 5.5!效能逼近 Fable,API 降價 40% 還自帶「用量重置」

