Anthropic 發布官方文章〈Maximizing the value of your Claude Code sessions〉,拆解 Claude Code 的計價機制,點名六個立刻能照做的習慣,並列出最該盯的四個花錢破口。
(前情提要:Claude Code 推出 Monitor 工具:背景監聽取代輪詢,大幅節省 Token 消耗)
(背景補充:Anthropic宣布解鎖Opus 4.6百萬Token不加價!上下文測試碾壓GPT-5.4)
過去寫程式的工具是固定費用甚至免費,編輯器不會因為你今天下午多修了四十九個測試就多收錢,單一任務本身沒有自己的價格。代理式(agentic)程式設計工具把這件事改掉了:同一個任務,用法不同,價格就不同。
Anthropic 在 8 月 14 日發布的官方文章中,用一個很小的例子說明這件事。同樣是修一個壞掉的測試,Session A 讀了測試檔、讀了被測檔案、改完收工,只送出 5 個 request;Session B 先在整個 repo grep 一輪,沿路開啟十幾個檔案才走到同樣那兩個檔,膨脹成 18 個 request — 而且這期間每一輪都還拖著今天早上以來讀進對話的所有東西。

同樣一個修復,先搜尋的 Session B 送出的 request 是 Session A 的三倍以上。圖片來源:Anthropic
文章強調一個關鍵觀念:所謂省 Token 不是總量用得更少,而是確保你花掉的 Token 都真的用在你要求的那件事上。
一個 Token 到底在賣什麼
帳單按 Token 計價,但你實際上付的是推論(inference),也就是 GPU 跑完模型所耗的時間。官方點出三件事決定一個 Token 佔用多少時間:用哪個模型、它是輸入還是輸出、以及有沒有被快取。
模型越大,處理輸入與輸出的工作量都越大,而且底下講的所有成本都會被模型單價再乘一次。官方的建議是:問題真的困難或曖昧時才用大模型,例行工作用小模型就好。

簡單任務上大小模型的品質曲線很快收斂,困難任務上則不會——大模型能用更少 Token 達到同樣品質。(官方註明曲線僅為示意,非真實 benchmark 資料)圖片來源:Anthropic
輸出為什麼貴 5 倍:Prefill 與 Decode
一次請求在 GPU 上會走兩個階段。Prefill(預填)是模型讀進你的請求與脈絡 — 系統提示、你的 CLAUDE.md、你的訊息,加上這段對話至今被塞進來的一切,這些是輸入 Token。Decode(解碼)則是模型寫出輸出 Token:它的思考、工具呼叫、你看到的文字。
差別在於 decode 是一次一個 Token 產生的:一段 200 Token 的回應,就是模型連續跑 200 次。單就每個 Token 而言,decode 佔用 GPU 的時間遠比 prefill 長,這就是輸出定價大約是輸入 5 倍的原因。

Prefill 對整個請求做一次掃描,Decode 則每跑一次只吐一個 Token 再帶著它重跑。圖片來源:Anthropic
Session 裡有相當比例的輸出 Token 其實是思考 Token,每輪思考多少由 effort 等級控制。
官方提醒,模型與 effort 都會記住你上次的選擇並沿用到下一個 Session,所以在乾淨的新 Session 先跑一次 /model 和 /effort,確認自己到底在什麼設定上。如果明知這個 Session 就是做粗活,可以用 MAX_THINKING_TOKENS=0 claude 關掉思考(Fable 5 除外),等於比 /effort low 再低一階。
真正的省錢關鍵:不要打掉 Prompt Cache
如果一次請求的開頭跟伺服器剛看過的請求完全一致,這段共同開頭算出來的狀態也會一樣,伺服器就能留著上次的結果,只針對新增的部分做 prefill,這就是 prompt caching。讀取快取只要輸入價的 0.1 倍,寫入快取最高約 2 倍,但寫入每個 Token 只發生一次,之後每一輪都是 0.1 倍的讀取。
Claude Code 每次請求都會自動管理快取,沒有東西要你開啟,但你有辦法把它弄壞。官方特別說明,快取必須從請求的最開頭往後逐字對上,而請求順序永遠固定:工具定義 → 系統提示 → 對話(CLAUDE.md 放在對話最前面)。只要這個字首有任何改變,後面全部得重新 prefill。
會打掉快取的動作包括:對話中途下 /model(每個模型有自己的快取,含每次進出 plan 模式都換模型的 opusplan)、改 /effort、開啟 fast mode(而且重新 prefill 是按 fast mode 價格算),以及 /compact(對話被換成更短的內容,原本的都對不上了)。
還有一個容易被忽略的變數是時間:快取在訂閱制是一小時過期、API key 是五分鐘(ENABLE_PROMPT_CACHING_1H=1 可拉到一小時)。超過才回來,下一輪就會把整段對話重新 prefill;恢復舊 Session 幾乎一定也是如此。
官方的結論是,這不代表你永遠不能換模型或 effort,而是有便宜的時機(Session 剛開始、或剛下完 /clear)和昂貴的時機(一段長對話的中間)。
另外還有一招:如果最近幾輪跑歪了不想留,用 /rewind 退回那幾輪之前,成本為零;而 /compact 會重寫整段對話,一定要花錢。
問法差一個字元,成本差六輪
接著是 Session 會送出多少 Token。最重要的觀念是:沒有任何東西只被送出一次。
任何進到對話裡的東西:Claude 讀的檔案、它跑的指令輸出,都會在之後的每一輪被重新送出,直到 Session 結束。它是走快取的,所以每次重送都很便宜,但便宜不等於免費,而且它同時佔著上下文的空間,模型每一輪都得繞過它去思考。
Claude 讀多少,主要取決於它得自己摸索多少。官方用三種問法做對比:說「the tests are failing」,它得先 grep、再開啟幾個檔案找出是哪個測試,開始修之前就燒掉 6 輪;指名「fix utils.test.ts」只要 1 輪;而用 @ 提及檔案的「fix @utils.test.ts」是 0 輪,直接開修。

用 @ 提及檔案,Claude Code 會在任何東西送出前就把檔案附到你的訊息上,連 Read 呼叫都省了。圖片來源:Anthropic
官方補充一個細節:檔案本身佔的上下文空間兩種方式都一樣,所以一次對話只需要 @ 提一次,它會一直待在那裡,之後再 @ 一次通常會附上第二份副本。
另一個把上下文塞滿的是指令輸出。有趣的是超大輸出反而沒問題:超過 30,000 字元後,Claude Code 會把輸出寫進檔案,對話裡只放簡短預覽與路徑(門檻可用 BASH_MAX_OUTPUT_LENGTH 調整)。真正的問題出在門檻以下:一個一行一行印出 400 個透過測試的 test runner 剛好落在限制內,然後這 400 行就成了接下來每一輪的一部分。
官方的建議是把你每天在跑的那兩三個指令寫進 CLAUDE.md,連安靜引數一起寫,就照你自己會打的樣子。只是多加一小段,但之後每個 Session 都省下一輪對話和幾百行輸出。
一個長 Session vs 三個短 Session:1.9 倍差距
一個長 Session,比同樣工作拆成幾個短 Session 貴,而且貴得比你想像多——因為第 40 輪同時也在重讀前面 39 輪。官方實測同樣三個任務,任務之間下 /clear,跟全部擠在一個 Session 相比,後者送出的 Token 是前者的 1.9 倍。

同樣三個任務、兩種 Token 用量,不清脈絡的那組多送出 1.9 倍。圖片來源:Anthropic
操作原則很簡單:開始新東西時 /clear,同一個任務的前半段做完時 /compact。之後還想找回這個 Session 的話,先 /rename 再 /clear;/compact 時記得告訴它要保留什麼,如果每次都一樣,就在 CLAUDE.md 開一段「Compact instructions」。用 100 萬 token 模型又想把自動壓縮的安全網放回原位的人,可以用 /autocompact 200k 還原(需 Claude Code v2.1.221 以上)。
官方也提醒留意那些你沒在打字時發生的輪次:/loop 是以完整一輪的形式在你設定它的那個 Session 裡觸發,每次都會帶著那整段對話跑,如果距離上一輪超過一小時,還會再加上一次 cache miss。建議在另一個終端機開新 Session 跑 loop。
把雜訊丟到別的上下文:子代理
另一個把東西擋在你的上下文之外的方法,是讓它發生在另一個上下文裡,這就是子代理(subagent)的用途。子代理有自己的上下文視窗,包含它自己的系統提示、工具、以及你的 CLAUDE.md,但不包含你的對話。它跑自己的輪次,回到主 Session 的只有它的答案,其餘的在它結束時全部丟棄。

主 Session 只拿回三個答案,三個子代理各自讀過與跑過的一大堆東西做完就丟。圖片來源:Anthropic
缺點是子代理沒有你的對話,有時得重讀主 Session 早就有的東西,而且做這些事的時候是在花自己的輪次成本,小工作的話純粹是額外開銷。它真正划算的時機,是某個工作會產生一大堆你不需要留下的輸出,例如翻一份 log。官方也提醒:主 Session 拿回來的,只有子代理選擇回報的部分。
如果有某個吵雜的工作你一再交辦,官方建議給它一個專屬的 subagent 定義並指定 model: haiku(或 sonnet),否則它會跟著你主 Session 的模型跑。
優先檢查這四個花錢破口
文章最後把所有內容收斂成四件最值得盯的事,大致按花費由高到低排列。

官方列出的四個花錢破口。圖片來源:Anthropic
| 1. 過長的 Session | 每一輪都會重送它前面的所有東西,一個 Session 的 Token 絕大多數花在這裡 |
| 2. 上下文塞太多 | 用不到的檔案、吵雜的指令輸出、上一個任務的殘留、沒在用的 MCP server,全部都會在每一輪被重送,模型每一輪還得去想它們 |
| 3. 模型或 effort 高於任務所需 | 其他所有成本都會被它乘一次,而且這兩個設定會跨 Session 沿用 |
| 4. 打掉 prompt cache | 對話中途改模型、改 effort、改 fast mode,或在快取過期後才回來,都會讓整段對話用全價重新 prefill |
六個立刻能照做的習慣
如果只想記結論,官方在文章開頭給了六條 TL;DR:
- 任務之間下
/clear - 開工前先把模型與 effort 等級定好
- 用
@提及檔案而不是只打檔名 - 吵雜指令加上安靜引數或丟給子代理跑
- 在乾淨的新 Session 跑一次
/context看看到底載入了什麼(CLAUDE.md 只放明確指令,工作流專屬規則搬到只有用到才載入的 skills - 用不到的 MCP server 用
/mcp關掉) - 以及離開鍵盤前先
/compact,趁對話還在快取裡做摘要便宜得多。
📍相關報導📍
Claude Code 推出 Monitor 工具:背景監聽取代輪詢,大幅節省 Token 消耗
Anthropic宣布解鎖Opus 4.6百萬Token不加價!上下文測試碾壓GPT-5.4
Claude Code 桌面版大更新:多工並行、拖拉布局、三種顯示模式+新快捷鍵,為開發者而生

