• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

Claude Code 官方教學:如何最大化 Sessions 價值,減少 Token 浪費

Token 形上學 by Token 形上學
2026-08-16
in AI, 技術
A A
Anthropic 宣布 Q2 預計首次獲利:季營收翻倍至 109 億美元,提早兩年達標
36
SHARES
分享至Facebook分享至Twitter

Anthropic 發布官方文章〈Maximizing the value of your Claude Code sessions〉,拆解 Claude Code 的計價機制,點名六個立刻能照做的習慣,並列出最該盯的四個花錢破口。
(前情提要:Claude Code 推出 Monitor 工具:背景監聽取代輪詢,大幅節省 Token 消耗)
(背景補充:Anthropic宣布解鎖Opus 4.6百萬Token不加價!上下文測試碾壓GPT-5.4)

本文目錄

Toggle
  • 一個 Token 到底在賣什麼
  • 輸出為什麼貴 5 倍:Prefill 與 Decode
  • 真正的省錢關鍵:不要打掉 Prompt Cache
  • 問法差一個字元,成本差六輪
  • 一個長 Session vs 三個短 Session:1.9 倍差距
  • 把雜訊丟到別的上下文:子代理
  • 優先檢查這四個花錢破口
  • 六個立刻能照做的習慣

 

過去寫程式的工具是固定費用甚至免費,編輯器不會因為你今天下午多修了四十九個測試就多收錢,單一任務本身沒有自己的價格。代理式(agentic)程式設計工具把這件事改掉了:同一個任務,用法不同,價格就不同。

Anthropic 在 8 月 14 日發布的官方文章中,用一個很小的例子說明這件事。同樣是修一個壞掉的測試,Session A 讀了測試檔、讀了被測檔案、改完收工,只送出 5 個 request;Session B 先在整個 repo grep 一輪,沿路開啟十幾個檔案才走到同樣那兩個檔,膨脹成 18 個 request — 而且這期間每一輪都還拖著今天早上以來讀進對話的所有東西。

Claude Code Session A 與 Session B 的 request 數量對比

同樣一個修復,先搜尋的 Session B 送出的 request 是 Session A 的三倍以上。圖片來源:Anthropic

文章強調一個關鍵觀念:所謂省 Token 不是總量用得更少,而是確保你花掉的 Token 都真的用在你要求的那件事上。

一個 Token 到底在賣什麼

帳單按 Token 計價,但你實際上付的是推論(inference),也就是 GPU 跑完模型所耗的時間。官方點出三件事決定一個 Token 佔用多少時間:用哪個模型、它是輸入還是輸出、以及有沒有被快取。

模型越大,處理輸入與輸出的工作量都越大,而且底下講的所有成本都會被模型單價再乘一次。官方的建議是:問題真的困難或曖昧時才用大模型,例行工作用小模型就好。

簡單任務與困難任務上,大小模型的品質曲線差異

簡單任務上大小模型的品質曲線很快收斂,困難任務上則不會——大模型能用更少 Token 達到同樣品質。(官方註明曲線僅為示意,非真實 benchmark 資料)圖片來源:Anthropic

輸出為什麼貴 5 倍:Prefill 與 Decode

一次請求在 GPU 上會走兩個階段。Prefill(預填)是模型讀進你的請求與脈絡 — 系統提示、你的 CLAUDE.md、你的訊息,加上這段對話至今被塞進來的一切,這些是輸入 Token。Decode(解碼)則是模型寫出輸出 Token:它的思考、工具呼叫、你看到的文字。

差別在於 decode 是一次一個 Token 產生的:一段 200 Token 的回應,就是模型連續跑 200 次。單就每個 Token 而言,decode 佔用 GPU 的時間遠比 prefill 長,這就是輸出定價大約是輸入 5 倍的原因。

Prefill 與 Decode 兩階段示意

Prefill 對整個請求做一次掃描,Decode 則每跑一次只吐一個 Token 再帶著它重跑。圖片來源:Anthropic

Session 裡有相當比例的輸出 Token 其實是思考 Token,每輪思考多少由 effort 等級控制。

官方提醒,模型與 effort 都會記住你上次的選擇並沿用到下一個 Session,所以在乾淨的新 Session 先跑一次 /model 和 /effort,確認自己到底在什麼設定上。如果明知這個 Session 就是做粗活,可以用 MAX_THINKING_TOKENS=0 claude 關掉思考(Fable 5 除外),等於比 /effort low 再低一階。

真正的省錢關鍵:不要打掉 Prompt Cache

如果一次請求的開頭跟伺服器剛看過的請求完全一致,這段共同開頭算出來的狀態也會一樣,伺服器就能留著上次的結果,只針對新增的部分做 prefill,這就是 prompt caching。讀取快取只要輸入價的 0.1 倍,寫入快取最高約 2 倍,但寫入每個 Token 只發生一次,之後每一輪都是 0.1 倍的讀取。

Claude Code 每次請求都會自動管理快取,沒有東西要你開啟,但你有辦法把它弄壞。官方特別說明,快取必須從請求的最開頭往後逐字對上,而請求順序永遠固定:工具定義 → 系統提示 → 對話(CLAUDE.md 放在對話最前面)。只要這個字首有任何改變,後面全部得重新 prefill。

會打掉快取的動作包括:對話中途下 /model(每個模型有自己的快取,含每次進出 plan 模式都換模型的 opusplan)、改 /effort、開啟 fast mode(而且重新 prefill 是按 fast mode 價格算),以及 /compact(對話被換成更短的內容,原本的都對不上了)。

還有一個容易被忽略的變數是時間:快取在訂閱制是一小時過期、API key 是五分鐘(ENABLE_PROMPT_CACHING_1H=1 可拉到一小時)。超過才回來,下一輪就會把整段對話重新 prefill;恢復舊 Session 幾乎一定也是如此。

官方的結論是,這不代表你永遠不能換模型或 effort,而是有便宜的時機(Session 剛開始、或剛下完 /clear)和昂貴的時機(一段長對話的中間)。

另外還有一招:如果最近幾輪跑歪了不想留,用 /rewind 退回那幾輪之前,成本為零;而 /compact 會重寫整段對話,一定要花錢。

問法差一個字元,成本差六輪

接著是 Session 會送出多少 Token。最重要的觀念是:沒有任何東西只被送出一次。

任何進到對話裡的東西:Claude 讀的檔案、它跑的指令輸出,都會在之後的每一輪被重新送出,直到 Session 結束。它是走快取的,所以每次重送都很便宜,但便宜不等於免費,而且它同時佔著上下文的空間,模型每一輪都得繞過它去思考。

Claude 讀多少,主要取決於它得自己摸索多少。官方用三種問法做對比:說「the tests are failing」,它得先 grep、再開啟幾個檔案找出是哪個測試,開始修之前就燒掉 6 輪;指名「fix utils.test.ts」只要 1 輪;而用 @ 提及檔案的「fix @utils.test.ts」是 0 輪,直接開修。

三種問法在開始修復前所需的輪次對比

用 @ 提及檔案,Claude Code 會在任何東西送出前就把檔案附到你的訊息上,連 Read 呼叫都省了。圖片來源:Anthropic

官方補充一個細節:檔案本身佔的上下文空間兩種方式都一樣,所以一次對話只需要 @ 提一次,它會一直待在那裡,之後再 @ 一次通常會附上第二份副本。

另一個把上下文塞滿的是指令輸出。有趣的是超大輸出反而沒問題:超過 30,000 字元後,Claude Code 會把輸出寫進檔案,對話裡只放簡短預覽與路徑(門檻可用 BASH_MAX_OUTPUT_LENGTH 調整)。真正的問題出在門檻以下:一個一行一行印出 400 個透過測試的 test runner 剛好落在限制內,然後這 400 行就成了接下來每一輪的一部分。

官方的建議是把你每天在跑的那兩三個指令寫進 CLAUDE.md,連安靜引數一起寫,就照你自己會打的樣子。只是多加一小段,但之後每個 Session 都省下一輪對話和幾百行輸出。

一個長 Session vs 三個短 Session:1.9 倍差距

一個長 Session,比同樣工作拆成幾個短 Session 貴,而且貴得比你想像多——因為第 40 輪同時也在重讀前面 39 輪。官方實測同樣三個任務,任務之間下 /clear,跟全部擠在一個 Session 相比,後者送出的 Token 是前者的 1.9 倍。

任務之間下 /clear 與全部擠在一個 Session 的 Token 用量對比

同樣三個任務、兩種 Token 用量,不清脈絡的那組多送出 1.9 倍。圖片來源:Anthropic

操作原則很簡單:開始新東西時 /clear,同一個任務的前半段做完時 /compact。之後還想找回這個 Session 的話,先 /rename 再 /clear;/compact 時記得告訴它要保留什麼,如果每次都一樣,就在 CLAUDE.md 開一段「Compact instructions」。用 100 萬 token 模型又想把自動壓縮的安全網放回原位的人,可以用 /autocompact 200k 還原(需 Claude Code v2.1.221 以上)。

官方也提醒留意那些你沒在打字時發生的輪次:/loop 是以完整一輪的形式在你設定它的那個 Session 裡觸發,每次都會帶著那整段對話跑,如果距離上一輪超過一小時,還會再加上一次 cache miss。建議在另一個終端機開新 Session 跑 loop。

把雜訊丟到別的上下文:子代理

另一個把東西擋在你的上下文之外的方法,是讓它發生在另一個上下文裡,這就是子代理(subagent)的用途。子代理有自己的上下文視窗,包含它自己的系統提示、工具、以及你的 CLAUDE.md,但不包含你的對話。它跑自己的輪次,回到主 Session 的只有它的答案,其餘的在它結束時全部丟棄。

一段對話、四個上下文的子代理架構示意

主 Session 只拿回三個答案,三個子代理各自讀過與跑過的一大堆東西做完就丟。圖片來源:Anthropic

缺點是子代理沒有你的對話,有時得重讀主 Session 早就有的東西,而且做這些事的時候是在花自己的輪次成本,小工作的話純粹是額外開銷。它真正划算的時機,是某個工作會產生一大堆你不需要留下的輸出,例如翻一份 log。官方也提醒:主 Session 拿回來的,只有子代理選擇回報的部分。

如果有某個吵雜的工作你一再交辦,官方建議給它一個專屬的 subagent 定義並指定 model: haiku(或 sonnet),否則它會跟著你主 Session 的模型跑。

優先檢查這四個花錢破口

文章最後把所有內容收斂成四件最值得盯的事,大致按花費由高到低排列。

Claude Code Session 四個最該注意的成本破口

官方列出的四個花錢破口。圖片來源:Anthropic

1. 過長的 Session 每一輪都會重送它前面的所有東西,一個 Session 的 Token 絕大多數花在這裡
2. 上下文塞太多 用不到的檔案、吵雜的指令輸出、上一個任務的殘留、沒在用的 MCP server,全部都會在每一輪被重送,模型每一輪還得去想它們
3. 模型或 effort 高於任務所需 其他所有成本都會被它乘一次,而且這兩個設定會跨 Session 沿用
4. 打掉 prompt cache 對話中途改模型、改 effort、改 fast mode,或在快取過期後才回來,都會讓整段對話用全價重新 prefill

六個立刻能照做的習慣

如果只想記結論,官方在文章開頭給了六條 TL;DR:

  • 任務之間下 /clear
  • 開工前先把模型與 effort 等級定好
  • 用 @ 提及檔案而不是只打檔名
  • 吵雜指令加上安靜引數或丟給子代理跑
  • 在乾淨的新 Session 跑一次 /context 看看到底載入了什麼(CLAUDE.md 只放明確指令,工作流專屬規則搬到只有用到才載入的 skills
  • 用不到的 MCP server 用 /mcp 關掉)
  • 以及離開鍵盤前先 /compact,趁對話還在快取裡做摘要便宜得多。

加入動區 Telegram 頻道

📍相關報導📍

Claude Code 推出 Monitor 工具:背景監聽取代輪詢,大幅節省 Token 消耗

Anthropic宣布解鎖Opus 4.6百萬Token不加價!上下文測試碾壓GPT-5.4

Claude Code 桌面版大更新:多工並行、拖拉布局、三種顯示模式+新快捷鍵,為開發者而生

Claude Opus 4.6 來了:自己寫編譯器、做 PPT、隨手挖出 500 個零日漏洞,你的工作它都想試試

Anthropic 訂閱 Claude Code 封殺龍蝦 OpenClaw!往後第三方工具僅能付費額度

Tags: AI AgentAnthropicClaudeClaude CodePrompt Caching


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.