YouTube 影片筆記
換任務就開新對話,三招有效控管AI額度消耗
原片標題:AI 額度老是不夠用?三招省 Token 的實戰方法
我原本以為省 Token 就是叫 AI 回話簡短一點,結果 Gary 直接點破這招根本沒用,因為對話視窗早就累積幾萬個 Token 了,你省那幾個字根本是杯水車薪。這支影片把每次送出指令時背後被塞進去的四層 Context 拆開給你看,看完才懂額度為什麼燒這麼快。

- 00:46拆解每次送出指令時,背後被塞進去的四層 Context
- 02:58破除「Prompt 寫短一點」的迷思,真正該控管的是整包 Context
- 03:56第一招:換任務就開新對話,別讓舊進度繼續燒額度
- 05:14第二招:精簡掛載的 MCP Server,工具說明文件超吃 Token
- 05:57第三招:先搜尋再餵給模型,別把整份 PDF 直接丟進去
- 07:03自動壓縮不是萬靈丹,重要規格要自己整理成 Markdown
- 07:58第三動作:用 Prompt Caching 讓輸入成本直接打一折
- 09:31送出前問自己兩個問題,判斷該開新對話還是繼續聊

換任務就開新對話,別讓舊進度繼續燒額度
很多人習慣一個視窗聊到底,剛改完登入功能又順手丟一份不相干的報表進去。但模型還背著上一段任務所有的程式碼跟報錯紀錄,等於每問一句新問題都在為舊進度白燒額度。Gary 說得很直接:任務告一段落就果斷開新視窗,讓 AI 從零開始,這是最立竿見影的一招。

先搜尋再餵給模型,別把整份文件丟進去
處理大專案時,很多人習慣把上百頁 PDF 或幾千行程式碼整包丟給 AI 自己撈。但如果問題有明確的關鍵字或錯誤代碼,先用搜尋工具找出最相關的段落,只把真正需要的內容餵進去,每次請求的 Token 就能從好幾萬瞬間降到幾百。這個動作多花不到一分鐘,省下的額度卻很可觀。

Prompt Caching 是省錢關鍵,但要注意快取壽命
Claude 或 OpenAI 都有 Prompt Caching 機制,以 Claude Opus 5 為例,命中快取後輸入價格直接打一折。但要吃到這個優惠有兩個前提:同一個 session 不能空超過一小時,中途也不要換模型或調整思考強度,否則快取全部失效,等於整段對話從頭重算一次全額。
值得下載嗎
值得,這支影片把省 Token 從「省錢」提升到「清理 AI 工作環境」的層次,三招都是日常就能立刻上手的操作習慣,看完馬上能改善你的額度焦慮。