YouTube 影片筆記
DeepSeek 壓縮 KV Cache 四倍與 27B 模型塞進 iPhone 的效率技術解析
原片標題:XEP29 - AI 市場變了!DeepSeek 最新壓縮技術、量化前沿與 AI 市場新訊號【試聽】
原片說明
AI 圈這兩個禮拜的新聞多到根本追不完,哈利自己都說好幾則本來可以單獨做一集。結果他挑了兩則效率提升的技術來補聊,一則是把 KV Cache 又壓縮四倍的 DeepSeek,一則是能把 27B 模型塞進 iPhone 的量化技術。最讓我意外的是,這種等級的壓縮以前早就該殺盤了,這次市場居然沒反應。

影片時間軸
- 01:44說明要把 AI 效率推到極限,現在大家用什麼做法
- 02:29介紹 DeepSeek V4.1 Flash,重點不在模型本身
- 03:00解釋壓縮 KV Cache 能省下大量 HBM 用量
- 03:55帶出 PrismML 的 Bonsai 2 27B 量化模型
- 06:20回頭複習什麼是 KV Cache 與注意力機制
- 08:31回顧 DeepSeek 從 V1 到現在每一代的壓縮倍數
- 11:06拆解這次壓縮背後的 CSA2 技術
- 11:47進入 Transformer layer 的細節說明

兩則新聞為什麼被挑出來
哈利開頭就講得很清楚,過去兩週 AI 圈的新聞量大到每週都有三、四則可以單獨做一集,但節目時間有限,只能挑一兩則聊深。他選的這兩則都跟效率提升有關,一個是 DeepSeek 壓縮 KV Cache,一個是 PrismML 的量化模型。他特別點出過去三年只要出現效率提升的新聞,股市幾乎都會先殺一波,這次卻沒有,這是他想順便談市場觀察的切入點。

壓縮四倍是什麼概念
DeepSeek 這次把 KV Cache 又壓縮了四倍,一個 token 不到 1 KB,只有 890 bytes。哈利把歷代數字攤出來對比,V1 時代一個 token 要 39 萬 bytes,V3.2 靠 MLA 壓了八倍,V4 Flash 又壓了 13.7 倍。兩年內從 39 萬降到 890,差不多是 437 倍。他說追技術追久了,看到這種規模不會太意外,但實際看到數字還是覺得神奇,因為這些壓縮不是亂壓,是有保住重要資訊的。

27B 模型塞進 iPhone
PrismML 的 Bonsai 2 27B 是基於 Qwen3 27B 量化出來的,原本 16-bit 精度要 54 GB,一般消費者根本跑不動。壓到 1.7 bit 之後只剩 6 GB,新的 iPhone 就能跑。哈利說從 Benchmark 看幾乎沒有智慧損失,但他也補了一句這只是 Benchmark 成績,有它的限制。這段對想知道本地跑模型門檻的人來說,是這集最具體的一個數字。
值得下載嗎
如果你在追 AI 推論效率的技術進展,這集把 KV Cache 壓縮的來龍去脈講得很完整,數字對照也清楚,值得留著。但如果你只想聽市場觀點,那部分這集只是點到為止,試聽版還沒講完。