YouTube 影片筆記
Opus 5.5 無預警上線實測跑分價格與額度完整拆解
原片標題:ChatGPT 該換 Claude 嗎?Opus 5.5 突襲上線!智力指數第一、成本還大降 40%,價格、跑分、額度完整比較
原片說明
Anthropic 這次根本是趁 OpenAI 在慶功的時候直接掀桌。GPT-6 Astra 好評才洗版幾個禮拜,Opus 5.5 就在九月二十二號無預警上線,官方說大部分工作做得跟最貴的 Fable 5.1 一樣好,跑一般工作的花費還少四成。可波這支就把跑分、單價、額度一項一項拆給你看,最後再對上 OpenAI 同一天端出的 Sol 跟 Luna。

- 00:13九月二十二號無預警放出 Opus 5.5,成本降四成
- 00:51網友拿它做動畫,有人把「自己的一生」畫出來
- 01:20可波自己實測,花十幾二十分鐘、調兩三輪做出動畫
- 02:23官方列九項跑分,Opus 5.5 拿下七項最高
- 05:25第三方 Artificial Analysis 智力指數 58 分排第一
- 06:14拆解單價,輸入 4 美元、輸出 20 美元,比上一代降兩成
- 06:44官方說的降四成,關鍵在 token 用量也變少
- 09:19財報分析測試,十八份過十六份,前代一份都沒過
- 10:20二十萬行程式除錯,上一代花二十多小時,5.5 不到三小時
- 13:37OpenAI 同天推出 GPT-6 Sol 與 Luna,走便宜路線

跑分贏七項,但官方自己說差距沒那麼大
九項評比裡 Opus 5.5 拿下七項最高,寫程式的三項全拿,GDPval 這種辦公室任務也贏得明顯。可是 Anthropic 自己講得很白,到這個程度跑分差距已經不太能代表實際用起來的差別,他們實測下來跟 Fable 5.1 的距離比帳面數字還小。所以比較準的說法是:它是一個跟旗艦差不多強、但便宜很多的模型。

便宜四成的真相藏在思考強度裡
單價確實降了兩成,但官方說的四成是加上 token 用量變少才湊出來的。要注意的是思考強度,Artificial Analysis 實測把思考開到最高,每題輸出 token 是上一代的 1.6 倍,算下來每題花費跟 Opus 5 差不多,根本沒省到。選單上也直接寫了,用 Opus 扣額度是 Sonnet 5 的 1.5 倍。工作不需要想那麼深的話,留在預設才是真的省。

實際工作表現比跑分更有說服力
官方那個財報分析測試很硬,只能自己上網找資料,每個數字都會回頭核對,編一個就不及格。Opus 5.5 寫十八份過十六份,Fable 5.1 跟上一代 Opus 5 一份都沒過。寫程式那邊更誇張,二十萬行的程式除錯,上一代花二十多小時,5.5 不到三小時,用量還不到一半。另外它講話方式也改了,第一句先講白話結論,後面才補細節。
值得下載嗎:值得,如果你正在 Claude 跟 ChatGPT 之間搖擺,這支把價格、額度、跑分跟實際案例都算清楚了,十五分鐘換一個明確的選擇依據,很划算。