YouTube 影片筆記
DeepSeek內部會議揭算力差距:沒有足夠GPU連失敗資格都沒有
原片標題:DEEPSEEK梁文锋内部讲话流出,意外泄露中美ai真实差距
梁文鋒內部講話流出,我以為會是什麼熱血沸騰的「中國AI要超車了」,結果他整場都在講「我們卡不夠、實驗做太少、只能省著用」。也太誠實了吧!這支影片把三萬四千字的內部會議濃縮成一個殘酷現實:算力差距不只是機器跑多快,而是決定你有沒有資格失敗。看完我反而對「彎道超車」這四個字有點過敏了。

- 00:00梁文鋒內部講話流出,全長近四小時
- 00:48主持人提醒敏感資訊不要外傳
- 01:46梁文鋒判斷中美AI差距主要在算力
- 03:46用化學實驗比喻AI研究,強調大量試錯
- 05:14解釋為什麼AI研究更像煉丹而非數學
- 09:15DeepSeek約有兩萬張H等效算力
- 12:21解釋MoE模型與激活參數的差別
- 16:03用學霸做題比喻蒸餾的運作邏輯
- 21:08對比中美模型公司年收入的巨大差距
- 26:19總結算力、實驗、人才、數據的連鎖反應

內部講話的六個區塊
梁文鋒先講情懷,解釋為什麼堅持開源、不追求利潤最大化,團隊也不怎麼加班。接著談商業化,強調C端用戶和API收入只是通往AGI的副產品。然後給出技術路線、組織人才觀,最後才是整場最關鍵的算力判斷與競爭策略。投資人問的問題很現實:你有多少張卡?收入多少?前面講理想,後面問伺服器和現金流,現場氣氛應該很微妙。

算力決定你有沒有失敗的資格
AI研究不是數學,更像化學實驗。數學靠天才拿支筆就能推導,但大模型靠的是不斷調整權重、反覆試錯,沒有足夠的GPU連失敗的資格都沒有。算力充足的公司可以同時跑二十組實驗,三天迭代一輪;算力不足只能排隊跑兩組,一年下來美國研究員看過兩千五百次真實結果,中國研究員只看過兩百五十次。這不是線性差距,是乘冪式的。

便宜不是護城河
中國模型便宜是因為激活參數少,每次處理token只叫三十個人開會,美國叫三百個人。但美國先燒錢把能力邊界頂出去,再把技術下放到小模型,就像先造F1賽車再發展民用車。蒸餾可以複製老師已經表現出來的能力,但面對全新問題時,學生不會自己產生新能力。如果Scaling Law繼續有效,領先者用更強模型加速研究,差距可能擴大而不是縮小。

數據飛輪與商業現實
真實用戶使用模型產生的回饋數據,比訓練語料更值錢。模型越好吸引越多用戶,用戶產生更多任務,任務暴露更多失敗,失敗變成訓練信號,下一代模型更好。美國的飛輪是模型能力、用戶數據、收入算力三個飛輪焊在一起。中國模型便宜兩三倍,很難穿越政治和信任壁壘,企業客戶更在意資料放哪裡、受哪國法律管轄。
值得下載嗎
值得。這支影片把梁文鋒三萬四千字內部講話拆成算力、實驗、人才、數據飛輪的連鎖反應,講清楚「永遠落後三個月」背後的結構性原因,比單純喊口號或唱衰都更有參考價值。