YTGET

貼上影片網址

DeepSeek內部會議揭算力差距:沒有足夠GPU連失敗資格都沒有

YouTube 影片筆記

DeepSeek內部會議揭算力差距:沒有足夠GPU連失敗資格都沒有

原片標題:DEEPSEEK梁文锋内部讲话流出,意外泄露中美ai真实差距

梁文鋒內部講話流出,我以為會是什麼熱血沸騰的「中國AI要超車了」,結果他整場都在講「我們卡不夠、實驗做太少、只能省著用」。也太誠實了吧!這支影片把三萬四千字的內部會議濃縮成一個殘酷現實:算力差距不只是機器跑多快,而是決定你有沒有資格失敗。看完我反而對「彎道超車」這四個字有點過敏了。

會議紀要果然流出
會議紀要果然流出00:55
  1. 00:00梁文鋒內部講話流出,全長近四小時
  2. 00:48主持人提醒敏感資訊不要外傳
  3. 01:46梁文鋒判斷中美AI差距主要在算力
  4. 03:46用化學實驗比喻AI研究,強調大量試錯
  5. 05:14解釋為什麼AI研究更像煉丹而非數學
  6. 09:15DeepSeek約有兩萬張H等效算力
  7. 12:21解釋MoE模型與激活參數的差別
  8. 16:03用學霸做題比喻蒸餾的運作邏輯
  9. 21:08對比中美模型公司年收入的巨大差距
  10. 26:19總結算力、實驗、人才、數據的連鎖反應
AI研究更像煉丹
AI研究更像煉丹05:14

內部講話的六個區塊

梁文鋒先講情懷,解釋為什麼堅持開源、不追求利潤最大化,團隊也不怎麼加班。接著談商業化,強調C端用戶和API收入只是通往AGI的副產品。然後給出技術路線、組織人才觀,最後才是整場最關鍵的算力判斷與競爭策略。投資人問的問題很現實:你有多少張卡?收入多少?前面講理想,後面問伺服器和現金流,現場氣氛應該很微妙。

中美AI差距在算力
中美AI差距在算力01:46

算力決定你有沒有失敗的資格

AI研究不是數學,更像化學實驗。數學靠天才拿支筆就能推導,但大模型靠的是不斷調整權重、反覆試錯,沒有足夠的GPU連失敗的資格都沒有。算力充足的公司可以同時跑二十組實驗,三天迭代一輪;算力不足只能排隊跑兩組,一年下來美國研究員看過兩千五百次真實結果,中國研究員只看過兩百五十次。這不是線性差距,是乘冪式的。

兩萬張H等效算力
兩萬張H等效算力09:15

便宜不是護城河

中國模型便宜是因為激活參數少,每次處理token只叫三十個人開會,美國叫三百個人。但美國先燒錢把能力邊界頂出去,再把技術下放到小模型,就像先造F1賽車再發展民用車。蒸餾可以複製老師已經表現出來的能力,但面對全新問題時,學生不會自己產生新能力。如果Scaling Law繼續有效,領先者用更強模型加速研究,差距可能擴大而不是縮小。

蒸餾的運作邏輯
蒸餾的運作邏輯16:03

數據飛輪與商業現實

真實用戶使用模型產生的回饋數據,比訓練語料更值錢。模型越好吸引越多用戶,用戶產生更多任務,任務暴露更多失敗,失敗變成訓練信號,下一代模型更好。美國的飛輪是模型能力、用戶數據、收入算力三個飛輪焊在一起。中國模型便宜兩三倍,很難穿越政治和信任壁壘,企業客戶更在意資料放哪裡、受哪國法律管轄。

值得下載嗎

值得。這支影片把梁文鋒三萬四千字內部講話拆成算力、實驗、人才、數據飛輪的連鎖反應,講清楚「永遠落後三個月」背後的結構性原因,比單純喊口號或唱衰都更有參考價值。

這支影片值得下載收藏嗎?
YTGet 編輯室|看完影片整理的筆記,細節以原片為準。

連線中

影片封面

擷取畫面

輸入時間點,例如 3:20、3.20 或 200

影片皆已含音訊。檔案越大準備時間越久,完成前請保持頁面開啟。

加到書籤列,看影片時一鍵解析

把右邊這顆按鈕拖曳到瀏覽器的書籤列。之後在 YouTube、Facebook、X 的影片頁面按一下,就會直接跳來這裡解析,不用複製貼上網址。

YTGet 下載

瀏覽器基於安全考量會擋下直接點擊,請用拖曳的方式加入。 手機請改用瀏覽器的「分享」功能開啟本站再貼上網址。