跳至主要內容
● LIVE · TAIPEI SIGNAL 001
科技 產業分析

跑分追平了,體感沒有:DeepSeek V4.1 與 Astra 的差距,出在帳本哪一欄

V2EX 網友實測 DeepSeek V4.1 跑分亮眼但與 GPT-6 Astra 實用差距明顯,本文從評測基準失真、需求分層與模型市場競爭格局,拆解跑分與體感落差背後的定價與生態帳。

SUE NEWS 編輯台 閱讀約 5 分鐘

一則 V2EX 討論串的標題寫得很直白:DeepSeek V4.1 跑分還行,實測還是和 Astra 有巨大差距。樓主的表述代表了相當一部分重度使用者的共同經驗:靜態基準分數已經貼近第一梯隊,實際拿來寫程式、拆解長任務、做多輪推理時,穩定性與指令遵循度的落差仍然肉眼可見。這則討論本身不是新聞,但它碰到的問題是整個大模型市場這兩年最核心的一個:當跑分收斂,競爭的計價單位開始往哪裡移。

基準分數為什麼會失真

公開基準測試的結構性問題並不新鮮。以程式能力為例,常見的 HumanEval、SWE-bench 類基準多為單輪、短脈絡、有明確測試案例的任務,模型只要在幾百行程式碼內一次做對就能得分。真實工作場景卻是數十個檔案的倉庫、跨輪對話的上下文、以及模糊到需要追問的需求描述。兩者的分布差距,正是 V2EX 樓主口中「跑分還行、實測差距巨大」的技術來源。

更具體地說,基準分數衡量的是單次採樣的通過率,重度使用者在乎的是第一百次呼叫時的方差。前者可以在訓練後期靠針對性資料與蒸餾快速拉高,後者涉及模型的長程一致性,這部分的改進成本遠高於刷榜。這也解釋了為什麼近兩年各家模型的榜單分數不斷逼近,使用者口碑卻持續分化。

跑分收斂之後,市場在比什麼

把鏡頭從技術換到市場結構,跑分收斂其實改變了採購決策的計價方式。當買方無法靠榜單區分模型,選擇依據會往三個方向移動:單位詞元價格、生態整合深度、以及可信度驗證機制。

DeepSeek 在第一項的動作非常積極。過去一個月內,官方先將 flash 系列調整定價,隨後又把週末全天統一按低谷時段價格計費,六天內兩張價目表,算的是一條負載曲線上的閒置算力帳。這與我們先前分析的DeepSeek 週末谷價定價策略同一邏輯:以價格彈性填滿離峯產能,把單位推理成本壓到對手難以跟進的水位。

而 Astra 走的是另一本帳。OpenAI 在 GPT-6 Astra 的訓練投入了十萬張 GPU 等級的資本支出,這筆前期投入決定了它短期內不可能打價格戰,只能靠能力差距與生態鎖定維持溢價,相關的資本結構我們在GPT-6 Astra 的十萬 GPU 資本帳一文中有過拆解。兩種商業模式的對照,恰好構成當前模型市場的基本張力:一邊賣性價比,一邊賣能力上限。

需求分層決定了差距值多少錢

「巨大差距」這個判斷是否成立,取決於用戶落在哪一層需求。

對偶發性、單輪、成本敏感的長尾需求,V4.1 與 Astra 的差距幾乎不構成支付意願的差異,價格彈性主導一切,DeepSeek 的定價策略直接命中這一層。這也是為什麼其 API 調用量能夠在價格調整後快速放大:換算下來,同樣的任務預算可以多跑數倍次的推理嘗試,用數量換品質,整體成功率未必喫虧。

但對代理型工作流,也就是讓模型連續執行數十步操作、每一步出錯都會放大成本的場景,方差就是錢。假設單步成功率 95% 與 99% 的差距,在五十步的任務鏈上會被指數放大為整體成功率約 7% 對 60% 的斷崖。這一層用戶對 Astra 的溢價支付意願最強,也正是 OpenAI 資本支出真正要收割的客羣。

傳導鏈:誰受惠、誰承壓

影響沿著三條路徑傳導。首先,跑分與體感的落差,直接受惠的是獨立評測與模型審計工具的市場,能提供可信的長程任務實測數據的第三方,正在獲得類似信用評級機構的定位。其次,居中的開源模型陣營承壓,當 V4.1 以更低價格提供相近跑分,同梯隊的其他開源模型的定價空間被同步壓縮。最後,雲端推理廠商的成本結構被重新定價,用戶按任務複雜度動態分級調用不同模型,成為越來越主流的架構選擇,單一模型獨佔工作流的假設正在鬆動。

收束判斷

V2EX 那則討論的價值,在於它把一個市場正在緩慢接受的事實講清楚了:基準分數作為採購依據的時代正在過去。跑分收斂之後,模型市場的定價權往兩端移動,一端是極致的單位成本,一端是極致的能力上限,中間地帶最為脆弱。DeepSeek V4.1 的處境是:它在成本端已經取得主動,但「實測巨大差距」這句話說明它在能力上限端仍有路要走。這條路要不要走、用多少資本支出去走,將決定它未來兩年是停留在性價比供應商,還是真正進入第一梯隊的競爭。對觀察者而言,與其盯著下一張榜單,不如盯著兩個指標:長程任務的公開實測方差數據,以及下一季的訓練資本支出規模。數字會比討論串誠實。