考場上的模型比你日常用的掉兩檔:AI Coding筆試的帳,算在輪次那一欄
一篇牛客網熱帖揭示大廠AI Coding筆試的考場約束:主辦方提供的中小模型、90分鐘3題,本文從成本結構與需求分層角度拆解分步式寫法在小模型上失效的帳。
一則帖子最近在牛客網被反覆轉發。作者自述背景是雙非學歷、後端轉Agent開發,走過一輪秋招與春招,近幾週在SWE-bench上測試自己的agent配置,觀察到一個反直覺現象:日常習慣的分步式agentic寫法,掛在大模型上通過率明顯上升,換成7B到30B級別的小模型,同一套流程通過率斷崖式下跌,反而不如一條prompt直接輸出完整修復的一次成稿。作者把這個發現對照今年大廠筆試的AI Coding環節,得出的結論是:考場的生存法則與日常練習完全相反。
這則帖子的價值不在求職建議本身,而在它無意間攤開了一本成本帳:企業在筆試環節部署什麼等級的模型、考生用什麼流程操作,兩邊的約束條件加起來,決定了這場考試實際在篩選什麼能力。
先看考場上的模型是誰出的錢
AI Coding筆試自2024年招聘季開始鋪開。據帖子描述,螞蟻率先將AI Coding定為演算法崗與研發崗筆試必考題,字節、騰訊、百度、華為、美團、拼多多隨後跟進。題型集中在三類:以numpy實作KMeans、PCA等ML工程題且必須可運行、呼叫API完成程式碼生成與自動除錯的模型調用題、以及AI結合演算法的綜合題。時間約束普遍是3題90分鐘,在牛客平臺的線上IDE內完成。
關鍵變數在模型選擇。考場提供的AI助手由主辦方部署,考生無法外掛自己的Claude或GPT。為了成本可控並防止作弊,主辦方普遍部署中小型模型。牛客上已考過的考生回報:讓考場AI第一次寫程式碼耗時很久且常有bug,光跑通樣例就花了30分鐘。
把這些條件排列起來,考場的真實約束是:模型能力比考生日常使用的大約低兩檔、單題平均預算30分鐘、AI輸出的程式碼大概率帶bug。在這組約束下,考生日常養成的分步式操作流程,恰恰是失效率最高的打法。
為什麼分步寫法在小模型上會崩
帖子給出的解釋可以整理成一條誤差累積的邏輯。分步式agentic寫法的核心假設是「每一步都夠準,多步串聯換品質」,先把bug成因分析清楚,再改程式碼,跑測試,讀報錯,再修改。這個假設在大模型上成立,在小模型上不成立。
首先是單輪出錯率。分步寫法的每一步都是一次獨立生成,弱模型的單輪出錯率本來就偏高,更關鍵的是它利用上一輪回饋的能力差:拿到報錯經常修不到點上,甚至把先前正確的部分改錯,錯誤逐輪傳播。大模型單輪穩、修得準,多步迭代是加分項;弱模型多輪循環的邊際收益為負,越迭代越糟。
其次是上下文的有效利用率。小模型的名義上下文長度並不短,7B級別的Qwen2.5-Coder模型卡標示支援128K。問題在分步寫法會把最初需求、每輪程式碼、每次運行日誌與報錯全部堆進對話,堆到後段模型開始遺忘:丟失函數簽名、忽略邊界條件、把已修好的bug改回去。名義長度足夠,有效容量被歷史紀錄稀釋。一次成稿沒有這個問題,一條prompt進、一次輸出出,上下文全程乾淨。
再來是指令遵循度。小模型對「先分析、再給方案、然後動手、最後跑測試」這類多步指令的執行完成度低,可能停在分析環節不寫碼,可能跳過分析直接亂改,也可能改完不跑測試就交卷。
最後是時間帳。每輪循環(生成、運行、讀回饋)至少5到8分鐘,走五輪就是40分鐘,超過單題30分鐘的預算。帖子裡那些「AI幫倒忙」的案例,多數不是題目太難,而是流程把時間燒完了。
這條邏輯對應的正是我們先前分析過的現象:模型的推理成本與能力檔位,直接改變了使用者的最適操作策略,這與MiniMax 把斬殺線算在詞元成本那一欄的思路同構,模型檔位下降,最優互動輪次必須跟著壓縮,兩者是同一本帳的兩面。
這場考試實際在篩選什麼
把鏡頭從個人策略拉到市場層面,AI Coding筆試改變的是篩選標準的權重結構。
傳統筆試篩編碼能力與演算法能力。加入AI環節後,表面上考的是「會不會用AI」,實際考的是考生有沒有能力辨識手上工具的檔位,並據此切換操作模式。日常用慣大模型的考生,肌肉記憶裡刻著agentic流程,進考場後模型掉兩檔但習慣沒換,等於拿大模型的戰法打小模型的仗。輸的不是技術,是沒做適配。
這個篩選機制對哪一類考生有利,值得注意。能接觸頂級模型API、日常在高檔位環境裡練習的考生,反而可能因為習慣錯位而喫虧;對小模型行為特性有實測經驗、懂得壓縮輪次的考生佔優。篩選的不再是資源可及性,而是對工具能力邊界的判斷力。
從企業端看,這也反映在招聘需求的分層上。這與我們先前從遊戲用戶端秋招面經拆解的人力市場定價帳是同一個週期的兩個切片:產業冷卻期裡,企業用更低的篩選成本、更高的筆試強度壓縮面試名單,AI Coding環節既是能力測試,也是成本控制工具。主辦方部署中小模型而非頂級模型,本身就把「防止外掛」與「推理成本可控」放在了體驗之前。考生端的時間帳(單題30分鐘)與企業端的成本帳(中小模型檔位),兩本帳共同決定了考場的最適策略是減少輪次、一次成稿、把AI當輸出工具而非迭代夥伴。
收束判斷
這則帖子能走紅,本質上是一個轉換期的典型症狀。評測平臺上可量化的通過率差異(分步寫法在大模型上上漲、在小模型上斷崖下跌),與考場上考生的實際翻車經驗互相印證,指向同一個結論:AI輔助能力的定義正在分裂。用大模型是把流程設計交給模型,用小模型是把流程設計收回自己手上。
對正在準備招聘季的考生,可操作的結論是:在與考場同檔位的開源模型上做模擬,練一次成稿的prompt寫法,把多輪迭代從流程裡刪掉。對觀察人力市場的人,更值得留意的是下一個週期的問題:當企業端部署的模型檔位逐季上升,考場的最適策略會不會再翻轉一次。屆時篩選的將是另一種能力,而習慣的錯位,永遠落在反應最慢的那批人頭上。
主題