8867分直接提交:科大訊飛這場AI Coding筆試,分數都擠在同一條帶上
科大訊飛9月13日筆試AI Coding環節大量考生分數卡在8800至8867區間,本文從評分機制與篩選成本結構,拆解這條分數帶背後的招聘帳。
2025年9月13日傍晚,科大訊飛2026屆校招筆試結束後,牛客網出現一則簡短的發文:「最後AI coding 8 8 6 7,不想改了直接提交了」。這個由四個數字組成的分數在隨後數小時內引來一串幾乎同構的回覆:8853、8842、8800。考生們的困境高度一致,初次提交分數不低,反覆修改後分數不再上升,甚至下降,最後在放棄迭代與勉強提交之間收場。
這條密集擠壓在8800上下的分數分佈,本身就是一個值得拆的市場訊號。它顯示評分機制在特定臨界點之後失去了區分度,而區分度正是篩選工具的核心規格。
一場兩小時的筆試,三種計分軌道
先還原考試結構。科大訊飛這場筆試為16:00至18:00共兩小時,依考生分享的題本,內容包含二十餘道單選題(每題約2分,合計約46分)與三道編程題(合計約54分)。AI Coding是獨立於傳統編程題的計分軌道,採千分制呈現,滿分對應9000分上下的量級,從考生分享的分數看,首次完整實現功能通常落在8500至8900分之間,剩餘分數綁定在少數測試樣本點上。
考生的實測經驗顯示了幾個穩定模式。其一,要求AI一次性完整實現,分數往往高於分階段指導實現;有考生先分模組引導,後改為一次生成,分數回升至8853。其二,樣本點不通過後的迭代修復效率極低,「讓它分析過不了的原因再改,結果沒有用」是多位考生的共同回饋。其三,自建測試用例通過與官方樣本點通過是兩回事,本地驗證無法覆蓋評分端的隱藏案例。
這與我們先前分析的考場上的模型比你日常用的掉兩檔現象一脈相承:考生在考場上面對的是受限的模型能力與受限的除錯迴圈,日常開發中「對話幾輪就能修好」的經驗在筆試環境中失效。
分數擠壓的原因:評分函數的邊際遞減
為什麼大量考生卡在同一條分數帶上?把評分機制攤開看,答案在於測試樣本點的難度結構。多數功能路徑的正確實現能拿到85%以上的分數,剩餘分數對應少數邊界條件與極端案例。一位考生自述「差兩個樣本點,改不出來」,另一位「耗盡所有力氣也才8853」。
問題在於,修復這兩個樣本點所需的不是更多輪對話,而是對題目邊界語義的精確理解,這恰好是當前AI輔助編程最弱的一環。考生能做的是描述症狀(哪個樣本不過),AI能做的是局部修補,但症狀描述無法傳導為正確的修補方向,於是迭代在8800分附近形成平臺期。
從篩選成本的角度看,這個平臺期對主辦方未必是缺陷。當考生分數密集分佈在狹窄帶內,AI Coding環節實際提供的區分資訊量下降,篩選功能移回單選題與傳統編程題,或者移到後續面試輪次。AI Coding環節此時承擔的功能更像門檻濾網:確認候選人具備與AI協作完成基本實現的能力,85%的完成度就是這條門檻線。
誰在這條分數帶上受惠,誰承壓
受惠方是兩類考生。一類是善於下達完整規格指令的考生,一次性把所有約束條件寫進提示詞,讓AI的首次生成即接近滿分解,避開低效的修補迴圈。另一類是具備獨立定位邊界條件能力的考生,他們能自己讀出隱藏樣本可能在測什麼,把對話從「這個點不過,幫我改」升級為「這個函數在輸入為空時應返回X,請修正」。
承壓方則是依賴迭代式除錯習慣的考生。這羣人的日常工作效率不低,但工作流建立在能執行程式、能看堆疊、能逐步驗證的環境上;筆試環境抽走了這些工具,等於強制他們用最不擅長的方式工作。留言區裡「怎麼改都改不過來」「有沒有攻略」的密集求援,反映的正是工作流與考場約束的錯配。
這條分數帶同時把成本加在培訓市場一側。筆試結束不到24小時,留言區已出現練習網站、面試題庫與攻略內容的推廣連結。當分數擠壓在可預測的區間且攻略存在明確標的,針對AI Coding筆試的應試訓練就成為一門可定價的生意,這與傳統編程筆試時代題庫經濟的演化路徑一致,只是這次標的從演算法套路換成了提示詞規格化能力。
放進更大的招募時間軸
把時間軸拉長,科大訊飛這場筆試是本季大廠AI Coding考試化的又一個數據點。美團在9月12日的技術筆試中加入AI Coding環節,我們在美團這場筆試,考的已經換了一種人力中已記錄考生分數同樣卡在8400至8888分之間。百度前端實習面試的面經也顯示,面試題重心正從八股文轉向AI協作與驗證能力。
跨公司對照可以得出兩個觀察。第一,8400至8900這條分數帶在至少兩家大廠重複出現,顯示評分系統可能採用相似的權重結構:功能正確性佔絕對大頭,邊界案例佔尾段。第二,當分數帶趨同,公司之間在這一環節獲得的橫向比較資訊也在趨同,差異化壓力將推向題目設計本身,未來題目極端案例的佔比與刁鑽程度,可能成為下一輪軍備競賽的變數。
對科大訊飛而言,這場筆試還有一層自身業務的鏡像意味。作為以AI為核心標籤的上市公司,其招聘流程中AI Coding環節的體驗直接向數千名準工程師展示其模型與工程能力的外觀。考生在考場裡體驗到的迭代低效,會形成對其技術棧的第一手印象,這是招募成本帳之外,一筆不易量化但真實存在的僱主品牌帳。
收束:門檻已定,定價未完
8867分直接提交,是考生在邊際收益趨零時的理性停損。這條8800上下的分數平臺,短期內劃出了AI協作能力的及格線,也同時暴露了評分工具在高端區間失去解析度的限制。
接下來值得追蹤的變數有二。一是主辦方是否調整樣本點結構,把分數分佈重新拉開;二是應試訓練市場的滲透速度,當提示詞規格化的攻略規模化擴散,這條分數帶可能整體上移,屆時篩選壓力又將回到下一個環節。分數帶在哪裡,篩選成本就在哪裡,這個機制不會因為換了考題而改變。
標籤:人工智慧產業+篩選成本分析+中國市場
主題