十五題問完Agent實作,最後倒在 LC297:百度這場實習面試,篩的是哪一欄成本
一篇2025年9月7日流傳的百度Agent開發日常實習面經,十五題直問工程實作細節,最後卡在一道Hard題,本文從人才篩選成本與技術棧遷移角度拆解這場面試背後的帳。
2025年9月7日,一篇標題為「9.7百度agent開發日常實習面經」的帖子出現在牛客網。發帖人應徵的是百度Agent開發方向的日常實習,這是他投遞日常實習以來的第一場大廠面試:第一天晚上投遞簡歷,第二天早上約面,下午三點面完,全程45分鐘。整場面試的結構很清楚:前20分鐘追問專案,後25分鐘手撕一道LeetCode 297(二叉樹的序列化與反序列化,Hard難度,ACM模式),發帖人沒有寫出來。
單看是一份普通的求職分享。但如果把這十五個問題逐條拆開,再看面試官在哪裡收手、在哪裡加碼,這場45分鐘的對話其實是一份採樣:它採到了2025年下半年中國大廠在Agent開發這個新崗位上,實際願意付錢購買的技能組合長什麼樣,以及篩選機制本身的成本結構正在怎麼變。
十五個問題的分佈:工程實作佔了絕對主體
把面經裡的題目按主題歸類,結構一目了然。檢索相關兩題:混合檢索的具體實作、RAG文檔切片粒度如何確定。Agent核心循環相關約七題:自研Agent相比開源方案的差異、工具層「兜底」的定義、工具執行器的展開、實作過程最難的點、長期記憶的方案、任務中斷後如何續跑、Multi-Agent架構詳述。可觀測性相關兩題:Agent執行對開發者是不是黑盒、能否靠日誌定位卡點。協議相關三題:MCP的stdio與Streamable HTTP如何實作、Streamable HTTP是否流式、流式協議是否適合音視頻數據。
十五題裡沒有一題是傳統意義上的「八股」。沒有問TCP三次握手,沒有問資料庫索引,沒有問作業系統調度。所有題目都指向同一件事:你有沒有真的把一個Agent從檢索、工具調用、記憶、協議到可觀測性,完整地做過一遍,而且能講出每個環節的取捨理由。
這個題目分佈本身就是一個訊號。Agent開發崗位在2025年之前基本不存在於校園招聘的功能表裡,它是在大模型API成本下降、MCP等協議標準化之後才長出來的新職缺。崗位出現的速度快於任何教學體系的更新速度,學校不教,培訓機構的教材也還在追。於是面試變成唯一有效的技能驗證場,而驗證的方式只能往下挖:問到你自己做過的那一層為止。
面試官在哪裡失去了興趣
面經裡有一個被發帖人自己點出來的轉折:可觀測性。第13、14題問Agent是否黑盒、能否用日誌定位卡點,發帖人承認「觀測我就沒做,也沒怎麼講」,之後面試官對專案「就沒啥興趣了」,提問環節在20分鐘處終止,剩餘時間全部轉入手撕算法,而且出的是一道Hot 100以外的Hard題。
評論區的解讀相當一致。「可能就是不太想要你」「不給hot100默認不要你」「出個hard基本就決定了」。把這些評論翻譯成篩選機制的語言:當專案深挖沒有達到門檻,面試官把剩下的時間用來測一個高失敗率的題目,讓淘汰決定有一個客觀依據。這不是刁難,是流程成本最低的收尾方式。
可觀測性恰恰是這份題單裡最有信息量的一題。Agent系統的除錯成本是其工程成本的大頭:任務執行到一半中斷、工具調用參數錯誤、長程任務延遲暴增,這些問題在傳統軟體裡靠斷點和日誌解決,在Agent系統裡因為決策鏈條由模型驅動,傳統手段大量失效。面試官在第13題問「對你來說是黑盒嗎」,實際上是在問:你做這個系統的時候,有沒有被迫為它建造過一套感知基礎設施。這一題答空白,意味著專案的完成度停留在跑通demo的層級,與生產環境之間的距離沒有被跨越。
同期的對照樣本也在牛客網上。另一篇字節跳動9月3日的Agent開發一面面經,問了Harness概念、長程任務從5分鐘延遲到15至20分鐘如何定位、工具入參如何由模型結合上下文提供。兩家公司在同一個月、同一類崗位上,把問題都壓在系統的可觀測與可控性上,這已經不是單一面試官的偏好,而是崗位需求本身在收斂。
篩選成本這一欄,正在被重新記帳
傳統後端面試的題庫是高度標準化的:八股文加Hot 100,準備路徑明確,題目難度可控。這套體系的成本邏輯是,用一個大家都熟悉的篩選工具,把區分度維持在統計可接受的水準,單場面試的邊際成本壓到最低。
Agent開發崗位把這個成本結構打亂了。第一,技能沒有標準化教材,候選人的方差極大,有的人已經在生產環境做過MCP接入與Multi-Agent編排,有的人只是調用過API寫了個聊天機器人,兩者在簡歷上可能長得一樣。第二,驗證真偽的唯一方式是往實作細節裡挖,每一層追問都是一次人工成本投入。第三,當專案驗證失敗,面試官需要一個退出機制,Hard題就是那個退出機制。
這也解釋了為什麼發帖人感覺「面試體驗一般」。45分鐘裡,前20分鐘是高投入的逐層驗證,後25分鐘是低投入的算法測試,兩段之間的切換點就是候選人被重新定價的時刻。這與我們先前分析的百度前端面試十七題過半問AI是同一條曲線上的兩個採樣點:當崗位所需的技能組合在兩三年內被大規模替換,面試題目的構成會先於職缺描述發生變化,因為題目是招聘方真實需求的直接洩漏。
算法題的角色也在這個結構裡被重新定義。它從核心篩選工具降級為輔助工具:專案深挖通過時,算法出中檔題確認基本功;專案深挖失敗時,算法出高檔題完成淘汰。評論區那句「不給hot100默認不要你」,說的正是這個定價訊號的讀法。
誰受惠,誰承壓
受惠的一方很具體:完整做過Agent系統、包含中斷恢復與可觀測性的候選人。這批人的技能是在開源社羣和實際專案裡長出來的,供給稀少,而百度從投遞到約面不到一天的周轉速度,說明需求端在搶人。發帖人第一天晚上投、第二天早上被約,這個周轉時間本身就是供需比的讀數。
承壓的一方是仍按舊路徑準備的學生羣體。Hot 100加八股的準備組合,覆蓋不了十五題裡的十三題。準備成本需要往上遊遷移:自己動手實作一個帶工具執行器、長期記憶、MCP協議接入與日誌觀測的Agent,取代刷更多的算法題。這個準備成本明顯更高,一個能講清楚「中斷後如何續跑」的專案,投入時間以週計,而一道Hard題的準備以小時計。篩選門檻的實質抬高,發生在候選人的準備成本欄,而不是公司的招聘預算欄。
往下傳導一層,是對教培與求職內容市場的重定價。以題庫為核心產品的準備體系,對這類崗位的邊際價值在下降;以專案實作為核心的準備路徑,價值在上升。牛客網這篇面經下面的AI回覆機器人已經在按新題單給建議,這個細節本身就是內容平臺對需求變化反應速度的縮影。
收束判斷
回到那份題單。十五題裡十三題問實作、兩題問觀測、零題問八股,加上一道作為退出機制的Hard題,這場45分鐘的面試把一個新崗位的技能定價表幾乎完整攤開:檢索工程、Agent核心循環、協議實作、可觀測性,四個模組缺一不可,其中可觀測性是分水嶺。
發帖人最後的疑問是「難道大家面日常都是這樣?不是說好的hot100嗎?」答案藏在題單的構成裡:當一個崗位的存在歷史不滿三年、技能驗證沒有標準工具可用,面試就只能回歸最原始的功能,當場測你有沒有做過。Hot 100是舊崗位的篩選共識,Agent開發崗位還沒有形成自己的共識題庫,在共識形成之前,每一場面試都是一次單獨定價。這對準備者是壞消息,因為無法套模板;對真的做過專案的人是好消息,因為他們的投入第一次能被精確地驗收。這也與考場上換用中小模型的AI Coding筆試成本帳指向同一個方向:篩選機制正在從標準化題庫,轉向更貼近真實工作約束的驗證方式。
主題