每分鐘 0.05 美元的語音層:GPT-Live-1 上架 API,攤開的是即時語音智慧體的定價帳
OpenAI 將即時語音模型 GPT-Live-1 推上 API,每分鐘 0.05 美元的前端語音層定價,本文從成本結構與定價權角度拆解語音智慧體市場的帳。
一個價格欄位先看規模:每分鐘 0.05 美元,換算成一小時是 3 美元,約合人民幣 20.2 元。這是 OpenAI 於 2026 年 9 月 11 日把 GPT-Live-1 推入 API 時,為前端語音層標出的單價,後端模型與智慧體工具費用另計。這個數字本身不驚人,值得拆的是它背後的架構選擇:OpenAI 把語音理解與語音輸出整併進同一個模型,砍掉了「語音轉文字、大語言模型、文字轉語音」的三段式接力。工程上的延遲下降,最終會以成本結構的形式,落進每一個做電話客服、餐廳預訂、語言學習的開發者帳本裡。
架構整併省下的,是每次銜接的帳
傳統即時語音系統的帳本由三張發票疊成:ASR 轉寫按音訊時長計費、LLM 按詞元計費、TTS 按字元計費。三段之間的銜接還要喫掉兩筆隱形成本,一是延遲,二是工程維護。GPT-Live-1 的做法是把前端語音層壓縮成單一計價單位,複雜推理與工具調用則交給後端文本模型處理,等於把「即時性要求高的薄層」與「推理要求厚的層」拆開定價。
這個分層在實際部署數據上有初步佐證。OpenAI 引用的早期評估顯示,語言學習平臺 Speak 使用 GPT-Live-1 後,學習者思考停頓期間的誤打斷次數,較此前基於輪次的系統減少近 80%。醫療服務平臺聯合創辦人兼技術長 Tony Stoyanov 給出的數字更具體:團隊程式碼量減少 80%,刪掉約 2.3 萬行。這兩個 80% 指向同一件事,銜接邏輯的工程成本正在從開發者的資產負債表上被移走,轉移到模型供應商這一側。
這與我們先前在GPT-6 Astra 背後的資本帳中拆解的邏輯一致:前沿模型公司把基礎設施成本集中化,再把標準化能力以 API 單價賣回去。語音層只是這條路線在即時互動場景的延伸。
定價權落在哪一欄
把 0.05 美元每分鐘放回座標系看。電話客服場景的一通典型通話約 5 分鐘,前端語音層成本約 0.25 美元;若後端掛 GPT-6 Astra 中等推理強度,疊加的詞元費用才是帳單的大頭。這種「薄前端、重後端」的報價結構,實質上把定價權從語音中間件廠商手上移回模型層。過去做全雙工語音對話的第三方方案,要自己組裝三段管線並從中抽取整合溢價;當單一 API 以每分鐘計價覆蓋打斷處理、停頓偵測、背景噪聲與輪次檢測,中間件的生存空間被壓縮到後端工具與企業系統整合那一塊。
橫向對照可以看歐洲陣營的嘗試。我們先前分析過Quasar 438B 的詞元定價帳,歐洲模型選擇在文字推理層打價格戰;GPT-Live-1 則是在語音這個更靠近終端客戶的介面層定錨。兩者共同點是:模型供應商不再賣能力,而是賣「每分鐘」或「每百萬詞元」這種可直接換算成單位經濟學的計價單位。對採購方來說,這讓語音智慧體的損益兩平點第一次可以被算清楚,一小時 3 美元的前端成本,對照美國客服人力每小時 15 至 20 美元起的薪資結構,替代空間取決於後端推理費用的控制。
誰受惠,誰承壓
受惠端分三層。第一層是 Speak 這類語言學習平臺,其核心產品體驗本就繫於對話自然度,誤打斷減少 80% 直接對應留存與完課率的改善空間。第二層是中小型語音應用開發者,2.3 萬行程式碼的刪減幅度若可規模化複製,代表進入門檻從工程能力轉為提示詞與業務流程設計。第三層是 OpenAI 自身,12 種新語音(Quartz、Ripple、Vesper 等)加上未來數月的語言擴充,是把 API 從功能供給推向品牌化供給的訊號。
承壓端同樣清楚。其一,獨立 ASR 與 TTS 廠商,當單一模型原生支援語音辨識轉寫與字母數字理解,純管線環節的可取代性升高。其二,自建語音智慧體平臺的 SaaS 公司,其整合溢價建基於三段式架構的複雜度,架構整併後溢價基礎變薄。其三,電信級 IVR 與傳統呼叫中心外包商,電話場景被 OpenAI 點名為目標用途,餐廳預訂與客服這類高頻低複雜度的通話,是替代曲線最陡的區段。
傳導機制上,壓力先落在語音中間件,再往呼叫中心服務商與 IVS 整合商移動;人力替代的影響則取決於後端推理成本曲線的下降速度,這一項目前還缺公開數據,不宜提前下結論。
收束判斷
GPT-Live-1 在 Full Duplex Bench 測試中比 GPT-Realtime-2.1 高出 30 個百分點,搭配 GPT-6 Astra 中等推理強度時在 Tau3 端到端語音智慧體任務測試排名第一。這兩個數字說明 OpenAI 在即時語音這條線上採取的是代際跳躍而非漸進改版,配合每分鐘 0.05 美元的定價,等於同時發布了能力與價格兩道錨。
真正決定市場重分配速度的變數有兩個。一是後端推理費用的透明度,前端語音層的 3 美元每小時只是帳單的一部分,若後端成本不可預測,企業採購仍會觀望。二是轉人工的可靠性門檻,OpenAI Presence 框架強調可查詢企業系統、執行獲批操作並在必要時轉交人工,但電話場景的錯誤成本遠高於文字介面,這會讓實際落地節奏慢於帳面成本的替代空間。
以定價結構論,這次發布把語音智慧體市場推向「按分鐘計價的基礎設施」邏輯。整合商的帳要重算,模型層的錨已經落下了。
主題