OpenAI 在9月10日將 GPT – Live –1 開放給 API,定價為前端語音層每分鐘0.05美元。該服務採用全雙工方式處理音頻,使用者可以邊聽邊說,並且在對話繼續時,可以將複雜的推理和工具調用交給後端文本模型 GPT –6 Astra 等。對開發者來說,這不僅是簡單地換一組更自然的聲音,而是將語音系統從「識別—推理—合成」的串聯式結構,改變為前端對話與後端執行協同的結構。
傳統語音機器人最明顯的問題並非聽不清每個字,而是不知道何時該說、何時該停。用戶稍作停頓,系統可能就會抢先回答;用戶中途改口,已經生成的回覆仍會繼續播放;背景有人說話,機器人又會將旁人的聲音當成指令。每一次語音轉文字、模型響應和文字轉語音之間的交接都會增加延遲,也容易丟失語氣、停頓和打斷信號。
全雙工可以減少機械輪次,但測試結果並非表示所有場景都能穩定運行。
GPT – Live – 1使用同一模型聯合處理輸入和輸出音頻,官方強調其在中斷處理、背景噪音、靜默管理以及長會話可靠性方面的優勢。Speak 在早期評估中表示,與之前的輪次式系統相比,語言學習者在思考時被中斷的次數減少了近80%。另一家客戶表示,改用該模型後代碼量减少了80%,刪除了約2.3萬行代碼。在Full Duplex Bench上,其表現比GPT – Realtime – 2.1提升了30個百分點,並且可以與後端模型組合處理端到端的任務。
這些數字顯示架構具有潛在的收益,但都帶有測試環境和客戶實現的界限。語言學習中的停頓規律,與急救熱線、銀行客服或嘈雜的餐廳不同;某家公司刪除的代碼,也取決於原始系統堆疊了多少中間組件。開發團隊不能將「減少80%」寫進自己的商業承諾中,必須用真實的口音、設備、網路和業務腳本重新測量。
全雙工還改變了錯誤的形態。串聯系統雖然較慢,但容易定位是識別錯、模型錯還是合成錯;端到端語音模型更自然,但需要同時記錄音頻時間軸、轉寫、系統動作和被打斷的位置。客戶說「不要取消」時,如果代理已經將取消請求提交到後臺,聲音停止並不代表動作停止。前台對話狀態與後臺交易狀態必須分別管理。
官方提供更多口音、方言和語言的聲音選擇,也允許通過系統提示調整語氣、節奏和風格。自定義聲音仍需聯繫銷售並滿足資格條件,不能理解為所有開發者都能立即克隆任意聲音。企業還應明確告知用戶正在與 AI 交流,禁止未經授權模仿真人,並對錄音保存、聲紋數據和轉寫內容設定保留期限。
真正上線時,必須將延遲、權限、需要轉交給人工處理的環節以及成本一起考慮在內。
語音代理適用於預約、訂單查詢和常規客戶服務,因為問題通常具有結構性,後台動作也能明確確認。在設計流程時,應將「聽懂意圖」和「執行動作」分開。查詢營業時間可以直接回答,修改地址可以複述確認,付款、退訂或醫療安排則需要更強的驗證。用戶中斷一次,不應自動視為同意或撤銷,關鍵動作需用清晰的问题來完成閉環。
轉接至人工機制同樣重要。系統應該能識別連續的誤解、強烈的情緒、高風險的關鍵詞以及工具的失敗,而不是為了維持自動解決率而不斷猜測。在轉接時,應將已確認的信息、未完成的動作和對話摘要交給人工,避免用戶需要重新說一遍。提升長時間對話的性能並不意味着代理人可以無限拖延;越早承認不確定性,就越能減少後續的補救成本。
價格也不能只按照0.05美元乘以通話時長來計算。後台模型的運算、電話線路的使用、工具的調用、日誌的儲存以及人工處理都會產生費用。全雙工模式可能會縮短通話時間,但也可能因為交流更加自然而延長會話時間。在評估時,應該同時考慮每次成功解決問題的總成本、平均處理時間、中斷後的恢復率、錯誤操作率,以及轉交給人工後需要重複說明的情況發生率。
語言覆蓋還需要進行本地實測。同一種語言在不同地區存在口音、語速、數字讀法以及客戶服務禮貌習慣的差異,電話線路壓縮也會導致聲音細節的損失。測試集應該包含老年人、兒童、非母語者、多人在一室內的情況以及網絡較弱的環境,而不只是讓內部員工在安靜的辦公室裏朗讀腳本。只有失敗樣本夠真實,模型升級時才不會將演示效果誤認為是大眾體驗。
GPT ‑ Live ‑1已可在API中使用,但更多的聲音和語言仍會繼續擴展,部分定制功能也會有資格限制。這讓語音代理跨越了「輪流朗讀」的體驗門檻,卻沒有消除業務系統的責任邊界。決定產品是否好用,不僅在於模型聽起來是否像人,而在於用戶改口時是否能真正停下,後臺動作是否能同步撤回,出錯時是否能迅速找到人,而且每一步都留下可核對的記錄。












