Google 在9月15日發布了 Gemini 3.8 版本,Live 和 Gemini 也同樣發布了 3.8 版本,並在17日更新了說明。這兩款模型都針對實時語音,但定位並不相同:前者強調規模化、低延遲和成本效率,後者則將更多計算能力留給複雜、多步驟的任務。它們共同傳達的一個信號是,語音應用正在脫離“問一句、答一句”的簡單客服模式,進入一邊維持對話、一邊調用工具來完成工作的階段。
這次升級最值得注意的,並非是聲音聽起來更像真人。Gemini 3.8 Live 可以在對話中自動識別並切換97種語言,接收音頻、圖像、視頻和文本,並在後台執行工具或API調用。用戶提出訂票、查庫存或整理資料的要求後,模型可以先確認需求,繼續追問條件,同時等待外部系統返回結果。過去的语音机器人往往一調用接口就沉默,用戶不知道系統是在處理還是已經卡住;新設計試圖把這段等待變成可理解的过程。
Extended Thinking 版本更进一步。Google 表示它可以在推理的同時繼續說話,用「我來核對一下」之類的早期回應確認已接到任務,並在多步驟流程中持續播報進度。這聽起來只是交互細節,實際上卻關係到用戶是否敢將複雜工作交給語音代理。一個會沉默數十秒的系統,即使最終答案正確,也難以用於銀行、差旅、員工入職或設備維護等高壓力場景。
排行榜成績顯示了能力的上限,卻無法替代真正的業務驗收。
官方公布的成績給出了模型的參考位置。在Artificial Analysis的语音到語音質量指數中得到82.6分;在τ-Voice任務完成評測中為68.6%,在Sierra的銀行場景τ-Voice評測中為35.1%;Big Bench Audio的成績為97.7%。普通Live版本在Speech Agent Arena中位列第二。還稱兩款模型在ServiceNow EVA - Bench上兼顧任務準確率和對話體驗,相關測試運行於Gemini Enterprise Agent Platform的Live API。
這些數字不能直接解釋為「68.6%的客戶服務電話都能無人值守」。基準測試有固定的任務、工具和成功條件,但在現實的電話通話中會出現口音、噪音、多人同時講話、長時間的停頓、錯誤的帳戶資訊以及臨時的言辭改變等情況。銀行場景中35.1%的成績反而提醒市場:能夠自然交流與能夠可靠地完成受監管的流程是兩種不同的能力。部署方必須分別測試識別、意圖理解、工具調用、權限驗證、最終確認以及異常情況下轉由人工處理等環節,而不能只看一個綜合分數。
模型卡還提供了相關的邊界設定。這兩款模型基於 Gemini 和 Pro,支持最高128K的上下文處理能力,輸出上限為64K,輸入數據包括音頻、圖像、視頻和文本。Live 被分發到 Gemini API、Gemini、AI Studio、Vertex AI 和 Search Live 等應用;Extended Thinking 也進入了 Gmail、Docs 和 Keep 等渠道。然而,渠道的廣泛性並不意味着所有用戶、地區和功能都能在同一時間完全使用,企業仍需以自己賬戶的实际可用權限、定價和數據條款為準。
語音代理進入生產環境後,權限和可恢復性比「像真人」更重要
邊說邊調用工具確實能提高效率,但同時也會將風險從回答錯誤擴大到執行錯誤。模型如果聽錯一個日期,可能不僅只是說錯了,還可能訂錯航班;將「取消」識別成「確認」,就可能觸發真正的付款。因此,生產系統需要將對話狀態與交易狀態分開:模型可以討論各種選項,但高風險的動作應在明確的重複說明、二次確認以及權限驗證之後才可執行。後台任務必須具有幂等性設計,網路重試不能導致重复下單。
語言自動切換同樣需要謹慎。97種語言意味著模型能識別更多用戶,但並不代表每種語言在專業術語、數字聽寫和法規表達上的質量都一致。企業應該根據目標市場分別進行測量,而不是以英語的成績來推斷所有語言的情況。視覺輸入也會帶來新的隱私問題:當員工讓模型查看屏幕、證件或現場設備時,畫面中可能包含無關的個人信息,因此收集範圍和留存策略必須事先定義。
Google 所展示的場景包括實時員工入職、在棋盤上下棋、將草圖和口頭反饋轉換為 React 组件,以及協調多步預訂。這些證明模型已能將視覺、語音和工具調用放在同一條交互鏈上,但演示並不等於任何流程都已穩定自動化。最合理的落實順序,是先從可撤銷、可審核、失敗成本低的任務開始,再逐步開放寫入和支付權限。
語音 AI 在過去對於拼音的顏色、延遲和打斷處理有問題;Gemini 3.8 Live 將競爭推往後臺任務編排。真正決定它是否能進入企業核心流程的,不是用戶第一次聽到「像真人」時的驚喜,而是第1000次任務遇到噪音、超時和改口時,系統是否仍能解釋自己做到哪一步、允許人接管,並且絕不重複執行。












