Gemini 3.8 Live 将語音助手變成「邊說邊辦」:97種語言之外,真正難的是後台任務不中斷
CoinMeta
Ai 焦點
Google 在9月15日發布了 Gemini 3.8 版本,Live 和 Gemini 也同樣发布了3.8版本,并在17日更新了說明。這兩款模型都針對實時語音技術,但定位有所不同:前者強調規模化、低延遲和成本效率,而後者則將更多的計算能力留給複雜、多步驟的任務。它們共同傳達的一個信號是,語音技術正在從“問一句、答一句”的簡單客服模式中脫離,進入到可以邊保持對話、邊調用工具來完成工作的階段。
有幫助
No.幫助

Google 在9月15日發布了 Gemini 3.8 版本,Live 和 Gemini 也同樣發布了 3.8 版本,並在17日更新了說明。這兩款模型都針對實時語音,但定位並不相同:前者強調規模化、低延遲和成本效率,後者則將更多計算能力留給複雜、多步驟的任務。它們共同傳達的一個信號是,語音應用正在脫離“問一句、答一句”的簡單客服模式,進入一邊維持對話、一邊調用工具來完成工作的階段。

這次升級最值得注意的,並非是聲音聽起來更像真人。Gemini 3.8 Live 可以在對話中自動識別並切換97種語言,接收音頻、圖像、視頻和文本,並在後台執行工具或API調用。用戶提出訂票、查庫存或整理資料的要求後,模型可以先確認需求,繼續追問條件,同時等待外部系統返回結果。過去的语音机器人往往一調用接口就沉默,用戶不知道系統是在處理還是已經卡住;新設計試圖把這段等待變成可理解的过程。

Extended Thinking 版本更进一步。Google 表示它可以在推理的同時繼續說話,用「我來核對一下」之類的早期回應確認已接到任務,並在多步驟流程中持續播報進度。這聽起來只是交互細節,實際上卻關係到用戶是否敢將複雜工作交給語音代理。一個會沉默數十秒的系統,即使最終答案正確,也難以用於銀行、差旅、員工入職或設備維護等高壓力場景。

排行榜成績顯示了能力的上限,卻無法替代真正的業務驗收。

官方公布的成績給出了模型的參考位置。在Artificial Analysis的语音到語音質量指數中得到82.6分;在τ-Voice任務完成評測中為68.6%,在Sierra的銀行場景τ-Voice評測中為35.1%;Big Bench Audio的成績為97.7%。普通Live版本在Speech Agent Arena中位列第二。還稱兩款模型在ServiceNow EVA - Bench上兼顧任務準確率和對話體驗,相關測試運行於Gemini Enterprise Agent Platform的Live API。

這些數字不能直接解釋為「68.6%的客戶服務電話都能無人值守」。基準測試有固定的任務、工具和成功條件,但在現實的電話通話中會出現口音、噪音、多人同時講話、長時間的停頓、錯誤的帳戶資訊以及臨時的言辭改變等情況。銀行場景中35.1%的成績反而提醒市場:能夠自然交流與能夠可靠地完成受監管的流程是兩種不同的能力。部署方必須分別測試識別、意圖理解、工具調用、權限驗證、最終確認以及異常情況下轉由人工處理等環節,而不能只看一個綜合分數。

模型卡還提供了相關的邊界設定。這兩款模型基於 Gemini 和 Pro,支持最高128K的上下文處理能力,輸出上限為64K,輸入數據包括音頻、圖像、視頻和文本。Live 被分發到 Gemini API、Gemini、AI Studio、Vertex AI 和 Search Live 等應用;Extended Thinking 也進入了 Gmail、Docs 和 Keep 等渠道。然而,渠道的廣泛性並不意味着所有用戶、地區和功能都能在同一時間完全使用,企業仍需以自己賬戶的实际可用權限、定價和數據條款為準。

語音代理進入生產環境後,權限和可恢復性比「像真人」更重要

邊說邊調用工具確實能提高效率,但同時也會將風險從回答錯誤擴大到執行錯誤。模型如果聽錯一個日期,可能不僅只是說錯了,還可能訂錯航班;將「取消」識別成「確認」,就可能觸發真正的付款。因此,生產系統需要將對話狀態與交易狀態分開:模型可以討論各種選項,但高風險的動作應在明確的重複說明、二次確認以及權限驗證之後才可執行。後台任務必須具有幂等性設計,網路重試不能導致重复下單。

語言自動切換同樣需要謹慎。97種語言意味著模型能識別更多用戶,但並不代表每種語言在專業術語、數字聽寫和法規表達上的質量都一致。企業應該根據目標市場分別進行測量,而不是以英語的成績來推斷所有語言的情況。視覺輸入也會帶來新的隱私問題:當員工讓模型查看屏幕、證件或現場設備時,畫面中可能包含無關的個人信息,因此收集範圍和留存策略必須事先定義。

Google 所展示的場景包括實時員工入職、在棋盤上下棋、將草圖和口頭反饋轉換為 React 组件,以及協調多步預訂。這些證明模型已能將視覺、語音和工具調用放在同一條交互鏈上,但演示並不等於任何流程都已穩定自動化。最合理的落實順序,是先從可撤銷、可審核、失敗成本低的任務開始,再逐步開放寫入和支付權限。

語音 AI 在過去對於拼音的顏色、延遲和打斷處理有問題;Gemini 3.8 Live 將競爭推往後臺任務編排。真正決定它是否能進入企業核心流程的,不是用戶第一次聽到「像真人」時的驚喜,而是第1000次任務遇到噪音、超時和改口時,系統是否仍能解釋自己做到哪一步、允許人接管,並且絕不重複執行。

打賞
$0
點讚
0
收藏
0
瀏覽量 28
幣界網提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
美國8月只有4個州顯著增加崗位:全國失業率穩定在4.1%,地方冷熱差卻繼續擴大
美國8月新增16.2萬個非農崗位,表面上看仍是一張穩健的全國成績單。但美國勞工統計局9月18日公布的州級數據卻顯示,增長並不普遍:只有加利福尼亞、威斯康星、南卡羅來納和新墨西哥四個州的非農就業出現統計上顯著增加,其餘46個州和哥倫比亞特區基本沒有顯著變化。
币百科
·2026-09-21 09:53:22
38
英國2025年按揭成交回升16.2%:首購者佔比過半,卻需用更高槓杆換取入場券
英國住房市場在2025年明顯回暖。英國國家統計局9月18日發布的新統計顯示,全年完成717,519筆按揭購房,較2024年的617,295筆增加約16.2%,為2021年以來最高。不過,成交量仍比2006年低34.5%。市場從高利率衝擊中恢復,並不等於已經回到金融危機前的活躍程度。
币百科
·2026-09-21 09:52:22
38
Aave討論將機構託管資產變成鏈上抵押品:CoCT能同步餘額,卻無法消除託管人風險
Aave 治理论坛正在討論一項機構託管抵押借貸方案。該提案計劃為 Aave V4 部署一個隔離的 Liquidity Hub 和一條 Spoke:機構借款者將資產存放在 Anchorage 託管處,由 Chainlink 設計的 CustodySync 根據託管餘額鑄造不可轉讓的 Custodied Collateral Token,也就是 CoCT;借款者再將 CoCT 作為鏈上抵押品,從隔離資金池借出穩定幣。
币界网
·2026-09-20 09:55:49
433
歐元區7月建築產出環比持平:樓房同比下降6.4%,基礎建設回升仍托不住整體
歐盟統計局9月18日公佈,2026年7月歐元區建築業產出環比持平,歐盟整體下降0.3%。6月數據則被修訂為歐元區下降1.5%、歐盟下降1.3%。同比看,歐元區建築產出下降2.0%,歐盟下降1.8%。月度止跌並未消除年度疲弱,尤其是樓房建築仍明顯低於去年同期。
币百科
·2026-09-20 09:54:47
117
美國8月進口價格上漲0.7%:燃料價格下降,而非燃料商品卻再次推高了外部成本
美國勞工統計局9月16日公佈,8月進口價格環比上漲0.7%,扭轉了6月和7月連續下降0.3%的走勢;過去12個月累計上漲7.0%,為2022年8月以來最大同比增幅。出口價格環比上漲0.6%,7月則下降1.4%;同比增幅達到8.6%。這組數據反映跨境商品與運輸服務價格重新走高,但它不是消費者物價指數,也不能直接說成美國居民當月生活成本上漲0.7%。
币百科
·2026-09-20 09:53:45
81
查看更多