OpenAI 7 月 24 日表示,已更新 ChatGPT 桌面应用,加入 ChatGPT Voice 支持。新功能让用户可以直接通过语音下达指令,控制 AI 代理在电脑上执行任务,而不再只是进行语音对话。
接入新一代语音模型
这项功能基于 OpenAI 本月早些时候推出的新语音模型系列 ChatGPT-Live。与此前主要面向手机端的语音交互不同,这次桌面端更新把语音输入与任务执行结合起来,覆盖范围更大。
OpenAI 表示,ChatGPT Voice 可与 ChatGPT Work 和 Codex 配合使用,也能调用电脑操作能力,访问网站和应用,完成查找与执行类任务。
桌面端可执行多步骤操作
按照 OpenAI 的说法,桌面版语音模式支持更复杂的指令。用户可以一次性口述多个步骤,随后在系统需要确认或补充信息时继续交互。
- 支持一次下达多步命令
- 可在执行过程中向用户追问信息
- 可结合 Codex 处理开发相关任务
在演示视频中,一名开发者通过一条语音指令,要求 ChatGPT 新建讨论线程、创建 pull request,并定位一个程序错误的根本原因。
macOS可读取屏幕内容
在 macOS 上,OpenAI 还加入了 Appshots 功能。启用后,应用可以读取用户屏幕上的内容,包括 alt-text 等信息,以便更准确地理解当前界面并继续执行任务。
OpenAI 同时提到,用户还可以通过 iOS 应用远程接入 Codex,使用 ChatGPT Voice 发起相关操作。
语音助手竞争继续升温
此前推出的手机版 ChatGPT Voice 已支持更自然的对话和更好的打断处理,但当时并不具备直接在手机上执行操作的能力。此次桌面端更新,意味着 OpenAI 正把语音模式从对话工具推进到可执行任务的代理入口。
Anthropic 近期也更新了 Claude 的语音模式。该功能可调用 Opus、Sonnet 和 Haiku 模型,在 Gmail、Calendar、Slack、Notion 和 Canva 等应用中完成任务,语音 AI 助手的产品竞争正在加快。












