$

Claude 和 OpenAI 同时升级语音,AI 的入口正在加速改变

2026-07-24AIWare[SKIP]

7 月 24 日凌晨,Claude 和 OpenAI 前后脚发布了两项语音功能更新。按照两则发布信息显示的时间计算,前后只差八分钟。

Claude 把更强的模型放进语音模式,用户在交谈中可以调用已经连接的工具,支持的语言也更多了。

OpenAI 的动作更靠近电脑操作:ChatGPT Voice 进入桌面端,用户可以直接说出任务,再控制电脑,并调动 ChatGPT Work 或 Codex 里的多个 Agent。该功能从 7 月 24 日起,面向 macOS 和 Windows 的 Plus、Pro、Business、Edu 与 Enterprise 用户逐步开放。

单独看,它们只是两次功能升级。放在一起,产品方向已经很清楚:语音正在离开聊天框旁边的麦克风按钮,成为人调用模型、工具和 Agent 的上层入口。

我们过去通过键盘告诉 AI 要做什么。接下来,越来越多任务会从一句自然语言开始,后面的拆解、调用和执行交给系统。

语音助手存在很多年,为什么一直没成为主入口

Siri、Alexa 和智能音箱早已让用户习惯对设备说话,但大多数场景仍停留在查天气、设闹钟、播放音乐。

限制它们的一直是理解和执行能力。传统语音助手依赖相对固定的指令。用户需要按照机器熟悉的方式表达,稍微多说一个条件,中途再改一次口,它就可能丢掉前文。即便识别正确,能做的事通常也局限在某个应用或预设动作里。

比如你说:

“看看团队今天的开发进度,把没完成的任务整理出来,再问一下负责人什么时候可以交付。”

这句话涉及读取项目数据、判断任务状态、整理信息、找到负责人、生成并发送消息。过去的语音助手很难把这些步骤串起来。说话没有省下多少工作,用户最后还是得打开应用继续操作。

大模型开始让语音真正具备办事能力

人平时说话并不严谨。我们会省略信息,会犹豫和改口,也常常讲到一半才意识到自己真正需要什么。

实时语音模型可以结合前后文理解这些不完整的表达,也允许用户在过程中调整:

“等等,先别发。”

“刚才那个条件改一下。”

“预算相关的内容留给我确认。”

这种交互的价值,在于用户不必开口前先写好一段严丝合缝的提示词。任务可以从一个大致目标开始,再通过追问和修正逐渐变清楚。

OpenAI 在 2022 年介绍 ChatGPT 时,就把“回答后续问题、承认错误、质疑错误前提”列为对话形式的特点。实时语音又往前走了一步:追问、打断和修正发生在更接近日常交流的节奏里。

有了工具和 Agent,语音还能继续向执行端延伸。模型理解目标,工具读取数据和操作软件,Agent 接手后续步骤。Claude 这次强调语音对话与已连接工具的结合,OpenAI 则把语音放到电脑和多 Agent 之前。

用户说出目的之后,系统可以继续拆解并执行任务。语音由此不再停留在过去“说一句、回一句”的范围里。

语音发起任务,Agent 调用工具执行,屏幕承接结果

几款已经上线的产品,正在验证同一条路线

这条变化并不只发生在 Claude 和 OpenAI 身上。

Google 已经在 Gemini Live 中加入摄像头和屏幕共享。官方给出的场景很直观:把镜头对准眼前的物品,边看边讨论;或者共享手机屏幕,让 Gemini 根据当前画面继续回答。

摄像头让交互省掉了一次转述。用户不用先把眼前情况完整翻译成文字,也不用琢磨应该搜索什么关键词。AI 同时得到语音、画面和上下文,更容易理解用户此刻要解决的问题。

Alexa+ 展示了家庭场景里的另一种走法。Amazon 把它定义为由生成式 AI 驱动的新一代助手,强调更自然的连续对话,并让它连接 Philips Hue、OpenTable、Spotify 等产品和服务。语音因此可以越过“控制一盏灯”这种单点命令,逐渐进入预约、娱乐和家庭管理等连续任务。

智能眼镜则让语音入口的必要性更明显。眼镜没有一块适合长时间点击和输入的屏幕,用户又经常处在走路、观察环境或双手被占用的状态。让 AI 结合眼前画面回答问题、提供翻译或发起任务,比在镜腿上塞进一套复杂菜单更自然。

汽车也是类似的环境。驾驶者的视线应该留在道路上,双手也不适合频繁操作屏幕。过去,车载语音受限于固定指令;大模型开始让它理解更自由的说法,并有机会连接导航、通信、娱乐与车辆状态。

从电脑到眼镜,产品形态不同,对交互的要求却在靠拢:用户越来越少关心该打开哪个功能,更关心系统能否理解当前处境并继续处理任务。

同一句自然语言跨越电脑、眼镜、汽车与家庭机器人

为什么语音更贴近 AI 时代的交互

如果语音的优势只是比打字快,它很难引发一轮交互迁移。

更重要的变化是,AI 已经可以处理“目标”,而语音恰好是人表达目标时很省力的方式。

人先想到目的,软件却常常要求我们拆成操作

当一个人想订明晚的餐厅时,脑子里出现的通常是一句话:

“找一家离公司不远、适合四个人聊天的餐厅,明晚七点还有位置。”

传统软件要求他把这句话拆成一串动作:打开应用、选择区域、设置人数和时间、查看评价、比较距离,再完成预订。

每多一个步骤,行动阻力就高一点。菜单越深,信息重复填写得越多,用户越容易在中途停下来。

语音与 Agent 结合后,人可以直接从最初的意图开始。AI 把意图翻译成搜索、比较、筛选和预订。用户仍然需要确认关键选择,但不必亲自穿过所有界面。

它能减少人从现实任务里“退出来”的次数

人在做饭、开车、维修设备或整理房间时,如果需要停下来解锁手机、寻找应用、组织文字,原来的任务就被打断了。

中断带来的消耗通常会超过操作本身的几十秒。人的工作记忆有限,注意力切到另一个界面后,回到原任务往往需要重新确认进度和上下文。

语音让交互留在当前场景里。做饭时可以直接问下一步,维修时可以把镜头对准故障部位,走路时可以安排日程。用户不必先退出正在做的事,再进入软件的操作逻辑。

不过,这个优势依赖场景。办公室、地铁和涉及隐私的环境里,说话可能比打字更麻烦;处理数字、代码和长文时,屏幕也更容易检查。语音降低的是某些任务的切换成本,并非所有任务的认知负荷。

对话允许模糊,也允许补救

传统界面往往要求用户一次做出正确选择。对话可以先从一个不完整的想法开始,再通过追问建立共同理解。

“不是周五,是下周五。”

“不要全部发,只发给项目负责人。”

“这两个方案都保留,再给我一个更激进的版本。”

在人机交互研究里,这类澄清、纠正和重新表述常被称为“对话修复”。它是日常交流的一部分,也是语音能否承担复杂任务的分水岭。

传统语音助手常把一句话当成不可修改的命令。实时模型更接近真正的交谈:用户可以停顿、打断、补充条件,系统也可以在不确定时追问。

这很适合目标已经出现、路径还没想清楚的任务,而这类任务正是 Agent 经常面对的工作。

声音会增加协作感,也可能放大信任

文字传递内容,声音还携带语气、节奏和停顿。同一句“我明白了”,换一种语气,给人的感受就会不同。

当一个系统能够倾听、快速回应、接受打断,用户更容易感到对面有一个对象正在与自己协作。心理学和传播研究通常用“社会临场感”来描述这种体验:媒介让另一方显得更真实、更在场。

这种感受可以降低使用门槛,尤其适合陪伴、学习、咨询和协作场景。风险也同时出现。声音越自然,人越容易高估系统的理解力,把表达流畅误当成判断可靠。

成熟的语音产品需要让用户看见系统听懂了什么、准备做什么、哪些地方仍不确定。声音可以更像人,操作边界也必须足够清楚。涉及付款或删除这类动作时,确认与撤回机制尤其重要。

桌面端很可能最先形成完整闭环

电脑拥有现成的文件、应用和工作环境,是语音、工具与 Agent 最容易连起来的地方。

今天使用 AI 工作,我们仍然要在很多窗口之间切换。打开聊天工具描述需求,把结果复制进文档;查完资料后转去邮件,再切到项目管理软件。

以后,用户可能直接对电脑说:

“把今天的会议记录整理一下,找出三个还没确定的问题,分别发给相关负责人。涉及预算的那一条先别发,留给我确认。”

AI 查找记录、提取问题、匹配联系人、生成消息。屏幕同步展示执行过程,遇到敏感步骤时暂停。

这也是 OpenAI 把 Voice、电脑操作和多个 Agent 放在一起的意义。用户不必逐个学习 Agent 的调用方式。语音位于最上层,下面连接模型、工具、应用和一组可以协同工作的 Agent。

更大的变化可能出现在 AI 硬件和机器人里

桌面端依然有键盘、鼠标和大屏幕,语音更多是在提升效率。到了眼镜、耳机、汽车和机器人上,设备要么没有合适的屏幕,要么不适合持续触控,语音的价值会进一步放大。

假设你对家用机器人说:

“把桌上的杯子收进厨房,药先放着,猫的水碗不要动。”

这句话包含多个对象、例外条件和空间关系。机器人可以通过摄像头理解环境,通过语音获取目标,再针对不确定之处追问:

“左边这个保温杯也要收走吗?”

当 AI 同时拥有视觉、听觉和行动能力,用户无需先把现实世界转写成结构化指令。人正常表达,AI 观察环境、理解限制条件,再执行动作。

需要输入精确信息时,键盘仍然更快;可当人站在厨房、车间或病房里,双手正被别的事情占用,开口交代任务会自然得多。机器人进入这些环境后,交谈很可能成为普通人管理它们的常用方式。

语音会成为常用起点,屏幕仍然负责把关

语音的边界也很清楚:比较大量数据、修改长文、检查代码、选择视觉方案时,屏幕更高效。在公共场合,用户也未必愿意把私人信息说出来。语音适合表达意图,却不适合承载所有结果。

未来更常见的组合大概是:

语音发起和调整任务,Agent 负责执行,屏幕展示结果并承担确认。

简单结果可以通过声音返回,复杂内容放到屏幕上。付款、删除文件、对外发送和控制现实设备等高风险动作,应该要求用户明确确认,并且允许暂停和撤回。

Agent 执行到高风险动作时暂停,由屏幕交还人类确认

交互不会变成所有事情都靠说话。系统会根据任务,在语音、屏幕和动作之间切换。语音更可能成为最常用的起点之一。

下一轮竞争,争的是谁能占住 AI 的上层入口

模型能力逐渐接近后,语音体验的差距会落到很具体的地方:响应够不够快,能不能随时打断,系统是否记得刚才的条件,工具调用是否稳定,出现误操作后能否撤回。

权限和隐私会变得更关键。AI 一旦可以读取文件、发送消息、控制电脑乃至驱动机器人,一句被错误理解的话就可能产生现实后果。

用户必须随时知道四件事:AI 听到了什么,它准备执行什么,哪些动作需要确认,出错后如何停止。

说话像不像人只是表层体验。用户最终会留下来,是因为系统能准确理解意图,并且可靠地把事情办妥。

结语

鼠标让人学会操作电脑,触屏让人可以直接碰到内容。AI 带来的下一步,是让人更直接地表达目的。

从 Claude 在语音中接入工具,到 OpenAI 用语音连接电脑和多个 Agent,再到 Gemini Live、Alexa+、智能眼镜和车载助手,产品演进已经指向同一个方向:语音正在从输入方式变成 AI 的上层入口。

等到 AI 硬件和机器人进入更多消费场景,人们不会愿意为每台设备重新学习一套复杂的菜单。

语音不会包办一切。可当我们说出目的,AI 能结合当前环境调用工具、完成任务,再把复杂结果交回屏幕确认,语音就会成为人类调动数字系统和现实设备时最自然的起点之一。


参考来源

  1. Claude 官方发布(X,2026-07-24)
  2. OpenAI 官方发布(X,2026-07-24)
  3. OpenAI:Introducing ChatGPT
  4. Google:5 ways to use Gemini Live with camera and screen sharing
  5. Amazon:Introducing Alexa+
← cd ~