
就在OpenAI把GPT-Live语音装进ChatGPT桌面版、允许用户用一句话协调Work与Codex多个Agent的同一天,Anthropic也补上了Claude语音体验中最明显的一块短板:Voice Mode不再只能依赖速度快、成本低,但推理能力相对有限的Haiku,而是正式开放Sonnet和Opus。
表面看,这是两家AI公司在同一天“升级语音”;实际上,它们正在争夺两种完全不同的入口。Anthropic想证明,手机里的语音助手也可以处理严肃工作;OpenAI则试图让语音越过聊天框,成为指挥电脑和多个Agent的总控台。
Claude不是今天才有语音,今天补的是“大脑”
需要先澄清一个容易被标题误导的事实:Claude Voice早在2025年就已上线。这次更新不是从无到有,而是把语音从Haiku扩展至Sonnet和Opus。
这一步看似只是模型选择器多了两个选项,背后却是在修复Claude语音最尴尬的产品矛盾。语音交互追求低延迟,Haiku非常适合快速接话;但用户一旦把它用于商业分析、复杂写作或工作决策,“快”就可能变成“回答不够深”。Anthropic在接受The Verge采访时承认,用户很快就开始拿语音处理真实商业问题,原先的Haiku并不总能提供足够深入的答案。
更新后,Claude Voice会沿用用户在文字聊天中最后选择的模型,也可以在同一段语音对话中切换Haiku、Sonnet或Opus。也就是说,用户可以先用Haiku快速讨论,再把同一个上下文升级给Opus做更复杂的判断,而不必重新描述问题。

Claude还把工具调用带进语音对话。根据Anthropic帮助中心,用户可以让它读取Gmail、检查Google Calendar、查找Google Docs或总结Slack线程。官方给出的场景包括把一段口头讨论整理成一页式提案,以及在火车晚点时调整日历安排。语音支持也从最初的英语扩展到法语、德语、西班牙语、印地语、日语、韩语、葡萄牙语等多种语言,非英语支持目前仍处于测试阶段。
手机端对比:Claude赢在“选哪个大脑”,ChatGPT赢在“像不像真人通话”
如果只比较手机,Claude和ChatGPT的优势并不重叠。
Claude的核心卖点是模型透明度和工作连接器。用户能明确选择Haiku、Sonnet或Opus,并在对话中途升级模型;语音还能使用已连接的邮件、日历、文档和团队沟通工具。对于熟悉Claude模型层级、希望把语音用于工作流的人,这种“我知道自己正在调用哪颗大脑”的体验非常直接。
ChatGPT的核心卖点则是实时交流的自然度和多模态。新版Live由GPT-Live驱动,可以同时听和说,用户不必等AI讲完就能插话。它还能在同一聊天中使用网页搜索和记忆,接收文字与图片,并通过部分组件展示可视化结果。符合条件的移动端订阅用户如果切回Advanced Voice,还可以继续使用摄像头和屏幕共享。
Claude也支持免手持连续聆听、自然停顿和插话打断,同时提供嘈杂环境下更稳妥的按住说话模式;但从产品结构看,它更像是把成熟的Claude文字模型和连接工具套进双向语音界面。ChatGPT Live则更强调原生实时对话本身,让“边听、边说、边打断”成为主要体验。
简化成一句话:Claude在问“这段语音该交给Haiku、Sonnet还是Opus思考”,ChatGPT在问“怎样让人忘记自己正在轮流发送语音消息”。
真正拉开差距的,是今天刚上线的ChatGPT桌面语音
把比较范围从手机扩大到桌面后,双方的路线差异突然变得非常明显。
Claude Voice现在同样覆盖Claude Desktop和网页,而不只是iOS、Android;但Anthropic明确表示,Voice Mode目前不能用于Claude Cowork或Claude Code。换言之,Claude可以在桌面端和用户聊天、搜索网页、调用Gmail或Slack,却还不能通过语音进入它最有价值的Agent工作环境。
OpenAI今天上线的桌面语音恰好越过了这道边界。ChatGPT Voice可以在macOS和Windows桌面应用中启动Work或Codex任务、询问执行进度、追问后台Agent,并在一段持续的GPT-Live对话中协调多个Agent。选中的工作模式拥有什么工具和权限,语音就能指挥它使用什么工具和权限。
这不是“手机版语音搬到电脑”那么简单。它把原先需要反复点击任务、切换线程和查看进度的Agent操作,压缩成一条口头指令。用户可以继续和前台语音助手讨论需求,同时让后台Agent分别研究资料、制作文档、修改代码或操作电脑。关于这次更新与此前代码泄露的对应关系,可参阅TOPSTIP此前的报道:《昨天被代码提前剧透,今天正式上线:ChatGPT桌面版把语音变成多Agent总控台》。
一张表看清Claude与ChatGPT语音的当前差异
| 比较项目 | Claude Voice | ChatGPT Voice |
|---|---|---|
| 手机平台 | iOS、Android | iOS、Android |
| 网页与桌面聊天 | 支持网页及Claude Desktop | 支持网页及桌面Chat |
| 模型/智能选择 | 可在Haiku、Sonnet、Opus之间切换,具体可用模型取决于套餐 | Live可选择Instant、Medium或High智能等级,具体取决于账户 |
| 实时交流 | 免手持连续聆听、支持打断,另有按住说话模式 | GPT-Live可同时听和说,强调自然插话与全双工交流 |
| 多模态 | 可在同一上下文切换文字与语音,并使用网页搜索及连接工具 | Live支持同一聊天中的文字、图片、搜索、记忆和部分可视组件;Advanced移动端支持视频与屏幕共享 |
| 连接服务 | Gmail、Google Calendar、Google Docs、Slack等已连接工具 | 新版Live首发时不支持连接应用或插件 |
| Agent工作区 | 暂不支持Claude Cowork与Claude Code | 桌面版可通过语音启动、追问并协调Work和Codex多个Agent |
Anthropic紧跟得很快,但追的不是同一场比赛
Anthropic选择在OpenAI桌面语音发布当天升级Claude Voice,很难不让人产生“紧跟ChatGPT”的联想。不过,把时间线当成全部故事会低估这次竞争。
Claude当前最强的品牌资产是Opus和Sonnet的复杂推理、写作与企业工作能力。让Voice长期停留在Haiku,相当于把最能代表Claude的部分挡在语音入口之外。此次更新首先解决的是品牌体验不一致:用户终于可以在说话时获得与文字聊天接近的模型能力。
OpenAI的赌注更激进。它没有把语音仅仅当作一种输入法或朗读功能,而是把GPT-Live放在用户与多个Agent之间。语音模型负责理解意图、维持对话和澄清要求,后台Agent负责执行。这种设计一旦成熟,桌面软件的交互单位就可能从“点击哪个按钮”变成“把什么目标交给系统”。
代价同样明显:Agent能操作的范围越大,权限审批、误操作、隐私和计费就越复杂。OpenAI桌面语音目前只在符合条件的付费方案中推出,Work和Codex执行任务还会消耗各自的使用额度。Claude的连接工具调用也可能带来短暂延迟,并且语音对话计入常规套餐额度。
现在该选哪一个?
如果主要需求是在手机上讨论复杂问题、明确选择Opus或Sonnet,并通过语音处理邮件、日历、文档和Slack,Claude这次升级后明显更有竞争力。
如果更在意通话般的自然插话、搜索与记忆、图片输入,或者需要移动端的视频和屏幕共享,ChatGPT的语音产品线更完整。若目标是坐在电脑前用语音同时指挥研究、文档和编程Agent,今天的ChatGPT桌面版则已经进入Claude Voice尚未覆盖的区域。
因此,这一轮并不是简单的“谁先推出语音”。Anthropic把更强的大脑放进了语音;OpenAI则试图让语音成为操作AI劳动力的方向盘。前者是在升级助手,后者是在争夺桌面操作系统之上的新控制层。
信息来源
- The Verge:Claude’s voice mode is now available for Opus and Sonnet
- Claude Help Center:Use voice mode
- OpenAI Help Center:ChatGPT Voice
- OpenAI Help Center:ChatGPT Work and Codex

TopsTip