Codex下一次重大更新,可能已经被自己的代码提前“剧透”了。

7月23日,社交平台流传的两组Codex界面本地化代码显示,产品内部已经出现“New Realtime Voice Chat(新建实时语音聊天)”“Voice session started(语音会话已开始)”“Open background task(打开后台任务)”以及命令、文件、网络、MCP工具等一整套审批与状态提示。
爆料者据此判断,OpenAI可能在7月24日为Codex带来一次重大更新:用户在前台与一个实时语音助手持续对话,后台工作Agent则同时执行搜索网页、处理文档、查看日历、调用应用、运行命令甚至寻找餐饮选项等任务。
如果这套判断成立,真正重要的并不是“Codex终于能说话”,而是OpenAI可能正在把语音变成一个Agent操作系统的前台——你负责表达意图,主Agent负责保持对话,后台Agent负责把事情做完。
第一张代码截图:这不是普通语音输入,而是完整的实时会话
第一组截图出现了多项以codex_remote_realtime_voice开头的字符串,包括麦克风解除静音、语音连接失败或中断、麦克风权限、语音会话发送与引导,以及“New Realtime Voice Chat”。

这些词的组合很关键。若只是给文本框增加语音转写,通常只需要录音、转写和发送等少量状态;而“连接失败”“连接中断”“会话引导”“新建实时语音聊天”更像是一条持续连接的双向语音链路。
OpenAI现有Realtime API官方文档也提供了相符的技术基础:实时会话可以持续接收音频、管理对话状态、调用工具,并通过WebRTC服务浏览器和移动端。官方当前公开推荐的高能力语音模型是gpt-realtime-2.1,并非爆料中所称的“GPT-Live”。因此,Codex内部最终采用什么模型、是否存在未公开的GPT-Live命名,目前都不能从截图中确认。
第二张截图更重要:语音背后藏着一套“边聊边干活”的执行系统
第二组代码把这次更新的野心暴露得更彻底。它不仅包括“Voice session started”,还列出了“Running a command”“Using a tool”“Changing files”“Using an app”“Searching the web”以及“Show work”等状态。

更值得注意的是,代码还专门为主机、网络、读取、写入、命令、文件与MCP设置审批提示。这意味着语音界面如果上线,并不是一个只会聊天的浮层,而可能直接连接Codex现有的执行能力。
这也解释了为何流传的系统提示词会把它描述为“通用代理型助手”:主Agent在前台保持低延迟对话,工作Agent把复杂任务分发到后台线程。用户不必听着语音助手沉默几十秒,等待它查完日历、浏览网页或修改文件;前台可以继续追问、补充条件或改变目标,后台任务则被重新引导。
这是一种比“语音版编程助手”更激进的产品形态。编程只是Codex最成熟的执行场景,真正的入口可能是语音驱动的多Agent调度。
最刁钻的信号:OpenAI刚移除过实验语音,现在却可能换了一个容器让它回来
OpenAI公开的Codex更新日志曾在6月15日记录,CLI/TUI中实验性的实时语音控件及相关音频依赖被移除。表面上看,这与“实时语音即将发布”相矛盾。
但新截图使用的键名集中出现codex_remote、后台线程、应用工具和图像产物,反而暗示语音功能可能并未被取消,而是从命令行界面迁移到更适合承载持续会话、权限卡片和多任务视图的Codex App或Remote体验中。
换句话说,旧实验可能不是失败,而是架构换轨:语音不再作为CLI的一项附属功能存在,而被提升为连接主Agent、工作Agent、应用和远程机器的统一交互层。
为什么“帮我看看Uber Eats晚餐吃什么”比写代码更有信号价值
爆料中提到的示例任务包括检查Slack、Spotify、文档、日历、浏览网页、购物或订餐,其中一个示例是查看Uber Eats并寻找晚餐选项。即使这些具体示例尚未获得OpenAI公开确认,它们仍揭示了产品定位的变化。
如果Codex只想争夺开发者,演示任务应该继续围绕修Bug、写测试和提交代码。把订餐、日历和工作沟通放进系统提示词,意味着OpenAI可能正尝试把Codex从“代码Agent”扩展为“电脑上的通用行动Agent”。
这会让Codex与ChatGPT的边界进一步模糊:ChatGPT负责知识、交流和消费场景,Codex负责工具、文件、终端与长任务执行;实时语音一旦成为统一入口,两者实际上可能在同一个前台汇合。
Cerebras版GPT-5.6 Sol和额度重置:最诱人,也最缺乏证据
同一批爆料还声称,基于Cerebras硬件的GPT-5.6 Sol版本可能同步上线,并可能由Codex负责人Thomas Sottiaux送出一次额度重置庆祝更新。
这两部分目前没有出现在用户提供的代码截图中,也未见OpenAI官方公告,应当视为社区预测,而不是已确认发布时间表。
不过两者与实时语音的商业逻辑确实相互咬合:语音交互对首字延迟和持续响应速度非常敏感,后台并行Agent又会迅速放大推理消耗。更快的推理硬件可以改善对话体验,额度重置则能迅速制造用户集中试用的传播效应。但“逻辑上合理”不等于“明天一定发布”。
真正的重大更新,不是麦克风按钮,而是人机协作方式
过去的Agent工作流是:用户提交任务,等待Agent执行,再回来验收结果。截图所暗示的新工作流则可能变成:用户始终与主Agent保持语音连接,实时观察多个后台任务,并在它们运行时随时改变方向。
这种模式一旦成熟,会带来三项变化:
- 提示词变成持续对话。用户不再需要一次把需求写完整,而是在执行过程中不断补充约束;
- 一个会话变成多个工作线程。搜索、命令、文档和应用任务可以并行推进,主Agent负责协调;
- 权限审批进入自然语言界面。网络、写文件、运行命令和使用应用仍需明确授权,语音便利不能绕过安全边界。
第二张截图中大量审批字符串,正是这套架构能否真正可用的关键。通用Agent越能行动,错误操作的代价就越高。OpenAI若要让用户“边聊边让它干活”,必须让权限请求既足够清晰,又不会频繁打断对话。
结论:代码已经证明“有人在做”,但没有证明“明天一定给你用”
截至发稿,OpenAI尚未就用户提供的截图、7月24日发布时间、GPT-Live架构、Cerebras版Sol或庆祝性额度重置发布正式公告。
但两组代码不是毫无意义的传闻。实时语音、后台任务、应用调用、网页搜索、文件修改与分层审批被放进同一套界面词汇,已经足以说明Codex团队正在探索一种远超语音输入的产品:一个能与你持续对话、同时调度后台Agent行动的通用助手。
所以明天真正值得盯住的,不是Codex界面上是否多了一个麦克风,而是OpenAI是否会第一次把“会说话的前台”和“会做事的后台”正式合并。如果答案是肯定的,Codex的竞争对手也将不再只是Claude Code、Cursor或其他编程工具,而是所有试图成为个人AI操作系统的Agent平台。

TopsTip