OpenAI Codex 曝光实时语音功能,语音操控复杂任务;Vivix 实时交互多模态模型首帧延迟仅 300ms丨日报

📅 2026/7/23 23:14:37 👁️ 阅读次数 📝 编程学习
OpenAI Codex 曝光实时语音功能,语音操控复杂任务;Vivix 实时交互多模态模型首帧延迟仅 300ms丨日报

 

24a3672a3af6dc32af43583db9f471aa

 

 

开发者朋友们大家好:

 

这里是 「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

 

本期编辑:@koki、@鲍勃

01 有话题的技术

1、Vivix 发布 W1 与 A1 实时交互多模态模型:30B 激活参数,首帧延迟降至 300–600ms

 

多模态 AI 初创公司 Vivix 正式推出面向互动叙事的基座模型 W1 与面向交互角色的 A1,并开放 API。该系统实现单模型集成实时理解、交互与生成,在 30B 激活参数规模下将首帧渲染延迟控制在 300–600ms,并在一年内将系统推理与基础设施成本降低了两个数量级。

 

  • 单模型一体化架构与 300–600ms 极低延迟:摒弃分步级联管线,将视觉理解、多模态交互(触屏、手势、语音)与实时生成统一整合于单模型中;在 30B 激活参数下,TTFF(首帧渲染时间)达 300–600ms。

  • 发布 A1 人形场景交互模型:超越嘴型/手势匹配的传统数字人,实现 AI 角色在动态场景内的物理交互,例如带货场景中抓取与展示商品、游戏场景内进行环境导航与实体互动。

  • 工程 Infra 成本降低 90% 以上:通过基础设施与模型推理优化,系统整体成本在一年内降低两个数量级(100 倍),对标 YouTube CDN 与带宽成本线(约每人小时 0.2 美元)。

  • 无文本中介的三元原生交互数据集:直接投喂游戏 Replay 录屏与仿真环境操作日志(涵盖「过去状态理解-人类交互动作-下一秒环境变化」三元组数据),不依赖自然语言翻译中介,数据量已对标头部视频生成模型。

  • 开放 API 与季度迭代计划:W1 作为中等规模验证模型已开放 API 接口;训练数据量扩大 100 倍的下一代基座模型 W2 计划于今年第四季度发布。

 

(@Monolith 砺思资本、智能涌现)

 

2、OpenAI 发布企业级智能体平台 Presence:支持实时语音与文本交互,通过 API 集成第三方模型与工具

 

OpenAI 推出企业级智能体部署与管理平台 OpenAI Presence,专注于实时语音及文本工作流落地。该平台通过结合预置护栏策略、仿真评测工具与前线工程师(FDE)交付模式,解决智能体在生产环境中高并发实时交互的可靠性及策略更新问题。

 

  • 实时语音交互与多模型 API 融合:原生支持全双工实时语音与文本频道,涵盖客服呼叫(如 SoftBank 日语客服、BBVA 墨西哥语音银行业务)、外呼销售及内部 IT/HR 服务台;核心智能体运行 OpenAI 模型,同时开放 API 接口,允许企业引入第三方模型或服务用于工具调用(Tools)与安全护栏(Guardrails)。

  • 电话客服实测 75% 自主解决率:Presence 已承载 OpenAI 官方英文电话客服(1-888-GPT-0090),处理验证身份、账户查询及执行批准动作等开放式语音请求,实现 75% 的无人工介入解决率;基于 Codex 的优化机制在 10 天内将人工转接率降低了 15 个百分点。

  • Codex 驱动的策略闭环更新:内置 Presence Codex 插件,自动捕获生产环境会话与人工转接(escalation)日志,分析用户意图与策略偏差,自动生成提示词(Prompt)与 SOP 变更建议,并支持在线对比仿真测试与受控发布。

  • 基于任务的最小授权与批处理仿真:对智能体施加基于特定工作流的最小数据与系统 API 访问权限;提供离线批处理仿真(Simulation Batches)与自动评分器(Graders),在上线前评估策略符合度与边界规则,防止语音与文本交互中的越权或误操作。

 

( @venturebeat)

 

3、OpenAI Codex 曝光实时语音智能体功能 Realtime Voice Mode:集成 Connectors 支持跨应用复杂任务执行

 

3be5920d2ce38dccf2bde21f45327451

 

 

OpenAI 被发现在 ChatGPT 代码中集成了 Codex Realtime Voice Mode。该功能将实时语音交互与 Codex 智能体相结合,使系统能够通过语音操控 Connectors 执行跨应用的复杂任务。

 

连接器与工具链调用: 用户可通过语音触发 Connectors,直接操控 Slack、Spotify、文档、日历、网页浏览器、在线购物及外卖下单等第三方服务。

 

通用智能体定位: 基于 Codex 智能体构建,将原本针对代码场景的能力扩展至通用自动化任务执行。

 

交互形态演进: 此前在 Codex 应用中曾以 Orb 或 Pets 挂件形态曝光,目前尚未在 ChatGPT 桌面端公开发布。

 

竞品同步推进: Anthropic 也在为其 Opus 和 Sonnet 模型升级语音模式,同步支持 Connectors 与工具调用。

 

目前处于代码曝光阶段,具体上线时间未定。

 

(@testingcatalog@X)

02 有亮点的产品

1、硬件初创公司 Augmental 开售 MouthPad 口腔触控板:通过舌头控制指针,厚度 1mm,售价 1400 美元

 

硬件初创公司 Augmental 正式在美国开售基于口腔佩戴的无线触控设备 MouthPad。该设备可将舌头与头部微动转化为计算机指针指令,帮助无障碍需求用户实现免手操作,定价 1,400 美元起。

 

  • 3D 打印个性化牙科封装:设备基于用户牙科 3D 扫描定制,采用牙科树脂材料制造;整体厚度约 1 mm,重量约 10 g,尽量降低对语言发音的影响。

  • 舌头与头部运动多模态映射:内置中央触控板与侧边柔性电路,支持将舌头触碰、滑动以及头部移动精准转化为鼠标指针定位、单击、双击、滚动及拖拽等操作。

  • 标准蓝牙无线连接:设备直接通过 Bluetooth 协议与终端连接,兼容 macOS、Windows、Linux、iOS 及 Android 系统,支持多设备间实时切换,并提供专属控制 App(适配 macOS、Windows、iOS)。

  • 硬件续航与安全认证:配备专属充电盒,内置电池可支持 7 小时以上的连续使用,完全充电时间约为 1.5 小时。

  • 无声打字扩展模块(VOX):同步推出公测版体感麦克风 VOX,利用体传导技术拾音,与 MouthPad 组合实现无双手参与下的完整「指针+打字」交互。

 

目前已在美国开放预订,单机售价 1,400 美元,双机套餐售价 1,900 美元;用户需在本地完成 3D 牙科扫描并提交数据,定制设备将在 6 个月内完成发货。

 

( @augmentaltech@X)

 

2、商汤 001 号员工「再创业」AI 陪伴,完成数千万种子轮

 

061b03f97b5ae2e8cbe8f678bbb4d597

 

 

AI 角色硬件公司酷奇奇科技(Coolqq) 宣布完成数千万元种子轮融资。本轮融资由上海浦东人工智能种子基金领投,商汤科技、零以创投跟投,云杉资本 Spruce Capital 担任长期独家财务顾问。

 

酷奇奇的创始人徐持衡,是商汤科技 001 号员工,师从计算机视觉泰斗汤晓鸥教授,曾与团队共同开发商汤早期最重要的人脸识别技术。此后,他出任灵宇宙 CTO,主导 AI 教育产品「Ling」从概念到完整落地。

 

酷奇奇的核心产品 「CookiePi 角色互动伙伴」 是一款分布式多端 AI 互动产品。它由触发器 Cookie 和角色端 Pi 两部分组成,可适配玩偶、手办、家居等各种物理实体,让数字生命能够以具身形态存在于现实场景中。

 

多个 AI 互动伙伴可以融入家居各处,主动探索空间,陪用户聊天,也能即兴演剧,共同演绎日常生活。

 

(@AING 硬迹)

 

3、Synthesia 发布 Roleplay 交互式培训系统:接入 OpenAI 推理引擎,集成自研 Avatar 与实时量化评分

 

79a94c41591697d5378634ad0ed8bddc

 

 

Synthesia 推出全新 Sessions 平台首款产品 Roleplay,支持员工与 AI 虚拟形象进行销售演示、绩效评估等高难度场景的实操模拟。该系统将底层 OpenAI 推理模型与自研音视频技术相结合,引入量化评分标准与性能分析层,推动公司业务从单纯视频生成向数据驱动的绩效管理平台转型。

 

  • 架构解耦与自研结合:底层推理智能接入 OpenAI 模型,前端融合 Synthesia 自有专利的 AI 虚拟形象生成与语音合成技术。

  • 实时抗辩与量化评分:AI 虚拟形象具备实时对答与提出质疑(push back)的能力,并在互动结束后依据预设量化指标(rubric)自动完成多维能力打分。

  • 分析层沉淀与人才图谱:集成 Performance Analytics 模块,将软技能培训转化为可视化数据,协助管理层进行细粒度的人力资源表现评估。

  • 场景拓展规划:作为「Sessions」平台的首发模块,后续计划将该交互架构延伸至求职面试与候选人筛选等场景。

 

( @TechCrunch)

03 有态度的观点

1、Vibe Coding 概念提出人 AK:用 10 分钟的交流,换取更懂你的大模型

 

0e75fe124805791c51d41eed9c6e53e7

 

 

近日,OpenAI 联合创始人、前特斯拉 AI 总监、vibe coding 概念提出人安德烈·卡帕西(Andrej Karpathy)在社交媒体上分享了他与大模型互动的独门秘诀:不要试图写出完美的指令,去和它交谈,越乱越好。

 

卡帕西指出,当面对复杂任务时,人类往往因为「懒得打字」而无法向大模型提供足够的背景信息。他的解决方案极具颠覆性:坐在椅子上,切换到语音模式,然后开始长达 10 分钟的「闲聊」——没有任何逻辑,想到什么说什么,甚至夹杂着口误和废话。

 

令人惊奇的是,大模型展现出了极强的「去粗取精」能力。它们能够从这些混乱、冗长的语音碎片中,精准重构出用户内心深处的真实意图,并给出一个比用户初始想法还要清晰得多的结构化回应。一旦完成这一步,后续的合作就会变得顺畅无比,几乎不再需要反复修正。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

 

1、活动推荐|BUIDL_QUESTS 2026 深圳站

2cb9e9b190842a95a80c11525b2e8a83

 

 

06ed49911af34465dad3951288cbc72f

 

 

BUIDL_QUESTS 2026 是一场聚焦 AI × AI-Crypto 的全球创业大赛。从新加坡出发,途经亚洲和美国 12+ 座城市,最终回到新加坡举办全球总决赛(7 月 → 10 月)。

 

去年我们 BUIDL_QUESTS 2025 共吸引了 150+ 项目提交、4,000+ 报名者、2,500+ 线下参与者,覆盖 10 场线下活动 和 13 场线上 Workshop(累计 46,000+ 观看)。Top 10 团队登上 Demo Day 路演,其中赛后一支团队成功获得 Tier-1 VC 150 万美元种子轮融资。

 

今年的主题为 Autonomous Agent & Sovereignty(自主智能体与主权),设置 Autonomous Agents、Sovereignty、Agent Commerce、AI Hardware、OPC(超级个体) 五大赛道,目前奖金池已达 $50K+(持续增加中)。

 

目前我们已经联合了 70+ 生态合作伙伴(包括 VC、社区、Crypto 公司、AI 公司、硬件企业、媒体及电视台),同时也与韩国、越南、泰国、英国、土耳其等多个国家和地区的合作伙伴共同开展全球宣发。

 

更多活动详情可参考官网:

 

https://openarena.to/zh/events/buidl-quests-2026

image

 

 

75425b04893c604025742af01aeea481

 

 

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

 

写在最后:

 

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

 

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

 

4621d251942d7d6c7ecb92768cd9e90d

 

 

作者提示: 个人观点,仅供参考