本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、PolyAI 发布 Dialog-RSN-1 音频原生对话模型:融合轮次控制、语音识别与函数调用能力

PolyAI 发布面向企业语音交互场景的 Dialog-RSN-1 模型,并开放 Agent Studio 平台。该模型直接处理用户音频输入,将轮次判断、语音识别、函数调用和响应生成整合到统一对话模型中,面向复杂电话客服和语音智能体场景优化。

https://poly.ai/blog/PolyAI-dialog-rsn-1

https://studio.poly.ai/

(@PolyAI)

2、AVS3 音视频编码标准支撑 2026 世界杯超高清直播:4K 码率降低 40%,完成编码到终端全链路商用

AVS3 音视频编码标准在 2026 美加墨世界杯期间首次作为世界级赛事超高清直播主力方案规模化应用,实现从编码、云端分发到终端播放的全链路商用。基于云边端一体化架构,AVS3 支撑千万级并发直播流,并在 4K 视频场景下相比 HEVC 平均节省 40% 以上码率。

2026 世界杯收官,AVS 标准实现世界级赛事全链路商用

(@ 新一代人工智能联盟)

3、StreamCore 发布开源实时语音智能体框架:Go 实现 WebRTC 通信,支持本地化语音 Agent 部署

StreamCore 开源实时语音智能体框架 streamcore-server,提供从音频接入、语音识别、模型推理到语音合成的完整实时交互链路。该项目基于 Go 构建,支持 WebRTC(WHIP)、流式 STT/LLM/TTS 管线、多语言 SDK 以及本地运行模式,面向实时语音 Agent 和电话机器人等场景。

https://github.com/streamcoreai/streamcore-server

(@streamcoreai)

4、NVIDIA 发布 Voice Memory 语音记忆机制:无需训练权重,通过外部记忆提升 ASR 纠错能力

NVIDIA 研究团队提出 Voice Memory,一种面向智能体语音识别的推理阶段记忆机制。该方法通过可读写的外部文本记忆文件,让冻结的语音识别模型根据领域经验自主判断是否修正识别结果,无需微调模型参数即可提升特定场景下的识别准确率。

https://arxiv.org/abs/2607.26410

(@NVIDIA)

02 有亮点的产品

1、京东外卖推出 AI 智能头盔:集成语音助手、路线规划与商户环境核验能力

京东外卖发布 AI 智能头盔,面向骑手配送场景集成 AI 语音助手、单王路线、商户环境核验、一键 SOS 等功能。该设备通过语音交互、路线辅助和订单信息提醒减少骑手操作负担,并计划向全职骑手免费发放。

会说话、会认路、会提醒——京东外卖 AI 智能头盔来了!

(@ 京东外卖)

2、Vokie 推出「表达场」:让语音输入拥有可调节的表达风格

Vokie 推出「表达场」功能,尝试解决自然表达与最终文本之间的偏差问题:用户说出来的话,往往并不是最终想发送的内容,而不同场景也需要不同的整理方式。

https://vokie.com/

https://x.com/alanshen144905/status/2082796610824863980

(@Vokie)

3、OpenAI ChatGPT Voice 登陆桌面端:支持 macOS 与 Windows 免手语音操控工作流

OpenAI 将 ChatGPT Voice 体验扩展至 macOS 和 Windows 桌面应用,用户可通过语音与 ChatGPT 进行实时交互,无需键盘输入。桌面端 Voice 基于实时语音能力,支持连续对话、打断、任务指令等交互方式,并可用于控制工作流和智能体任务。

https://x.com/ChatGPT/status/2083305352469352714

(@ChatGPT)

4、腾讯《猫仙札》AI Agent 游戏首曝:自研角色模型,支持动态记忆与多 Agent 协同互动

腾讯在 ChinaJoy 2026 展示 AI Agent 叙事 RPG《猫仙札》,将 AI Agent 融入女性向叙事玩法,通过角色对话、休闲玩法和多人互动模块扩展传统剧情游戏体验。项目采用自研模型构建角色交互系统,并通过角色训练数据、情绪平滑、动态记忆等机制提升 AI 角色稳定性。

我在 CJ 上玩到了腾讯新露面的 AI Agent 游戏

(@ 游戏日报)

03 有态度的观点

1、The Information:苹果应该收购 AI 会议记录产品 Granola,它是苹果长期缺失的下一代 AI 交互入口

The Information 近日提出一个大胆判断:苹果应该收购 AI 会议记录产品 Granola。原因并非看中一个简单的效率工具,而是 Granola 代表了一种苹果长期缺失的 AI 产品形态——一个无需学习、持续陪伴用户、能够理解个人生活上下文的下一代交互入口。

Granola 展示了 AI 产品真正的 Apple 式体验

与许多 AI 产品追求功能堆叠不同,Granola 凭借极简设计、低干扰体验和高频使用场景获得用户喜爱。它更像一个「隐形基础设施」,而不是一个需要学习的新工具。

AI 正在重新定义可穿戴设备的价值

Granola 的 Apple Watch 版本意外成为爆款,甚至重新激活了用户对 Apple Watch 的兴趣。原因在于:语音记录和 AI 总结这种场景天然适合随身设备,而不是藏在手机里的 App。

苹果缺少能够推动 AI 时代产品创新的团队

作者认为,苹果近年来更多依赖已有硬件产品迭代,而 Granola 团队展现出的能力——让一个成熟设备重新变得有吸引力——正是苹果需要补充的 AI 产品能力。

Granola 可能是苹果进入「Always-on AI」时代的入口

AI 未来可能从被动调用工具,转向持续感知、记录和理解用户生活。Granola 已经验证了用户对于这种「始终在线的个人记忆层」的需求。

收购成本符合苹果传统策略

Granola 成立于 2023 年,最新估值约 15 亿美元。相比苹果历史上的大型收购,这属于可接受范围,也符合苹果偏好收购小团队、吸收核心能力的方式。

延伸阅读:引爆 AI 会议工具潮流,Granola 打造 2.5 亿美元估值产品的秘密丨 Voice Agent 学习笔记

@The information)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流