本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、苹果发布高效音频生成架构:解耦时间 - 深度扩散 Transformer,实现端侧实时语音合成

图片

苹果研究团队发布音频生成架构「Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers」,用于支撑 Siri Expressive Voices 的端侧实时语音合成。该方案针对移动设备算力和内存限制,通过解耦时间建模与声学深度生成,将峰值运行内存降低至 21MB,并在 Apple Matrix Coprocessor 上实现约 10ms 单步生成速度。

https://arxiv.org/abs/2607.23811

(@Apple Research)

2、Lychee-FD 发布原生全双工语音大模型:层级声学 - 语义建模,提升 Spoken QA 7.4% 与交互流畅度 28.5%

图片

哈尔滨工业大学(深圳)团队发布 Lychee-FD 原生端到端全双工语音大模型,并获 ACL 2026 杰出论文。该模型将持续监听、语义理解、语音生成和交互控制统一到多流架构中,通过解决声学与语义模态之间的干扰问题,实现更自然的实时语音交互。

图片

https://hitsz-tmg.github.io/Lychee-FD/

(@Lychee-FD Team)

3、Wan-Streamer v0.3 发布「世界状态 + 事件流」实时交互模型:640×368 视频流,550ms 全链路延迟

图片

阿里巴巴 Wan 团队发布 Wan-Streamer v0.3,将视频建模为「世界状态 + 事件流」,用于实时多模态交互模型训练。该模型在统一框架下持续理解环境、主体状态和动态事件,并支持全双工音视频交互,在 640×368 分辨率、25 FPS 下实现约 550ms 总交互延迟。

世界设定(精简):一位沉稳的年轻德国工程师在整洁专业的家庭工作室中介绍个人项目,伴有自然的工具环境声。

图片

https://wan-streamer.com/v0.3/

(@Wan-Streamer Team)

02 有亮点的产品

1、Qoder 发布 Voice 实时语音交互智能体:全双工对话,支持代码执行、浏览器操作与 MCP 调用

图片

Qoder 推出 Qoder Voice 实时语音交互智能体,将语音模型与代码智能体能力结合,支持全双工实时交流和桌面常驻唤起。该系统基于 Qwen-Audio-3.0-Realtime,实现低延迟语音理解、上下文处理和工具调用,用户可通过自然语音指令让智能体执行代码、操作浏览器和连接外部系统。

(@Qoder)

2、Heard 发布 Coding Agent 语音层:支持 Claude Code、Codex 并行任务语音摘要与移动端控制

Heard 推出面向智能体编程工作流的语音交互层,将 Claude Code、Codex 等 Coding Agent 的终端输出转化为上下文语音摘要。该工具针对多智能体并行运行场景,通过理解任务状态后筛选关键信息播报,减少开发者持续查看终端的需求。

https://www.producthunt.com/products/heard-2

(@Heard)

3、堡垒之夜上线 AI NPC 对话系统:36 个 AI Persona 接入 UEFN,支持无脚本动态交互

图片

Epic Games 宣布将在堡垒之夜中开放 AI NPC Persona 系统,允许创作者在 UEFN(Unreal Editor for Fortnite)中加入具备固定声音与人格设定的 AI 角色。首批提供 36 个 AI Persona,玩家可与 NPC 进行非脚本化对话,用于任务引导、剧情互动和自定义游戏体验。

https://thecosmicmeta.com/fortnite-to-roll-out-multiple-ai-powered-personas

(@Fortnite / Epic Games)

03 有态度的观点

1、北大校友翁荔发文告别 Thinking Machines,因健康原因离职

图片

Thinking Machines Lab 联合创始人、北大校友翁荔(Lilian Weng)在社交媒体发布离职信,宣布正式离开这家成立仅 20 个月的 AI 初创公司。就在几天前,Thinking Machines 刚发布了其首个开源大模型 Inkling。

翁荔在离职信中表示,离开的主要原因是健康问题。她提到在过去 7 个月中,自己的生病频率超过了以往任何阶段,且在公司冲刺发布 Inkling 期间,因病无法参与工作的负罪感令其备受煎熬。

翁荔此前在 OpenAI 任职超过 6 年,曾从零组建了规模超 80 人的安全系统团队,并担任研究与安全副总裁。2024 年 11 月离开 OpenAI 后,她于 2025 年 2 月与 OpenAI 前 CTO Mira Murati 等人共同创立了 Thinking Machines。

Thinking Machines 在成立之初曾获得 20 亿美元种子轮融资,由 a16z 领投,投后估值达 120 亿美元。然而在过去一年中,该公司经历了频繁的人事变动,包括联合创始人 Barret Zoph、Luke Metz 在内的多名核心成员已相继重返 OpenAI。

目前,Thinking Machines 已与英伟达达成战略合作,并上线了模型微调工具 Tinker 及开源模型 Inkling,正处于从研发阶段向产品交付转型的关键期。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、Voice Vibe Coding(VVC)的境界

图片

@mikedevs\@X

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流