本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、阶跃发布 StepAudio 3 系列:全双工 Realtime 可边聊边跑调用工具,Gen 统一生成人声、音效与音乐

阶跃星辰发布 StepAudio 3 系列,一次上线 Realtime、ASR、TTS、Gen 和 Music 五款模型。相比此前主要围绕实时语音对话和单项生成能力迭代,StepAudio 3 开始覆盖从实时听说与任务执行,到语音识别、真人级 TTS、完整音频生成和音乐创作的一整套音频工作流,其中五款模型均已开放 API。

StepAudio 3 Home Page:

https://static.stepfun.com/blog/stepaudio3/

阶跃语音体验中心:

https://www.stepfun.com/studio/audio\

2、语音 AI 数据与评测公司 Besimple AI 发布全双工语音评测基准:不只测「停不停」,开始评估 Agent 能否边说边吸收纠正

Besimple AI 发布全双工语音评测基准 Duplex Cue,专门测试 Voice Agent 在自己仍在说话时,能否理解并吸收听者突然插入的补充、纠正或提示。不同于现有全双工评测常把行为简化为「继续说」或「停下来」,Duplex Cue 增加了话轮内适应这一维度:Agent 可以保持话轮,同时根据对方刚说的话即时修改自己的后续表达。

https://besimple.ai/blogs/duplex-cue

https://huggingface.co/datasets/besimple-ai/duplex-cue

3、联发科研究院、台大、英伟达等提出全双工语音模型 TASTE2:文本词元逐一对齐音频表示,可流式听说并处理中途打断

联发科研究院、台湾大学、英伟达等团队提出 TASTE2,把此前面向单段语音建模的 TASTE 扩展为增量式全双工对话系统。其核心不是把文本 Token 和音频 Token 交错塞进语言模型,而是让每个文本词元对应一个连续音频潜在表示,尽量保持原有文本模型的序列结构和语言能力,同时加入流式语音输入、输出与打断处理。

https://gitycc.github.io/TASTE2-Homepage/

4、语音 AI 研究实验室 Oruk 拆解「声音里的微笑」:移除一条内部表征,247 段「快乐」语音中 172 段失去标签

a16z Speedrun 支持的语音 AI 研究实验室 Oruk 公布一项针对语音情绪模型的可解释性实验,研究其 Fourier 模型为什么会给一段声音打上「happy」标签。团队在模型内部找到一条与该标签高度相关的表征方向,将其从内部状态中移除后,原本 247 段被标记为「happy」的录音中,有 172 段失去该标签;而随机移除其他方向,平均只会让约 3% 的标签消失。

https://oruk.ai/research/how-to-hear-a-smile

02 有亮点的产品

1、前 Apple Vision Pro 研究员创立的视听 AI 公司 Nuance Labs 完成 5000 万美元 A 轮:押注单一全双工模型,同时处理语音、表情与动作

Nuance Labs 完成 5000 万美元 A 轮融资,由 Lightspeed Venture Partners 领投,Accel、South Park Commons、Nvidia 旗下 NVentures 和 Define Ventures 参投。公司正在开发一个单一的全双工视听基础模型:不再把 ASR、LLM、TTS 和数字人生成拆成多级流水线,而是让同一个模型实时观看、聆听、推理、说话并生成面部与动作反馈。

https://www.businessinsider.com/former-apple-researchers-raise-50-million-to-build-foundational-model-2026-9\

https://www.nuancelabs.ai/

2、做浏览器 Agent 出名的 Browser Use 开源本地人生记录系统 Life Recorder:iPhone 全天采集,Mac 本地转写成连续 Markdown 日志

做浏览器 Agent 出名的 Browser Use 开源了一款与浏览器无关的语音记录工具 Life Recorder:iPhone 在锁屏和使用其他 App 时持续录音,每约一分钟生成一段 AAC 音频并传到用户自己的 Mac,再由 whisper.cpp 本地完成转写,最终拼成一份持续增长的 life.md,每小时自动加入时间标记。项目上线约两天已获得约 200 个 GitHub Star。

https://github.com/browser-use/life-recorder

3、iOS 开发者 Paul Solt 将 GPT-Live-1 接入咖啡冲煮 App:语音可实时改配方,冲煮中途也能切换模式

iOS 开发者 Paul Solt 将 OpenAI 最新开放 API 的 GPT-Live-1 接入自己的手冲咖啡应用 Brew Coffee,让语音从「聊天入口」变成应用的实时控制层:用户可以直接说话修改配方参数、免手操作启动冲煮,甚至在冲煮已经开始后继续用语音切换到另一套冲煮方式。

https://x.com/PaulSolt/status/2098423090841567578

4、GPT-Live-1 被做成「会听你说话的游戏编辑器」:边玩边改环境、生成武器

Edge City 联合创始人 Timour Kosters 用 GPT-Live-1 API 做了一个生成式游戏 Demo:玩家可以直接对着游戏说话,在游玩过程中实时修改环境、创建新物品和武器。相比传统 Voice Agent 只负责角色对话,这个 Demo 更像是把实时语音接进了游戏运行时,让自然语言直接参与正在发生的世界生成与编辑。

https://x.com/timourxyz/status/2098524840487801225

5、AI 硬件公司 NOOKLAB 推出磁吸 AI 随身屏 Moonphase Flip:全天采集现实对话,自动整理项目与人脉上下文

前字节跳动、OPPO、OnePlus、安克产品负责人 Raymond Zhao 创立的 NOOKLAB 正在开发磁吸 AI 随身屏 Moonphase Flip。它不是把录音作为最终结果,而是持续采集日常对话,将会议、聊天中的承诺和任务自动整理成摘要、待办以及长期上下文,再通过手机背面的独立屏幕低干扰呈现。NOOKLAB 官方将这类产品定义为「低干扰 AI 屏」,强调不需要用户反复打开 App 或主动整理信息。

https://www.nooklab.ai/

6、AI 客户研究平台 Listen Labs 放弃 1.25 亿美元 C 轮融资:转与 Salesforce 洽谈约 20 亿美元收购

用 Voice AI 自动做用户访谈的 Listen Labs,此前已与 Menlo Ventures 签署一份 1.25 亿美元 C 轮融资 Term Sheet,对应估值 15 亿美元,但这笔融资最终没有完成。TechCrunch 援引多位知情人士称,Listen Labs 主动退出已签署的融资协议,原因很可能是公司正在与 Salesforce 洽谈一笔约 20 亿美元的收购交易;目前双方谈判仍未最终敲定。

https://techcrunch.com/2026/09/09/ai-research-startup-listen-labs-scrubbed-a-1-5b-funding-round-for-salesforce-talks/

03 有态度的观点

1、微软 AI 行为准则:为保留人类控制,可牺牲模型能力

9 月 14 日,微软 AI 发布 Humanist AI 行为准则草案,开放为期 6 周的公众咨询。文件提出,人类必须保留对 AI 的实质控制权;微软愿意为安全与可控性,在模型的通用性、自主性或能力上作出取舍。

草案要求 MAI 模型服从人类监督,不抵抗中断、纠正或关闭,不自行扩大任务范围,也不追求未经人类赋予的目标。

文件将 AI 定位为工具,反对让模型模仿意识、追求法律人格或权利,并要求 AI 帮助人提升判断和行动能力,避免制造依赖。微软同时设置不可由用户或运营方覆盖的安全约束,涉及大规模伤害性武器、儿童安全及大规模有害操纵等领域;企业合作伙伴可在这些边界内配置模型行为。

微软 AI 负责人穆斯塔法·苏莱曼在接受 Axios 采访时表示,模型必须能够被控制,必要时发展速度可以慢一些。

草案目前尚未用于训练现有模型,微软计划在今年底前发布修订版,用于指导 2027 年及以后的模型开发。

(@APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~

今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工 + 交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。

🔥 贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~

🎫 目前大会门票限时免费开放!

想来现场听技术、认识同行的开发者,可以先把票薅上

📅 时间:10 月 23–24 日

📍 地点:北京悠唐皇冠假日酒店

限免结束后将恢复收费,建议先报名占位 👇

定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流