本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、阿里云栖大会期间 Qwen 连发两款实时语音模型:Qwen3.8-Omni-Flash-Realtime 加入多通道音频、视频聚合与远程 MCP,Qwen-Audio 3.1 Realtime Plus 新增 8 个系统音色

近 4 日,Qwen 密集更新实时 Voice AI 产品线。前两日发布实时音视频翻译模型 Qwen3.8-LiveTranslate-Flash-Realtime 后,现又上线 Qwen3.8-Omni-Flash-RealtimeQwen-Audio 3.1 Realtime Plus,分别补全实时全模态交互与端到端全双工语音两条能力线。其中,Qwen3.8-Omni-Flash-Realtime 面向实时音视频交互,在已有文本/音频输出基础上新增多通道音频输入、视频聚合和远程 MCP,并支持 WebSocket、WebRTC 和 AOQ;Qwen-Audio 3.1 Realtime Plus 则延续 3.0 Plus 的接入协议,新增 8 个系统音色。

同时剧透会发布一个首次亮相的新模型——Qwen-Audio-3.1-TTS-Next ,将呈现 Qwen Audio 从语音生成迈向通用音频生成的最新进展:根据一段脚本生成包含语音及完整环境声场的音频,并支持细粒度时间戳控制、声音复刻和 48 kHz 输出,满足有声书、影视剧和播客等专业创作需求。

https://docs.qwencloud.com/changelog/models

2、Kyutai 基于 GLM-4-Voice 发布语音推理模型 Voice of Reason:首次将强化学习用于语音原生数学推理,不加额外推理 token 也将 GSM8K 提升至 65.5%

Kyutai 基于 GLM-4-Voice 做了一版更会「算题」的语音模型 Voice of Reason:模型可以直接听语音题目并用语音回答,不需要先转成文字再交给文本模型。团队先用数学语音问答数据训练,再加入强化学习,把 GLM-4-Voice 在数学文字题推理数据集 GSM8K 上的准确率从 27.3% 提升到 65.5%;进一步加入 STITCH 的「边说边想」方式后,最高达到 77.1%

这也延续了 Kyutai 从 Moshi 开始探索的方向:Moshi 主要解决语音模型如何做到低延迟、全双工地边听边说,而 Voice of Reason 开始进一步补上复杂推理能力,让实时语音模型不仅能「边听边说」,也能尝试「边说边想」。

https://x.com/kyutai_labs/status/2102080831242060123\

https://arxiv.org/abs/2609.18677

3、语音 AI 公司 Freya 发布 TTS 模型 Adam / Eve:Adam 在 AudioRealismBench AI 模型中排名第一,API 开始分批开放

Freya 发布两款英语 TTS 声音 Adam 和 Eve,并开始开放 API 申请。其中 Adam V1 在 Design Arena 的 Audio Realism Benchmark 中获得 1419 Elo,在参测 AI 模型中排名第一,仅次于真人语音基线 1462。该评测让母语听众盲听相同文本生成的两段语音,并选择哪一段更像真人。

https://x.com/TungaBayrak/status/2102069626762932680

https://www.freyavoice.ai/

4、清华孵化全模态交互公司聆芯智语发布声音设计 TTS 模型 LingX-TTS:可按场景与角色控制表达,并主动生成笑声、咳嗽等副语言

聆芯智语发布高表现力语音生成模型 LingX-TTS,用户可用自然语言描述角色、场景和说话方式,控制生成语音的情绪与韵律。模型还可根据上下文生成笑声、叹息、咳嗽等副语言声音。

https://lingx.cn/playground

https://lingx.cn/tts.html

5、端侧 AI 推理公司 Argmax 等研究者提出长文本 TTS 推理方法 LACI:不重训模型,Qwen3-TTS 1500+ 词最差 WER 从 35.2% 降至 3.4%

端侧 AI 推理公司 Argmax 等研究者提出 LACI(Localized Attention-Constrained Inference),用于解决 Qwen3-TTS、VoxCPM2 等自回归 TTS 在超长文本生成中容易出现的跳读和幻觉问题:生成过程中持续监控音频与文本的注意力对齐,一旦检测到异常,就回滚到错误起点,并临时施加注意力约束重新生成。

https://x.com/RmdW_W/status/2102032894600401231\

https://arxiv.org/abs/2609.16989

6、端侧 AI 公司 M87 Labs 发布三值 ASR 模型 Parakeet Redux:将 NVIDIA Parakeet 从 1.2 GB 压到 178 MB,8 核 CPU 达 113× 实时转写

M87 Labs 基于 NVIDIA Parakeet-TDT-0.6B-v3 发布 Parakeet Redux,把编码器权重量化成 -1 / 0 / +1 三种取值,在保持原架构和 tokenizer 不变的情况下,将模型权重从 1.2 GB 压缩到 178 MB。配合其 Photon 推理引擎,官方测试中在 8 个 x86 CPU 核心上达到 113× realtime,同时在英文基准上与原模型保持接近的 WER。

https://huggingface.co/moondream/parakeet-redux

02 有亮点的产品

1、阿里实时交互开放式世界模型 HappyOyster 新增 Acting 角色演绎模式:可与生成角色实时交流,扩展至三种交互方式

阿里实时交互开放式世界模型 HappyOyster 目前提供 Adventure 世界探索、Directing 实时导演、Acting 角色演绎三种交互模式。相比此前主要开放的 Adventure 和 Directing,这次新增的 Acting 把交互对象从「生成世界」和「视频剧情」进一步扩展到「生成角色」:用户可以和角色面对面实时交流,角色会通过语音、表情和动作即时回应。该模型目前处于邀测阶段。

https://www.happyoyster.cn/

2、DeepNovaCore 发布开源语音智能体 NovaAudioAgent v0.2:语音对话不中断后台任务,新增长期记忆与可插拔语音链路

DeepNovaCore 开源语音智能体 NovaAudioAgent v0.2,让实时对话和后台任务并行运行:用户可以一边和 Nova 继续说话,一边让 Codex 在后台写代码、执行任务或管理工作区;任务有重要进展时再主动播报,普通过程则保持安静。v0.2 进一步加入可配置的 ASR / LLM / TTS、个人记忆、MCP 和 iPhone 远程接入。

https://deepnovacore.github.io/NovaAudioAgent/

03 有态度的观点

1、Anthropic、OpenAI、SpaceX 和 Google 因「放缓 AI 开发」表态遭反垄断诉讼

据 Seeking Alpha 和界面新闻报道,4 名 ChatGPT、Claude、Grok 和 Gemini 付费用户的律师已在加利福尼亚州提起反垄断诉讼,将 Anthropic、OpenAI、SpaceX 和 Google 列为被告。

原告指称,4 家公司的高管近期先后公开表态应放缓前沿 AI 开发,这些言论构成协调行动,可能减慢产品竞争与功能迭代,降低付费订阅的价值。这些目前只是诉状中的指控,现有公开报道尚未提供案件编号,4 家公司也未在报道中公开回应。

@APPSO

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流