图片

本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、QwenAudio 开源 Qwen-Audio-Agent:将实时语音交互层部署在用户与后台智能体之间

QwenAudio 开源 Qwen-Audio-Agent,将实时语音交互层部署在用户与后台智能体之间,负责连续对话、任务委派、上下文衔接和结果播报。系统可即时处理简单问题,并将搜索、推理、代码修改和工具操作等复杂任务转交 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy 或 Codex 执行。

https://github.com/QwenAudio/qwen-audio-agent

(@QwenAudio)

2、安菲翁科技发布个性化语音识别系统 AmphionASR:集成 LLM 与检索增强,支持万级热词与指定说话人识别

图片

安菲翁科技发布基于 LLM 的个性化语音识别系统 AmphionASR,将行业热词、指定说话人、强噪声下语音识别和耳语识别四类能力融合至统一框架。该系统通过检索增强与三阶段训练策略,实现了复杂声学场景下的高精度转录。

图片

API 即将发布,论文与技术细节已开源上线。

信息来源@Amphion Team)

AmphionASR:「懂」场景支持大规模热词的个性化语音识别

(@Amphion)

3、Audio8 开源 0.6B 多语言 TTS 模型:支持 11 种语言与零样本声音克隆,输出 44.1kHz 音频

图片

Audio8 发布 Audio8-TTS-Preview-0.6b,一款采用 DualAR 架构的多语言 TTS 模型,主模型参数量为 601M,支持零样本声音克隆和无参考音频生成。项目同步开放完整模型权重、44.1kHz 神经音频编解码器、分词器及 Transformers 推理代码,并采用 Apache 2.0 许可证。

demo:

https://audio8-ai.github.io/Audio8_TTS/

(@Audio8)

4、Google 发布音乐生成模型 Lyria 3.5:最长生成 3 分钟,增强歌词结构、演唱表现与节奏控制

Google DeepMind 发布 Lyria 3.5,并率先接入 Google Flow Music。新版本重点提升旋律结构、歌词指令遵循、歌声自然度和发音准确性,同时支持按提示词控制歌曲节奏与时长,可生成最长 3 分钟的完整音乐。

https://blog.google/innovation-and-ai/models-and-research/google-labs/lyria-3-5/

https://flowmusic.google

(@Google DeepMind\@Google Labs)

02 有亮点的产品

1、企业级对话智能体平台 Encore AI 完成 3000 万美元 A 轮融资:从客户通话提炼销售方法,训练语音与文本智能体

图片

Encore AI 宣布完成 3000 万美元 A 轮融资,由 Team8 领投,并将原 Insait IO 品牌更名为 Encore AI。其平台通过分析企业积累的通话、邮件、聊天和 CRM 数据,识别高绩效员工在销售、催收和客户服务中的有效行为,再将其转化为可自主对客或辅助人工坐席的智能体。

https://techcrunch.com/2026/07/29/encore-ai-raises-30m-to-build-ai-agents-that-learn-from-customer-calls/

(@Encore AI\@TechCrunch)

2、telli 完成 1500 万美元种子轮融资:语音、聊天与 WhatsApp 智能体统一处理客户运营

图片

柏林初创公司 telli 完成 1500 万美元种子轮融资,由 redalpine 领投,Mutschler、Cherry Ventures、Y Combinator 及多位天使投资人参投,累计融资超过 1850 万美元。其平台面向 B2C 企业,将语音、聊天、SMS、WhatsApp 和邮件中的客户交互统一交由智能体处理,并通过 AI 协作者 Charlie 帮助运营团队构建、分析和持续优化这些智能体。

https://tech.eu/2026/07/23/telli-secures-15m-seed-to-automate-customer-facing-operations/

(@telli)

3、Intelligent Internet 开源 Genii 个人智能体:消息入口交互,支持长期记忆与本地部署

Intelligent Internet 开源个人智能体 Genii,将 AI 助手入口从独立聊天窗口迁移至日常消息场景。项目支持通过消息与智能体持续交互,并通过长期记忆保存用户上下文,使智能体能够跨会话延续任务和个人偏好。

https://github.com/Intelligent-Internet/genii

https://x.com/ii_posts/status/2082474832877269208

(@Intelligent Internet)

03 有态度的观点

1、OpenAI 总裁 Greg Brockman:未来计算入口将从键盘转向语音

图片

OpenAI 总裁 Greg Brockman 在接受《华尔街日报》记者 Joanna Stern 采访时表示,语音将成为未来人与 AI 交互的主要方式,下一代计算设备不再只是围绕屏幕和键盘设计,而是围绕人与 AI 的自然交流展开。

Brockman 认为,当前 ChatGPT 桌面应用仍存在一些体验问题,但 OpenAI 正持续改进。同时,他透露 OpenAI 正在探索新的 AI 设备形态,希望重新定义人与计算机之间的连接方式。

过去几十年,人类逐渐适应计算机的交互方式:点击鼠标、敲击键盘、操作触摸屏。而 AI 时代的变化可能恰恰相反——计算机需要开始理解人的表达方式。语气、停顿、上下文和情绪,都将成为新的交互信号。

这一趋势也解释了为什么语音成为当前 AI 产品竞争的重要方向。从 ChatGPT Voice、Realtime API 到各种 AI Agent,实时语音正在从「辅助功能」变成 AI 服务的核心入口。

Brockman 认为,未来人们不会再像今天一样「使用电脑」,而是直接与智能系统交流。计算机的下一次革命,可能不是更强的屏幕,而是更懂人的对话。

https://x.com/JoannaStern/status/2082485630513156597

@JoannaStern\@X

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流