本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、字节跳动、港理工与 AMD 提出实时数字人框架 Avatar-Forever:单张 H100 实现 27.2 FPS,支持无限时长音频驱动生成

字节跳动、香港理工大学与 AMD 等团队提出 Avatar-Forever,面向实时、长时间运行的音频驱动数字人生成。其核心变化是把「生成得快」和「长时间不崩」拆成两条独立训练路线,再在推理时组合,使基于 22B 视频基础模型的系统能在单张 H100 上以 768×512 分辨率达到 27.2 FPS。

https://leeruibin.github.io/avatarforever-project-page/

(@Avatar-Forever)

2、伦敦帝国理工等提出音频自监督学习方法 NAPE:只预测下一个音频片段,也能随模型规模持续提升

伦敦帝国理工学院与萨里大学研究者提出 NAPE,将语言模型「预测下一个 token」的思路用于音频自监督学习:模型把频谱切成连续片段,只根据前面的音频内容预测下一个片段的嵌入表示。相比现有不少音频自监督方法,NAPE 不需要重建解码器、音频分词器、教师模型或额外正则损失,用更简单的训练目标获得可扩展的音频表征能力。

https://umbertocappellazzo.github.io/nape/

(@Umberto_Senpai)

3、Murf AI 全面开放实时 TTS 模型 Falcon 2:首音频低于 100ms,价格 0.01 美元/分钟

Murf AI 正式发布实时 TTS 模型 Falcon 2:TTFA 低于 100ms,价格降至每分钟 0.01 美元

印度 Voice AI 公司 Murf AI 正式公开 Falcon 2,面向 Voice Agent 等实时语音场景,在降低首音频延迟和推理成本的同时提升语音自然度。官方数据显示,Falcon 2 当前生产环境 30 天中位 TTFA 为 95ms,价格为每生成 1 分钟语音 0.01 美元;在独立评测平台 Artificial Analysis 的语音自然度榜单中,其得分超过部分 OpenAI、ElevenLabs 和 xAI 的实时语音模型。

https://murf.ai/falcon

(@Murf AI)

4、IMPA 提出双耳声学数据生成平台 AudioWorldSim:模拟移动中的空间声音变化,为音频世界模型生成训练数据

巴西国家纯数学与应用数学研究所(IMPA)研究者发布 AudioWorldSim 技术报告,面向音频世界模型缺少「动作—空间—声音变化」训练数据的问题,在 Meta SoundSpaces 2.0 基础上构建自动化声学模拟平台。系统可让虚拟智能体在 3D 场景中持续移动,并同步生成左右耳听到的双耳音频及动作轨迹,使模型能够学习「移动、转向后,周围声音会如何变化」。

未加混响、音效的原始音频素材

空间化声音

https://arxiv.org/abs/2608.21075

https://github.com/Luizerko/AudioWorldSim

(@Luizerko)

02 有亮点的产品

1、Artificial Analysis 更新语音智能体评测竞技场:用真人真实任务评测语音 Agent,区分「更喜欢聊」和「真的把事办成」

Artificial Analysis 更新 Speech Agent Arena,将语音模型评测从推理、打断处理等单项能力,进一步扩展到真人参与的真实任务。参与者会分别与两个匿名语音系统完成同一场景,再评价更喜欢哪一个;对于需要工具调用的任务,平台还会单独统计任务成功率,用来判断 Agent 是否真的完成了最终操作。

https://artificialanalysis.ai/speech-to-speech/arena/overview

(@ArtificialAnlys)

2、BetterVoice 开源 macOS 语音输入工具:边说边圈屏幕,同时捕捉语音与视觉上下文

BetterVoice 是一款实验性的 macOS 语音输入工具,把语音听写和屏幕上下文采集放进同一次输入过程。用户按下快捷键开始说话时,可以直接用鼠标圈出正在讨论的界面内容;应用在本地完成语音转录,同时按圈选顺序保存对应屏幕画面,让后续交给 AI Agent 的内容不只有「你说了什么」,还包含「你指的是屏幕上的什么」。

https://github.com/TarunTomar122/better-voice

(@TarunTomar122@GitHub)

3、腾讯混元推出长视频生成 Agent 框架 HyCreator:自动生成 10 分钟级影片,可随时切换实时编辑

腾讯混元推出 HyCreator,面向长视频生成,将原本需要反复生成片段、人工衔接的流程交给 Agent 连续执行。其自动模式可在无人干预下完成 10 分钟级影片生成,同时允许创作者在生成过程中随时介入,切换到实时交互编辑,而不必重新从提示词开始生成。

https://hycreator.tencent.com

(@TencentHunyuan)

03 有态度的观点

1、实时语音 AI 工程师 Stu Kennedy :「Voice AI 首先是一个音频工程问题,然后才是机器学习问题。」

实时语音 AI 工程师 Stu Kennedy 长期从事音频与实时系统开发,曾参与 Anam、Pyannote 等项目,目前主要关注 Voice AI、流式说话人分离、合成语音以及实时数字人系统。在 Michael Young 的播客《A Class Act》中,他谈到一个自己反复强调的判断:企业真正做 Voice AI 时,不能只依赖一站式平台,而需要掌握属于自己的一套语音处理管线(pipeline)。

Kennedy 认为,很多 Voice AI 平台最初可能只擅长语音识别、语音合成或某一种模型,但为了让开发者更快搭建产品,又逐渐加入大语言模型、轮次管理、函数调用和智能体编排,最后变成一套几分钟就能跑起来的「一站式解决方案」。这类平台非常适合做 Demo,但进入真实业务后,企业很容易发现,平台预设的通用流程并不一定适合自己的具体场景。

Voice AI 最核心的能力之一,是开发者能够控制和调整自己的语音处理管线,而不是把整个产品交给某个封装好的平台。

在 Kennedy 看来,不同 Voice AI 产品对系统的要求本来就不一样。医疗场景可能更重视语音识别准确率,有些实时交互产品则更关心响应速度,还有一些应用会更加关注说话人识别、打断处理或者自然的轮次交互。因此,开发者应该能够分别选择和替换语音识别(ASR)、大语言模型(LLM)、语音合成(TTS)以及实时通信基础设施,而不是被固定在某一个平台提供的模型组合里。

这种控制权尤其体现在延迟上。Kennedy 曾把一套系统的语音识别延迟从约 2 秒降低到 350 毫秒,但他强调,Voice Agent 的延迟从来不是某一个模型的问题,而是麦克风采集、音频缓冲、网络传输、语音识别、轮次判断、大语言模型推理和语音合成等多个环节共同叠加的结果。只优化其中一个模型,并不能真正解决实时对话体验。

他认为,开发者越早掌握自己的音频与语音处理管线,就越能根据实际业务调整每个环节,也越不容易被某一家模型或平台的能力边界限制。

从第一天开始就应该把 audio pipeline 当成产品本身的一部分,而不是一个可以完全外包出去的基础设施模块。

Kennedy 对下一代 Voice AI 的判断因此并不只是「模型会越来越强」,而是整个系统会越来越接近人类真实对话:能够在用户说话过程中持续理解上下文,正确处理停顿和打断,并在合适的时机回应。真正成熟的 Voice AI,不应该迫使用户适应机器,而应该让机器适应人类原本的说话方式。

https://www.buzzsprout.com/2499498/episodes/19207953-building-the-future-of-voice-ai-from-soundtracks-to-synthetic-speech-with-stu-kennedy-edge-realtime-ai-systems-consultant

@michaelyoungMBN@X)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、 社区活动推荐|Vibe Coding for 准点下班:一天解决一个真实工作痛点

有没有哪件工作,你每天都在重复做、反复确认,明知道可以优化,却一直没时间真正解决?

8 月 29 日,VibeFriends × 原点学堂将在北京举办 VibeHacks #05「Vibe Coding for 准点下班」。这次黑客松直接把题目放进真实工作场景:找到最消耗你的一个环节,用一天时间把它做成可以现场体验的作品。形式不限,可以是 插件、Skill、Agent、自动化脚本、工作流或完整产品

活动将招募 33 组参赛者,现场有 10+ 行业 Mentor、100+ 目标用户参与体验和投票;作品不只看 Demo 能不能跑,更看它是不是真的能解决工作痛点、提升效率。一等奖 10,000 元,同时还有 Amazon Quick、小红书社区人气、Waffo 变现潜力等奖项。

🕙 线上启动:8 月 28 日 18:00–18:30

📍 线下比赛:8 月 29 日,北京海淀 · 原点大厦

⏰ 报名截止:8 月 28 日

如果你手里正好有一个 “早就想自动化掉” 的工作流程,这次很适合直接带到现场,把它做掉,然后——准点下班。😎

👉 参赛者 / 特约观察员报名:https://vibecafe.ai/hacks/5

[招募] 不加班了!用一天做出让人准点下班的作品|VibeHacks #05 报名开启

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流