本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、FireRedAudio:一个模型覆盖「听、理解、推理、说和编辑」完整音频链路,共享同一个 9B 参数语言模型底座

小红书 FireRedTeam 发布 FireRedAudio 代码与模型权重,希望用一个模型覆盖「听、理解、推理、说和编辑」完整音频链路。其核心设计是将音频理解与语音生成使用的表示分开:理解侧负责提取适合识别和推理的信息,生成侧负责保留声音合成所需的细节,但二者共享同一个 9B 参数语言模型底座,减少理解和生成能力相互干扰。

https://github.com/FireRedTeam/FireRedAudio

2、Hume AI 研究发现:部分高分 ASR 可能在「识别测试集」,公开榜单分数或高估真实转录能力

Hume AI 发布 ASR 基准优化研究,对 11 个常用开源 ASR 模型进行三组测试后发现,一些公开基准上的高分模型会根据音频中的数据集特征,输出测试集「预期的参考答案」,而不是严格按照实际听到的内容转录。这意味着更低的 WER 不一定完全来自更强的语音识别能力,也可能包含针对公开测试集的适配。

https://huggingface.co/blog/asr-benchmark-optimization

3、Amphion 发布端到端语音大模型 FlexiSLM:4–12.5Hz 动态可控帧率,6.25Hz 输出将推理时间近乎减半

Amphion 团队发布 FlexiSLM,并被 EMNLP 2026 主会接收。它不再让 Speech LLM 以固定帧率处理整段语音,而是根据信息密度动态分配语音 Token,同时允许开发者直接指定目标帧率;同一个模型可在 4–12.5Hz 之间运行,无需针对不同帧率重新训练。

https://flexislm.github.io

4、Liquid AI × Artificial Analysis 开源端侧 AI 基准平台 Pipette:不再只测模型,而是评测「模型 + 量化 + 运行时 + 设备」完整组合

Liquid AI 与 Artificial Analysis 联合发布 Pipette,面向手机、电脑和嵌入式设备上的基础模型评测。与传统榜单只比较模型能力不同,Pipette 将一次端侧部署视为「模型 + 量化方式 + 运行时 + 设备」的完整系统,同时测量质量、首 Token 延迟、吞吐、端到端延迟和内存占用,让开发者直接判断某个模型在目标硬件上是否真正可用。

https://www.liquid.ai/blog/pipette-on-device-ai-benchmarking-by-liquid-ai

02 有亮点的产品

1、独立开发者打造实时 AI 游戏伴侣 Varkos:能在《上古卷轴 V:天际》中边听边行动,大部分推理在本地完成

独立开发者 Pantelis Kalogiros 展示实时 AI 游戏伴侣 Varkos,目前运行于《上古卷轴 V:天际》。与主要负责 NPC 对话的 AI Mod 不同,Varkos 会持续听取玩家语音,并结合游戏世界状态规划行动:战斗、寻找和递交物品、等待条件触发后继续任务,甚至可以执行捉迷藏等持续数分钟的多步计划。

https://pantel.is/projects/ai-gaming-companion/

2、前 MiniMax 技术合伙人杨斌创立 Voice AI 公司 BreezeBlue:获 600 万美元种子轮,押注实时语音交互

前 MiniMax 技术合伙人、视觉生成模型团队负责人杨斌于 2025 年底创立 BreezeBlue,目前已完成 600 万美元种子轮融资,由元璟资本、红点中国联合领投。公司希望从 TTS 切入实时语音交互,让 AI 不只生成自然语音,还能理解角色设定、场景和交流意图,并在长期互动中持续保持角色与表达一致性。

(@ 智能涌现)

3、宝马集团旗下风投 BMW i Ventures 投资全双工语音模型公司 Familiar Labs:让 Voice Agent 在说话时继续听,面向生产级外呼场景

宝马集团旗下风投 BMW i Ventures 宣布投资 Familiar Labs,这家公司前身为 MetaVoice Labs,正在开发面向生产级 Voice Agent 的全双工语音模型。与常见 ASR→LLM→TTS 级联方案需要等待一轮说完再处理不同,Familiar 的模型可以在生成语音的同时持续监听用户,并实时处理打断、重叠说话和简短回应等自然对话行为。

03 有态度的观点

1、💡 Sam Altman:AI 权力集中同样「反人类」,言论被指暗讽 Anthropic

OpenAI CEO Sam Altman 在 David Senra 8 月 23 日上线的访谈中表示,他担心 AI 的控制权最终集中到少数公司或个人手中。相较于由少数机构替社会决定技术方向,他主张让更多人实际参与并影响 AI 的未来,让社会与模型共同演进。

Altman 没有点名具体公司,但他批评一些 AI 从业者一边宣称技术有 25% 的概率带来严重灾难、可能让一半岗位消失,一边主张限制谁能使用最强模型、把决定权留给少数公司。

Anthropic CEO Dario Amodei 此前曾分别公开提出「25%」的 AI 灾难概率,并警告 AI 可能在数年内取代一半初级白领岗位,因此这段话被外界解读为暗指 Anthropic,但 Altman 本人没有确认这一指向。

正确的路径,是让人们深入掌握未来。社会与模型将共同演进。

Altman 同时承认 AI 脱离人类控制是现实风险。他反对的是,行业以保护世界为理由,要求公众用大量自由换取安全,并把技术控制权永久集中在少数机构手中。他讽刺这种主张相当于由技术公司向公众承诺治愈疾病、创造财富和娱乐,交换人们的自主权与影响未来的能力,并称这种权力安排「非常反人类」。

他的方案包含两层:一方面,社会选择应持续进入模型和产品的演进过程;另一方面,应扩大个人使用 AI 的能力。Altman 举例称,AI 将让更多人以过去无法实现的规模创办小型企业,这也是个人参与技术未来的一种方式。

这番表态并未否认安全治理,也没有提出放任前沿模型发展的主张。Altman 划出的边界是,控制失配模型的制度不能永久把决定权交给极少数机构;安全、自由与个人能动性需要在同一套治理框架里处理。

@APPSO

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流