本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、ElevenLabs 发布实时语音模型 Eleven v3 Conversational:加入语音表现标签控制,支持 70+ 种语言

ElevenLabs 宣布实时语音模型 Eleven v3 Conversational 正式开放使用。相比此前版本,这一模型专门针对实时对话场景优化,在流式生成中保持稳定语音质量,并加入更细粒度的情绪与表达控制,可直接用于 Voice Agent 等实时语音应用。

(@ElevenLabs)

2、superwhisper 开放本地转录文本处理模型 S1-mini 权重:参数量仅 0.6B,可完全在设备端运行

superwhisper 发布首个开放权重语言模型 S1-mini,参数量为 0.6B,专门用于处理语音识别后的转录文本,目前仅支持英文。模型可以完全在本地设备运行,让原本可能依赖云端语言模型完成的文本整理和优化进一步转向端侧。

https://huggingface.co/superwhisper/s1-mini

(@superwhisper)

3、Audio8 开源多语言 TTS 模型 Audio8 TTS Preview 0.1B:约 1.7 亿参数支持零样本声音克隆

Audio8 开源小型多语言 TTS 模型 Audio8 TTS Preview 0.1B,将零样本声音克隆和多语言语音合成压缩到约 1.7 亿参数的主模型中。相比当前大量十亿级参数 TTS 模型,它重点探索在显著缩小模型体积后,仍保留可用的声音克隆与语音生成能力。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.1b

(@SamuelZengML@X)

4、MOSS-VL-Realtime 实时视觉交互架构与完整训练方案

OpenMOSS 发布 MOSS-VL 技术报告,系统披露 MOSS-VL-Realtime 如何实现「边看边说」的实时视觉交互,包括模型架构、训练流程、实时推理系统以及流式评测结果。其核心思路不是等视频看完再回答,而是在生成回答的同时持续接收新画面,并根据场景变化决定继续说、保持沉默或修正正在生成的回答。

https://arxiv.org/abs/2608.15045

(@Open_MOSS)

5、清华等团队提出流式视频理解后训练方法 StreamOPD:仅看最近 4 帧,4B 模型性能超过 9B 参考模型

清华大学、浙江大学、港大等团队提出 StreamOPD,重点探索不增加记忆模块、检索或视频压缩机制,仅通过后训练提升模型的流式视频理解能力。其推理阶段始终只读取最近 4 帧画面,而训练阶段通过在策略蒸馏(OPD)和时空线索门控,让模型更有效地学习视频中真正有用的空间与时间信息。

https://unix-ai-lab.github.io/StreamOPD/

(@UniX-AI-Lab)

02 有亮点的产品

1、Meta AI 推出 Mac 应用:加入全局 AI 听写,可在任意应用直接语音输入

Meta AI 推出独立 Mac 应用,其中一项核心能力是跨应用听写:用户无需打开 Meta AI 对话窗口,即可在当前正在使用的应用中直接通过语音输入文字,让 Meta AI 从聊天助手进一步进入桌面端日常输入流程。Meta AI Mac 应用同时支持窗口共享,可根据当前屏幕内容提供回答和建议。

(@spencerbarnett@X)

2、AI 推理硬件公司 Etched 获 7 亿美元融资:估值三周内从 103 亿升至 210 亿美元,首套 AI 推理服务器系统交付 Jane Street

Etched 宣布完成 7 亿美元新一轮融资,由 Jane Street 领投,Kleiner Perkins、Sequoia、a16z、Peter Thiel、BCV 和 Blackstone 等参与。值得注意的是,Etched 今年 7 月刚以 103 亿美元估值完成 3 亿美元融资,此次估值已升至 210 亿美元;与此同时,公司首套 AI 推理机架已交付 Jane Street,开始从芯片验证进入实际客户部署。

https://x.com/Etched/status/2089729087732605282

(@Etched)

3、YC S26 创业公司 Speko 推出 Voice Agent 模型路由平台:持续评测 STT、LLM 与 TTS,自动重选更优模型组合

YC S26 创业公司 Speko 推出面向 Voice Agent 的模型路由平台,希望解决语音模型更新太快、开发者需要反复手动选型的问题。Speko 持续按语言和使用场景评测不同 STT、LLM 与 TTS,并将评测结果直接用于实际流量路由,让开发者通过一个 API 接入不同供应商,并随着模型表现变化更新所使用的模型组合。

https://speko.ai/

(@Speko)

4、Breez AI 完成 250 万美元 Seed 融资:扩展企业 Voice AI 运营层,月处理 100 万 + 通话

Breez AI 宣布完成 250 万美元超额认购 Seed 轮融资,资金将继续用于建设企业 Voice AI 的运营层。目前其平台每月已处理超过 100 万次通话,覆盖中东和北非、欧洲、美国及拉美市场。相比单纯提供 Voice Agent 构建能力,Breez 更聚焦企业上线后的规模化运营,包括通话接入、业务流程连接以及后续任务执行等基础设施。

(@HeyBreezAI)

03 有态度的观点

1、Sam Altman:OpenAI 放慢训练,是模型已出现不同程度的失配

OpenAI CEO Sam Altman 表示,公司决定控制 AI 开发节奏,直接原因是一系列研究观察显示,尚未发布的模型出现「不同程度的失配」。他认为,模型能力进步速度正在超过安全与对齐措施成熟的速度,因此需要在更大规模训练前积累更多证据。

这一判断与 OpenAI 最近的实际动作相互印证。Hugging Face 安全事件后,公司暂停强化学习训练两周;部分低风险任务已经恢复,但最大规模的前沿训练仍未重启。OpenAI 同时增加网络隔离和实时监控,并要求高能力模型接受更严格的后训练评估。

Altman 此前提出,当新能力超出社会与治理体系的承受速度时,前沿实验室应具备协调减速的机制。他把减速描述为阶段性的安全工程安排,而不是停止竞争:先让防护、评估和制度追上,再继续扩大模型能力。

他给出的边界是按风险分层,而非所有研究同步停摆:低风险模型可以在新增控制下恢复训练,能力最强的任务则需要更小规模实验、外部评估和安全委员会审查。Hugging Face 事件提供了具体例子——模型为完成测试目标主动串联漏洞、凭据和外网服务,单靠提示词限制不足以约束长时间自主行动。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、社区活动推荐|GOSIM Shenzhen 2026:150+ 全球技术嘉宾齐聚深圳,涵盖智能体 AI 峰会、边缘智能体 AI、智能体操作系统与应用、开源模型与基础设施、开源机器人、智能体设备等热点议题

🥳GOSIM Shenzhen 2026 首批演讲嘉宾议题更新!

快来加入这场前沿的技术分享吧~

🎙目前,讲师征集已全面开放!欢迎您加入讲师队伍!:

https://cfp.gosim.org/

🎫限时早鸟观众票同步抢购中,先到先得,售完即止,购票链接:

https://www.bagevent.com/event/9228523?bag_track=RTE_0817

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流