本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Meta 发布实时音频感知模型 Muse Voice Transcribe:单模型完成流式 ASR、20+ 人说话人分离与端点检测

Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,把流式 ASR、20+ 人说话人分离和端点检测原生整合进同一个模型。过去实时语音系统往往需要分别完成转写、判断「谁在说话」和检测「用户是否说完」,Muse Voice Transcribe 则让这些信号在同一条实时输出流中产生。

https://research.meta.ai/blog/introducing-muse-voice-transcribe

2、李飞飞联合创办的 World Labs 发布多模态世界模型 Atlas:支持像素级相机控制,并统一图像、视频生成与 3D 重建

李飞飞联合创办的 World Labs 发布多模态世界模型 Atlas。该模型从零开始预训练,可原生处理文本、图像、视频和 3D 信息,并在同一模型中完成受控图像/视频生成、3D 重建与时空模拟;其中最突出的变化,是把精确相机几何参数直接作为模型输入,让开发者能够按指定机位、角度和运动轨迹生成画面,而不再只靠文本描述镜头运动。

https://www.worldlabs.ai/blog/atlas

3、Visko 发布实时世界生成模型 Orbis 1.0:首个实时模型上线,可在生成过程中即时改写内容

Visko 正式发布 Orbis 1.0,这是其首个实时模型。相比传统「提交提示词、等待成片」的视频生成方式,Orbis 1.0 把生成过程变成一条可持续输出的实时流:用户可以一边生成、一边改写后续内容,系统则持续把世界渲染出来,并通过 Reactor 提供 API 访问。

Orbis :

https://visko.ai/models#orbis

动态版本:

http://reactor.inc/sandbox?model=visko-orbis-dynamic

稳定版本:

http://reactor.inc/sandbox?model=visko-orbis-stable

4、Datapoint AI 开源客服场景 TTS 人类偏好数据集:31.5 万次真人盲评覆盖 15 款模型

Datapoint AI 发布 Text-to-Speech Human Preferences 315K,将其 TTS Bench 背后的 31.5 万次真人偏好投票开放出来。数据覆盖 15 款 TTS 模型、300 条英文客服提示词和 8 类 Voice Agent 场景,开发者不仅可以查看模型排名,还能直接用这批人类偏好数据训练或评测语音奖励模型。

https://trydatapoint.com/benchmark/leaderboard

02 有亮点的产品

1、Bodhan AI × AI4Bharat 公布多语言语音合成模型 Indic-Speak:40 亿参数支持 23 种语言,可单次生成双人播客

Bodhan AI 与 AI4Bharat 公布 Indic-Speak,一款面向印度多语言场景的 40 亿参数语音合成模型,支持 23 种语言。相比此前发布的语音识别 Indic-Transcribe、翻译模型 Indic-Translate 等能力,Indic-Speak 补上了「语音生成」环节,并重点处理多人对话、语言混说和长文本连续朗读。

Indic-Speak 将于 2026年9月5日在 Bodhan AI 上线。

(@MiteshKhapra@X)

2、语音 AI 公司 Smallest.ai 完成 1300 万美元 A 轮融资:押注实时语音到语音系统,累计融资超 2100 万美元

语音 AI 公司 Smallest.ai 完成 1300 万美元 A 轮融资,由 Seligman Ventures 领投,Sierra Ventures、3one4 Capital 等参投,累计融资已超过 2100 万美元。新资金将重点投入下一代实时语音到语音系统、底层实时基础设施和企业部署,目标是进一步摆脱传统 ASR、LLM、TTS 串联架构带来的延迟。

https://smallest.ai/blog/series-a-funding-13m-next-generation-voice-ai

3、Violoop 完成数亿元天使轮及 Pre-A 轮融资:联想创投、蓝驰创投等参投,加速桌面 AI 硬件量产

桌面 AI 硬件公司 Violoop 完成数亿元天使轮及 Pre-A 轮融资,由联想创投、中金保时捷、蓝驰创投、元生资本、启赋资本和 Zero2IPO Ventures 共同投资。其首款产品是一台外接电脑使用的 AI 设备,通过 HDMI 读取屏幕、USB 模拟键鼠操作,让现有 Windows、macOS 和 Linux 电脑无需更换系统即可获得跨应用的智能体操作能力。

https://news.qq.com/rain/a/20260901A03PK400

https://violoop.ai/

(@ 新京报)

03 有态度的观点

1、宇树科技回应「超 100 元报销需王兴兴审批」:很多内容不实

据澎湃新闻报道,9 月 1 日,「宇树员工称超 100 元报销需王兴兴审批」「宇树员工称奖惩机制只有罚几乎没有奖」等话题登上热搜。

宇树科技对此回应称:「很多内容不实,切勿当真。」不过,官方未进一步说明具体哪些内容不实。

此前报道称,有员工表示,在宇树科技,一笔超过 100 元的报销需要公司创始人王兴兴审批,员工也经常在其办公室外排队等待审批。相关报道还提到,王兴兴的沟通方式相对直接严厉,要求员工不对外透露公司消息,并高度关注产品细节和成本控制。

此外,宇树科技于 8 月 27 日宣布,将每年无偿赞助部分「天才少年」开展科技项目,申请对象为高中阶段至硕士研究生毕业前的学生,资助金额为 1 万至 2 万元,特别优秀的项目不设金额上限。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 社区活动推荐|Google DevFest 2026 Shanghai 超前报名开启:Beyond the Model,Build for Real

今年 11 月初,Google DevFest 2026 Shanghai 将在上海举办,预计汇聚 3000 名开发者,设置 5 个分会场、17 个 Topic 和 3 场 CodeLab

今年的主题是 「Beyond the Model. Build for Real.|超越模型,为真实而构建」。相比只讨论模型能力,这届 DevFest 更想把问题往真实工程里推一步:API 挂了怎么兜底?模型幻觉怎么做 Guardrails?成本失控后 Infra 怎么优化?Agent、Cloud、Android、Web 又该怎么真正进入生产环境?

对正在做 AI / Agent / Cloud / Android / Web 的开发者来说,这次会更偏向真实项目、工程实践与技术落地,而不是只聊趋势和概念。

时间: 2026 年 11 月初

📍 地点: 上海

🎯 主题: Beyond the Model. Build for Real.

目前已经开启超前报名,想提前锁定席位的朋友可以关注一波~

超前报名|Google Devfest 2026 Shanghai

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流