本期编辑:@ 三水、@ 鲍勃

今天,AMD 将以约 82 亿美元收购世界模型公司 World Labs,李飞飞将出任 AMD 执行副总裁兼首席科学家。

当世界模型开始理解空间、持续模拟环境,并实时响应人的输入,AI 生成的就不再只是一段内容,而可能是一个可以进入、探索和交互的世界。

这也是 RTE 开发者社区最近一直在关注的一条路线:从实时视频生成、空间智能、交互式视频,到可交互世界模型,视频正在从「生成出来给人看」,继续走向「跟人实时互动」。

所以今年 iRTE 2026 实时智能大会专门设置了 「视频 AI 技术专场:从实时视频生成到可交互世界模型」。

现场,生数科技 Vidu 团队会从 SageAttention、Vidu S1/S2 出发,聊视频生成如何进一步走向实时;Xmax AI 也会带来实时交互模型的探索,讨论当生成内容可以持续响应用户之后,会出现怎样的新娱乐和交互形态。

从 World Labs 的可交互 3D 世界,到 Vidu、Xmax 对实时视频与交互模型的探索,这条路线正在变得越来越具体。

如果你也在关注空间智能、实时视频和可交互世界,10 月 24 日,来现场看看这条路线已经走到哪一步。

扫描下方二维码报名,线上追进展,这次线下聊实现。

01 有话题的技术

1、AMD 将以约 82 亿美元收购世界模型公司 World Labs:李飞飞将出任 AMD 执行副总裁兼首席科学家,世界模型团队进入芯片与系统研发体系

AMD 与 World Labs 签署最终收购协议,这笔全股票交易价值约 82 亿美元,预计在获得监管批准后于 2026 年底前完成。交易完成后,World Labs 创始人李飞飞将加入 AMD,担任执行副总裁兼首席科学家并直接向 CEO 苏姿丰汇报;World Labs 团队将继续推进世界模型研究。

https://www.worldlabs.ai/blog/amd-announcement

2、YODAS v3 开源 110 万小时 48kHz 多通道语音数据:覆盖 147 种语言,可用于 TTS、音频编解码和空间语音训练

ESPnet 团队发布开放语音数据集 YODAS v3,收录超过 110 万小时、147 种语言的真实世界音频,全部以 48kHz 发布,其中超过 70% 包含两个及以上真正不同的音频通道。相比此前主要面向语音识别的 YODAS,v3 加入更高带宽、多通道和更丰富的时间戳标注,使同一套数据可以进一步用于 TTS、神经音频编解码、语音增强和立体声/空间语音生成。

https://hf.co/blog/espnet/yodasv3

https://huggingface.co/datasets/espnet/yodas3

https://arxiv.org/abs/2609.29448

https://x.com/chenwanch1/status/2104412499395350674

3、Edge0 发布中英双语流式语音识别模型 Audio8-ASR-Infinite:滚动 KV 缓存支持 24/7 持续转写,延迟最低 240ms

Edge0 发布 Audio8-ASR-Infinite 预览版,面向中英文实时语音识别,提供 80、120 和 160ms 三档流式音频时钟,并可将转写延迟配置在 240–560ms。模型原生上下文为 30 秒,但通过滚动 KV 缓存持续淘汰旧状态,可在内存占用和推理延迟不随音频时长增长的情况下连续运行,用于会议、实时字幕和长期监听等持续转写场景。

https://modelscope.cn/models/Edge0/Audio8-ASR-Infinite

4、Voice Arena 发布 Monsoon ASR 训练语料:覆盖 50 种语言、10 万 + 小时,Whisper Medium 泰卢固语语义 WER 从 92.7% 降至 16.1%

Voice Arena 发布多语种语音识别训练语料 Monsoon ASR,目前包含 10 万 + 小时、50 种语言、23 个国家的真实语音,覆盖南亚、东南亚、非洲、欧洲、中东及北非和美洲。数据主要来自双人真实对话中的即兴单人语音,每位说话人单独录制一个声道,重点覆盖口音、非正式表达、噪声和真实声学条件,而不是以朗读语音为主。

https://voicearena.com/datasets/monsoon

4、Voice AI 公司 SoundHound 推出端侧智能体语音架构 OASYS Edge:LLM 语音智能体可完全在设备端运行,同一智能体可部署到云端、边缘或混合环境

SoundHound 发布 OASYS Edge,将基于 LLM 的语音智能体完整部署到汽车和智能设备本地,在无网络连接时也能继续完成对话、理解请求和多步骤任务。开发者可以在 OASYS 平台构建一次智能体,再根据硬件与业务需求部署到云端、端侧或混合环境。

( @SoundHound )

5、蚂蚁研究团队开源实时声纹验证模型 MECT:9.57M 参数支持 100ms 流式推理,VoxCeleb1 达到 SOTA

蚂蚁研究团队开源 AntSpeaker/MECT 声纹验证模型,将 MoE 引入 CNN-Transformer 声纹识别架构,并进一步提供支持实时场景的流式版本。MECT 系列模型参数量从 3.78M 到 9.57M,其中 MECT-B2 在 VoxCeleb1 上取得 SOTA;通过因果重训练得到的流式版本在 100ms 音频块下仍能保持接近离线模型的验证性能。

https://github.com/ant-research/AntSpeaker

6、世界模型公司 Odyssey 发布多智能体世界模型 Agora-2:最多 20 个人类与智能体共享同一实时生成环境,参与者数量较 Agora-1 提升 5 倍

Odyssey 发布 Agora-2 多智能体世界模型,可让最多 20 个人类用户和 AI 智能体进入同一个共享环境实时互动。相比 Agora-1 最多支持 4 名参与者,Agora-2 将参与规模扩大 5 倍,同时从单一环境扩展到多个环境,并支持更复杂、持续时间更长的交互。

https://odyssey.systems/introducing-agora-2

02 有亮点的产品

1、AI 辅助 PCB 设计平台 HeyPCB 上线多人实时协作:可在同一块板上同步布线、放置元件和编辑外壳

HeyPCB 推出 Multiplayer 多人协作模式,把原本偏单人使用的浏览器 PCB 设计流程扩展为多人共同编辑。团队成员可以直接打开同一个项目,在同一浏览器工作区里实时看到彼此的位置、光标和正在进行的操作。

https://heypcb.ai/multiplayer

2、来电识别平台 Truecaller 推出 Scam Checker:诈骗检测从电话号码扩展到链接和消息,无需登录即可在网页查询

Truecaller 推出 Scam Checker,把过去主要用于来电识别和垃圾电话拦截的诈骗情报扩展到开放网页。用户无需安装 App 或登录账号,就可以提交可疑的电话号码、链接或消息,查看是否与诈骗有关;服务目前首先在印度上线,后续计划扩展到拉美、中东和非洲、东南亚。

https://techcrunch.com/2026/09/27/truecaller-takes-its-scam-intelligence-to-the-open-web-as-it-looks-beyond-caller-id/

03 有态度的观点

1、英伟达推出 AI 智能体安全平台,用独立硬件监控越权行为

英伟达 9 月 28 日发布 Open Agent Safety Platform,将控制智能体执行权限的 OpenShell 软件,与在独立硬件上监控行为的 Sentry 参考设计组合。

OpenShell 目前已开放使用,可记录智能体操作并限制其访问范围;英伟达称,它也可扩展到 Arm、英特尔等第三方计算平台。

Sentry 设计运行在 BlueField-4 DPU 上,在智能体运行环境之外检查行为。如果智能体试图越过软件设定的边界,系统可将其隔离。英伟达把两层控制分开,是为了让安全规则不完全依赖智能体自身执行;发布材料列出的毫秒级隔离能力仍是厂商描述。

英伟达称,Anthropic 的 Claude Managed Agents 正与 OpenShell、BlueField 集成,Salesforce 则已将 OpenShell 接入 Slack,供团队查看智能体活动并处理额外权限请求。英伟达发布的是开放软件和参考系统设计,具体部署取决于使用方。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📌 社区活动推荐|🔥 硬件进化论开始招募辣!

SheNicest × STACK ANYWAY 消费硬件创作赛,国庆 7 天做一个能跑起来的硬件原型。

✅ Token 全免费 + 一站式 BOM 下单(可到 STACK ANYWAY 官方指定平台,或使用自有设备参赛)

✅奖金和奖品多多

✅ 10 个入围项目直接到 WTCC 线下展出 + 卖客松拍卖

✅ 个人 / 组队都行,从 0 到 1 或旧物改造都欢迎

‼报名截止时间:9 月 30 日中午 12 点之前

‼ 报名方式:扫码报名!

线上征集 不限地点!

线上征集|给吃灰硬件装上一个 AI 灵魂

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流