本期编辑:@ 三水、@ 鲍勃

今天日报开头先插播一条:10 月,来北京线下对答案。

这一年,我们在日报里持续关注实时智能正在发生的变化。从国内到海外,覆盖全双工、端到端语音、Voice Agent、实时多模态、世界模型等话题,从新模型发布、开源项目到产品落地和创业融资,我们几乎每天都在记录这个行业又往前走了一点什么。

而这次,很多日报里出现过的公司、项目和开发者,也会来到 iRTE 2026 实时智能大会现场。比如有 *阶跃星辰、Kimi、Minimax、面壁智能、生数科技、模思智能等 AI *模型公司,也有我们此前报道过的 *VoiceMem、SGLang-Omni、Breeze-TTS *等开源项目作者或团队参会。当然,这还只是目前提前剧透的一部分,还有一些神秘嘉宾会陆续揭晓~

过去在日报里看到的新技术、新项目和新团队,这次可以在线下面对面聊。

10 月 23–24 日,大会会有 15+ 个论坛、100+ 场技术分享,从模型、Agent,到 AI 硬件和实时基础设施,把过去一年我们持续关注的很多话题真正聚到一起。

如果你也每天在关注这些,扫描下方二维码报名,来一起见个面。

线上看了一年,这次线下见~

01 有话题的技术

1、复旦大学、上海创智学院等研究者提出音视频生成奖励模型 VA-Judger:从人类偏好学习整体音画判断,并用于强化学习提升

复旦大学、上海创智学院等研究团队提出 VA-Judger,面向联合音视频生成学习人类对完整结果的偏好。模型会同时比较同一提示词下的两段生成视频,从 提示词匹配、音视频一致性、音频质量、视频质量、内容完整性与连贯性 五个维度给出判断,并生成偏好解释,再将这些评分作为强化学习奖励用于后训练音视频生成模型。

https://github.com/ShareLab-SII/VA-Judger

2、世界模型团队 XGEN Labs 开源第一人称交互体验模型 JING:可用键盘控制移动、与物体和角色互动,并同步生成视频与音频

XGEN Labs 发布 JING,一款基于 MiniMax-H3 的第一人称交互体验模型。输入动作、参考图像和历史观察后,JING 会继续生成第一人称视频与音频,让用户通过摄像机移动、物体交互和角色对话持续改变后续内容。

https://x.com/XGEN_labs/status/2102050332960497738\

https://huggingface.co/XGENlabs/XGEN-JING

3、Voice AI 公司 Gradium 推出低延迟 TTS Beta:官方称首包音频可低于 50 ms,较当前生产模型进一步压缩语音智能体响应延迟

Gradium 开放新一版 Gradium TTS Beta,重点继续压缩实时语音合成的首包延迟。官方称新模型的 time-to-first-audio 可低于 50 ms,目前已可在 Gradium Studio 体验;相比 8 月底成为默认版本的 Gradium TTS,这次更新把延迟继续作为主要优化方向。

https://studio.gradium.ai/?model_name=gradium-tts-beta\

https://x.com/GradiumAI/status/2102438831668551687

4、三星波兰研发中心等研究者开源端侧小型音频语言模型 Samsone:最小 99M 参数,Galaxy S25 Ultra 可实时运行

三星波兰研发中心等研究者提出并开源 Samsone,一组面向设备端音频理解的小型 Audio Language Model,包括 99M、134M 和 356M 三个版本。项目同时开放 PyTorch 权重、移动端 ExecuTorch checkpoint、训练与评测代码,以及可直接在 Android 设备上运行的 Demo App;论文已被 Interspeech 2026 接收。

https://arxiv.org/abs/2609.21666

https://github.com/SamsungLabs/samsone

02 有亮点的产品

1、上海首例涉 AI 声音仿冒不正当竞争案生效:《原神》63 款角色声音被复刻销售,法院判赔 75 万元

上海市浦东新区人民法院公布上海首例涉 AI 声音仿冒不正当竞争案。被告运营的 AI 变声软件未经授权复刻《原神》63 款角色声音,制作成付费声音资源包,并配合角色头像、原声试听和游戏宣传素材进行销售推广。法院认定相关行为同时涉及著作权侵权和不正当竞争,一审判赔经济损失及合理维权开支共计 75 万元;被告撤回上诉后,判决已生效。

https://m.thepaper.cn/newsDetail_forward_34043593

2、瑞典 AI 助手公司 Incredible 推出语音优先桌面智能体:可直接操作浏览器、文件与应用完成电脑任务

瑞典 AI 公司 Incredible 发布面向 Mac 和 Windows 的语音优先桌面智能体。用户按下快捷键后直接说出任务,Incredible 会结合当前屏幕内容理解上下文,并在浏览器、文件和应用中执行点击、输入、搜索、切换标签页、填写表单和发送等操作。

http://incredible.one

https://x.com/useincredible/status/2102382407471263760

3、AI 硬件公司 Rabbit 发布跨平台智能体系统 OS3:从 R1 专用设备扩展到 Mac、Windows、Linux、Telegram 和 iMessage

Rabbit 发布 OS3,将原本围绕 R1 硬件构建的 Agent 能力扩展成跨设备的软件系统。OS3 运行在云端,通过安装在 Windows、Mac 或 Linux 上的本地 Agent Node 连接桌面软件、文件和网页;用户也可以通过浏览器、Telegram 或 iMessage 发起任务,一个账号最多可连接 5 台设备。

https://www.wired.com/story/rabbit-r1-os3-jesse-lyu/

(@wired)

4、开发者 Akhila 开源多模态实时决策模型 Jev-Omni:统一支持文本、图像、音频和视频输入,文本决策延迟约 83 ms

开发者 Akhila 开源 ** Jev-Omni**,一款面向实时类型化决策的多模态模型,统一支持文本、图像、音频和视频输入。模型延续 Jev 这类决策模型的使用方式:输入当前状态和候选选项后,直接返回各选项概率,用于分类、路由和动作选择。

https://x.com/Akhila_988/status/2102171891410825520

https://huggingface.co/akhilaaa3/Jev-Omni

03 有态度的观点

1、特努斯:Siri AI 不应代替人际关系

苹果 CEO John Ternus 在接受 Canal+ 节目 Clique 采访时表示,Siri AI「并非被设计成你的朋友」。面对 AI 伴侣产品的市场竞争,他认为苹果不希望 AI 取代人与人的关系,因为人际关系是学习、成长和获得快乐的基础。

他还谈到 iPhone Duo 的开发取舍。苹果从类似 iPad 的大屏体验出发确定展开比例,没有沿用常见的两块手机屏幕拼接形态。铰链和屏幕的可靠性是主要工程问题;例如,团队需要同时处理展开角度、屏幕连续性与软件动画的配合。

Ternus 特别展示了展开手机时跨越两侧屏幕的动画。他把这个小细节视为工程之外的产品目标:用户在展开设备时能立刻理解界面如何连续,同时保留一点轻松感。

对于接任 CEO 后的方向,Ternus 称不会对苹果做激进改造。

Tim Cook 和苹果董事会询问他是否愿意接任时,他形容自己「幸好当时是坐着的」。他给出的经营边界是继续把产品、创新和用户放在中心,不把新任期包装成路线翻转。

(@APPSO)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流