本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、智象未来发布交互式世界模型 HiDream-O1-World:通过文本或图片生成可漫游 3D 世界,采用几何 - 外观两阶段扩散架构

智象未来发布交互式世界模型 HiDream-O1-World,可通过文本或图片生成可漫游、可编辑的 3D 世界。其相关研究 DreamWorld 入选 ECCV 2026,通过显式几何信息约束视频扩散过程,改善新视角生成中的几何结构和跨视角一致性。

https://yanghb22-fdu.github.io/DreamWorld

(@DreamWorld)

2、西工大 ASLP 联合 WeNet 开源中文多方言 ASR 模型 CN-MultiDialect-ASR:用 *OPSD* 缓解方言微调后的普通话能力退化

西北工业大学 ASLP 团队联合 WeNet、NEXDATA 发布 CN-MultiDialect-ASR,基于 Qwen3-ASR-1.7B 引入 OPSD 自蒸馏训练,重点解决多方言 ASR 中一个常见问题:提升方言识别后,普通话识别能力容易随之下降。OPSD 不再只让模型沿着标准答案训练,而是让模型基于自己实际生成的识别结果继续学习,使训练状态更接近真实推理过程。

https://github.com/ASLP-lab/CN-MultiDialect-ASR

(@ASLP-lab)

###

02 有亮点的产品

1、深光发布物理 AI 多模态光交互世界模型 DeepLight:用空间理解驱动实时投影交互

深光科技发布物理 AI 多模态光交互世界模型 DeepLight,将摄像头环境感知、空间理解与投影输出串成一套交互系统。DeepLight 通过理解人与物体在真实空间中的位置和交互意图,将提示、导航、批注等内容直接投射到桌面、纸面、墙面或地面,让机器人能够直接通过真实空间提供可视化反馈。

https://www.alight-tech.cn/

(@ 深光 ALight)

2、阿里推出可编辑 AI 音频创作室:CosyCreative:支持文本音频同步编辑与多轨混音

CosyCreative 定位一站式音频内容创作平台,内置上千种音色,支持声音复刻、AI 播客、AI 有声书、链接听文章等场景。

文本与音频可同步编辑,并支持自动标签、多轨混音和背景音乐,覆盖从「一键生成」到「精细创作」的全链路。视频配音、短视频出海、音效音乐生成等场景后续也将上线。

(@ 阿里语音 AI)

3、Fish Audio 推出多模态创作平台 Fish Creative:从语音生成扩展到口型同步、图像视频与音效创作

Fish Audio 推出多模态创作平台 Fish Creative,将原有语音能力进一步扩展到完整的视听内容制作流程。用户可以从生成或复刻一段声音开始,在同一创作画布中继续完成口型同步、图像与视频生成以及音效添加,把声音直接作为多模态内容创作的起点。

https://x.com/FishCreativeHQ/status/2089759230576451693

(@FishCreativeHQ)

4、Suno 发布生成式音乐工作台 Studio 2.0:加入 MIDI 编辑、Studio Chat 与参数自动化

Suno 发布生成式音乐工作台 Studio 2.0,在浏览器端加入 MIDI 编辑、内置合成器、音频效果器、参数自动化和 Studio Chat。新版本将生成能力进一步嵌入编曲、音色设计和混音流程,用户可以同时通过传统 DAW 操作和自然语言修改当前工程。

https://suno.com/blog/studio-2

(@Suno)

5、Sarvam AI 向所有开发者开放语音智能体平台 Voice Agents:企业级构建与部署能力转为公开可用

Sarvam AI 宣布其语音智能体平台 Voice Agents 面向所有用户开放,此前该平台主要用于企业部署,并已累计支撑超过 3.5 亿次语音对话。此次变化在于,Sarvam 将经过大规模企业场景验证的一整套语音智能体构建、管理和部署能力直接开放给开发者使用。

https://links.sarvam.io/Voiceagents

(@SarvamAI)


03 有态度的观点

1、💡** Dario Amodei:AI 公司画了这么久的饼,该真正「治愈癌症」了 **


Anthropic CEO Dario Amodei 近日在 X 发文表示,当前针对 AI 公司「最准确的批评」,是包括 Anthropic 在内的企业尚未兑现此前关于 AI 造福世界的宏大承诺。

他认为,想要改善公众对 AI 的看法,关键并非进一步宣传技术潜力,而是拿出真正能够改变现实的成果。

Amodei 以医疗领域为例称,如今「AI 将治愈癌症」已经越来越像一句陈词滥调,许多人甚至认为这样的说法具有欺骗性。他表示,真正能够改变公众态度的办法,是「实际治愈癌症」。

Amodei 同时将当前 AI 行业面临的问题归因于更广泛的信任危机,认为普通用户对科技公司、政府等机构长期存在不信任。

与此同时,前 OpenAI 高管 Fidji Simo 也公开回应称,尽管她在许多问题上与 Amodei 意见不同,但认同这一判断。她认为 AI 最终有潜力帮助治愈疾病,但仅依赖更强的模型并不足够,生物医学数据基础设施同样是目前限制 AI 医疗应用的重要因素。

(@APPSO)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流