图片

开发者朋友们大家好:

这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、字节跳动发布音频创作模型 Seed Audio 1.0:统一生成人声、音效与环境声,单次音频约 2 分钟

字节跳动发布音频创作模型 Seed Audio 1.0,在统一框架内生成人声、音效和环境声。用户可通过 prompt、参考音频和结构化时间线直接生成完整声音场景,减少分环节制作与后期拼接。

图片

( @ 语音之家)

2、Memories.ai 发布音视频理解框架 O-MARC:音视频推理延迟降低 34.6%,显存占用减少 34.7%

Memories.ai 发布音视频理解框架 O-MARC,通过训练外的 OMAC 压缩和压缩蒸馏降低全模态模型的推理成本。在 Qwen2.5-Omni-3B 上,其四项基准平均得分达到 45.8,高于完整 token 推理的 44.1,同时实现 1.53× 推理加速。

参考链接:https://memories.ai/research/O-MARC

( @Memories.ai\@X)

3、面壁智能开源 MiniCPM-Robot:1.5B VLA 单步延迟 120ms,跟踪模型端侧延迟约 180ms

图片

面壁智能与 OpenBMB 发布 MiniCPM-Robot 系列,包含通用操作模型 MiniCPM-RobotManip 和目标跟踪模型 MiniCPM-RobotTrack。两款模型均面向端侧机器人部署,分别输出操作动作和移动轨迹,模型权重及代码已开放。

Github:

🔗  https://github.com/OpenBMB/MiniCPM-Robot

Hugging face:

🔗  https://huggingface.co/openbmb/MiniCPM-RobotManip

🔗  https://huggingface.co/openbmb/MiniCPM-RobotTrack

( @ 面壁智能)

02 有亮点的产品

1、BodyPark ATOM 健身摄像头上市:摄像头识别训练动作并提供实时语音反馈,售价 219 美元起

BodyPark 将此前通过 Kickstarter 众筹的 ATOM 转为现货销售。该设备通过摄像头识别训练动作并提供实时语音反馈,使独立训练者无需佩戴传感器即可获得动作纠正、次数统计和训练报告。

https://www.bodypark.fit/

( @ritwikpavan\@X)

2、千问亮相 Qwen Clip 耳夹耳机:Bose 参与调音,支持同声传译与 AI 眼镜联动

图片

千问在 WAIC 2026 展示 Qwen Clip,由千问与 Bose 共同打造,定位为接入千问智能体的开放式耳夹耳机。设备可承担语音输入输出、实时翻译和会议记录,并与千问 AI 眼镜联动,但完整硬件规格和发售计划尚未公布。

( @Alibaba Cloud Community )

3、Spotify 上线对话式 AI 功能「Talk to Spotify」:支持语音/文字交互,覆盖音乐、播客、有声书全场景

Spotify 推出对话式交互功能,用户可在应用内通过语音或文本搜索内容、控制播放并查询个人收听记录。该功能首先向部分 Premium 用户开放 Beta,可在同一会话中持续修改播放要求,无需退出当前页面。

( @Spotify)

03 有态度的观点

1、Google DeepMind CEO 哈萨比斯:AI 不会让 STEM 和计算机科学学位失去价值

图片

谷歌 DeepMind CEO 德米斯·哈萨比斯在伦敦一场商业会议上表示,AI 正在改变科技行业的职业路径,但 STEM 学位和计算机科学基础不会因此失去价值。哈萨比斯认为,掌握软件工程和计算机科学基础的人,能够更高效地使用 AI 工具。

他提到,编程语言已经历从机器码到 C 语言、再到 Python 的演变,未来可能进一步转向使用英语进行编程。不过,系统架构设计和软件工程最佳实践仍然不可或缺。

真正深入理解技术的人,使用 AI 工具的效率可能达到缺乏技术基础者的 10 倍。他同时表示,AI 时代也需要伦理学、哲学、经济学等人文学科和社会科学,以应对技术发展带来的新问题。

( @APPSO)


04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、活动推荐|AMD AI DevMaster 全球黑客松等你来战

首届 AMD Radeon GPU 全球黑客松来了!2026 AMD AI DevMaster 正式开放报名!本届黑客松由 AMD 主办,聚焦前沿 AI 应用与高性能 AMD Radeon GPU 技术,基于完全开源的 AMD ROCm 软件栈。无论你是独立开发者还是小团队(≤3 人),只要对 GPU 上的 AI 开发有热情,这就是你的舞台!

三大独立赛道,每个赛道单独评奖,总奖金池 30,000 美元

图片

时间:

图片

详情链接:

报名开启 | AMD AI DevMaster 全球黑客松等你来战(文末福利)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流