本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Inworld AI 发布实时 TTS 模型 Realtime TTS-2:从单句合成升级为多轮音频感知,可用自然语言控制语气

Inworld AI 发布 Realtime TTS-2,相比 Realtime TTS 1.5 主要根据当前文本生成语音,新版本开始利用此前多轮对话音频、用户情绪和说话节奏共同决定下一句话该怎么说,并把原来的固定情绪选项改成自然语言控制,让 TTS 从「把一句话念出来」进一步变成根据对话状态实时调整表达方式。

https://inworld.ai/realtime-tts-2

2、通义千问团队、清华大学提出长音频理解基准 AudioSpan:覆盖 10 分钟至 2 小时以上音频,分层测试感知、理解与推理

通义千问团队与清华大学研究人员提出长音频理解评测基准 AudioSpan,并公开完整数据集。不同于大量音频 Benchmark 仍以数秒短片为主,AudioSpan 将音频长度扩展到 10 分钟至 2 小时以上,同时不只测试「能不能找到答案」,而是把长音频理解拆成感知、理解和推理三个层级,共构建 3,240 道问题。

https://huggingface.co/datasets/holvan/AudioSpan

3、腾讯、NUS、港理工提出基于 MiniMax-H3 改造的交互式世界模型 H3-World:把键盘操作转成语言指令,仅训练 MiniMax-H3 0.199% 参数

腾讯、新加坡国立大学和香港理工大学研究团队提出 H3-World,将 330 亿参数的 MiniMax-H3 视频生成模型改造成可通过键盘实时控制角色和镜头的交互式世界模型。它没有额外训练一套动作控制模块,而是把键盘操作转换成 MiniMax-H3 已经能够理解的自然语言,再把每条指令精确绑定到对应的视频时间段。

https://danzer1xxxxchan.github.io/H3-World/

4、微软 GitHub 万星开源语音项目 VibeVoice 新增开源流式 ASR 模型 VibeVoice-ASR-Streaming:边听边识别「谁说了什么」,支持自定义热词和 10 种语言

微软GitHub 万星开源语音项目 VibeVoice 新增 VibeVoice-ASR-Streaming,将今年 1 月 VibeVoice-ASR 已有的「谁在何时说了什么」结构化转录能力推进到实时场景。模型无需等整段音频结束,而是随着语音持续输入逐块输出带说话人归属的转录结果,并支持自定义热词和 10 种语言。VibeVoice 最早以长文本多人 TTS 模型进入开发者视野,随后陆续推出实时 TTS、长音频 ASR 和 CPU 端侧推理版本,逐步从语音合成扩展成同时覆盖 TTS 与 ASR 的开源语音模型家族。此次 Streaming 版本进一步补上实时多人语音识别能力。

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B

02 有亮点的产品

1、fal 创意工程团队负责人开源 Minimax H3 Max 实时互动教育系统:语音讲解同步生成教学动画,支持打断后立即切题

fal 创意工程团队负责人 Gökay Aydoğan 开源 Minimax H3 Max Realtime Education把实时语音辅导与 H3 Max 视频生成串成一套可打断的教学系统。学生一边与 AI 对话,系统一边把当前科学讲解拆成具体知识点并持续生成 5 秒教学动画。 如果学生中途提问或切换话题,正在播放的视频不会中断,旧的待生成任务会被取消,新主题的视频生成完成后直接接替播放。

https://github.com/gokayfem/h3-max-education

2、a16z speedrun 04 项目 AI Agent 通信基础设施 Dial 上线:10 秒给 AI Agent 分配真实手机号,可自主打电话、收短信验证码

a16z speedrun 04 的 Genway AI 创业团队推出 AI Agent 通信基础设施 Dial,为 AI Agent 提供可编程的真实电话号码。Agent 可以在约 10 秒内申请自己的号码,并通过同一套接口拨打和接听电话、收发短信及读取验证码,让原本需要人工接管的电话预约、身份验证和线下沟通继续由 Agent 自主完成。

https://www.producthunt.com/products/dial-3

3、反诈 AI 公司 Apate.AI 获 815 万美元种子轮融资:用语音、消息和邮件主动「拖住」诈骗分子,已完成 250 万次自主对话

反诈 AI 公司 Apate.AI 获得 815 万美元种子轮融资,由 Lobby Capital 领投,OIF Ventures、Investible、Concept Ventures 和 Baobab Ventures 参投。与传统依赖检测和拦截的反诈系统不同,Apate.AI 部署大规模对抗式对话 AI 智能体,主动通过语音、消息和邮件与诈骗分子交互,在拖延其时间的同时提取诈骗话术、钓鱼链接、洗钱账户和加密钱包等实时情报。

(@ApateAI)

4、警务 AI 公司 Blue Voice 获 600 万美元种子轮融资:用语音和随身摄像头记录自动生成案件报告

面向执法机构的 AI 公司 Blue Voice 获得 600 万美元种子轮融资,由 General Catalyst 领投。其核心产品是一套面向警员的 AI 工作助手,可以读取警员口述内容、随身摄像头视频和案件材料,自动整理成案件报告、证词摘要等文书,试图把警员大量花在案后记录和行政工作的时间交给 AI 处理。

@Techcrunch

03 有态度的观点

1、马斯克:AI 明年底可胜任所有数字工作

昨日,马斯克在 G20 创新部长峰会的公开发言中表示,他预计到明年底,AI 可胜任几乎所有不需要人类直接操作物理世界的数字工作。

他将届时的 AI 编程能力比作国际象棋引擎 Stockfish,认为人类将很难在软件开发上与之竞争;各类工程与其他数字任务也可能在未来 12 至 18 个月达到很高水平。

对人形机器人,马斯克的判断更谨慎一些。他说,物理世界的产品需要建立庞大供应链,无法像软件那样直接复制。他把机器人的实用性拆成三个相乘的因素:AI 软件能力、机身芯片性能,以及机电灵巧性,尤其是手部操作能力。

他同时把电力列为 AI 扩张的主要约束。按他引用的分析师共识估计,2027 年 AI 芯片可能面临至少 15GW 的供电缺口:AI 芯片产量每年增长约 40%~50%,而中国以外地区的可用电力年增速约为 10%~20%。

针对电力缺口,马斯克建议各国在承接 AI 数据中心时,同步增建发电和电网设施。

他也提到,Google、Anthropic 等公司正向 SpaceX 租用算力,SpaceX 之所以能更快投用设备,是因为自建了发电设施。

@APPSO

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 深圳开发者活动推荐|Physical AI Camp 项目 WatcheRobot Workshop:把 AI Agent 接入真实机器人的开发实践

现在大多数 AI 应用仍停留在屏幕里:能对话、能生成代码,却无法感知真实环境,也不能通过硬件做出反馈。

这次 Workshop 将开放尚未上市的 WatcheRobot 及其 SDK。参与者可以使用 Codex、Claude Code、DeepSeek 等 AI 编程工具,调用机器人的摄像头、麦克风、屏幕表情、灯光和机身动作,把一个具体创意开发成可在真机上运行的功能。

现场不只是观看产品 Demo,而是实际连接设备、编写代码、运行测试并调试机器人的反馈,让它根据语音或视觉输入做出对应的表情、灯光和动作。

🕘 时间:9 月 5 日(周六)9:00–17:00

📍 地点:深圳市南山区

💻 要求:自带电脑,具备基础开发环境

🎫 名额限 10 人参加,需提前报名审核

如果你对 WatcheRobot 活动、AI 机器人开发或我们的产品方向感兴趣,报名连接:

https://mcnsslrwxv50.feishu.cn/share/base/form/shrcnbP0aKpMfCqVB1hy7QXk55b

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流