本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Anthropic 开放硬件标准 MHS 研究预览:让 AI Agent 统一操控实验设备,硬件集成从数周缩短到数小时

Anthropic 开放 Model Hardware Standard(MHS)研究预览,一套让 AI Agent 安全操作现实硬件的统一规范。它将显微镜、移液工作站、机械臂等不同设备转换成统一接口,让 Agent 可以同时发现、读取和控制多台设备;Anthropic 表示,过去往往需要数周甚至数月的硬件集成工作,可缩短到数小时或数分钟。

MHS 目前仅向首批科研实验室和先进制造企业开放 Research Preview,Anthropic 计划在完成安全评测和最佳实践验证后进一步开源。

https://www.anthropic.com/news/model-hardware-standard-research-preview

2、MiniMax 推出 H3 Max Live:视频生成速度快于实时播放,聊天室一句 Prompt 数秒改写「无限直播」

MiniMax 展示基于 H3 Max 的实时 AI 直播形态 H3 Max Live:观众在聊天室输入 !prompt,模型会在几秒内生成下一段带声音的视频并直接接入直播流,让节目内容随着观众指令持续变化。H3 Max 生成 5 秒、768p 音视频不到 3 秒,已经快于实际播放速度,因此上一段视频播放时,系统就能提前生成下一段,把视频模型从「一次生成一个片段」推进到可以持续运行的实时内容系统。

https://x.com/fal/status/2094286082275696880

(@Minimax @fal@X)

3、Reactor × Hao AI Lab 开源无限 AI 直播系统:观众发 Prompt,FastH3 实时生成 768p 音视频并持续推流

Reactor 与 Hao AI Lab 基于 FastVideo 的 FastH3 搭建并开源了一套端到端「无限 AI 直播」系统。观众可以直接在 Twitch 或 YouTube 聊天室输入 Prompt,LLM 将想法扩展成连续场景,再交给 FastH3 生成带同步音频的 768p 视频片段,并通过 RTMP 无缝接入同一条持续直播流。

https://haoailab.com/blogs/fasth3-preview/

4、开发者用 Codex + fal H3 数小时搭出「无限 TikTok」:边刷边实时生成视频,观看中还能续写到 30 秒

开发者 Rames Jusso 用 OpenAI Codex 在数小时内完成了一款支持无限滚动的 TikTok 式应用,视频内容由 fal 上的 H3 模型实时生成;从界面搭建、功能实现到演示录屏,整个流程基本交给 Codex 自动完成。产品不是预先准备固定视频库,而是在用户持续下滑时动态生成下一条内容;当用户停留观看某段视频时,系统还可以继续向后生成,把原本较短的片段延长到约 30 秒,展示了实时视频模型开始从「一次生成一个片段」转向持续内容流的可能性。

https://x.com/Rames_Jusso/status/2094160939776155706

(@Rames_Jusso@X)

5、NUS、NTU 等提出情感 TTS 系统 EmoTra-TTS:一句话内可从「开心」平滑过渡到「愤怒」,情绪转换质量最高提升 87%

新加坡国立大学、南洋理工大学、LIGHTSPEED 等研究团队提出 EmoTra-TTS,并已被 EMNLP 2026 主会接收。不同于常见 TTS 为整句话指定一个固定情绪,EmoTra-TTS 将情绪建模为随时间连续变化的轨迹,让同一句语音可以从「开心→愤怒」「惊讶→悲伤」等状态自然过渡,并允许开发者明确控制变化方向与强度。

https://liu-tianchi.github.io/EmoTra_DemoPage/

02 有亮点的产品

1、开源车载 AI 项目 CarWatch 0.4:Raspberry Pi 5 本地跑完整语音 Agent,断网也能直接问车况

CarWatch 0.4 新增完整车内语音交互链路:驾驶者说出「Hello car」即可提问,Raspberry Pi 5 在车内本地完成 VAD、whisper.cpp 语音识别、35B 级模型推理和语音播放,并结合 OBD 实时数据、车辆云端信息和 489 页车主手册回答问题;演示中最后一个问题在完全断网状态下完成。项目使用约 300 欧元硬件,AGPL 开源,可适配带 OBD 接口的车辆。

https://github.com/ThinkOffApp/CarWatch

2、开源爆款小智 A I 孵化「龙树智能」获天使轮融资,首发 AI 代接电话硬件:金沙江创投、泓川源资本参投

由 GitHub 开源项目「小智 AI(xiaozhi-ESP32)」团队孵化的龙树智能完成天使轮融资,投资方为金沙江创投与泓川源资本。这家公司 2026 年 2 月成立,团队此前已通过开源社区积累百万级设备接入、数十万开发者和日均近千万次真实对话,开始把这套实时语音交互与设备连接能力进一步产品化。

https://github.com/78/xiaozhi-esp32

@AING 硬迹)

3、开发者开源语音控制 MIDI 工具 midi-voice:直接对合成器说「加贝斯、换音色、开始循环」,AI 自动编排并演奏

开发者 jia-seed 将 Roland Juno-D8 合成器接入浏览器,用语音直接控制 MIDI 演奏和循环编排:语音先由 Web Speech API 转成文字,再交给 Claude Sonnet 4.6 理解成 start_loopadd_trackplay_chordprogram_change 等 MIDI 工具调用,通过 Web MIDI API 直接发到合成器。系统会保留当前循环中的调性、BPM 和已有声部,因此用户继续说「加一个管乐」「让它更暗」「多一点混响」时,模型会在现有编曲基础上补充新的声部,而不是只执行单次按键命令。

https://github.com/jia-seed/midi-voice

(@jia_seed)

03 有态度的观点

1、马斯克回应 OpenAI「断供」Cursor:毫不在意

OpenAI 宣布,已通知 SpaceX,计划逐步终止向 Cursor 直接提供 OpenAI 模型的合同,拟定停止日期为2026年11月12日。

OpenAI 表示,这一日期已经用足合同规定的通知期限,受影响的主要是通过 Cursor 订阅直接调用其模型的开发者。现有模型直连在拟定日期前仍可继续使用,但 OpenAI 不会再向 Cursor 提供未来模型,包括尚未发布的 Astra。

对此,马斯克在 X 上只回了一句:「毫不在意。」

随后他继续开火,称 OpenAI CEO Sam Altman 和总裁 Greg Brockman「完全不值得信任」,并再次指责两人「偷走了一个开源非营利组织」。

马斯克与 OpenAI 的矛盾也因此进一步升级。此前马斯克已向 OpenAI 发起 1500 亿美元索赔诉讼,指控 OpenAI 与 Altman 背弃最初的非营利使命;OpenAI 则反驳称,马斯克过去曾试图夺取公司控制权。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 Data for AI Meetup 议程升级|新增 AWS OpenSearch,7 位嘉宾阵容完整公布

前两天和大家推荐过的 9 月 5 日上海 Data for AI Meetup,这两天议程又升级了。

这次新增 AWS OpenSearch AI 研发经理 Charlie Yang,将从 Agentic Search、Agent Memory 到 Agent 可观测性,分享 OpenSearch 围绕 Agent 构建的完整搜索生态。

目前阵容已升级为 7 位嘉宾,来自 Datastrato、腾讯、Zilliz、AWS OpenSearch、Apache Doris、Red Hat,完整覆盖 语义层、元数据与取数、检索、Agent Memory、数据库内核与 AI 全栈基础设施

📍 9 月 5 日|上海前滩

🎫 活动免费,限 100 人

报名截止延长至 9 月 2 日 24:00

[议程升级] Data Agent、语义层、元数据与检索,一场围绕开源 AI 数据基础设施的技术聚会 | 9/5 上海见

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流