本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Qwen 开源 Qwen-MM-Plugins:以 Skill + MCP 接入多模态能力,覆盖图像、视频、3D 与 CAD

Qwen 开源 Qwen-MM-Plugins,为不同 Agent Harness 提供可独立安装的多模态能力。项目将每项能力拆分为用于声明工具能力的 Skill,以及可选的 MCP Server,并提供面向 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 等环境的安装方式。

https://github.com/QwenLM/Qwen-MM-Plugins

(@QwenLM)

2、英伟达开源 NeMo-Speech.cpp:C++ 语音推理运行时支持实时/批量模式与 OpenAI 兼容 API

英伟达开源 NeMo-Speech.cpp,一个基于 ggml 的原生 C++ 语音模型推理运行时环境,可运行 NVIDIA Nemotron Speech 等模型,并提供实时与批量推理模式。项目同时提供 CLI、本地 HTTP 服务、WebSocket 实时转录以及原生 C/C++ SDK 等接入方式。

https://github.com/NVIDIA/NeMo-Speech.cpp

(@NVIDA)

3、Wan 开源 Wan-Animate-2:端到端 DiT 直接输入驱动视频,蒸馏版 10 步完成推理

Wan 团队发布 Wan-Animate-2 推理代码以及 Base、Distillation 模型权重,用于参考图像驱动的角色动画生成。模型将驱动视频直接输入重新设计的 Diffusion Transformer,取消中间动作提取器,并加入文本控制的视角调整能力。

https://github.com/Wan-Video/Wan-Animate-2

( @Wan-Video)

02 有亮点的产品

1、ChatGPT Voice 支持文件上传与 Projects 项目上下文调用

ChatGPT Voice 的 GPT-Live 功能现已支持文件上传和项目管理。用户可在语音交互中上传文件并开展内容分析与提问,同时亦可在项目管理场景下,调用历史对话、参考资料及项目说明等相关内容。

(@OpenAI)

2、音频智能公司 Noiz 完成数千万元种子轮融资:AudioX 构建声学模型底座,探索声音物理信息建模

音频智能公司 Noiz AI 已完成数千万元种子轮融资,投资方包括金沙江创投、北极光创投和英诺天使基金。公司以自研开源音频模型底座 AudioX 为核心,尝试让模型从声音生成与识别扩展到对声音产生、传播和感知过程的理解。

获金沙江数千万元种子融资,音频模型 Noiz 要挖掘声音背后的物理信息|智能涌现融资首发

(@ 智能涌现)

3、keybodhi 开源 Aoi VR Agent:在 SteamVR 手部面板接入语音智能体,支持流式 TTS 与同声传译

Aoi VR Agent 是一个面向 SteamVR 的开源 AI 语音助手,通过附着在右手控制器上的 OpenVR overlay 提供交互界面,并由本地原生 C++ 智能体驱动。用户可直接在 VR 中进行 LLM 语音对话、查看环境截图、翻译系统音频或控制部分系统设置。

https://github.com/keybodhi/AoiVR

( @keybodhi)

4、AMNESIAC 展示反向图灵测试 AI 审讯游戏:MiniCPM-o 4.5 驱动对话,VoxCPM 生成角色语音

开发者 Hetansh Waghela 在 BuildSmall Hackathon 中开发 AMNESIAC,通过「让 AI 判断用户是否为人类」反转传统图灵测试。游戏中的 AI 审讯者 A.M.N。 会结合摄像头和麦克风获取的面部表情、脉搏信号与回答时间,持续调整后续提问。

https://huggingface.co/spaces/build-small-hackathon/amnesiac

(@HetanshWaghela)

5、Qoder Voice 上线:开口就能共事的实时语音伙伴

真正的动嘴编程来了:Qoder Voice 上线

你有没有过这种时刻:脑子里方案已经跑完三轮,手指还在键盘上敲第一句话。

Qoder Voice 要解决的就是这个时差。你说,它听,它答——不用等你写完一整段提示词,也不用把话组织成"标准句式"。想到哪说到哪,说错了直接打断重来,像跟一个反应快、能陪聊、也能找到解决方案的同事。

Qoder Voice 的声纹识别,就是给这件事上了把锁。开启后,它先认得你的声音,再决定要不要回应。开放工位、会议间隙、地铁站台、楼上还在装修的家——环境可以很吵,但它的注意力只在你身上。

欢迎在 Qoder 国际版和 CN 版 Quest 模式里体验 Qoder Voice!

03 有态度的观点

1、Replit CEO:AI 并没有杀死编程,它让软件工程变得更「以人为本」

Replit CEO Amjad Masad 近日在科技记者 Casey Newton 的播客节目中表示,AI 正在让 Replit 内部的软件工程工作变得更加「以人为本」,编码智能体将工程师从高强度敲码中解放出来,转向更具创造力的工作。

Masad 提到,两年前公司里的工程师「都在埋头敲键盘,办公室里全是键盘声」,而现在「环境变得更有活力」。他表示,工程师如今花更多时间在白板前构思和讨论,偶尔向 AI 智能体发送下一步指令即可。

这一表态与业界对「SaaSpocalypse」(SaaS 末日论)的普遍担忧形成对比。今年早些时候,市场曾担忧 AI 将使企业能够自行构建软件、不再依赖专业软件公司,这一预期一度引发软件股抛售。

与此同时,AI 对软件工程岗位的冲击仍在持续。至少十余家大型公司已将 AI 列为裁员理由之一,工程师们也表示借助 AI 编码虽然效率更高,但容易导致倦怠。今年夏天,Meta 裁减了近 1000 名软件工程师,但 Mark Zuckerberg 将裁员归因于抵消 AI 支出,而非自动化取代人力。

Masad 透露,Replit 在去年迎来转折点。当时 Anthropic 开始发布 Opus 系列模型,其代码生成能力显著优于此前的模型。Masad 回忆称,自己当时一度觉得「我毕生致力于教人们编程、让编程变得更简单的使命,似乎都失去了意义。」

此后,Replit 将公司使命从「教人编程」转向「让编程尽可能简单」,并推出了基于自然语言指令生成程序的 AI 智能体,即如今被称为「vibe coding」的模式。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、帮社区的好伙伴 S 创推荐一下路演大赛报名!

✨S 创上海 2026 路演大赛 # 二轮评委天团正式解锁✨

15 位深耕各赛道产业投资人集结~全赛道覆盖配齐专业评审视角

⚠报名倒计时!8 月 12 日 24:00 截止,时间余量不多,别拖到最后!

戳文解锁评委名单 + 抢占最后报名位

→与顶流投资团面对面的机会,手慢真无🚀

S 创上海 2026|路演大赛二轮评委嘉宾阵容公布!

2、活动推荐|SheNicest 烈变黑客松:1000 人、96 小时、15 万奖金,等你来玩

8 月 26 日—30 日,烈变黑客松将在北京开启 96 小时创造。RTE 开发者社区欢迎所有构建实时 AI、Voice Agent、Physical AI 与实时多模态的 Builder 报名,让想法真正跑起来。

1000 人、96 小时、15 万元奖金|烈变黑客松选手招募

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流