本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、DeepSeek 上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp:首次在 DeepSeek API 中开放图像输入,多模态 Agent 评测接近 Opus-4.8,Harness 同步加入原生图片支持

对 DeepSeek Harness 官网进行二次创作:

要求模型用黑蓝深海、玻璃 UI 和 ASCII 原子像素等视觉要素,经过长多轮交互后重构得到的未来主义风格开发者网站

DeepSeek 上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp,并首次在 DeepSeek API 中开放图像输入。新模型在保持 V4-Flash 文本 Agent、推理和世界知识能力基本持平的同时,补上视觉理解能力,可直接接入 Agent 工作流处理网页、PPT、前端界面等图文任务。

V4-Flash-Vision-Exp 上线,开启多模态 API 服务

(@DeepSeek)

2、Avera Labs 开源全双工语音训练数据管线 ConversationalVoice:把真实录音转成说话人分离的高质量对话数据

Avera Labs 发布首项研究工作 ConversationalVoice,针对全双工语音模型缺少高质量真实对话训练数据的问题,将播客、视频等真实录音中的多人语音分离并重新整理为结构化训练数据。相比只保留转录文本,这套管线重点保留对话中的轮次、停顿、重叠说话和非语言表达,让模型能够学习更接近真实人类交流的互动方式。

https://github.com/avera-labs/ConversationalVoice

(@averalabs0)

3、快手 Kling、港中文与清华提出统一音频生成模型 SonicWeave:一个模型生成语音、音乐、歌声与音效,复杂场景 MOS-R 达 4.49

快手 Kling 团队联合香港中文大学、清华大学提出统一音频生成模型 SonicWeave,用一套模型参数同时生成语音、歌声、音乐、音效,以及多种声音交织的复杂音频场景。相比为不同声音类型分别训练模型,SonicWeave 重点解决同一段音频中语音、音乐和环境声不断变化、相互重叠时,模型该如何动态分配生成能力的问题。

https://caiyunrui.github.io/SonicWeave

(@caiyunrui)

4、Patronus AI 开源设计类 computer-use 数据集 FigmaTrace:记录 200+ 小时真实设计过程,而不只保留最终作品,让模型学习设计过程而不只看成品

Patronus AI 开源 FigmaTrace,面向设计类 computer-use Agent 的训练与评测,包含 3,469 条 Figma 操作轨迹、超过 200 小时真实设计工作,覆盖 10 类设计技能。与过去从最终设计稿反推操作过程不同,FigmaTrace 直接记录设计师如何一步步完成长链路任务,让模型学习元素选择、坐标定位以及不同设计阶段中的实际决策过程。

https://patronus.ai/blog/figmatrace-a-comprehensive-training-dataset-for-figma-design-workflows

https://x.com/anandnk24/status/2090499988833107978

(@anandnk24)

5、自变量机器人开源实时语音轮次模型 X2-Turn:每 80ms 同步输出转写与轮次状态,判断用户是否说完或只是在附和

自变量机器人 X-Square Robot 开源 X2-Turn,在同一个 4B 流式语音模型中同时完成 ASR 和对话轮次判断。不同于先做 VAD、再转写、最后判断用户是否说完的串联方案,X2-Turn 基于 Voxtral Realtime 增加并行的轮次状态预测模块,每 80ms 随语音流同步更新转写和状态,用于更早判断用户还在继续说、已经说完,还是只发出了「嗯」「啊」这类附和声。

https://github.com/X-Square-Robot/X2-Turn

(@X-Square-Robot)

02 有亮点的产品

1、乐鑫发布面向 Coding Agent 的开发板 ESP-Mosaico:Agent 可直接部署真机,多机拼接扩展硬件能力

乐鑫发布面向 Coding Agent 的模块化开发板 ESP-Mosaico,将 AI Coding 从代码生成进一步延伸到真实硬件开发。开发者可以按需组合摄像头、传感器、按键、灯光、电机等模块,Agent 根据当前硬件配置生成应用,并继续完成构建、部署、真机测试和调试;多台设备还可以拼接并协同运行,让硬件形态也能随着应用需求持续变化。

https://mosaico.espressif.com/

(@ 乐鑫科技)

2、Vapi 下线 Workflows、全面转向 Squads:Voice Agent 编排从流程图走向多 Agent 分工与动态交接

Vapi 已于 8 月 18 日正式下线 Workflows,8 月 19 日起原有 Workflow 停止运行,并将 Squads 作为复杂 Voice Agent 的推荐方案。相比用节点和连线提前画出完整对话路径,Squads 将复杂任务拆给多个职责更聚焦的 Agent,再根据实际对话上下文决定何时交接。Vapi 表示,现阶段模型很难同时记住当前节点要求、所有可能的下一步及对应条件,而多 Agent 分工在实际客户场景中表现更稳定。

https://docs.vapi.ai/workflows/legacy-migration

(@Vapi)

3、OpenAI 为 ChatGPT 接入 Apple Messages:可直接检索与发送消息,桌面 Agent 开始进入私人通信

OpenAI 推出 Apple Messages 插件,让 ChatGPT 在 Mac 上直接访问用户的消息会话,可搜索历史消息、总结对话进展、起草并发送回复,目前已接入 ChatGPT Work 和 Codex。相比过去需要用户手动复制聊天内容给 AI,这次 ChatGPT 开始直接进入 Messages 这类系统级私人通信入口,在已有上下文中完成理解和操作。

https://www.bloomberg.com/news/articles/2026-08-20/chatgpt-can-now-control-imessage-potentially-raising-apple-privacy-concerns

(@OpenAI)

03 有态度的观点

1、Retell:约 99% 的 Voice Agent 客户仍在用级联架构,端到端 S2S 还没有赢下生产环境

Retell 高级工程师 Zhongren Shao 透露,其平台 99% 的 Voice Agent 仍采用 STT + LLM + TTS 的级联架构,而非端到端(Speech-to-Speech)模型。级联的核心价值在于生产环境的高度可控

从 Demo 到生产,「系统更可控」仍优先于「模型更原生」。相比端到端,生产级落地更看重系统的可替换、可评测与容灾能力。

https://www.assemblyai.com/blog/build-smarter-voice-agents-retell-super

( @AssemblyAI)

04 Real-Time AI Demo

1、TypeGPU 实现深度感知实时光照:M4 Pro 推理延迟低至 8ms

开发者 Konrad Reczko 展示了基于 TypeGPU 的深度感知光照效果。他在 Apple M4 Pro 上将 448×448 单目深度估计模型的推理耗时优化至约 8ms(含约 250 次 GPU 调度),满足实时渲染需求。

得益于 TypeGPU 的统一管线,深度数据全流程留在 GPU 内,推理、光照注入与渲染通过同一个命令编码器完成,免去了跨接口传输与额外的同步开销。

https://docs.swmansion.com/TypeGPU/examples/#example=image-processing--monocular-light-injection

( @Konrad Reczko)

2、Hugging Face 推出 Realtime Voice 实时语音 Demo:四个开放模型组成级联式 Voice Agent

Hugging Face 上线 Realtime Voice 实时语音 Demo,基于其开源 speech-to-speech 框架构建,并非端到端语音模型,而是采用 VAD → 语音识别 → 视觉语言模型 → 语音合成 的级联架构。当前在线 Demo 分别使用 Silero VAD、NVIDIA Parakeet TDT 1.1B、Gemma 4 31B 和 Qwen3-TTS 1.7B,各环节均可替换或本地运行;前端通过 WebSocket 与实时后端通信,并兼容 OpenAI Realtime API 的核心事件协议。

https://huggingface.co/spaces/smolagents/hf-realtime-voice

( @DerekColley_@Huggingface)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流