本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、OpenAI 披露 GPT-Live 实时语音架构:全双工流式推理,WARP 将 WebRTC 启动从 6 个网络往返降至 1 个

OpenAI 发布 GPT-Live 工程解析,首次公开实时语音系统的核心架构设计。GPT-Live 不再依赖传统轮次检测器判断用户何时结束讲话,而是让全双工语音模型持续收发音频,同时将工具调用、深度推理、持久化等长耗时任务移出实时媒体路径,保持语音交互链路稳定。

Blog:

https://openai.com/index/continuous-voice-interaction-with-gpt-live/

WARP 提议草案:

https://datatracker.ietf.org/doc/draft-uberti-tsvwg-warp/

(@OpenAI)

2、微软内测全双工实时语音模型 MAI Realtime:支持对话中多语言无缝切换与低延迟打断

微软旗下 superintelligence 团队在 MAI Playground 早期测试版中悄然上线首款原生双工实时语音模型 MAI Realtime。该模型采用双向全双工架构,可同时接收与输出语音信号,旨在全面替代 Copilot 及 Azure 实时语音接口中对 OpenAI GPT-Realtime 的依赖。

目前该模型仅在 MAI Playground 面向少数合作伙伴开放非公开测试,尚未公布面向开发者 API 或消费端的正式上线时间表。

https://www.testingcatalog.com/exclusive-microsoft-tests-new-mai-realtime-voice-model/

(@TestingCatalog)

3、欧盟新规生效:Voice Agent 必须披露 AI 身份,合成语音需支持可识别标记

欧盟《人工智能法案》(EU AI Act)Article 50 透明度义务正式生效,面向公众提供服务的 AI 系统需要明确告知用户其正在与 AI 交互。对于 Voice Agent 场景,企业需要在语音交互开始阶段披露 AI 身份,并针对 AI 生成音频等合成内容满足透明度要求。

https://www.consilium.europa.eu/en/press/press-releases/2026/05/07/artificial-intelligence-council-and-parliament-agree-to-simplify-and-streamline-rules/

(@Council of the EU)

4、Moondream 发布 Photon 2.0 推理引擎:面向物理 AI 部署,支持多款视觉语言模型,推理效率提升 2.3 倍

Moondream 发布 Photon 2.0 推理引擎,定位为面向物理 AI 场景的高性能多模态模型推理基础设施。该引擎支持 Moondream、Qwen、Gemma 等视觉语言模型,并通过自定义 CUDA / Metal 内核、自动批处理和 KV 缓存优化,在官方测试中相比 vLLM 和 SGLang 实现最高 2.3 倍处理效率提升。

https://moondream.ai/blog/photon-2-launch

(@Moondream)

02 有亮点的产品

1、DPVR 发布面向运动场景的 AI 智能眼镜 R1:13MP 第一视角拍摄,支持语音 AI 与视觉识别,8 月登陆美国市场

DPVR 扩展 AI 智能眼镜产品线,推出面向运动场景的 R1 模型,预计于 2026 年 8 月在美国 Amazon 上线。R1 集成摄像头、语音 AI 和视觉识别能力,针对跑步、骑行和户外活动设计,支持第一视角记录与免手操作交互。

https://www.einpresswire.com/article/929870056/dpvr-expands-u-s-ai-smart-glasses-lineup-on-amazon-sport-focused-r1-arrives-in-august

(@EIN Presswire)

2、淘宝直播团队发布 TaoMate 实时音视频数字人:引入 Anchor-Guided Memory,支持长时稳定生成

淘宝直播团队发布 TaoMate 实时音视频数字人生成框架,面向长时间直播场景解决数字人连续生成中的身份保持、音视频同步和历史状态遗忘问题。该方法提出 Anchor-Guided Memory 机制,通过固定视觉锚点和动态记忆状态桥接历史生成内容,实现实时长视频中的稳定数字人生成。

https://arxiv.org/abs/2607.24359

https://taoliveaigc.github.io/TaoMate/

(@TaoMate)

3、线上虚拟办公平台 Gather 推出「智能对象(Smart Objects)」功能:连接外部工具与实时数据,让虚拟办公室具备动态交互能力

线上虚拟办公平台 Gather 最近推出了「智能对象」(Smart Objects)。用户可以收集各种能连接其他工具并实时更新的物品。

比如,你可以用它来做这些事:

📥 做一个能随着 Pull Request (PR) 堆积而不断填满的收件箱;

💡 做一盏在发生突发故障(Incident)时会变成红色的灯泡;

🤖 做一个能一目了然展示 AI 智能体状态的机器人监视器。

这个功能目前已经在 Gather 2.0 版本中上线。

https://x.com/gather_town/status/2084300898990264436

(@gather_town@X)

4、腾讯混元发布 Hy ASR 3.0 Preview:融合大模型语义理解,中文 WER 降至 3.34%,支持上下文纠错与方言识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 Preview,将语音识别与大语言模型语义理解能力结合,提升通用转写、上下文理解、专业词识别和复杂环境鲁棒性。模型基于 Hy3 大语言模型能力,采用 MoE 架构,并已通过腾讯云 API 开放服务。

Hy ASR 3.0 preview 发布:真正懂上下文的语音识别

(@ 腾讯混元)

03 有态度的观点

1、Reddit:AI 吃不掉我们

Reddit 刚交出一份漂亮财报:第二季度营收 8.05 亿美元,同比增长 61%;净利润 2.53 亿美元,增长 183%。但财报发布后,股价盘后一度跌超 10%。但让投资者紧张的是 Google 带来的流量。Reddit 在股东信里承认,来自搜索引擎的访问量本季度「时好时坏」,季度后半段波动更大。全球日活增至 1.303 亿,但美国日活从上一季度的 5350 万降到了 5320 万。

Reddit 有不少未登录访客来自 Google。过去搜索一个问题,用户会点进 Reddit 看真人经验;现在 Google 把 AI 摘要放在链接前面,答案已经写好了,很多人可能看完就走。Reddit CEO Steve Huffman 并不认为 AI 能把这部分需求全部吃掉

他接受采访时表示,Google 的 AI 摘要替代不了传统搜索里的「十个蓝色链接」。而在股东信里,他说得更直接:

人们不想看 Reddit 的摘要,他们想要的就是 Reddit。

Reddit CEO, Steve Huffman

Reddit 的理由是,AI 可以整理信息,却很难把社区里的争论、个人经历和不同意见压成一个标准答案。公司也在努力让用户每天主动打开 Reddit,减少对 Google 流量的依赖。

2024 年,Reddit 把帖子授权给了 Google,用于改进 AI。现在这些真人讨论让 Google 的答案变得更好,也可能让用户更少点进 Reddit。

🔗https://techcrunch.com/2026/07/30/reddit-reports-a-solid-quarter-but-shows-signs-of-ais-impact/

( @APPSO)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流