本期编辑:@ 三水 @ 鲍勃

01 有话题的技术

1、实时 AI 视频交互公司 Tavus 发布全双工视频交互模型 Griffin:边听边说并持续理解表情与动作,VideoFDB 生成与感知两项排名第一

Tavus 发布 Griffin,并将其定义为首个「Human Interaction Model(HIM)」。Griffin 将音视频感知、对话决策、语音生成和视频生成放进同一个实时系统,在自己说话时仍持续接收用户的声音和画面,因此可以根据插话、停顿、视线、表情和手势动态调整说话时机、语气与非语言动作。当前开放的是 Griffin-Lite 研究预览版,仅向部分早期测试者提供。

https://www.tavus.io/griffin

https://x.com/tavus/status/2105704169009246248

2、Meta 与企业级 AI 智能体公司 Sierra 联合推出开放标准 Personal Agent Protocol:支持个人智能体跨网站、API 与企业智能体执行任务

10 月 6 日,Meta 与 Sierra 联合 Genesys、Shopify、Stripe、Walmart 等企业宣布开发开放标准 Personal Agent Protocol(个人智能体协议),旨在统一个人智能体代表用户与企业交互时的身份认证、权限管理和任务执行方式。个人智能体可通过统一会话访问企业网站、API 或企业自有智能体,减少依赖网页点击、表单填写等操作。

https://sierra.ai/blog/introducing-personal-agent-protocol

3、OpenAI 发布语音与 Decisions API 集成指南:智能体可边对话边执行操作,支持语音控制浏览器和应用

OpenAI 发布新开发指南《Connect voice to Decisions》,介绍如何结合 GPT-Live 语音能力、Decisions API 和客户端委托机制,构建能够一边进行语音对话、一边执行任务的智能体。开发者可以让智能体根据用户的语音指令操作浏览器、控制应用界面,或将复杂请求交给推理模型处理。

https://developers.openai.com/api/docs/guides/decisions-voice

4、Google DeepMind 发布设备端多模态嵌入模型 EmbeddingGemma 2:740M 参数统一文本、代码、图像、音频和视频检索

Google DeepMind 发布 EmbeddingGemma 2,这是 EmbeddingGemma 系列首个原生多模态开放嵌入模型。相比上一代主要处理文本,新模型把文本、代码、图像、视频和音频映射到同一个 768 维向量空间,让跨模态搜索、RAG、分类和路由可以直接在手机、笔记本等设备端运行。

模型已按 Apache 2.0 许可开放,可通过 Hugging Face、Kaggle 和 Google AI Edge 使用。

https://x.com/GoogleDeepMind/status/2107502286758895878

5、多模态数据与评测公司 Mundo AI 测试语音 Benchmark 输入:6 家 TTS 合成语音与真人录音在模型表示中仍可明显区分

Mundo AI 分析了语音智能体与 Speech-to-Speech Benchmark 中常见的「用 TTS 合成语音代替真人录音」做法,并用相同文本分别生成真人与 6 家商业 TTS 的语音进行对比。在其测试数据中,Gemma 4 E2B 和 Qwen3-TTS 的音频表示几乎可以直接区分真人与合成语音,加入现有 Benchmark 常用的噪声与信道退化后,这一差异仍然存在。

https://mundoai.world/research/benchmarks-dont-hear-humans/

02 有亮点的产品

1、实时 AI 基础设施公司 Inworld 收购语音智能体平台 Ultravox:整合语音理解、轮次控制与 Realtime TTS-2

Inworld 收购实时语音智能体平台 Ultravox,并将其并入自身 Speech-to-Speech 路线。Ultravox 团队成员将继续开发原平台;双方此前已合作超过一年,Ultravox 主要提供语音理解、推理、任务执行以及实时对话中的轮次控制和打断处理,Inworld 则提供 STT/TTS 模型、模型服务和实时推理基础设施。

https://inworld.ai/blog/inworld-acquires-ultravox

https://www.linkedin.com/posts/zachkoch_big-personal-update-inworld-ai-acquired-activity-7511793003288801280-8QjJ

2、端侧 AI 模型公司 Cactus Compute 发布 16.9MB 语音识别模型 Whistle:CPU 本地运行,首 token 延迟 11.1ms

Cactus Compute 发布开源语音识别模型 Whistle,面向手机、可穿戴设备、机器人、汽车和微控制器等端侧设备。模型文件仅 16.9MB,直接在 CPU 上运行,并与其端侧工具调用模型 Needle 共用同一套 C++ 推理引擎,可以把语音转写和后续工具调用放进同一个本地执行链路。

https://cactuscompute.com/blog/whistle

3、端侧语音技术公司 DaVoice 起诉 Perplexity:指控合作期间获取唤醒词技术机密后自行开发同类系统

DaVoice 运营方 SyteMLLabs 9 月 24 日在美国加州北区联邦法院起诉 Perplexity,指控后者在双方合作开发语音唤醒技术期间接触其商业机密,随后自行开发了同类能力。案件以《商业秘密保护法》为依据提起,目前这些内容均为 DaVoice 的诉讼主张,法院尚未就侵权事实作出认定。

(@Bloomberg Law)

03 有态度的观点

1、华为徐直军:昇腾在中国可统计市场的份额已超过英伟达

在近日公布的华为全联接大会媒体交流纪要中,轮值董事长徐直军表示,中国市场的英伟达份额很难统计,但按华为能够统计到的数据看,昇腾的市场份额应该已经超过英伟达。

徐直军称,当前昇腾供给仍不足以满足中国市场需求,华为没有全面拓展海外市场的计划,国内客户将获得优先供应;海外业务主要面向少数确有需求、难以取得算力或需要另一种选择的客户。基于 950DT 的超节点仍处于测试阶段,预计今年年底或明年初开始规模供货。

他预计,从明年起会有大量模型训练建立在这一系统上。谈到芯片供应瓶颈,徐直军认为,光模块、存储等环节都没有为 AI 需求的快速增长做好准备,全球供需平衡可能到 2029 年才能实现,中国可能更晚。华为单芯片仍受国内工艺限制,多芯片互联和系统架构则是其重点投入的路线。

华为 10 月 5 日公布的另一场媒体圆桌中,余承东表示,鸿蒙 6、鸿蒙 7 的设备总数已超过 9000 万台,预计年底超过 1 亿台;华为已有将鸿蒙推向海外的初步计划,将分步骤推进。

余承东称,自 2019 年以来,华为持续重构供应链,并在 2023 年恢复手机芯片的国内制造。按照他的说法,华为在芯片和操作系统层面已基本摆脱对美国技术的依赖,国产先进制程的产能仍然紧张。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、社区活动推荐| 🚀 Google DevFest 2026 上海站 来啦!

由 GDG Shanghai 主办,RTE 开发者社区共同支持的 Google DevFest 2026,将于 11 月 7 日在上海 举办!

今年以 Build with Gemini 为主题,现场不仅有 Google 专家与 GDE 带来 AI、Gemini 和 Google Cloud 的技术实践分享,还有沉浸式 AI 互动体验,以及与 2000+ 开发者 面对面交流的机会。

如果你正在关注 AI 应用开发、Gemini、云技术,或者想认识更多开发者朋友,欢迎来现场一起交流!

📅 时间:2026年11月7日

📍 地点:上海闵行区中庚聚龙酒店

👉 扫描下方海报二维码报名参与~

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流