本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 双模型:实时语音可边聊边跑异步 Tool Call,Extended Thinking 支持后台多步推理

Google 推出 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking 两款实时语音模型。相比上一代 Gemini 3.1 Flash Live,最大的工作流变化是:3.8 Live 开始支持异步函数调用,工具执行期间无需暂停整场语音对话;Extended Thinking 则进一步把可配置的多步推理放到后台,让模型在持续说话的同时完成复杂分析和工具任务。

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

2、TTS Arena 联合 LAION 上线 Voice Acting Arena:同场景盲测两款 TTS,开始评「演得像不像」而不只是「说得像不像」

TTS Arena 与 LAION 推出 Voice Acting Arena,把 TTS 人类偏好评测从传统的自然度、音色质量进一步扩展到配音表演能力。用户会听到两个匿名模型演绎同一段场景和剧本,再从整体表演、是否遵循导演指令、情感是否真实等维度进行比较;部分任务还包含笑声、倒吸气、抽泣等非语言声音。团队希望通过持续收集这种 A/B 偏好数据,建立面向 Voice Acting 模型的长期评测,而不是只比较「哪个声音更像真人」。

https://huggingface.co/spaces/TTS-AGI/voice-acting-arena

3、NVIDIA 为全双工 Speech-to-Speech 模型补上实时转录:并行加一个轻量 ASR Head,边听边说时也能输出用户文字

NVIDIA 研究团队提出一种给现有全双工 Speech-to-Speech 模型增加流式用户转录的方法:在原有 Agent 文本输出 Head 旁边并行加入一个轻量级 ASR Head,无需大改基础架构,就能一边维持同时听说、话轮切换和打断处理,一边持续输出用户语音的文字转录。对于 Voice Agent,这意味着原生 S2S 不再只是「听懂后直接说回来」,还可以同时留下可用于日志、字幕、质检和后续工具调用的文本轨迹。

https://arxiv.org/abs/2609.15759

4、Lemn Lab × EleutherAI 开源 BuzzASR:不给一个模型塞 102 种语言,而是为每种语言单独训练 Whisper 专家

加州大学圣地亚哥分校的 Lemn Lab 联合 EleutherAI 发布 BuzzASR,一次开源 102 个单语 ASR 模型。每个模型都从 Whisper-large-v3 单独微调,只负责一种语言,试图解决大型多语言 ASR 在低资源语言上「什么都会一点、但很多语言都不够准」的问题;该工作已被 EMNLP 2026 接收。

https://lemn-lab.github.io/buzz-asr/

02 有亮点的产品

1、实时视觉交互平台 Flam 完成 4000 万美元 B 轮:让视频、3D 与视觉 Agent 在播放中实时响应用户

Flam 完成 4000 万美元 B 轮融资,由 QED Investors 领投,Claypond Capital、Datadog CEO Olivier Pomel、Martin Chavez、Venky Harinarayan 等参投,累计融资达到 6200 万美元。相比传统生成式内容先生成、再播放,Flam 更强调低延迟互动内容:视频、3D 场景和视觉 Agent 可以在展示过程中根据点击、语音或摄像头输入实时变化。

https://flamapp.ai/

2、DeepL Voice 推出跨 Zoom、Teams、Meet 的语音翻译桌面应用:实时翻译时可保留说话人的音色、语气与节奏

DeepL 更新 DeepL Voice,推出适用于 Windows 和 Mac 的统一桌面应用,不再依赖单个平台插件,即可跨 Zoom、Microsoft Teams 和 Google Meet 提供实时字幕与语音对语音翻译。更重要的变化是,新一代 Voice 模型开始在跨语言转换时保留说话人的声音身份和表达方式:不同说话人仍可被区分,语气、节奏、语速、重音以及犹豫、兴奋、紧迫感等表达也会尽量随翻译保留下来。

https://www.deepl.com/en/blog/deepl-voice-preserves-your-voice-across-languages

03 有态度的观点

1、黄仁勋活动现场免提接听特朗普电话,双方隔空探讨 AI

9 月 14 日在洛杉矶举行的 All-in Summit 峰会上,英伟达 CEO 黄仁勋在演讲期间接听了美国总统特朗普打来的免提电话。

通话中,特朗普将 AI 末日论称为「骗局」,表示机器人绝不可能统治世界,并批评了放缓 AI 发展速度的主张,认为此类呼吁出于政治动机。

特朗普还提到自己在麻省理工学院任教四十余年的叔叔约翰·乔治·特朗普,称自己凭借家族基因遗传也具备相应天赋,因而深谙 AI 领域;

黄仁勋在现场回应称「难怪你对 AI 这么懂」

另据《金融时报》报道,黄仁勋在 Salesforce 年度 Dreamforce 大会上就 AI 安全与监管议题表达了不同路径。

针对此前 Anthropic CEO Dario Amodei 呼吁行业放缓新模型开发速度,以及马斯克和 OpenAI CEO Sam Altman 公开支持控制研发节奏的提议,黄仁勋表示不同意将减速作为行业通用方案。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、Happy prompting!

( @aquavoice@X)

2、各位 RTE 社区的开发者朋友 **👋 我们在做一份语音 Agent 开发生态的调研 **

想了解大家在落地 Voice Agent 时,实际都在用哪些 Skill?几道选择题,2-3 分钟搞定。欢迎来填,也欢迎转给身边做语音的开发者~

https://rcnxnwjad4la.feishu.cn/share/base/form/shrcn49HlEu1ZWeLIw6OLfYPgMg

3、📣 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~

今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工 + 交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。

🔥 贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~

🎫 目前大会门票限时免费开放!

想来现场听技术、认识同行的开发者,可以先把票薅上

📅 时间:10 月 23–24 日

📍 地点:北京悠唐皇冠假日酒店

限免结束后将恢复收费,建议先报名占位 👇

定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流