本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Lychee-FD 开源原生端到端全双工语音模型:多流 vLLM 推理加速 2.96×,长对话显存增量降低约 23%

哈工大(深圳)等团队开源 Lychee-FD,一种面向实时语音交互的原生端到端全双工语音语言模型,并入选 ACL 2026 Outstanding Paper。模型不依赖级联的 ASR、LLM、TTS 和 Turn-Taking 模块,而是在统一多流架构中同时建模持续聆听、语义理解、语音生成和交互控制。

https://github.com/HITsz-TMG/Lychee-FD

( @Lychee-FD)

2、Deepgram 推出 Flux TTS:跨轮次保留对话上下文,原生支持打断与流式 LLM 输入

Deepgram 推出面向 Voice Agent 的 Flux TTS,采用 streaming-first 设计,不再将每段文本作为独立 TTS 请求处理,而是在多个轮次之间持续保留对话状态,根据上下文调整语速、重音和情绪表达。

目前首批 Flux TTS Voice 为英语声音,支持 Cloud、VPC 和 On-prem 部署。

https://deepgram.com/product/text-to-speech/flux

(@DeepgramAI)

3、NVIDIA 发布 Nemotron 3.5 Lightning:30B MoE 仅激活 3B 参数,同级模型输出速度最高提升 4×

NVIDIA 发布 Nemotron 3.5 Lightning,一款面向长时间运行 Agent 高频执行任务的开放 MoE 模型,总参数量 30B、每 Token 激活 3B 参数。模型针对工具调用、结果验证和子智能体委派等执行型任务优化,并通过 speculative decoding、Harness-oriented training 和量化降低连续 Agent 工作负载的推理开销。

https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/

( @NVIDA)

4、DuplexWorld 提出一套面向真实日常任务的全双工 Voice Agent 评测框架,不再只测试 Turn-Taking、语音自然度或工具调用等单项能力

DuplexWorld 提出一套面向真实日常任务的全双工 Voice Agent 评测框架,同时评估「任务有没有完成、对话是否自然、声音表现如何」。Benchmark 覆盖银行、保险、旅行、医疗、物流和 Pathfinding 6 个世界、11 类对话、156 个场景,累计生成超过 350 小时对话。

https://duplexworld.github.io/index.html

( @DuplexWorld)

5、SpotSound 发布细粒度音频时间定位模型:插入 Timestamp Token,短事件定位 mIoU 最高提升 27.0%

浙江大学、上海 AI Lab 与上海交大团队提出 SpotSound,一种面向长音频事件时间定位的 Audio-Language Model,并入选 ACM MM 2026。模型通过在音频 Token 序列中显式插入时间戳 Token,让模型直接学习 “什么声音在什么时候发生”,同时加入负样本训练以减少不存在事件的时间戳幻觉。SpotSound 现登陆了 Hugging Face 平台。如果你有较长的录音文件,可以提交给他们,并描述你所寻找的内容,他们会帮你记录下时间戳信息。

https://loiesun.github.io/spotsound/

https://huggingface.co/spaces/hugging-apps/spotsound-temporal-grounding

( @SpotSound)

02 有亮点的产品

1、Anthropic PBC 正在洽谈收购实时生成式 AI 公司 Decart AI,交易金额约为 60 亿美元

据彭博社报道,知情人士透露,Anthropic PBC 正在洽谈收购人工智能初创公司 Decart AI,交易金额约为 60 亿美元(现汇率约合 405.41 亿元人民币)。

知情人士表示,目前双方尚未最终敲定交易,谈判仍有破裂的可能。由于涉及私人谈判,这些人士要求匿名。

Decart 致力于帮助 AI 开发者充分发挥各种不同芯片的性能,同时也专注于生成式视频领域。该公司使用所谓的「世界模型」(world models),能够对实时视频画面进行即时修改。

https://decart.ai/

@IT 之家)

2、LiveKit Agents 上线 Expressive Mode:LLM 自动生成 TTS 表达标记,按上下文调整情绪与语气

LiveKit 在 Agents 框架中推出 Expressive Mode,用一层统一的表达控制机制连接 LLM 与不同 TTS 模型。开启后,LLM 会根据当前对话上下文自动生成情绪、语气、非语言声音和停顿等标记,再由 LiveKit 转换为不同 TTS Provider 对应的格式。

https://livekit.com/blog/making-voice-agents-sound-human-with-expressive-mode#try-the-live-demo

@LiveKit

03 有态度的观点

1、Sandbar CEO Mina Fahmi:AI 可穿戴的未来是语音,但不应该一直监听

AI 可穿戴设备正在越来越多地把「持续监听」当作默认设计,但 Stream 戒指背后的 Sandbar 选择了另一条路:语音应该成为人与 AI 交互的入口,但什么时候开始听,应该由人来决定。 TechCrunch 在最新一期 Equity 播客中介绍了这一思路。

Stream 通过按键通话来捕捉想法、提醒和待办,而不是持续录音。Sandbar CEO Mina Fahmi 认为,要让 AI 可穿戴真正进入日常生活,关键不是让设备无时无刻都在感知,而是「让人始终掌握控制权」。

这背后其实是两种 Voice AI 产品哲学的分歧:一种希望 AI 永远在线、主动感知;另一种则认为,语音足够自然,但交互边界必须足够明确。

对可穿戴设备来说,真正重要的问题可能已经不是「能不能一直听」,而是「什么时候应该听」。

https://techcrunch.com/video/why-stream-ring-maker-sandbar-says-the-future-of-ai-wearables-is-voice/

( @Techcrunch )

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流