本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、语音数据公司 The Agentic Data Company 发布全双工对话数据集 Open Yap 1K:1000 小时真实双人对话,可免费用于商业训练

语音数据公司 The Agentic Data Company 发布全双工自然对话数据集 Open Yap 1K,收录约 1000 小时、1600 余场英语双人真实对话。与围绕指定话题轮流说话的数据不同,这套数据让朋友、家人和同事直接自由聊天,并将双方语音分别录制到独立声道,完整保留打断、重叠说话、附和、笑声和快速接话等真实互动现象,重点服务于全双工 Voice Agent 和实时语音模型训练。

https://huggingface.co/datasets/TheAgenticDataCompany/open-yap-1k

2、语音 AI 评测导航 Voice Benchmarks:集中整理 TTS、STT、LLM 与轮次结束检测基准

HappyRobot 工程师 Gonzalo Cordova 推出了开源平台 Voice Benchmarks。该平台汇总了分散在各处的语音 AI 评测资源,覆盖 TTS、STT、LLM 及 EoT(轮次结束检测)等环节,方便开发者按需挑选针对性的评测工具,而非仅参考单一综合榜单。项目依托社区 PR 持续共建,本质上是一个开放、动态维护的语音 AI Benchmark 索引库。

https://voicebenchmarks.com

3、厦门大学等开源统一语音模型 UniVoice:一个 LLM 同时做 ASR 与 TTS,用连续语音表征避开离散 Token 损失

厦门大学、上海创新研究院、上海交通大学和浙江大学研究团队开源 UniVoice,将原本通常分开训练的 ASR 与 TTS 统一进同一个 LLM 框架:语音识别采用自回归生成,语音合成采用流匹配,并直接使用连续语音表征连接两项任务,避免先把语音离散成 Token 带来的信息损失。UniVoice 以 SmolLM2-360M 为语言模型骨干,目前同时开放仅 TTS 版本和统一 ASR+TTS 版本。

https://univoice-demo.github.io/UniVoice/

4、尼泊尔语音实验室 Ampixa 开源微控制器 TTS 模型家族 sanoTTS:最小仅 29.4 万参数,3 美元 ESP32-S3 可完全离线实时合成

尼泊尔语音 AI 实验室 Ampixa Labs 开源超小型神经 TTS 模型家族 sanoTTS,模型规模覆盖 29.4 万至 227 万参数,包含 11 个声音、6 种语言。其核心变化是把完整的神经语音合成链路压缩到通用微控制器上,无需云端、GPU 或 NPU,即可在约 3 美元的 ESP32-S3 上离线运行。

https://tts.ampixa.com/sanoTTS/

5、字节跳动被曝基于 Seedance 开发实时空间视频世界模型:目标 20 FPS、约 50ms 响应,最快 10 月发布

据彭博社报道,字节跳动正在开发一款面向实时空间视频生成的世界模型,最快可能于 10 月发布,创始人张一鸣正在亲自协调内部资源推进项目。新模型将基于现有视频生成模型 Seedance 构建,目标是让用户通过语音或动作实时控制虚拟环境,并与 PICO 头显、直播、短剧和游戏等场景结合。

(@Bloomberg)

02 有亮点的产品

1、Google 为 Gemini 加入智能体式视频理解:模型主动决定看哪里、看多快,Token 最多降低 88%

Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体式视频理解。与过去按固定帧率(默认 1 FPS)把整段视频送入模型不同,Gemini 现在会根据问题主动决定查看哪一段、以什么帧率查看,以及读取画面、音频还是转写文本,只调取完成任务真正需要的信号。Google 称,在标准视频理解评测中,这种方式可让 Token 消耗最多降低 88%、分析成本最多降低 66%,准确率最高提升 7%,尤其适合数十分钟甚至数小时的长视频。

https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/

2、印度语音 AI 辅导平台 YoLearn.ai 获 ABP Education 种子轮投资:把学校教材直接接入可对话 AI 导师

印度语音优先 AI 辅导平台 YoLearn.ai 完成金额未披露的种子轮融资,由 ABP 集团旗下 ABP Education 领投。相比单纯扩张一款 AI Tutor,这轮合作更重要的变化是:ABP 旗下教育出版社 Headword Publishing 和 KIPS Learning 将把现有学校教材与 YoLearn.ai 的语音 AI 导师直接绑定,学生扫描课本中的二维码,就能围绕当前教材内容用语音提问,AI 一边回答、一边在交互式画板上画图和分步解题。

(@ 多知)

3、联想升级个人智能体天禧 AI 4.3:引入全双工自然语音交互,端侧 VAD + AEC 支持随时打断

联想上线个人智能体 天禧 AI 4.3,重点升级全双工自然语音交互:AI 播放语音时仍可持续监听用户,用户无需等待一轮回答结束即可直接插话;系统结合端侧 VAD 与 AEC 回声消除判断用户是否真正开始说话,并减少扬声器自身声音对麦克风输入的干扰。

(@ 联想官方)

4、印度企业 Voice AI 公司 Navana.ai 获 420 万美元 A 轮融资:覆盖 12 种印度语言、45 种方言,已处理超 1 亿分钟语音

印度 Voice AI 公司 Navana.ai 完成 4000 万卢比(约 420 万美元)A 轮融资,由企业家兼投资人 Ronnie Screwvala 领投,Antler India、Sharad Sanghi、Sandeep Singhal、Paula Mariwala 等参投。新资金将用于扩大银行、金融服务和保险行业部署,继续训练印度语言与方言语音模型,并开发 AI 联络中心和自动评测平台。

( @Navana.ai)

5、SoundHound AI 完成收购企业对话平台 LivePerson:从 Voice Agent 扩展到语音、网页、短信和社交消息全渠道

SoundHound AI 正式完成对企业对话 AI 公司 LivePerson 的收购。相比此前主要聚焦电话、车载、餐厅等语音场景,SoundHound 将把 LivePerson 的数字消息平台接入自研 Agent 系统 OASYS,让企业可以用同一套 Agent 同时处理语音、网页、移动端、SMS 和社交消息中的客户交互。

6、欧洲消费电子展 IFA 2026 智能眼镜路线分化:36g 无摄像头 AI 眼镜拿下设计创新奖,另一边继续卷 307 英寸虚拟大屏

IFA 2026 上,智能眼镜产品路线进一步分化:一类以 INMO GO3 为代表,把实时翻译、导航、提词和会议记录等 AI 信息直接叠加到视野中,重点做轻量化和全天候佩戴;另一类则以 RayNeo GT Max 为代表,继续强化大视场、高画质和空间显示,把眼镜做成随身虚拟屏幕。

(@INMO)

03 有态度的观点

1、《纽约客》John Cassidy:AI 就业冲击尚未按预言到来

《纽约客》专栏作者 John Cassidy 认为,生成式 AI 至今没有造成部分科技高管预言的大规模失业。美国 8 月新增 16.2 万个岗位,失业率维持在 4.1%;自 2023 年 8 月以来,月均裁员与解雇人数约为 170 万,与 2010 至 2019 年的平均水平接近。

应届大学毕业生的处境确实变差:这一群体的失业率从 2022 年 6 月的 4.2% 升至今年 6 月的 5.7%。Cassidy 指出,同期 22 至 27 岁、没有大学学位的年轻人失业率也在上升,远程办公让企业更不愿招聘需要现场带教的新人,因此目前还不能把变化单独归因于 AI。

McKinsey 的企业调查显示,部署 AI Agent 的大型企业比例从去年的 27% 升至 40%,但报告实际出现 AI 相关裁员的企业只有 14%,低于上一年预计会裁员的 32%。

Cassidy 以放射科和法律行业为例说明,许多岗位包含沟通、协调与复杂判断,短期内难被单一工具替代;他同时提醒,AI 正在压低法律服务收费,企业仍可能为维持利润率削减初级岗位,这段缓冲期应被用于调整税收、公共采购和就业支持政策。

(@APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~

今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工 + 交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。

🔥 贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~

🎫 目前大会门票限时免费开放!

想来现场听技术、认识同行的开发者,可以先把票薅上

📅 时间:10 月 23–24 日

📍 地点:北京悠唐皇冠假日酒店

限免结束后将恢复收费,建议先报名占位 👇

定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流