本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、OpenAI 将全双工语音模型 GPT-Live-1 开放 API:可边听边说,复杂推理交给 GPT-6 Astra 等后端模型

OpenAI 正式将 GPT-Live-1 开放至 API。该模型此前已于 7 月用于 ChatGPT Voice,这次开发者可以直接用它构建全双工 Voice Agent:模型持续同时处理输入和输出音频,不必等待用户明确结束一轮对话,就能决定继续听、回应、等待或处理打断。

https://openai.com/index/introducing-gpt-live-1-in-the-api/

https://x.com/OpenAIDevs/status/2098099269551149398

2、HeyGen 开源实时数字人参考框架:GPT-Live-1 负责全双工语音,LiveAvatar 驱动数字人,HyperFrames 动态生成交互界面

HeyGen 与 OpenAI 合作推出并开源一套 GPT-Live-1 × LiveAvatar × HyperFrames 实时 AI 应用参考架构,把全双工语音、实时数字人和动态可视化界面串进同一条交互链路。仓库默认提供一个日语教师 Demo,但核心代码被刻意做得足够精简,开发者可以替换角色 Prompt、工具和界面组件,改造成其他实时 Agent。

https://github.com/heygen-com/liveavatar-gpt-live-demos

3、Agora 开源 GPT-Live-1 会议助手 Agora Meeting Copilot:AI 可加入多人会议,并通过语音直接操作共享看板

Agora 开源 Agora Meeting Copilot,展示如何把 GPT-Live-1 作为一个真正的 AI 参会者加入多人实时会议。它不仅能听会、回答问题,还可以把语音指令转成工具调用,直接创建、移动和修改共享看板中的任务,同时保存带说话人信息的会议转写并生成会后纪要。

https://github.com/zicojiao/agora-meeting-copilot

GPT‑Live‑1 + Agora 实战教程:做一个能参会、操作看板的 AI 助手

4、Hugging Face 发布 speech-to-speech v1.0.0:统一开源语音 Agent 的 Realtime 服务端,本地可直接接 OpenAI Realtime 客户端

Hugging Face 发布开源语音 Agent 框架 speech-to-speech v1.0.0。首个大版本把原本分散的 VAD、STT、LLM、TTS 和实时通信能力整理成统一 Realtime 引擎,开发者现在可以在本地启动一套兼容 OpenAI Realtime 核心事件集的语音 Agent 服务,并通过 WebSocket 或 WebRTC 接入现有客户端。

https://github.com/huggingface/speech-to-speech/releases/tag/v1.0.0

5、Hume AI 发布语音复制排行榜:11 款模型克隆同一批 25 个声音,真人盲评「到底像不像本人」

Hume AI 推出公开的 Voice Replication Leaderboard,专门评估声音克隆模型能否保留原说话人的身份特征。团队让 11 款声音克隆模型分别复制相同的 25 个声音,再由真人听众判断生成声音与原始声音是否「像同一个人」,排行榜和音频样本已在 Hugging Face 开放试听。

https://huggingface.co/spaces/HumeAI/voice-replication-leaderboard

https://hume.ai/blog/introducing-the-hume-voice-replication-leaderboard

02 有亮点的产品

1、KAIST 提出流式音频 - 视觉语音令牌增强框架 AV-STE:用唇动修复噪声中的语义令牌,无需重训语音模型

KAIST 团队提出 AV-STE,面向全双工语音对话模型的流式音视频前端。它不直接重建更干净的语音波形,而是结合噪声音频和说话人的唇部视频,恢复被背景噪声或其他说话人干扰破坏的 Mimi 语义令牌,再把修复后的令牌直接送入 Moshi 等语音模型;下游模型本身保持冻结,无需重新做多模态训练。

https://github.com/bellagodiva/av-ste

2、开源 ESP32 Voice Agent 框架 ElatoAI 接入 Boson Higgs Realtime:支持端到端实时语音与用户打断

开源实时语音 Agent 框架 ElatoAI 新增对 Boson AI Higgs Realtime 的支持。开发者现在可以让 ESP32 等硬件通过 ElatoAI 的边缘服务器接入 Higgs Realtime,在原有 OpenAI、Gemini、Grok、ElevenLabs 和 Hume 等后端之外,再增加一套端到端实时 Speech-to-Speech 模型。

https://github.com/akdeb/ElatoAI

https://www.boson.ai/higgs-realtime

3、时空壶发布 W4 Plus AI 翻译耳机:一副耳机同时做面对面对话、电话/会议双向翻译和媒体字幕

时空壶(Timekettle)推出 W4 Plus AI 翻译耳机。相比上一代 W4 主要服务面对面对话和现场听译,新款把系统电话、视频会议和音视频内容翻译纳入同一设备:用户只需自己佩戴耳机,即可在电话、Zoom、Microsoft Teams、微信、WhatsApp 等场景进行双向实时翻译,对方无需安装 App 或佩戴额外设备。

W4 Plus 已于 9 月 6 日通过 Timekettle 官网和 Amazon 开售,完整功能版售价 379 美元;另有 299 美元订阅版,电话、媒体翻译和高级 AI 功能需订阅解锁。

https://www.timekettle.co/products/w4-plus-ai-interpreter-earbuds

4、企业语音服务公司星语智能完成千万级天使轮融资:AI 400 热线日服务超 10 万分钟,部分项目完成率超 90%

聚焦企业 AI 400 热线的星语智能完成千万级天使轮融资。公司将端到端语音模型与多智能体协作应用到传统企业客服热线,让 AI 不只负责问答,还可以继续完成业务判断、流程办理和工单闭环;目前已在餐饮、出行、家电、快消、保险和政务等行业落地。

@36 氪)

03 有态度的观点

1、AI 客服公司 Fin 的《2026 AI Sentiment Report》:AI 客服的信任不能靠用户「习惯」,而要主动设计

Fin 的《2026 AI Sentiment Report》发现,人们确实正在变得更接受 AI 客服:49% 的受访者表示自己对 AI 的整体体验积极,比 2025 年提高 9 个百分点;在看到 AI Agent 实际解决一个客服问题后,这一比例进一步升至 74%。但作者 Maia Bridi 提醒,因为接触越来越多而产生的接受,并不等于企业真正赢得了信任。

用户真正担心的,是 AI 出错后谁负责、复杂问题能否灵活判断,以及需要时能不能迅速找到真人。调查中,最能提高信任的两个设计分别是:需要时可以轻松升级给人工,以及一开始就明确告知正在与 AI 交互。

AI 客服的信任不是一个等待用户慢慢适应的问题,而是一个产品设计问题。 身份披露、人工兜底、责任机制和例外处理能力,都应该直接被设计进 Agent 的工作流里。

https://www.intercom.com/blog/the-2026-ai-sentiment-report/

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~

今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工 + 交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。

🔥 贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~

🎫 目前大会门票限时免费开放!

想来现场听技术、认识同行的开发者,可以先把票薅上

📅 时间:10 月 23–24 日

📍 地点:北京悠唐皇冠假日酒店

限免结束后将恢复收费,建议先报名占位 👇

定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流