图片

开发者朋友们大家好:

这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@koki、@ 鲍勃

01 有话题的技术

1、OpenAI 发布 GPT-Live 语音模型:全双工架构,支持后台委派 GPT-5.5 深层推理

OpenAI 推出新一代语音模型 GPT-Live,现已内置于 ChatGPT。该模型采用全新的全双工架构,支持音视频与文本的高并发连续交互,并可将深度推理任务异步委派给后台的 GPT-5.5 模型。此更新彻底解决了传统级联式与轮次式语音系统响应延迟高、易受静音误判打断的技术瓶颈。

图片

图片

图片

该模型现已面向全球 ChatGPT 用户逐步推出,GPT-Live-1 默认提供给 Go、Plus 和 Pro 用户,GPT-Live-1 mini 默认提供给免费用户;API 接入通道已开放开发者注册。

博客链接:

https://openai.com/zh-Hans-CN/index/introducing-gpt-live/

API 申请通道:

https://openai.com/form/gpt-live-1-in-the-api/

( @OpenAI\@X)

2、MOSS 开源 0.9B 端到端多说话人 ASR 模型:支持 128k 上下文与 90 分钟超长音频转录

MOSS 发布 MOSS-Transcribe-Diarize-0.9B 语音转录模型。该模型采用端到端自回归生成架构,将 ASR、说话人分离(Diarization)与时间戳预测统一建模,彻底解决了传统级联系统(如 WhisperX)在长音频场景下的误差传播与时间戳漂移问题,在 0.9B 参数量级下实现了对超长复杂会议音频的结构化转写。

此外,MOSS 还同步发布了面向复杂英语场景的语音识别模型 MOSS-Transcribe。该模型针对标准英语、多样口音、低声耳语等真实场景进行了专项优化,在复杂英语语音识别任务中表现更加稳定和精准。

https://github.com/OpenMOSS/MOSS-Transcribe-Diarize

(@ 模思智能)

3、香港中文大学等提出实时全模态服务系统 LiveServe:引入交互感知调度与 KV 缓存预加载,音频首包延迟降低至多 2.21 倍

图片

香港中文大学等研究团队提出专为全模态大语言模型实时语音交互设计的新型服务系统 LiveServe。该系统突破了传统分阶段执行引擎各自孤立调度的局限,引入全局交互平面,通过实时感知客户端播放进度和打断信号,动态调整推理调度与键值缓存管理。实验表明,LiveServe 在保障多轮对话流畅度的同时,大幅度降低了无效计算,并显著压低了首包延迟。

论文链接:

https://arxiv.org/pdf/2606.22983

(@ 机智流)

4、蚂蚁灵波发布世界模型 LingBot-World 2.0:采用 14B/1.3B 双版本架构,支持小时级实时交互生成

图片

图片

蚂蚁灵波正式发布开源世界模型 LingBot-World 2.0,实现了秒级世界加载与小时级持续交互生成。该模型通过引入双智能体架构与混合注意力机制,解决了长时序世界模型中常见的 KV Cache 爆炸与逻辑崩溃问题,支持实时文本事件注入与物理法则自演化,标志着交互式世界模型从「分钟级测试」向「长时序运行」的范式演进。

图片

图片

( @APPSO)

02 有亮点的产品

1、Beambox 获同创伟业独家投资:电子吧唧年营收破千万,集成 AIGC 与惯性交互

图片

图片

深圳消费科技品牌 Beambox 宣布完成新一轮融资,由同创伟业独家投资。公司成立仅一年多,核心产品「电子吧唧」(动态电子徽章)年营收已突破千万元,成功打入日本、东南亚及北美市场。本轮资金将用于 AI 智能体系列新品研发、交互性能迭代及全球品牌营销。

@AING 硬迹)

03 有态度的观点

1、Decagon CEO:开源模型和前沿模型不是零和竞争

图片

美国 AI 初创公司 Decagon CEO Jesse Zhang 日前发布了一篇题为「Everyone is wrong about open source AI in the enterprise」的文章,提出了一个反直觉的论断:

在企业级 AI 市场,开源模型与闭源模型之间并不存在此消彼长的竞争关系,而是同一条产品生命周期中的两个不同阶段

Zhang 以自家公司为例:Decagon 目前约 90% 的工作负载运行在开源模型上,但这并非出于成本考量,而是因为客户服务场景对延迟极为敏感,需要经过大量微调的小型快速模型,而前沿闭源模型在微调灵活性上无法满足这一需求。

他将这一路径概括为「闭源主导发现,开源接管生产」——企业在探索一个全新用例时,倾向于选用能力最强的前沿模型;等到用例完全成熟、输入分布稳定、失效模式明确之后,再将任务迁移至经过专项微调的轻量开源模型。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、Demo Day\@Physical AI Camp,与 16 家 Voice First AI 硬件团队面对面!7.16 上海丨超音速计划 2026

像《Her》那样完美的语音 AI 硬件从未真正到来,但它正在被拆解成一个个真实的产品:会议转录硬件、桌面机器人、AI 挂坠、个人记忆设备、亲子 AI 潮玩……这一期 Physical AI Camp 的 Builder,正在给出属于自己的答案。

7 月 16 日,WAIC 世界人工智能大会前夕,我们将在上海世博天地举办 Demo Day @ Physical AI Camp,16 家「Voice First」AI 硬件团队将迎来第一次集体亮相。

如果你正在关注 Voice AI、Physical AI、多模态 AI 或智能硬件,或者只是好奇 AI 离开屏幕后,会最先住进哪些真实产品里,欢迎来到现场,一起体验真实 Demo,也和 Builder、投资人、生态伙伴面对面交流。

📍 上海|7 月 16 日(周四)13:30–17:30

点击链接或扫码报名👇@ 所有人 

图片

https://www.rtecommunity.dev/t/t_SmZTTDkbYlhxSm

详情链接🔗:

Demo Day@Physical AI Camp,与 16 家 Voice First AI 硬件团队面对面!7.16 上海丨超音速计划 2026

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流