AI测试 Runway 发布「界面世界模型」Solaris ,不生成代码、实时渲染可交互 App;Sesame 开源 TurnBench,14 套轮次系统无一做到又快又准丨日报

RTE开发者社区 · 2026年09月02日 · 24 次阅读

本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、AI 视频生成公司 Runway 发布首个「界面世界模型」Solaris:不用生成代码,直接逐帧实时生成可交互 App 和网页

AI 视频生成公司 Runway 发布 Solaris,并将其定义为首个 Interface World Model(界面世界模型)。它不再走「LLM 生成 HTML / CSS / JavaScript → 浏览器执行」的路线,而是把界面本身当作一个持续生成的世界:用户点击、拖拽或输入后,模型直接生成下一帧 720p 画面,让图片本身成为可以实时交互的应用。

  • 界面不再由预写代码决定: Solaris 持续接收点击、拖拽等操作作为下一帧生成条件,同一个初始画面可以根据用户行为产生此前没有被开发者预先定义过的交互。

  • 基于 Runway Gen-4.5 改造成实时引擎: 团队先将视频模型改造成逐帧自回归生成,再把多步去噪蒸馏到少量步骤,并让模型在自身生成结果上继续训练,以维持长时间交互中的画面一致性。

  • 语言模型负责「想」,世界模型负责「画」: LLM 判断用户意图、场景应该如何变化以及何时切换状态,Solaris 则负责把这些决定实时渲染成连续界面,实现推理与视觉生成分工。

  • 用户研究中优于代码生成界面: Runway 将 Solaris 与 Claude Opus 5 生成的代码界面进行 30 组交互对比、收集近 7500 次判断;在指令遵循上 Solaris 获得 61% 偏好,代码界面为 24%,在交互自然度上则为 71% 对 21%。

Solaris 目前仍处于研究阶段,可申请抢先体验;稳定文字生成、长时间一致性、可信信息约束和无障碍兼容仍是待解决问题。

https://runway.com/news/research/introducing-solaris

2、实时语音 AI 公司 Inworld AI 开源 TTS 评测工具 Open TTS Eval:不只报一个 WER,而是把音频、ASR 转写和评分过程全部留档

实时语音 AI 公司 Inworld AI 开源 Open TTS Eval,希望解决 TTS Benchmark 中「同一模型、同一数据集,不同团队却能测出不同结果」的问题。工具会把每次评测使用的声音、合成配置、原始音频、ASR 转写、文本规范化方式、阈值和逐样本结果保存在同一目录,让开发者可以从最终分数一路追溯到具体哪条语音出了问题,而不是只得到一个无法复现的平均值。

  • 把评测协议本身也纳入结果: WER/CER 会受到 ASR 模型、文本规范化和失败样本处理方式影响,Open TTS Eval 因此把这些配置与每条样本结果一起保存,并支持查看「参考文本 vs。 ASR 实际听到的内容」。

  • 不试图用一个总分定义 TTS 好坏: 首版同时评测 WER/CER、静音与削波、响度、语速、尾部杂音、元音异常延长,并可加入 NISQAv2 和说话人相似度;Inworld 特别强调,低 WER 并不代表声音自然。

  • 附带 100 条专门「找茬」的英语测试语料: 包括残句、打断、重复词、嵌套引语和长台词等容易让 TTS / ASR 出错的内容,用于在大规模评测前快速暴露明显问题。

  • 首版已接入多家 TTS 服务: 内置 Inworld、ElevenLabs 和 Hume 的生成适配器,其他 TTS 系统也可以直接提供音频清单接入;评测完成后可生成完全离线、可检查的 HTML 报告。

https://inworld.ai/blog/introducing-inworld-tts-open-evaluation-toolkit

3、Tontaube 发布流式 TTS 模型 Tontaube V1:单张 RTX 5090 首段音频约 200ms,权重可本地部署

AI 音频平台 Tontaube 发布 Tontaube V1,一款采用分层音频编码建模和有限上下文机制的流式 TTS 模型。模型由 4 个从语义到声学逐级生成的预测器组成,总参数约 2.9B,可在单张消费级 GPU 上运行;官方在 RTX 5090 上测得首段音频约 200ms,单路生成 RTF 为 0.08,约为实时播放速度的 12.5 倍。

  • 长文本生成不需要无限增长上下文: 模型只保留上一段、当前段和少量下一段文本,并持续丢弃更早内容,让输入上下文在长篇语音生成过程中保持固定规模。

  • 先决定「说什么、说多久」,再逐级补声音细节: 第一阶段生成语义音频表示并确定整句话长度,后续三个较小模型再补充声学细节,希望把更多算力集中到决定韵律和内容的部分。

  • 支持参考音频复刻与多种朗读风格: 可使用最长约 60 秒参考音频进行声音条件控制,目前主要面向英语和德语,同时提供西班牙语、法语、意大利语、荷兰语和葡萄牙语输入,以及有声书、对话和 Agent 三种风格。

https://craitech.io/blog/tontaube-v1-model-card

4、实时语音 AI 公司 Gradium 发布新版实时 TTS 模型:TTFA 中位数 216ms,电话号码、邮箱等复杂文本准确率达 81%

实时语音 AI 公司 Gradium 发布新版实时 TTS,并直接替换为平台默认模型,重点同时解决 Voice Agent 里常见的低延迟与复杂文本准确性问题。新版在 Coval 测试中 TTFA P50 为 216ms,比上一版快 170ms;同时在 Gradium 自建的 500 条「高难文本」测试集中取得 81.0% 通过率,覆盖电话号码、邮箱、IBAN、订单号、日期等容易读错的内容,无需开发者提前做文本改写或额外规范化。

  • 延迟不仅更低,也更稳定: 480 次测试中 TTFA 的 P75-P25 区间只有 30ms;相比之下,Cartesia Sonic 3.6 的中位数为 454ms,区间为 165ms。

  • 重点优化 Voice Agent 里的结构化信息朗读: 评测覆盖英语、德语、法语、西班牙语和葡萄牙语共 500 条文本;Gradium 通过率 81.0%,高于 Cartesia Sonic 3.6 的 75.1%、ElevenLabs v3 Conversational 的 65.4%、Inworld Realtime TTS-2 的 61.5% 和 Fish Audio S2.1 Pro 的 49.5%。

  • 不再要求开发者手工做文本规范化: 模型会自行判断金额、电话号码、邮箱和参考编号应该如何发音,Studio 与生产 API 也走同一套输入链路,避免 Demo 和线上效果不一致。

https://gradium.ai/blog/gradium-tts-latency-and-accuracy

5、对话式 AI 公司 Sesame 开源语音轮次评测基准 TurnBench:测试 14 套系统后发现,没有一个能同时做到「快、准、少误触」

对话式 AI 公司 Sesame 发布并开源 TurnBench,用来专门评估 Voice Agent 在对话中什么时候该说、什么时候该等、什么时候该被打断。相比只测 VAD 或「用户是否说完」,TurnBench 把真实对话里的轮次变化拆成结束发言、打断、附和和句中停顿等事件,并同时衡量召回率、误触率和决策延迟;官方还开放了排行榜、对话可视化和开发集自助评分。

  • 数据集专门为轮次交互而录制: 包含约 30 小时双通道英语对话、154 段会话、106 名配音员,覆盖闲聊、任务协作、教学、争论、叙事等 6 类场景;另提供 104 小时训练集。

  • 不只看「识别对不对」,还看「什么时候决定」: EOT 任务会处罚把句中停顿误判成说完,打断任务则会处罚把「嗯嗯」「对」等附和声误判成真正抢话,并记录 P10/P50/P90 决策延迟。

  • 14 套系统实测暴露出明显速度—准确率权衡: VAP 在 EOT 和打断两项中表现领先,但打断决策接近 1 秒;部分约 200ms 就能响应的系统则更容易误触。Sesame 的结论是,目前还没有系统能同时做到低延迟、低误报和高召回。

  • 传统 VAD 远远不够: 简单能量 VAD 虽然响应很快,但很容易把停顿、附和或背景声音当成轮次变化,说明 Voice Agent 的轮次判断需要结合语音韵律、语义和上下文,而不只是检测「有没有声音」。

https://www.sesame.com/blog/turnbench

02 有亮点的产品

1、前 Bose、依视路陆逊梯卡高管创立 AI 助听眼镜公司 Legato:完成 1200 万美元种子轮,嘈杂环境语音清晰度提升 40%

听力科技初创 Legato 完成 1200 万美元种子轮融资,并首次公开 AI 助听眼镜 Legato Frames。产品面向轻度至中度听力损失人群,将助听能力直接集成进日常眼镜:AI 实时区分背景噪音与人声,只增强语音信号,公司称在嘈杂环境下的语音清晰度相比传统助听器提升 40%;开放式耳部设计配合双扬声器定向传声,续航最长 16 小时,预计 2026 年秋季上市。

  • 核心团队来自 Bose 与依视路陆逊梯卡: 创始人 Mehul Trivedi 曾领导 Bose Frames 项目,后在依视路陆逊梯卡参与 Meta Ray-Ban 智能眼镜业务;联合创始人 Steve Romine 曾负责 Bose 助听器部门,后任 Audicus COO。

  • 路线不同于传统定向助听器: Legato 不只是把麦克风朝向某个方向,而是利用 AI 实时做「人声 / 环境噪音」分离,再针对语音进行增强,重点解决餐厅等复杂声场中的听清问题。

  • 把助听器做成普通眼镜形态: 团队自研声学系统、信号处理栈和机械结构,希望降低传统助听设备在成本、佩戴不适和医疗器械外观上的使用门槛。

@AING 硬迹)

2、日本 franky 推出可穿戴 AI 日志设备 Mori:自动检测对话并记录,把一天整理成个人日志

日本公司 franky 推出可穿戴 AI 日志设备 Mori,用户佩戴后无需每次手动开启录音,设备检测到说话即可自动开始记录,再由 AI 完成转写、分类和总结,把工作交流、朋友聊天、旅行感想和临时想法整理成一段段可回顾的记录,并在每天晚上进一步汇总成个人日志。

  • 从「手动录音」改成自动捕捉对话: Mori 支持语音自动触发,无需每次掏出手机点击录制;设备可连续录音 24 小时以上,待机超过 7 天,并提供 30 小时以上的加密本地存储,重新连接蓝牙后可自动同步。

  • 不只做转写,还会重新组织一天: App 会把内容整理成时间线、摘要和个人日志,并从对话中提炼关键信息、待办事项和个人感悟;用户还可以基于这些长期记录继续向 AI 提问。

  • 设备支持多种佩戴方式: 可作为手表、夹扣或项链佩戴,并通过双麦克风、波束成形和降噪来改善嘈杂环境中的收音。

  • 强调录音隐私: 音频会在设备端加密,官方称完成转写后删除,也不会用于训练 AI;同时提供一键静音,用户可随时停止记录。

Mori 已开放购买,首发优惠为 399 美元,包含设备、1 年无限量订阅和磁吸表带。

https://mori.to/

https://x.com/yuakasaka/status/2094209288038469769

(@yuakasaka@X)

3、开发者打造「会回信」的手写 AI 笔记本:在页面上写字,Claude 直接在旁边批注、讨论和出题

独立开发者 tokentrillionaire 基于 Daylight DC-1 护眼平板,打造了一款创新的手写 AI 学习应用。

在交互体验上,用户可以像使用实体笔记本一样随手手写提问,Claude 则会在页面的合适位置以统一的手写风格「落笔作答」;阅读 PDF 或电子书时,圈画重点即可让 Claude 即时生成笔记、展开探讨,甚至根据材料现场出题测评。

技术实现也颇具巧思:应用没有采用传统的全屏截图传输方案,而是仅上传产生变动的笔迹向量数据,交由模型判断「回复内容与落笔坐标」,最终在本地渲染呈现。配合 Prompt 缓存技术,单轮交互成本仅需几美分。

该应用目前主要基于 DC-1 开发,但已兼容支持手写笔的 Android 平板,iPad 版本也在移植中。

https://www.reddit.com/r/ClaudeAI/comments/1vxqbzs/i_built_a_handwriting_notebook_app_where_claude/

(@tokentrillionaire@Reddit)

03 有态度的观点

1、💡 陈沁:AI 正在拆散岗位分工,经验者接手更多年轻人原有任务

脉策科技首席经济学家陈沁依据截至 2026 年 8 月的 7.4 亿条招聘数据,观察大模型进入工作场景后的岗位变化。他指出,越容易被大模型加速的职业,市场需求下降越明显;低工资、低经验的年轻人受到的冲击更大,有经验的中高职位需求则相对稳定。

陈沁认为,岗位减少不等于任务消失。编程、产品设计、测试和客户沟通等职责开始被重新组合,原本集中在某个职业里的任务也被分散给更多岗位。例如,程序员要参与产品和测试,产品经理、数据分析师甚至 HR 也开始承担编程任务。

招聘数据还显示,新的任务组合更强调现场操作、具身手艺、标准流程和出错后果。公司组织趋于扁平后,一部分年轻人的入口岗位消失,职场中坚借助大模型接过这些任务,同时需要处理更多种类的工作并承担更大责任。

陈沁测算,2026 年招聘需求因大模型应用减少 5.2%,另有 18.6% 的岗位任务组合已与三年前完全不同。他的核心判断是,大模型降低了学习和切换任务的成本,企业把工作拆给多名专业人员的收益随之下降。

数字生产领域开始出现一人完成多道工序的「鲁滨逊」式工作者,但这种模式仍依赖稳定的电力、网络和算力,也尚未扩展到全部行业。他建议先从招聘需求和任务重组这些可观察变化出发,不急于把局部现象推演成统一结论。

@APPSO

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考

暂无回复。
需要 登录 后方可回复, 如果你还没有账号请点击这里 注册