本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、AI 视频生成公司 Runway 发布首个「界面世界模型」Solaris:不用生成代码,直接逐帧实时生成可交互 App 和网页

AI 视频生成公司 Runway 发布 Solaris,并将其定义为首个 Interface World Model(界面世界模型)。它不再走「LLM 生成 HTML / CSS / JavaScript → 浏览器执行」的路线,而是把界面本身当作一个持续生成的世界:用户点击、拖拽或输入后,模型直接生成下一帧 720p 画面,让图片本身成为可以实时交互的应用。

Solaris 目前仍处于研究阶段,可申请抢先体验;稳定文字生成、长时间一致性、可信信息约束和无障碍兼容仍是待解决问题。

https://runway.com/news/research/introducing-solaris

2、实时语音 AI 公司 Inworld AI 开源 TTS 评测工具 Open TTS Eval:不只报一个 WER,而是把音频、ASR 转写和评分过程全部留档

实时语音 AI 公司 Inworld AI 开源 Open TTS Eval,希望解决 TTS Benchmark 中「同一模型、同一数据集,不同团队却能测出不同结果」的问题。工具会把每次评测使用的声音、合成配置、原始音频、ASR 转写、文本规范化方式、阈值和逐样本结果保存在同一目录,让开发者可以从最终分数一路追溯到具体哪条语音出了问题,而不是只得到一个无法复现的平均值。

https://inworld.ai/blog/introducing-inworld-tts-open-evaluation-toolkit

3、Tontaube 发布流式 TTS 模型 Tontaube V1:单张 RTX 5090 首段音频约 200ms,权重可本地部署

AI 音频平台 Tontaube 发布 Tontaube V1,一款采用分层音频编码建模和有限上下文机制的流式 TTS 模型。模型由 4 个从语义到声学逐级生成的预测器组成,总参数约 2.9B,可在单张消费级 GPU 上运行;官方在 RTX 5090 上测得首段音频约 200ms,单路生成 RTF 为 0.08,约为实时播放速度的 12.5 倍。

https://craitech.io/blog/tontaube-v1-model-card

4、实时语音 AI 公司 Gradium 发布新版实时 TTS 模型:TTFA 中位数 216ms,电话号码、邮箱等复杂文本准确率达 81%

实时语音 AI 公司 Gradium 发布新版实时 TTS,并直接替换为平台默认模型,重点同时解决 Voice Agent 里常见的低延迟与复杂文本准确性问题。新版在 Coval 测试中 TTFA P50 为 216ms,比上一版快 170ms;同时在 Gradium 自建的 500 条「高难文本」测试集中取得 81.0% 通过率,覆盖电话号码、邮箱、IBAN、订单号、日期等容易读错的内容,无需开发者提前做文本改写或额外规范化。

https://gradium.ai/blog/gradium-tts-latency-and-accuracy

5、对话式 AI 公司 Sesame 开源语音轮次评测基准 TurnBench:测试 14 套系统后发现,没有一个能同时做到「快、准、少误触」

对话式 AI 公司 Sesame 发布并开源 TurnBench,用来专门评估 Voice Agent 在对话中什么时候该说、什么时候该等、什么时候该被打断。相比只测 VAD 或「用户是否说完」,TurnBench 把真实对话里的轮次变化拆成结束发言、打断、附和和句中停顿等事件,并同时衡量召回率、误触率和决策延迟;官方还开放了排行榜、对话可视化和开发集自助评分。

https://www.sesame.com/blog/turnbench

02 有亮点的产品

1、前 Bose、依视路陆逊梯卡高管创立 AI 助听眼镜公司 Legato:完成 1200 万美元种子轮,嘈杂环境语音清晰度提升 40%

听力科技初创 Legato 完成 1200 万美元种子轮融资,并首次公开 AI 助听眼镜 Legato Frames。产品面向轻度至中度听力损失人群,将助听能力直接集成进日常眼镜:AI 实时区分背景噪音与人声,只增强语音信号,公司称在嘈杂环境下的语音清晰度相比传统助听器提升 40%;开放式耳部设计配合双扬声器定向传声,续航最长 16 小时,预计 2026 年秋季上市。

@AING 硬迹)

2、日本 franky 推出可穿戴 AI 日志设备 Mori:自动检测对话并记录,把一天整理成个人日志

日本公司 franky 推出可穿戴 AI 日志设备 Mori,用户佩戴后无需每次手动开启录音,设备检测到说话即可自动开始记录,再由 AI 完成转写、分类和总结,把工作交流、朋友聊天、旅行感想和临时想法整理成一段段可回顾的记录,并在每天晚上进一步汇总成个人日志。

Mori 已开放购买,首发优惠为 399 美元,包含设备、1 年无限量订阅和磁吸表带。

https://mori.to/

https://x.com/yuakasaka/status/2094209288038469769

(@yuakasaka@X)

3、开发者打造「会回信」的手写 AI 笔记本:在页面上写字,Claude 直接在旁边批注、讨论和出题

独立开发者 tokentrillionaire 基于 Daylight DC-1 护眼平板,打造了一款创新的手写 AI 学习应用。

在交互体验上,用户可以像使用实体笔记本一样随手手写提问,Claude 则会在页面的合适位置以统一的手写风格「落笔作答」;阅读 PDF 或电子书时,圈画重点即可让 Claude 即时生成笔记、展开探讨,甚至根据材料现场出题测评。

技术实现也颇具巧思:应用没有采用传统的全屏截图传输方案,而是仅上传产生变动的笔迹向量数据,交由模型判断「回复内容与落笔坐标」,最终在本地渲染呈现。配合 Prompt 缓存技术,单轮交互成本仅需几美分。

该应用目前主要基于 DC-1 开发,但已兼容支持手写笔的 Android 平板,iPad 版本也在移植中。

https://www.reddit.com/r/ClaudeAI/comments/1vxqbzs/i_built_a_handwriting_notebook_app_where_claude/

(@tokentrillionaire@Reddit)

03 有态度的观点

1、💡 陈沁:AI 正在拆散岗位分工,经验者接手更多年轻人原有任务

脉策科技首席经济学家陈沁依据截至 2026 年 8 月的 7.4 亿条招聘数据,观察大模型进入工作场景后的岗位变化。他指出,越容易被大模型加速的职业,市场需求下降越明显;低工资、低经验的年轻人受到的冲击更大,有经验的中高职位需求则相对稳定。

陈沁认为,岗位减少不等于任务消失。编程、产品设计、测试和客户沟通等职责开始被重新组合,原本集中在某个职业里的任务也被分散给更多岗位。例如,程序员要参与产品和测试,产品经理、数据分析师甚至 HR 也开始承担编程任务。

招聘数据还显示,新的任务组合更强调现场操作、具身手艺、标准流程和出错后果。公司组织趋于扁平后,一部分年轻人的入口岗位消失,职场中坚借助大模型接过这些任务,同时需要处理更多种类的工作并承担更大责任。

陈沁测算,2026 年招聘需求因大模型应用减少 5.2%,另有 18.6% 的岗位任务组合已与三年前完全不同。他的核心判断是,大模型降低了学习和切换任务的成本,企业把工作拆给多名专业人员的收益随之下降。

数字生产领域开始出现一人完成多道工序的「鲁滨逊」式工作者,但这种模式仍依赖稳定的电力、网络和算力,也尚未扩展到全部行业。他建议先从招聘需求和任务重组这些可观察变化出发,不急于把局部现象推演成统一结论。

@APPSO

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流