本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、微软发布批量语音识别模型 MAI-Transcribe-2:新增说话人分离与逐词时间戳,1 小时音频约 10 秒完成转录

Microsoft AI 发布批量语音识别模型 MAI-Transcribe-2。相比 MAI-Transcribe-1.5,新版本新增说话人分离、逐词时间戳和可配置转写风格,语言覆盖从 43 种扩展到 60 种,同时把 1 小时音频的模型推理时间从约 20 秒缩短至 10 秒

Okay, listen. I have this absolutely unhinged idea, and I need you to roll with it. Help me make an agent that will literally buy tickets for my favorite band the second they are available.

模型:

https://microsoft.ai/models/mai-transcribe-2/

博客:

https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/

2、港中深、NUS、NVIDIA 等开源交互式视频世界模型体系 SolarWM:统一 143 万段视频训练流程,覆盖 5B–33B 四种模型

香港中文大学(深圳)、新加坡国立大学、香港中文大学、香港科技大学、NVIDIA、UCLA、微软亚洲研究院等团队开源 SolarWM,一套覆盖数据整理、模型训练到长时实时推理的交互式视频世界模型体系。项目将 143 万段异构视频统一成同一套交互训练格式,并用一套训练框架适配 Wan2.2、LTX-2.5 和 MiniMax-H3,形成四个 5B–33B 规模的世界模型。

https://junchao-cs.github.io/SolarWM-Web/

3、通义千问团队、华中科技大学开源自动驾驶视觉语言基础模型 Qwen-Drive-1.0:4B 模型统一 3D 感知、视觉问答与运动规划

通义千问团队与华中科技大学推出并开源 Qwen-Drive-1.0,一款面向自动驾驶的 4B 视觉语言基础模型。它以 Qwen3.5-4B 为共享视觉语言骨干,在不改动原有模型架构的情况下外挂鸟瞰图(BEV)感知头和规划专家,让同一套模型表示同时服务于 3D 环境感知、驾驶场景问答和车辆运动规划。

https://github.com/QwenLM/Qwen-Drive-1.0

02 有亮点的产品

1、YC F25 智能眼镜公司 AirCaps 推出音频研究实验室:开发全流式远场语音模型,可在消费级硬件端侧运行

YC F25 智能眼镜公司 AirCaps 正式推出 AirCaps Audio Research Lab,开始将其面向真实线下环境积累的音频能力扩展成一套全流式语音与音频模型体系,覆盖目标说话人提取、远场语音增强、说话人区分与识别、重叠语音分离和语音转文本。与主要针对干净近场音频优化的语音系统不同,AirCaps 将重点放在远距离、混响、低信噪比、多人同时说话等真实声学环境。

https://research.aircaps.com

2、YC F25 个人 AI 助手 Caddy 从桌面语音控制转向 iMessage:可主动读取工作上下文并替用户执行任务

两位前 Loom AI 产品负责人创立的 YC F25 项目 Caddy,正在把产品从最初的「用语音控制电脑」转向常驻 iMessage 的个人 AI Agent。用户无需下载独立 App,只需像给联系人发消息一样与 Caddy 对话,它会持续学习用户的工作方式和关注事项,并连接 Gmail、Google Calendar、Slack、Linear、Todoist 等工具完成后续操作。

https://caddy.app/

3、OpenAI 发布旗舰模型 GPT-6 Astra:强化电脑操作与长任务执行,Codex 可跨上下文保存并检索工作记忆

OpenAI 发布新一代旗舰模型 GPT-6 Astra,重点提升电脑操作、软件工程、浏览器使用和复杂专业任务执行能力。相比 GPT-5.6 Sol,新模型不仅在多项推理与代码评测上提升,更明显的变化是能够更快完成跨应用、多步骤工作流,并在长任务中更稳定地理解用户意图和持续接受中途调整。

https://openai.com/index/gpt-6-astra/

4、前 OpenAI CTO 创立的 AI 公司 Thinking Machines Lab 洽谈至少 10 亿美元融资:投前估值至少 400 亿美元,Accel 拟领投

前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 正在洽谈新一轮至少 10 亿美元融资,投前估值至少 400 亿美元,现有投资方 Accel 正洽谈领投,Nvidia 也讨论过参与。若交易完成,这家成立不到两年的 AI 公司估值将较 2025 年首轮融资时的 100 亿美元投前估值增长至约 4 倍。

(@The Information)

5、Google 上线 Gmail Live、Docs Live 与 Keep Live:把实时语音对话扩展到邮件查询、文档创作和笔记整理

Google 正式将此前在 I/O 预览的 Gemini 音频能力带入 Gmail、Docs 和 Keep,推出 Gmail Live、Docs Live 与 Keep Live。相比传统语音输入只负责「把说的话变成文字」,新的 Live 入口支持用户与应用持续对话,并直接基于当前 Workspace 内容完成搜索、写作和整理任务。

https://blog.google/products-and-platforms/products/workspace/voice-features-gmail-docs-keep/

03 有态度的观点

1、奥特曼:OpenAI 将开发人形机器人

OpenAI CEO 山姆·奥尔特曼在《Sources with Alex Heath》播客中表示,OpenAI「一定会做人形机器人」,同时也会研发其他形态的机器人。这是他首次明确确认 OpenAI 将开发自有的人形机器人本体。

奥尔特曼解释称,现有的门、键盘、设备和厨房都按照人类身体构造,因此人形结构有利于机器人适配现实环境。但在数据中心等场景,OpenAI 会选择更适合具体任务的非人形设计。

他认为,机器人的外形最终仍要服务于「让机器人工作的大脑」。面对行业对机器人外形路线的不同判断,奥尔特曼把机器人的「大脑」放在机身之前。

他表示,OpenAI Robotics 的基础是机器人硬件研究与机器学习的共同设计;团队招聘方向涵盖全栈硬件、系统、机器学习和运营,目标是让模型能在真实物理环境中完成任务。

他把「每个人都拥有能完成各种任务的个人机器人」描述为长期目标,短期重点则是支持数据中心和其他基础设施建设。OpenAI 今年早些时候已组建内部机器人团队,并招聘机电执行器、仿真管线和数据收集等方向的工程师。

@APPSO

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、🎲 北京招募 AI 主题《Talk With》桌游主持人!

10 月底,我们又要在北京开玩 AI 主题桌游《Talk With|聊天能解决的事儿》啦,这次想从开发者社区里招募几位桌游主持人,一起把现场带起来~

作为主持人,你主要需要:

不用是资深桌游玩家,我们会提前带大家熟悉完整玩法,帮助你开启主持人之路~如果你对 AI / Voice AI / 开发者社区 / 桌游感兴趣,就非常适合来!

📍地点:北京

📅时间:10 月底

想来当主持人的朋友,可以直接私聊我报名~这次不只来玩一局,而是来当那个让整桌人都玩嗨的人 😎

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流