本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、蚂蚁开源百灵首个原生多模态模型 Ling-3.0-flash-VL:引入视觉反馈闭环,Agent 可边执行边观察并持续修正

蚂蚁开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构扩展,支持文本、图像和视频输入;相比一次性的视觉理解,重点是把视觉反馈加入 Agent 执行链路,让模型按照「观察 → 行动 → 验证 → 修正」 持续完成前端开发、GUI 操作和长视频处理等任务。

https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8

2、蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0 轻量版:1.3B 世界模型可在消费级单卡 GPU 实时运行

蚂蚁灵波进一步开放实时交互世界模型 LingBot-World 2.0 的完整模型体系,新增 1.3B 轻量实时版、14B 双向模型和 14B 因果预训练模型。其中 1.3B Small 将原本偏多卡部署的实时世界生成能力压缩到消费级单张 GPU,降低开发者本地运行和实验世界模型的硬件门槛。

https://github.com/Robbyant/lingbot-world-v2

3、Meta FAIR 提出 3B 参数语音生成模型 Text-AB:免强制对齐统一跨语言配音与全双工对话合成

Meta FAIR 提出 Text-Audiobox(Text-AB),一个 3B 参数的语音生成模型,在同一套框架中统一跨语言配音、全双工对话合成和情绪化全双工对话合成。相比此前 Audiobox,Text-AB 不再依赖文本与语音的强制对齐和显式时长预测,而是直接从原始文本学习何时说、说多久以及两名说话人的互动节奏。

https://ai.meta.com/research/publications/alignment-free-text-audiobox-for-voice-dubbing-and-full-duplex-dialogue-synthesis/

4、美团首次披露「智播」数字人直播全链路:流式生成语音手势,视觉 Token 压缩 75% 面向万路并发

美团技术团队系统披露数字人直播产品 「美团智播」 背后的工程方案,覆盖数字人形象生成、动作生成、语音与手势实时协调、视觉大模型推理优化以及多智能体内容生产。相比单独优化数字人画质,其重点是把「边说边动、实时互动」做到可持续运行,并进一步压低大规模直播的推理成本。

https://tech.meituan.com/2026/09/03/meituan-Digital-Human-practice.html

5、南洋理工 S-Lab 等提出 3D 世界模型 Puffin-World:同时生成画面、深度与物理状态,可直接重建三维场景

南洋理工大学 S-Lab、密歇根大学、北京交通大学和 ACE Robotics 等团队提出统一多模态世界模型 Puffin-World。与主要预测后续 RGB 画面的视频世界模型不同,它在同一框架中显式建模物理、几何和外观三种世界状态,让模型不仅生成「接下来看到什么」,还同时预测场景深度、重力方向和相机在真实世界中的姿态,并可直接重建 3D 场景。

https://kangliao929.github.io/projects/puffin-world/

02 有亮点的产品

1、智能眼镜影目科技完成 C3 轮融资:C 轮累计近 10 亿元,已启动上市筹备

智能眼镜影目科技(INMO) 完成 C3 轮融资,由四川振兴科创基金领投,静安资本、市北高新、广州产投等跟投。继今年完成 C1、C2 轮后,公司 C 轮累计融资近 10 亿元,并已正式启动上市筹备;新资金将继续投入新一代空间智能硬件和自研 INMO AIOS

(@ 硬氪)

2、前 OPPO、一加团队创办的 APOM 推旅行 AI 眼镜 L'Atitude 52°N:用影像、AI 导览和实时翻译覆盖旅行全程,众筹近 40 万美元

前 OPPO、一加团队创办的 APOM,将首款 L'Atitude 52°N 定义为旅行 AI 眼镜,而非通用型智能眼镜。产品售价 399 美元起,围绕旅行中的第一视角记录、AI 导览和实时翻译做功能取舍;Kickstarter 已获得 735 名支持者,累计众筹约 34.6 万欧元,折合约 40 万美元。

https://www.kickstarter.com/projects/latitude52n/latitude-52n-smart-ai-glasses-for-travel-and-adventure/

(@ 硬氪)

3、前 Sora 核心研究员联手 DreamWorks 联合创始人创业:将自研 AI 视频模型,直接瞄准电影制作人

据 The Information 报道,前 OpenAI 视频研究员、Sora 核心成员 Bill Peebles 正与 DreamWorks 联合创始人 Jeffrey Katzenberg、Dropbox 前 CFO Sujay Jaswa 共同筹备一家新的 AI 视频公司。新公司尚未公布名称,计划自行训练视频生成模型,并直接面向电影制作人和影视制作场景

(@The Information)

4、印度语音 AI 公司 Sarvam 升级实时 STT API:用户没说完即可返回转写,通话中可动态切换语言和模式

Sarvam 更新 Realtime Speech-to-Text API,新接口基于 saaras:v3-realtime / saaras:v4-realtime,与旧版流式 WebSocket 最大的区别是开始在用户说话过程中持续返回部分转写结果(partial transcript),而不是等一个完整话轮结束后才给出文本,更适合 Voice Agent 打断判断和实时字幕。

https://docs.sarvam.ai/api/api-guides-tutorials/speech-to-text/realtime-streaming

5、OpenAI 升级 ChatGPT Voice:语音中可调用 GPT-5.6 / GPT-6 Astra 推理,模型与推理强度控件和文字聊天打通

OpenAI 更新 ChatGPT Voice:实时语音对话仍由 GPT-Live-1 / GPT-Live-1 mini 驱动,但遇到网页搜索或更复杂的推理任务时,Voice 现在可以进一步调用 GPT-5.6 或 GPT-6 Astra。用户选择模型和推理强度时,也开始沿用文字聊天中的同一套控件。

https://help.openai.com/en/articles/6825453-chatgpt-release-notes

(@OpenAI)

03 有态度的观点

1、字节 AI 产品「猫箱」前负责人梁琛奇:AI 娱乐真正的新平台,必须让用户「消费时也烧 Token」

梁琛奇提出了一个很反直觉的判断:如果 AI 只是让原有内容生产得更便宜,它大概率不会诞生一个新的消费平台。 因为内容形态没变,用户最终还是会回到已经拥有分发、推荐和用户关系的旧平台里——AI 做出来的短剧,最后仍然可能在红果、抖音里被消费。

真正的 AI Native 娱乐体验,应该让 AI 不只参与生产,也参与每一次消费。用户每次点击、输入、互动,系统都要实时生成新的内容或反馈,也就是消费过程本身持续「烧 Token」。只有这样,产品提供的才不是更便宜的旧内容,而是一种过去不存在、旧平台也无法直接承载的互动体验。

这也解释了为什么他更看好「边玩边生成」的内容,而不是单纯把短剧、漫画或视频换成 AI 制作:AI 娱乐的机会不在生产工具升级,而在消费方式本身被重新发明。

(@ 晚点 LatePost)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📣 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~

今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工 + 交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。

🔥 贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~

🎫 目前大会门票限时免费开放!

想来现场听技术、认识同行的开发者,可以先把票薅上

📅 时间:10 月 23–24 日

📍 地点:北京悠唐皇冠假日酒店

限免结束后将恢复收费,建议先报名占位 👇

定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流