图片

开发者朋友们大家好:

这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@koki、@ 鲍勃

01 有话题的技术

1、NVIDIA 发布端侧世界模型 Cosmos 3 Edge :4B 参数混合 Transformer 架构,支持端侧五模态实时推理

NVIDIA 推出面向边缘计算的 4B 参数世界基座模型 Cosmos 3 Edge。该模型采用混合 Transformer 架构,旨在不牺牲模型能力的前提下,在边缘端设备上实现高吞吐、低内存占用端侧物理推理与机器人控制

HuggingFace:https://huggingface.co/collections/nvidia/cosmos3

( @blogs.nvidia)

2、Twelve Labs 发布视频 AI 智能体 Jockey:支持多视频库跨文件检索,由 Pegasus 与 Marengo 模型栈驱动

TwelveLabs 推出视频理解 AI 智能体 Jockey,目前处于研究预览阶段。该智能体通过将 TwelveLabs 的视听理解能力与 Claude 的逻辑推理能力相结合,可直接对大量视频资产的视听元素进行深度分析,自动化定位视频剪辑中的结构缺陷、视觉节奏偏差及内容覆盖缺口。

预览链接: 

http://twelvelabs.io/jockey

( @twelve_labs\@X)

3、谷歌发布 Gemini 3.5 Flash-Lite:350 tokens/s 极速响应,内置计算机使用工具赋能智能体交互

谷歌正式推出 Gemini 3.5 Flash-Lite 模型,主打极低延迟与高吞吐量交互,在 Artificial Analysis 评测中输出速度达到 350 tokens/s。该模型专为大规模智能体工作流设计,通过内置的计算机使用工具实现高频交互,在大幅降低高并发调用成本的同时,多项编码及智能体基准测试成绩超越前代模型及标准版 Gemini 3 Flash。

( @blog.google)

4、京东发布 JoyAI 实时语音交互与视频编辑模型

图片

京东在 WAIC 2026 发布 JoyAI-Talker 实时语音交互模型和 JoyAI-Video-Edit 实时视频编辑模型,补充其面向物理世界的多模态模型矩阵。

(@ 虎嗅 APP、@APPSO

02 有亮点的产品

1、3D 生成技术公司 Meshy 完成近 4 亿美元 B 轮融资:推出对话式 3D 智能体与图形学 +AI 视频「混合世界模型」架构,宣布下一步进军实时互动的多模态内容体验

图片

Meshy 宣布完成近 4 亿美元 B 轮融资,投后估值超 100 亿元人民币。公司在跑通 3D 资产生成商业化(ARR 突破 4000 万美元)的基础上,正式进军「实时互动的多模态内容体验」领域,推出基于图形学与 AI 视频混合渲染的技术路线。

(@ 极客公园)

2、三星联合 Google 发布 Galaxy AI 眼镜:支持原生手势识别,打通 Notes 会议记录与 SmartThings 边缘生态

图片

图片

三星(Samsung)联合 Google、Gentle Monster 及 Warby Parker 推出全新 AI 智能眼镜,由歌尔股份(Goertek)代工。该设备搭载 Google Gemini 助手,支持原生手势识别,并实现与三星 Notes 办公生态、SmartThings 智能家居及现代/起亚车载系统的深度跨端互联,定位为「核心边缘设备」以直接对标 Ray-Ban Meta。

( @XR Vision)

3、CapWords 发布 Speak 功能:基于实时图像识别的个性化口语练习,取代预设场景对话

CapWords 在其语言学习 App 中上线 Speak 功能,将传统的预设场景口语练习替换为:用户拍摄当前环境物体 → AI 识别 → 基于该物体生成个性化对话模拟。核心差异在于训练数据从通用语料库转向用户日常生活的实时输入。

( @DTD_STUDIOS\@X)

03 有态度的观点

1、黄震昕:SOTA 模型应该有自己的定价权

图片

月之暗面企业业务负责人黄震昕在接受 21 世纪经济报道采访时表示,前沿模型的价值不应只用低价衡量

这番回应针对 Kimi K3 发布后围绕定价、算力紧张和开源路线的行业争议。他表示,Kimi 会继续开源,但开源与闭源服务面向不同需求:需要私有化部署和微调的客户会选择开源模型,希望直接购买托管服务的客户则可能选择闭源服务,开源本身并不决定 Token 的质量和价格

黄震昕称,月之暗面把模型能力集中在编程、金融、法律和科学等专业任务,而没有同时扩张到娱乐、图片和视频生成。对于大模型无法彻底消除的幻觉问题,K3 会在 Agent Swarm 中加入事实核查子智能体,让另一个智能体复核输出,而不是把不确定信息直接交给用户

在商业化方面,他透露 Kimi 的企业收入中 API 调用占比最高,公司目前不做私有化部署。近期暂停新用户注册,是因为需求超过资源承载能力,团队优先保障付费用户体验,再通过模型效能优化和补充算力恢复服务。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、会议推荐:会议预告|第四届城市科学大会

图片

第四届城市科学大会旨在以城市科学为锚点,推动城市科学与人工智能、公共健康、社会治理、气候变化、认知科学、复杂系统等方向的交叉融合创新,搭建跨学科交流与合作的平台。大会将于 8 月 8 日至 9 日在香港科技大学(广州)举办。

邀请国内外高校与科研机构的专家学者作特邀报告,共同探讨应对城市复杂性挑战的前沿理念、创新技术与实践方案。

此外,大会还将举办 Urban Cup 2026 挑战赛,设置「城市具身智能与世界模型」、「城市科学 Vibe Research」、「城市社会模拟 AgentSociety」三大赛道,旨在探索 AI 时代城市科学研究的新范式、新方法与新应用。

入围决赛队伍将有机会在大会现场进行成果展示,并获得与国际著名城市科学学者当面交流探讨的宝贵机会。本届赛事受到清华大学 - 美团数智生活联合研究中心等合作方联合资助, 总奖金达 15 万元,并将为各赛道提供计算平台与必要的技术支持,诚邀智慧城市、城市科学、人工智能及计算社会科学等相关交叉领域的研究者、开发者与实践者积极参与。

图片

详情链接:

https://fi.ee.tsinghua.edu.cn/RSUSHD2026/

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流