图片

开发者朋友们大家好:

这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@koki、@ 鲍勃

01 有话题的技术

1、Vivix 发布 W1 与 A1 实时交互多模态模型:30B 激活参数,首帧延迟降至 300–600ms

多模态 AI 初创公司 Vivix 正式推出面向互动叙事的基座模型 W1 与面向交互角色的 A1,并开放 API。该系统实现单模型集成实时理解、交互与生成,在 30B 激活参数规模下将首帧渲染延迟控制在 300–600ms,并在一年内将系统推理与基础设施成本降低了两个数量级。

@Monolith 砺思资本、智能涌现)

2、OpenAI 发布企业级智能体平台 Presence:支持实时语音与文本交互,通过 API 集成第三方模型与工具

OpenAI 推出企业级智能体部署与管理平台 OpenAI Presence,专注于实时语音及文本工作流落地。该平台通过结合预置护栏策略、仿真评测工具与前线工程师(FDE)交付模式,解决智能体在生产环境中高并发实时交互的可靠性及策略更新问题。

( @venturebeat

3、OpenAI Codex 曝光实时语音智能体功能 Realtime Voice Mode:集成 Connectors 支持跨应用复杂任务执行

图片

OpenAI 被发现在 ChatGPT 代码中集成了 Codex Realtime Voice Mode。该功能将实时语音交互与 Codex 智能体相结合,使系统能够通过语音操控 Connectors 执行跨应用的复杂任务。

连接器与工具链调用:用户可通过语音触发 Connectors,直接操控 Slack、Spotify、文档、日历、网页浏览器、在线购物及外卖下单等第三方服务。

通用智能体定位:基于 Codex 智能体构建,将原本针对代码场景的能力扩展至通用自动化任务执行。

交互形态演进:此前在 Codex 应用中曾以 Orb 或 Pets 挂件形态曝光,目前尚未在 ChatGPT 桌面端公开发布。

竞品同步推进:Anthropic 也在为其 Opus 和 Sonnet 模型升级语音模式,同步支持 Connectors 与工具调用。

目前处于代码曝光阶段,具体上线时间未定。

@testingcatalog\@X

02 有亮点的产品

1、硬件初创公司 Augmental 开售 MouthPad 口腔触控板:通过舌头控制指针,厚度 1mm,售价 1400 美元

硬件初创公司 Augmental 正式在美国开售基于口腔佩戴的无线触控设备 MouthPad。该设备可将舌头与头部微动转化为计算机指针指令,帮助无障碍需求用户实现免手操作,定价 1,400 美元起。

目前已在美国开放预订,单机售价 1,400 美元,双机套餐售价 1,900 美元;用户需在本地完成 3D 牙科扫描并提交数据,定制设备将在 6 个月内完成发货。

( @augmentaltech\@X)

2、商汤 001 号员工「再创业」AI 陪伴,完成数千万种子轮

图片

AI 角色硬件公司酷奇奇科技(Coolqq)宣布完成数千万元种子轮融资。本轮融资由上海浦东人工智能种子基金领投,商汤科技、零以创投跟投,云杉资本 Spruce Capital 担任长期独家财务顾问。

酷奇奇的创始人徐持衡,是商汤科技 001 号员工,师从计算机视觉泰斗汤晓鸥教授,曾与团队共同开发商汤早期最重要的人脸识别技术。此后,他出任灵宇宙 CTO,主导 AI 教育产品「Ling」从概念到完整落地。

酷奇奇的核心产品「CookiePi 角色互动伙伴」是一款分布式多端 AI 互动产品。它由触发器 Cookie 和角色端 Pi 两部分组成,可适配玩偶、手办、家居等各种物理实体,让数字生命能够以具身形态存在于现实场景中。

多个 AI 互动伙伴可以融入家居各处,主动探索空间,陪用户聊天,也能即兴演剧,共同演绎日常生活。

@AING 硬迹)

3、Synthesia 发布 Roleplay 交互式培训系统:接入 OpenAI 推理引擎,集成自研 Avatar 与实时量化评分

图片

Synthesia 推出全新 Sessions 平台首款产品 Roleplay,支持员工与 AI 虚拟形象进行销售演示、绩效评估等高难度场景的实操模拟。该系统将底层 OpenAI 推理模型与自研音视频技术相结合,引入量化评分标准与性能分析层,推动公司业务从单纯视频生成向数据驱动的绩效管理平台转型。

( @TechCrunch)

03 有态度的观点

1、Vibe Coding 概念提出人 AK:用 10 分钟的交流,换取更懂你的大模型

图片

近日,OpenAI 联合创始人、前特斯拉 AI 总监、vibe coding 概念提出人安德烈·卡帕西(Andrej Karpathy)在社交媒体上分享了他与大模型互动的独门秘诀:不要试图写出完美的指令,去和它交谈,越乱越好。

卡帕西指出,当面对复杂任务时,人类往往因为「懒得打字」而无法向大模型提供足够的背景信息。他的解决方案极具颠覆性:坐在椅子上,切换到语音模式,然后开始长达 10 分钟的「闲聊」——没有任何逻辑,想到什么说什么,甚至夹杂着口误和废话。

令人惊奇的是,大模型展现出了极强的「去粗取精」能力。它们能够从这些混乱、冗长的语音碎片中,精准重构出用户内心深处的真实意图,并给出一个比用户初始想法还要清晰得多的结构化回应。一旦完成这一步,后续的合作就会变得顺畅无比,几乎不再需要反复修正。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、活动推荐|BUIDL_QUESTS 2026 深圳站

图片

图片

BUIDL_QUESTS 2026 是一场聚焦 AI × AI-Crypto 的全球创业大赛。从新加坡出发,途经亚洲和美国 12+ 座城市,最终回到新加坡举办全球总决赛(7 月 → 10 月)。

去年我们 BUIDL_QUESTS 2025 共吸引了 150+ 项目提交、4,000+ 报名者、2,500+ 线下参与者,覆盖 10 场线下活动 和 13 场线上 Workshop(累计 46,000+ 观看)。Top 10 团队登上 Demo Day 路演,其中赛后一支团队成功获得 Tier-1 VC 150 万美元种子轮融资。

今年的主题为 Autonomous Agent & Sovereignty(自主智能体与主权),设置 Autonomous Agents、Sovereignty、Agent Commerce、AI Hardware、OPC(超级个体)五大赛道,目前奖金池已达 $50K+(持续增加中)。

目前我们已经联合了 70+ 生态合作伙伴(包括 VC、社区、Crypto 公司、AI 公司、硬件企业、媒体及电视台),同时也与韩国、越南、泰国、英国、土耳其等多个国家和地区的合作伙伴共同开展全球宣发。

更多活动详情可参考官网:

https://openarena.to/zh/events/buidl-quests-2026

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流