本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Qwen 发布 Qwen-Audio-3.0-ASR-Flash:上下文不「断片」、听得准行业词、热词加多也不乱、边识别边润色、一套模型听懂 30 种语言

阿里云千问发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型,针对长音频上下文一致性、行业词识别、热词定制和语音润色进行升级。模型支持从音频上下文中持续更新识别记忆,可直接输出结构化文本,并通过阿里云百炼平台提供 Flash、Filetrans 和 Streaming 三种调用版本。

语音识别结果: 공개매수는 경영권 확보를 위해 주식을 장외에서 정해진 가격으로 사는 건데 공개매수가 발표되면 해당 주식의 주가는 보통 상승합니다。

(公开收购是指为了取得经营权,在场外按照指定价格购买股票。公开收购发布后,相关股票的价格通常会上涨。)

语音识别结果: Apakah perasaan anda apabila pertama kali mengetahui anda akan mewakili sekolah ataupun negeri ke peringkat kebangsaan?

(当你第一次得知自己将代表学校或所在州参加全国级别的活动时,你是什么感受?)

语音识别结果: Vậy thì qua những cái kinh nghiệm, qua những cái bài học, qua những cái mà anh đúc kết được thì anh nghĩ đâu là yếu tố quan trọng nhất để có thể xây dựng cũng như là giữ vững được một cái đội nhóm hiệu quả?

(根据你的经验、教训和总结,你认为建立并长期维持一支高效团队,最重要的因素是什么?)

Qwen-Audio-3.0-ASR-Flash:

https://help.aliyun.com/zh/model-studio/non-real-time-speech-recognition-for-fun-asr-flash

Qwen-Audio-3.0-ASR-Flash-Filetrans:

https://help.aliyun.com/zh/model-studio/fun-asr-recorded-speech-recognition-http-api

Qwen-Audio-3.0-ASR-Flash-Streaming:

https://help.aliyun.com/zh/model-studio/fun-asr-realtime-websocket-api

Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教

(@Qwen)

2、Thinking Machines 发布 Inkling-Small 开放权重模型:276B 总参数,12B 激活参数,1M token 上下文窗口

Thinking Machines Lab 发布开放权重模型 Inkling-Small,定位为 Inkling 的轻量版本,在四分之一模型规模下保持接近 Inkling 的性能表现。该模型采用混合专家架构,拥有 2760 亿总参数和 120 亿激活参数,支持文本、图像、音频原生推理以及最长 100 万 token 上下文窗口。

https://x.com/thinkymachines/status/2082885869426631032

( @ThinkingMachinesLab)

3、SpaceXAI 发布 Grok Voice Think Fast 2.0 语音模型:实时语音智能体延迟优化,支持工具调用与多语言交互

SpaceXAI 发布 Grok Voice Think Fast 2.0,面向实时语音智能体场景升级语音理解、生成和任务执行能力。该模型通过 Voice API 提供端到端语音交互,支持 WebSocket 实时通信、函数调用、搜索和 MCP 工具接入,可用于客服、语音助手和实时 Agent 应用。

https://x.ai/news/grok-voice-think-fast-2

(@SpaceXAI)

4、智元发布 WITA-Omni Preview 具身全模态大模型:DailyOmni 得分 85.21 登顶,Thinker–Talker–Actor 统一感知与动作生成

智元发布具身原生全模态大模型 WITA-Omni Preview,在 DailyOmni 全模态理解榜单中以 85.21 分登顶,并在八项细分指标中六项排名第一。模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。

全球第一,智元 WITA-Omni Preview 登顶 DailyOmni 全模态理解榜单

(@ 智元 AGIBOT)

5、Kalpa Labs 推出通用音频模型:探索统一语音理解与生成的 Audio Foundation Model

Kalpa Labs 发布流式对话 TTS 模型公测,并展示其 Generalist Audio Model(通用音频模型)路线,希望通过统一音频基础模型覆盖语音生成、语音理解、环境音和音乐等任务。团队认为当前音频领域仍类似语言模型早期阶段,依赖多个专用模型组合,未来需要能够理解上下文并执行复杂指令的通用音频模型。

https://x.com/KalpaLabsAI/status/2082867854547005954

https://kalpalabs.ai/blog/towards-generalist-audio-models

(@KalpaLabsAI)

02 有亮点的产品

1、语音编程助手 SKI :本地运行连接 Claude Code、Codex 等智能体,支持语音控制与会议记录

SKI 是一款面向开发者的语音编程助手,将语音交互能力接入 Claude Code、Codex、Hermes 等编码智能体。用户可以通过语音描述需求,让智能体执行代码任务并以语音方式反馈结果;同时支持本地运行、离线转录和会议记录,无需 API Key。

https://heyski.io/

(@SKI)

2、Smallest.ai 完成 1300 万美元 A 轮融资:发布 Voice 4.0 架构与 Hydra 语音模型,推进端到端实时语音智能体

Smallest.ai 完成 1300 万美元 A 轮融资,由 Seligman Ventures 领投,Sierra Ventures 与 3one4 Capital 参投,累计融资超过 2100 万美元。公司同步发布 Voice 4.0 架构与 Hydra 异步语音 - 语音模型,将语音智能体处理流程从传统 ASR → LLM → TTS 串行链路改为「听、思考、动作、回答」并行处理。

https://www.aol.com/articles/smallest-ai-gets-21-million-203000000.html

(@Smallest.ai)

3、Simile AI 完成 1 亿美元 A 轮融资:构建人类行为基础模型,用生成式智能体模拟真实决策

Simile AI 宣布完成 1 亿美元融资,由 Index Ventures 领投,Hanabi Capital、Bain Capital Ventures、A* 等机构及 Andrej Karpathy、Fei-Fei Li 等个人投资者参与。公司从生成式智能体研究起步,正在构建用于预测人类行为的基础模型和企业级模拟平台,通过 AI 智能体模拟消费者、员工和群体决策过程。

https://x.com/simile_ai/status/2082873889407827980

https://www.simile.ai/

(@Simile AI)

4、Friend 发布 AI 陪伴项链 Friend 2.0:提供固定但随机化的声音和人格设定,支持长期记忆与主动交互

备受争议的 AI 伴侣设备 Friend 推出新一代 AI 陪伴硬件 Friend 2.0,将原本通过手机文字消息交互的 AI 项链升级为可直接语音回应的可穿戴设备。新版本加入内置扬声器、个性化声音和增强记忆能力,定位为长期陪伴型 AI,而非生产力助手。

https://x.com/friend/status/2082827641338658873

(@Friend)

03 有态度的观点

1、马斯克批评 Anthropic 切书脊,要求 SpaceXAI 扫描时不得切断书脊

埃隆·马斯克在 X 上表示,他已要求 SpaceXAI 团队把处理过的珍稀书籍保存在一座图书馆,并采用不破坏装帧的方式扫描,而不是切断书脊后将书页送入高速扫描设备。

这条回应针对 AI 公司大批采购旧书作为训练数据引发的争议。404 Media 报道称,书籍数据库公司 ISBNdb 正向 AI 公司提供大批量图书采购服务,理由是旧书内容不含生成式 AI 产生的文本;《华盛顿邮报》此前援引诉讼文件称,Anthropic 的「巴拿马计划」曾批量购买纸质书,拆除装帧、扫描书页后回收原书。

这项要求只针对珍稀书籍:团队需保留实体原书,再完成数字化处理。

( @APPSO)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、招聘:内容增长 · 开发者方向(Content & Developer Growth)

职责

负责国内外开发者的 KOL 与内容增长,让我们的产品借声量持续被发现、讨论和推荐。

你会做的事

能力需求

加分项

简历请投递给 RTE 小助手(添加微信 Creators2022 并备注岗位名称)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流