本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、哔哩哔哩 IndexTTS 团队开源 IndexTTS-2.5:支持 5 种语言与跨语种情感复刻,推理速度快于 IndexTTS-2

IndexSpeech 团队正式开源 IndexTTS-2.5,针对 IndexTTS-2 的多语言、情绪表现和推理效率进行优化。新版本支持中文、英语、日语、西班牙语和阿拉伯语,并保留跨语种与音色情感解耦能力,同时新增语速控制和更细粒度的发音控制。

https://github.com/index-tts/index-tts

https://arxiv.org/abs/2601.03888

https://github.com/index-tts/index-tts2-5.github.io

( @IndexTTS)

2、VoiceHub 开源统一语音模型库:集成 34 个 TTS、23 个 ASR 与 11 个 VAD 后端

图片

开发者 Kadir Nar 发布 VoiceHub,将 TTS、ASR 和 VAD 模型整合到统一的推理、数据处理、训练与优化工作流中。项目当前包含 68 个模型集成,可通过统一 API 加载 Hugging Face 等来源的 checkpoint,也支持本地模型路径。

https://github.com/kadirnar/voicehub

https://kadirnar.github.io/voicehub/

(@kadirnardev)

3、苹果公开默声语音识别专利申请:光学读取面部微动,本地音频反馈延迟控制在 100ms 内

图片

苹果公开一项默声语音检测相关 PCT 专利申请 WO2026/159706A1,提出通过非接触光学传感器读取用户面部皮肤微运动,再利用神经网络解码为词序列,并生成音频反馈。该方案面向耳机和智能眼镜等穿戴设备,专利申请目前尚未获得授权。

Apple 20 亿美元收购「无声对话」公司 Q.ai,微表情识别无声指令;AI 玩具 FoloToy 连获数千万元融资丨日报

@21dB 声学人)

4、Cartesia 为 STT 模型 Ink-2 增加 Keyterm Prompting 与可配置 Turn Detection:单次最多传入 100 个关键词

Cartesia 为流式 STT 模型 Ink-2 上线两项新能力:Keyterm Prompting 用于提高专业术语、品牌名和人名等实体的转录准确率;Configurable Turn Detection 则允许开发者在更低响应延迟与更准确的端点判断之间进行调整。两项功能现已向所有 Ink-2 用户开放。

https://www.cartesia.ai/blog/keyterm-prompting/?utm_source=x

( @Cartesia)

02 有亮点的产品

1、西湖心辰完成数亿元 B+ 轮融资:持续研发扩散语言模型,迭代原生多模态实时互动产品

图片

西湖心辰完成数亿元人民币 B+ 轮融资,由广发信德领投,西湖创新投、武汉江豚基金、容亿投资、南通投管等机构跟投,58 产业基金等产业资本参与,蚂蚁集团、汤姆猫等老股东继续支持。融资资金将主要用于新一代扩散语言模型研发、原生多模态实时互动产品迭代及海外市场拓展。

(@ 西湖心辰)

2、CosyFlow:说得随意,写得漂亮

CosyFlow 基于 Qwen-Audio-3.0-ASR-Flash 模型,将语音转写与语义理解融为一体,开口即成可交付的内容。

语音键盘在转写基础上叠加语义理解与文本生成能力。日常表达中,自动过滤无意义的口语填充词,将零散想法整理为清晰结构;说话时的自我修正不会留下改口痕迹,只保留最终意图。工作场景中,口述即可生成邮件、工作汇报、会议纪要的格式与话术。

随记把记录能力延伸到更长的场景——会议、访谈、课堂等,支持实时录制与离线文件上传,根据声纹区分发言人,一键多语言翻译。录音结束后自动生成 AI 摘要与智能待办。

让每一句开口,都成为可沉淀的价值。

( @CosyFlow)

3、WAXAL 开放非洲多语言语音语料:覆盖 21 种语言,包含约 1250 小时 ASR 与 180+ 小时 TTS 数据

WAXAL 是 Google Research 与多家非洲高校和社区机构合作构建的大规模多语言语音语料库,论文版本覆盖 21 种撒哈拉以南非洲语言,面向 ASR 与 TTS 训练和研究。数据涉及的语言使用者合计超过 1 亿人。

https://modelscope.cn/datasets/google/WaxalNLP?wx=

4、腾讯混元发布 3D 世界的 Agentic 框架 WorldClaw:Agent 驱动开放世界 3D 生成,输出可编辑实例级资产

图片

图片

腾讯混元团队发布 WorldClaw,一套从开放文本生成大规模可探索 3D 世界的 Agentic 框架。系统采用 coarse-to-fine 流程,将生成拆分为意图分析与规划、全局地形生成、区域对象生成与放置三个阶段,同时保留全局地形结构与实例级可编辑 3D 资产。

https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw/

03 有态度的观点

1、数字生命卡兹克:学 AI 最重要的不是学 Prompt,而是先把「最不想干的事」扔给 AI

数字生命卡兹克近日分享了一套「从 0 开始,12 步学会用好 AI」的方法。他认为,很多人会天然觉得「用 AI 是一件很难的事情」,甚至因此不敢开始。但真正学会 AI,并不需要先掌握复杂的模型原理或 Prompt 技巧,而是直接从一件自己「最头疼、最不想干、最抗拒的事情」开始。

他的第一条建议甚至不是学怎么打字提问,而是:下载一个语音输入法,从此以后,跟 AI 发消息时就不要再打字了,直接用嘴进行表达。

接下来,把脑海里的事情「一股脑」说给 AI,按照【背景、痛点、需求】的框架描述,再让 AI 先不要干活,而是「用苏格拉底提问法向我提问,一次只问一个问题,直到你认为已经完全理解这件事」。

等 AI 问得差不多,再把和这件事相关的文档、表格、PPT、参考资料全部放进一个文件夹交给它,然后直接说:「这是我的所有文件,请你帮我直接完成吧,遇到必须由我决定的地方,再停下来问我。」

如果结果不满意,也不要马上觉得「AI 不行,然后自己去干了」,而是继续告诉 AI 哪里不对。哪怕自己说不清楚,也可以直接说:「我现在讲不出来具体原因,但我就是不喜欢,请你对比几个方向,一次问我一个问题,帮我把判断标准找出来。」

大概经过 2~3 轮,这件「最不想做的事」大概率就已经被 AI 做完了。

但真正关键的是最后一步:再让 AI 把刚才整个过程做成一个可以反复使用的 Skill。

这套方法背后的判断其实很直接:学 AI,不是学会更多 Prompt,而是先学会把自己的想法完整地说出来,再把一次次工作过程沉淀成 AI 可以重复执行的能力。

(@ 数字生命卡兹克)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、📌社区活动推荐|8 月 29 日 Unstructured Data Meetup 上海站

8 月 29 日,Unstructured Data Meetup 即将登陆上海!

Unstructured Data Meetup 以非结构化数据和 GenAI 为主题,面向开发者的技术分享线下聚会,该活动源自硅谷,由向量数据库领先者 Zilliz 创办。分享嘉宾将会介绍向量数据库,大模型、AI 应用、大数据等领域的话题。活动受众包括,AI 工程师,数据科学家,大数据工程师,AI 产品经理等群体。通过 Unstructured Data Meetup,让更多非结构化数据和 GenAI 开发者共聚一堂,共同探索非结构化数据和 Gen AI 的最新进展及演进方向。

报名倒计时丨 8 月 29 日 Milvus 社区 上海 Unstructured Data Meetup

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流