本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Cartesia 发布 TTS 模型 Sonic-3.6:支持 44 种语言,重点提升跨语言翻译与语音自然度,Artificial Analysis 榜单排名第一

Cartesia 发布 Sonic-3.6 TTS 模型,重点提升 44 种语言下的语音自然度,并称这是其目前最逼真的 TTS 版本。相比三个月前发布的 Sonic-3.5,新版本根据开发团队反馈进行了底层模型改进,并在 Artificial Analysis 的 Provider Voice Streaming 和 Controlled Voice Streaming 两项榜单中均排名第一。此外,在 Voice of India 的印地语 General TTS 榜单中,上一代 Sonic-3.5 当前排名第 3,Bradley-Terry Elo 为 1072,Win Rate 为 59%。目前 Sonic-3.6 已开放 Beta 测试。

Sonic 3.6 英文版:自然的停顿和填充词

Sonic 3.6 用印地语和英语对话:印地语和英语之间的切换非常流畅

测试链接:

https://www.cartesia.ai/sonic

Voice of india:

https://voiceofindia.ai/leaderboards

( @Cartesia)

2、ElevenLabs 正式推出 MCP:支持在 Claude 中直接创建、配置和管理 Voice Agent

ElevenLabs 正式推出 MCP,将 ElevenAgents 的管理能力接入 Claude 等 MCP Client。开发者可以直接通过自然语言创建和修改 Voice Agent,无需在本地安装 ElevenLabs MCP Server。

( @Elevenlabs)

3、Fish Audio 推出 MCP:接入 Claude、Codex CLI、Cursor 与 Windsurf,支持语音生成和音频转录

Fish Audio 推出 MCP,将语音能力直接接入 Claude、Codex CLI、Cursor 和 Windsurf 等 Agent 与开发工具。开发者可以通过统一 Endpoint 在现有工作流中搜索 Voice、生成语音、转录音频,并查询账户使用情况,无需切换到 Fish Audio 平台单独操作。

( @Fish Audio)

02 有亮点的产品

1、Giga 为 Voice Agent 平台推出实时合成语音检测:通话过程中识别 AI 生成语音,可触发二次验证

Giga 在其语音智能体平台上线实时合成语音检测能力,可在客服通话进行过程中持续分析来电者音频,并判断对方是否为 AI 生成语音。该能力直接运行在现有语音平台内,无需上传完整录音或额外搭建检测链路,检测结果可用于触发加强身份验证、人工接管、敏感操作限制或欺诈分析。

https://giga.ai/news/synthetic-voice-detection

2、Wispr Flow 完成 2.8 亿美元 Series B 融资,估值 20 亿美元:预览首款自研语音识别模型 Canto,专为真实环境而设计,嘈杂环境 WER 降至 5%–10%

Wispr Flow 完成 2.8 亿美元 Series B 融资,投后估值达到 20 亿美元,本轮由 Menlo Ventures 领投,累计融资额达到 3.61 亿美元。同期,公司预览首款自研语音识别模型 Canto,重点针对噪声、风声、重口音、多语言混说等真实语音输入环境优化。

https://wisprflow.ai/post/series-b

( @Wispr Flow)

3、印度儿童科技初创公司 Wippi 完成 120 万美元种子轮融资:无屏 AI 语音设备支持儿童与故事角色双向对话

印度儿童科技初创公司 Wippi 完成 120 万美元种子轮融资,由 12 Flags 领投,Warmup Ventures、Ventana Ventures 和 Ruvento Ventures 跟投。公司面向 4–8 岁儿童开发无屏 AI 语音陪伴设备,让孩子通过语音与故事角色对话、提问并参与剧情走向。

( @Wippi)

4、具身交互模型企业 CyboPal 完成数亿元融资:首款桌面机器人终端集成实时交互模型,支持语言 + 手势控制

具身交互模型企业 CyboPal(江苏细胞壁智能科技有限公司)完成数亿元融资,由东方富海领投,联想之星、天启资本等机构跟投,心流资本 FlowCapital 担任财务顾问。本轮资金将用于首款 Desktop Robotic Terminal 的量产交付,以及具身交互系统迭代。

独家|CyboPal 完成数亿元融资,打造消费级具身智能的「交互模型底座」

( @Z Potentials)

5、苹果被曝正开发带摄像头的 AirPods:深度集成 Visual Intelligence,支持 Siri 环境感知

据 MacRumors 报道,从 macOS Tahoe 26.7 测试版的相关视频线索来看,苹果正在开发带摄像功能的 AirPods,这款产品的开发进度已接近上市阶段。

演示画面显示,耳机搭载的摄像头能够采集佩戴者视野内的环境画面,交由视觉智能(Visual Intelligence)处理,配合 Siri 识别周边物体、解答相关问题或是记录环境信息。系统还会在头发等异物遮挡耳机摄像头时发出提示,提醒用户移除遮挡,保障环境识别效果。目前该硬件尚未正式对外发布。

据 MacRumors 报道,macOS Tahoe 26.7 测试版中曝光的一段视频显示,苹果公司目前正在研发一款配备摄像功能的 AirPods 耳机,且该产品似乎已接近量产准备阶段。

演示视频显示,这款耳机的内置摄像头可将佩戴者眼前的视觉信息实时传输至「视觉智能」(Visual Intelligence)系统,并通过 Siri 回答用户关于周围环境、物体的各种提问,或是直接保存相关信息。此外,当头发或其他物体遮挡住 AirPods 的摄像头时,设备会自动发出提醒,提示用户清理遮挡物,以确保环境识别的准确性。

截至目前,苹果官方尚未正式发布该产品。

@MacRumors

03 有态度的观点

1、黄仁勋:AI 工厂正在成为一种可投资的基础设施资产

英伟达 CEO 黄仁勋在署名文章中表示,公司与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 建立合作关系,创建独立融资平台,计划逐步调动超过 5000 亿美元的第三方资本建设 AI 基础设施。

他把 AI 工厂定义为一套包含加速计算、网络、系统软件、AI 框架与开发者生态的平台,而非单一芯片。语言、视觉、语音、生物学、物理 AI 和机器人模型可以共享同一套基础设施;客户需求变化时,设备也可以重新部署给其他云、运营商或企业。CUDA 的持续优化则会提高已部署设备在生命周期内的性能与效率。‘

在 AI 领域,计算就是收入。

黄仁勋强调,超过 5000 亿美元是多个平台未来计划调动的第三方资本总额,不是英伟达收入、单个基金规模或对单一客户的承诺。金融机构将分别评估客户、需求、利用率、现金流和残值,再独立决定是否融资。在部分项目中,英伟达可能提供最高 25% 的残值支持,并逐项评估。

这项有限支持用于补充独立承销;黄仁勋以设备可交换、全球通用、能通过软件升级和重新部署为理由,解释金融机构为何可以把 AI 计算设施视为长期生产性资产。

( @APPSO)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流