本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、Bland 发布 Speech v3 语音引擎:基于 1 亿 + 真人通话数据训练

Bland 发布 Speech v3 语音模型,并将其定位为「人类语音引擎」。该模型基于超过 1 亿次真人通话数据训练,Speech v3 在 Audio Realism 榜单中超过 OpenAI、ElevenLabs 等语音模型,并已在 Bland 平台全面上线。

图片

测试:

https://www.bland.ai/speech

(@Bland.ai)

2、NVIDIA 发布端到端全双工语音模型 Nemotron VoiceChat-11B:首个支持实时工具调用的开源全双工模型

NVIDIA-NemotronLabs-VoiceChat-11B 是 NVIDIA 面向实时语音智能体开发的端到端全双工模型,可在同一场对话中完成语音监听、生成、打断处理和工具调用。该模型采用统一架构处理语音理解、转录、生成与工具执行,并针对实时 Voice Agent 场景进行优化。

https://modelscope.ai/models/nv-community/NVIDIA-NemotronLabs-VoiceChat-11B

(@ModelScope2022)

3、字节跳动 Seed 发布原生音视频全双工大模型:统一融合音频、视频与文本,实现边看、边听、边说

字节跳动 Seed 发布原生音视频全双工大模型 SeedRealtime,将音频、视频与文本融合到统一架构中,支持在连续多模态信息流中实时交互。该模型已在豆包 App 全量上线,用于视频通话场景体验。

项目主页:

https://seed.bytedance.com/seedrealtime

体验入口:将豆包 App 更新至最新版本,在对话框内选择「打电话」,进入视频通话界面体验即可。

SeedRealtime 音视频全双工大模型发布:走向全模态自然交互

(@ 字节 Seed)

4、京东开源实时开放式视频编辑模型 JoyAI-Video-Edit:采用自回归扩散架构,实现 720p 30.19 FPS 流式生成

图片

https://github.com/jd-opensource/JoyAI-Video-Edit

(@jd-opensource)

5、FFmpeg 9.0 发布多媒体框架新版本:代号「Lei」纪念中国音视频开发者雷霄骅

图片

图片

全球开源多媒体框架 FFmpeg 发布 9.0 版本,代号命名为「Lei」,以纪念中国开发者雷霄骅(Lei Xiaohua)。该版本除带来新一代音视频处理能力和硬件加速支持外,也通过版本命名向长期推动 FFmpeg 中文技术传播和开发者教育的贡献者致敬。

(@OSCHINA)

02 有亮点的产品

1、SpaceXAI 测试语音交互 UI 技术 Orbs:为 iOS 版 Grok Voice 功能探索空间化交互体验

据 TestingCatalog 报道,SpaceXAI 正在为 iOS 版 Grok 的语音功能开发名为 Orbs 的相关技术。该功能目前处于测试阶段,具体用途和上线时间尚未公布。

(@TestingCatalog)

2、影石 Insta360 正在为 AI 硬件产品增加 AI 语音助手能力

图片

据蓝鲸科技消息,影石 Insta360 正在为 AI 硬件产品增加 AI 语音助手能力,相关功能预计率先落地于 Go Ultra 系列。报道称,该语音助手内部代号为「Kira」,中国大陆地区将调用阿里千问大模型,海外及中国港澳台地区则调用 Google Gemini。

@IT 之家)

3、吴恩达推出 Voice for AI Agents and Applications 教程:系统讲解 Voice Agent 三类集成模式

吴恩达推出《Voice for AI Agents and Applications》教程,面向开发者介绍如何将语音能力接入 AI Agent 和应用。该课程由 DeepLearning.AI 与 Vocal Bridge 合作推出,围绕语音嵌入应用、为已有 Agent 增加语音层,以及让 Agent 调用语音工具三类模式展开。

https://www.deeplearning.ai/courses/voice-for-ai-agents-and-applications

(@VocalBridge)

4、AI 智能戒指 Vocci Ring 上线:支持语音记录、说话人识别与 AI 上下文连接

Vocci 推出 AI 智能戒指 Vocci Ring,通过戒指内置麦克风采集会议、对话和语音笔记,并将内容转换为文本、摘要和可检索的 AI 上下文。该设备支持与 ChatGPT、Claude 等 AI 应用连接,让用户授权 AI 获取 Vocci 中的语音记录和上下文信息。

https://vocci.ai/

(@Vocci)

03 有态度的观点

1、Anthropic CEO:担心新员工只为高薪加入,而非认同公司使命

图片

据 Polymarket 转述,Anthropic CEO Dario Amodei 近期表达担忧:随着 AI 人才争夺不断升温,一些新员工加入公司,可能主要是被高额薪酬吸引,而不是因为认同 Anthropic 所强调的 AI 安全使命。

这番表态迅速引发争议。Anthropic 长期将安全、对齐和负责任开发 AI 作为公司核心叙事,但与此同时,它也必须通过高薪、股权和更有竞争力的待遇,与 OpenAI、Meta 等公司争夺顶尖研究员和工程师。

讨论的焦点并不是员工能否追求更高收入,而是当公司要求员工相信使命时,管理层是否也应接受同样的审视。创始人、投资人和高管同样处于资本回报与公司估值的激励体系中,不能只把「是否忠于使命」的问题留给普通员工。

这场争论暴露了前沿 AI 公司的共同矛盾:一方面依靠长期主义和安全使命凝聚团队,另一方面又必须遵循高度市场化的人才竞争规则。当使命与薪酬同时成为招聘工具,公司真正需要解决的,不是员工究竟「为了什么而来」,而是如何让个人利益、商业目标与安全使命长期保持一致。

( @Polymarket\@X)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、直播预告|OpenAI 实时 AI 负责人、WebRTC 创建者 Justin Uberti:拆解 GPT-Live 的 WARP 与 WebRTC 优化

时间:北京时间 8 月 6 日(周四)00:30 - 01:30

地址:

http://linkedin.com/events/7485922769654824960/

图片

https://x.com/juberti/status/2084734090591556017

( @juberti\@X)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流