图片

开发者朋友们大家好:

这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@ 三水、@ 鲍勃

01 有话题的技术

1、微软发布 VibeVoice-ASR-BitNet 边缘 CPU 推理引擎:模型压缩至 1.58 GB,支持 3 线程实时语音识别

图片

微软推出面向 VibeVoice-ASR 的边缘 CPU 推理引擎 VibeVoice-ASR-BitNet,通过异构量化技术将模型规模从 4.62 GB 压缩至 1.58 GB。该引擎无需 GPU,在 3 个以上 CPU 线程上即可实现实时推理,面向端侧设备部署。

Github

https://github.com/microsoft/VibeVoice/

Hugging face

https://huggingface.co/microsoft/VibeVoice-ASR-BitNet

( @Microsoft VibeVoice GitHub)

2、Inflect 发布超小型 TTS 模型 Inflect v2:4M 与 10M 参数规模,支持本地端侧语音合成

图片

开发者 Owen Song 发布 Inflect v2,一组面向本地部署的超小型文本转语音模型,包含参数量低于 400 万的 Inflect-Nano-v2 与低于 1000 万参数的模型版本。该系列模型针对资源受限设备优化,在极低参数规模下提供完整 TTS 能力。

Hugging Face Inflect-Nano-v2

https://huggingface.co/owensong/Inflect-Nano-v2

GitHub Inflect

https://github.com/owenawsong/Inflect

Reddit r/LocalLLaMA 发布帖

https://www.reddit.com/r/LocalLLaMA/comments/1v5ve6v/

( @Inflect)

3、Black Forest Labs 与 Mimic Robotics 发布 FLUX-mimic 视频动作模型:基于 FLUX 3 多模态模型预测机器人动作

Black Forest Labs 与 Mimic Robotics 推出 FLUX-mimic,一款基于 FLUX 3 多模态基础模型的视频动作模型。该模型利用 FLUX 3 对图像、视频和音频的统一世界表示能力,结合机器人操作数据训练,可从视频预测未来场景变化并生成机器人动作。

Black Forest Labs Blog

https://bfl.ai/blog/flux-3-mimic

Mimic Robotics Blog

https://www.mimicrobotics.com/blog/introducing-flux-mimic

( @Black Forest Labs Blog @Mimic Robotics Blog)

4、ViiTor AI 发布 ViiTorVoice-NAR 词级 TTS 编辑模型:支持局部语音重写,首帧延迟约 60ms

图片

ViiTor AI 开源 ViiTorVoice-NAR,一款基于非自回归架构的文本转语音模型,支持语音克隆、局部语音编辑和情感控制。该模型可仅替换音频中的指定词语或片段,无需重新生成整段语音,并支持低延迟推理。

ViiTor AI GitHub

https://github.com/viitor-ai/viitor-voice-nar

Hugging Face ViiTorVoice-NAR

https://huggingface.co/ZzWater/ViiTorVoice-NAR

( @ViiTor AI GitHub @Hugging Face ViiTorVoice-NAR)

02 有亮点的产品

1、Raintree Systems 收购 Spike Technologies:将智能体语音 AI 集成至医疗 EHR,自动化收入周期管理流程

图片

医疗软件公司 Raintree Systems 宣布收购 Spike Technologies,将其智能体语音 AI 技术原生集成到 Raintree 的电子病历(EHR)和实践管理平台中。此次整合面向康复治疗和物理治疗机构,重点自动化保险沟通、理赔跟进、资格验证、预授权和患者触达等高人工成本流程。

https://www.linkedin.com/pulse/transformative-acquisition-raintree-systems-combines-spike-hedges-u9ztc/

( @Nick Hedges\@Linkedin)

2、Anuttacon 停运 AI 陪伴产品 AnuNeko:转向大语言模型与智能体研发方向

蔡浩宇创立的 AI 公司 Anuttacon 宣布旗下 AI 陪伴产品 AnuNeko 将于2026年7月29日停止运营,应用和聊天记录将无法访问,用户数据按隐私政策删除。此次停运后,团队将资源集中到其他 AI 项目,研发重心逐步转向大语言模型与智能体系统能力建设。

(@ 游戏葡萄)

3、Fovea 发布人机交互系统:将视线、语音与屏幕上下文融合为 AI 输入,支持免键鼠操作

AI 硬件公司 Fovea 推出面向桌面场景的人机交互系统 Fovea,通过摄像头捕捉用户视线、麦克风采集语音,并结合当前屏幕内容理解用户意图,将注意力转化为 AI 可执行输入。该系统目标是让用户通过「看、说」完成电脑操作,减少传统键鼠交互依赖。

https://www.hellofovea.com/

@Fovea\@X

03 有态度的观点

1、黄仁勋:AI 时代需要开放模型,与闭源前沿模型共同推动未来

图片

近日,英伟达(NVIDIA)创始人兼 CEO 黄仁勋(Jensen Huang)在社交媒体发布首篇公开帖,分享了英伟达签署的一封关于「为什么开放模型重要」的公开信,并表达了对开放 AI 生态的支持。

黄仁勋认为,人工智能将改变每一个行业,赋能每一家企业,并最终被世界各国共同建设和应用。在这一过程中,开放模型将成为推动 AI 普及的重要力量。

他指出,开放模型不仅能够加速技术创新和传播,还能提升 AI 安全性与网络安全能力。由于模型权重公开,研究人员、开发者和企业可以更深入地理解、测试和改进模型,从而帮助整个生态发现问题、修复漏洞,并推动技术进步。

与此同时,黄仁勋强调,未来世界并不应该只有一种 AI 发展路径。「前沿闭源模型」和「前沿开放模型」都将发挥重要作用:闭源模型可以持续探索极限能力,而开放模型则能够让更多国家、企业和开发者参与 AI 创新。

这一表态也反映出英伟达在 AI 产业链中的战略方向——推动更广泛的 AI 基础设施建设,让 AI 能力从少数公司掌握的技术,逐渐变成全球开发者都可以参与和创造的平台。

( @JensenHuang\@X)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


↙↙↙阅读原文可查看相关链接,并与作者交流