ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

音频智能公司 Noiz 完成数千万元种子轮融资;英伟达开源语音推理运行时 NeMo-Speech.cpp丨日报

音频智能公司 Noiz 完成数千万元种子轮融资;英伟达开源语音推理运行时 NeMo-Speech.cpp丨日报

 

1854a5312ddaad153ff7b4e7f63f3593

 

 

本期编辑:@三水、@鲍勃

01 有话题的技术

1、Qwen 开源 Qwen-MM-Plugins:以 Skill + MCP 接入多模态能力,覆盖图像、视频、3D 与 CAD

 

c18ae5e09b4154141c65d73cca6b46a7

 

 

Qwen 开源 Qwen-MM-Plugins,为不同 Agent Harness 提供可独立安装的多模态能力。项目将每项能力拆分为用于声明工具能力的 Skill,以及可选的 MCP Server,并提供面向 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 等环境的安装方式。

 

  • 提供 6 类可独立安装能力: 包括 core、video-memory、video-edit、blender、freecad 和 edu-agent,覆盖多模态理解、长视频问答、视频编辑与生成、3D 建模、参数化 CAD 和教学视频生成。

  • core 支持动态分辨率多模态读取: 可处理图像、视频、文档和 3D 模型,并提供 OCR、grounding、分割、ASR、vision chat 和 web search 等工具。

  • 采用 Skill + 可选 MCP Server 结构: Skill 用于让模型识别可用工具集,MCP Server 提供具体工具,并可通过 uvx 按需启动;edu-agent 为仅包含 Skill 的能力。

  • 可接入多种 Agent Harness: 引导安装脚本覆盖 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI;opencode、pi、QwenPaw 等环境可手动注册 Skill 与 MCP。

  • Blender 与 FreeCAD 通过运行中的桌面应用执行操作: Blender 提供 22 个工具,可控制建模、材质、灯光和渲染;FreeCAD 提供 14 个工具,覆盖参数化建模、属性编辑、STEP/STL 导入导出和 FEM 分析。

 

https://github.com/QwenLM/Qwen-MM-Plugins

 

(@QwenLM)

 

2、英伟达开源 NeMo-Speech.cpp:C++ 语音推理运行时支持实时/批量模式与 OpenAI 兼容 API

 

英伟达开源 NeMo-Speech.cpp,一个基于 ggml 的原生 C++ 语音模型推理运行时环境,可运行 NVIDIA Nemotron Speech 等模型,并提供实时与批量推理模式。项目同时提供 CLI、本地 HTTP 服务、WebSocket 实时转录以及原生 C/C++ SDK 等接入方式。

 

  • ASR 模型统一使用 GGUF: 已提供 Parakeet CTC 1.1B、Parakeet TDT 0.6B v3、Nemotron-Speech Streaming 0.6B 和 Nemotron 3.5 ASR Streaming 0.6B 等模型的运行支持,官方提供可直接运行的 Q8 GGUF。

  • 提供 OpenAI 兼容音频 API 与实时 WebSocket: 本地 HTTP Server 提供部分 OpenAI 兼容音频 API,并支持 WebSocket 实时转录;另有独立 riva_server 提供 Riva 兼容 gRPC 接口。

  • 支持将 NeMo 与 Hugging Face checkpoint 转换为 GGUF: 转换工具可处理 .nemo、本地 NeMo checkpoint、Hugging Face 本地模型或仓库,并自动识别 CTC、RNNT 和 TDT head。

  • GGUF 支持多种量化格式: 包括 Q8_0、BF16、F16、Q6_K、Q5_K 和 Q4_K,其中 Q8_0 为默认格式;CUDA 后端还提供面向批处理的 planar Q8 布局。

  • 同时提供 CLI 与原生 C/C++ SDK: Release 包包含稳定 C headers、共享库和 CMake package,应用可按 ASR 等具体能力单独链接;源码构建文档覆盖 CPU、CUDA、Metal、Vulkan、Windows 和容器环境。

 

https://github.com/NVIDIA/NeMo-Speech.cpp

 

(@NVIDA)

 

3、Wan 开源 Wan-Animate-2:端到端 DiT 直接输入驱动视频,蒸馏版 10 步完成推理

 

9118eb86237baad64c066d99606611bb

 

1af7bed8c70c89535831cbb8f3462677

 

 

Wan 团队发布 Wan-Animate-2 推理代码以及 Base、Distillation 模型权重,用于参考图像驱动的角色动画生成。模型将驱动视频直接输入重新设计的 Diffusion Transformer,取消中间动作提取器,并加入文本控制的视角调整能力。

 

  • 驱动视频直接进入 Diffusion Transformer: Wan-Animate-2 采用端到端角色动画框架,不再依赖中间动作提取器,用于生成角色运动并保持参考角色身份特征。

  • 文本可独立控制输出视角: 模型增加文本驱动的 viewpoint control,使生成视频的相机视角可以与驱动视频中的视角解耦。

  • Distillation 版本采用 10 步推理: 官方 Diffusers 示例中,蒸馏模型使用 10 个 inference steps,无需 CFG,guidance_scale 设为 1.0。

  • 默认配置支持 720P 生成: 仓库默认参数针对 8× A800 GPU 调优,并已测试在 2× A800 GPU 上生成 480P 视频。

  • 已接入 Diffusers、DiffSynth-Studio 和 ComfyUI: Wan-Animate-2 已提供对应集成方式,其中 Diffusers 可直接调用 Base 和 Distillation 模型进行推理。

 

https://github.com/Wan-Video/Wan-Animate-2

 

( @Wan-Video)

02 有亮点的产品

1、ChatGPT Voice 支持文件上传与 Projects 项目上下文调用

 

ChatGPT Voice 的 GPT-Live 功能现已支持文件上传和项目管理。用户可在语音交互中上传文件并开展内容分析与提问,同时亦可在项目管理场景下,调用历史对话、参考资料及项目说明等相关内容。

 

(@OpenAI)

 

2、音频智能公司 Noiz 完成数千万元种子轮融资:AudioX 构建声学模型底座,探索声音物理信息建模

 

24536b5f24ff8e383c27a72f91e38f81

 

 

音频智能公司 Noiz AI 已完成数千万元种子轮融资,投资方包括金沙江创投、北极光创投和英诺天使基金。公司以自研开源音频模型底座 AudioX 为核心,尝试让模型从声音生成与识别扩展到对声音产生、传播和感知过程的理解。

 

  • AudioX 作为通用音频模型底座: Noiz 将模型能力应用于语音、音乐、音效、视频配音和声音编辑等任务,并通过 API 与系统集成形式接入内容平台、视频生产工具和企业工作流。

  • AudioX-Turbo 面向更快的音频生成: 团队于今年 6 月发布 AudioX-Turbo,用于降低无声视频生成声音时的等待时间,让脚步、碰撞、运动等声音事件更贴近画面中的发生时刻。

  • 训练数据引入声音背后的物理条件: Noiz 正采集包含空间结构、材质、距离、方向、混响和声源位置等信息的数据,同时结合物理声学仿真和产品端用户反馈构建训练数据。

  • 向空间音频与具身智能拓展: Noiz 正将声音模型用于 3D 场景,根据几何结构、材质、距离和听者位置生成匹配的空间声场,并已与一家具身智能公司合作进行声音事件识别与模型适配。

  • C 端产品作为模型迭代数据来源: Noiz AI 面向海外创作者提供音频生成和编辑能力,目前全球用户已突破 200 万,用户生成、编辑、保留和付费行为被用于模型优化。

 

获金沙江数千万元种子融资,音频模型 Noiz 要挖掘声音背后的物理信息|智能涌现融资首发

 

(@智能涌现)

 

3、keybodhi 开源 Aoi VR Agent:在 SteamVR 手部面板接入语音智能体,支持流式 TTS 与同声传译

 

60a263efb0f9395a479d87ff35fb7432

 

 

Aoi VR Agent 是一个面向 SteamVR 的开源 AI 语音助手,通过附着在右手控制器上的 OpenVR overlay 提供交互界面,并由本地原生 C++ 智能体驱动。用户可直接在 VR 中进行 LLM 语音对话、查看环境截图、翻译系统音频或控制部分系统设置。

 

  • 原生 C++20 智能体运行在 Unity 进程内:aoi_agent.dll 集成 LLM 客户端、TTS、ASR、DSP 和工具调用,智能体循环设计为不阻塞 Unity 渲染线程。

  • 语音对话接入 OpenAI 兼容 LLM: 支持流式推理与流式 TTS,并提供 prompt 缓存和用量统计等能力。

  • 支持 VR 环境感知与同声传译: 智能体可按需获取 VR 截图,并可选开启持续视觉和系统音频转写;同声传译功能可实时翻译系统音频。

  • OpenVR overlay 直接附着于手柄: 手板面板支持激光/射线输入和桌面镜像,同时可调整 Windows 应用级音量与 VR 亮度。

  • 提供预编译版本与桌面模式: Release 包可直接运行,除 SteamVR overlay 模式外,还提供无需头显的桌面预览和无需 API key 的 Demo 模式。

 

https://github.com/keybodhi/AoiVR

 

( @keybodhi)

 

4、AMNESIAC 展示反向图灵测试 AI 审讯游戏:MiniCPM-o 4.5 驱动对话,VoxCPM 生成角色语音

 

开发者 Hetansh Waghela 在 BuildSmall Hackathon 中开发 AMNESIAC,通过「让 AI 判断用户是否为人类」反转传统图灵测试。游戏中的 AI 审讯者 A.M.N。 会结合摄像头和麦克风获取的面部表情、脉搏信号与回答时间,持续调整后续提问。

 

  • MiniCPM-o 4.5 负责理解与实时对话生成: 模型处理用户回答,并根据交互过程生成后续审讯内容。

  • VoxCPM 用于生成 AI 审讯者语音: 项目通过自定义语音数据集进行 LoRA 微调,塑造偏冷静、临床感的角色声音风格。

  • 结合面部分析与生物信号调整交互: 系统在设备端分析面部信息,并结合脉搏信号和用户响应时间,用于构建审讯过程中的反馈信号。

  • 将视觉感知、语言理解与语音生成组合为角色交互: AMNESIAC 将 MiniCPM-o 与 VoxCPM 接入同一互动流程,让 AI 角色根据用户反应持续进行多模态交互。

 

https://huggingface.co/spaces/build-small-hackathon/amnesiac

 

(@HetanshWaghela)

 

5、Qoder Voice上线:开口就能共事的实时语音伙伴

 

真正的动嘴编程来了:Qoder Voice 上线

 

你有没有过这种时刻:脑子里方案已经跑完三轮,手指还在键盘上敲第一句话。

 

Qoder Voice 要解决的就是这个时差。你说,它听,它答——不用等你写完一整段提示词,也不用把话组织成"标准句式"。想到哪说到哪,说错了直接打断重来,像跟一个反应快、能陪聊、也能找到解决方案的同事。

 

Qoder Voice 的声纹识别,就是给这件事上了把锁。开启后,它先认得你的声音,再决定要不要回应。开放工位、会议间隙、地铁站台、楼上还在装修的家——环境可以很吵,但它的注意力只在你身上。

 

欢迎在 Qoder 国际版和 CN 版 Quest 模式里体验 Qoder Voice!

03 有态度的观点

1、Replit CEO:AI 并没有杀死编程,它让软件工程变得更「以人为本」

 

1118e4a4d57e7d49fa7738e016e3c331

 

 

Replit CEO Amjad Masad 近日在科技记者 Casey Newton 的播客节目中表示,AI 正在让 Replit 内部的软件工程工作变得更加「以人为本」,编码智能体将工程师从高强度敲码中解放出来,转向更具创造力的工作。

 

Masad 提到,两年前公司里的工程师「都在埋头敲键盘,办公室里全是键盘声」,而现在「环境变得更有活力」。他表示,工程师如今花更多时间在白板前构思和讨论,偶尔向 AI 智能体发送下一步指令即可。

 

这一表态与业界对「SaaSpocalypse」(SaaS 末日论)的普遍担忧形成对比。今年早些时候,市场曾担忧 AI 将使企业能够自行构建软件、不再依赖专业软件公司,这一预期一度引发软件股抛售。

 

与此同时,AI 对软件工程岗位的冲击仍在持续。至少十余家大型公司已将 AI 列为裁员理由之一,工程师们也表示借助 AI 编码虽然效率更高,但容易导致倦怠。今年夏天,Meta 裁减了近 1000 名软件工程师,但 Mark Zuckerberg 将裁员归因于抵消 AI 支出,而非自动化取代人力。

 

Masad 透露,Replit 在去年迎来转折点。当时 Anthropic 开始发布 Opus 系列模型,其代码生成能力显著优于此前的模型。Masad 回忆称,自己当时一度觉得「我毕生致力于教人们编程、让编程变得更简单的使命,似乎都失去了意义。」

 

此后,Replit 将公司使命从「教人编程」转向「让编程尽可能简单」,并推出了基于自然语言指令生成程序的 AI 智能体,即如今被称为「vibe coding」的模式。

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

 

1、帮社区的好伙伴 S 创推荐一下路演大赛报名!

 

✨S创上海2026路演大赛#二轮评委天团正式解锁✨

 

15位深耕各赛道产业投资人集结~全赛道覆盖配齐专业评审视角

 

⚠报名倒计时!8月12日24:00截止,时间余量不多,别拖到最后!

 

戳文解锁评委名单+抢占最后报名位

 

→与顶流投资团面对面的机会,手慢真无🚀

 

3126045d7c86f3615912b686e270679f

 

 

S创上海2026|路演大赛二轮评委嘉宾阵容公布!

 

2、活动推荐|SheNicest 烈变黑客松:1000 人、96 小时、15 万奖金,等你来玩

 

8 月 26 日—30 日,烈变黑客松将在北京开启 96 小时创造。RTE 开发者社区欢迎所有构建实时 AI、Voice Agent、Physical AI 与实时多模态的 Builder 报名,让想法真正跑起来。

 

3d1bc634936b50e516e9915b8cabf5e3

 

 

1000人、96小时、15万元奖金|烈变黑客松选手招募

image

 

79e3f83e1a30a6b675f91f4c177875eb

 

 

 

 

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

 

写在最后:

 

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

 

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

 

2f061ce1558b1c8d3103114774680a58

 

 

作者提示: 个人观点,仅供参考

返回列表