获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发
5843点击    2026-08-10 15:26

获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发


高中第一次戴上耳机听陈奕迅,陈伟嘉就被歌词之外的信息吸引:音色、歌手状态、声音环境。如今,他想让音频模型处理的,也正是这些语言之外的信息。


一句“我没事”,可能是安慰、逞强,或冷漠。一个关门声,不只是关门动作本身,还包含了关门的力度、门的材质、声源距离多远、传递的情绪等信息。


在陈伟嘉看来,这些文本之外的信息更难被模型捕捉,“过去两年,⾳频AI目前在很⼤程度上被等同于语⾳AI。”行业讨论更⾃然的TTS、更准确的语⾳识别、更低延迟的⼈机交互,主要围绕“⼈在说什么”展开。⼤量⾳频模型,只重点处理了其中最易被⽂字描述的⼀层。模型理解声⾳“代表什么”,但难以“为什么会这样发⽣”。


聚焦这一方向,陈伟嘉在2025年9月创立音频智能公司Noiz,希望构建声学智能基础设施,让AI不仅能够识别和⽣成声⾳,也能够理解、模拟声⾳如何发⽣、传播并被感知。


《智能涌现》获悉,Noiz AI已完成数千万元种子轮融资。最近一次融资来自金沙江创投,此前由北极光创投、英诺天使基金投资。目前Noiz全球用户已突破200万,ARR百万美元。


Noiz团队目前正职员工10余人。创始⼈陈伟嘉曾在Meta、Tiktok任职,做视频、ASR与Agent相关工作。回国后他创办玉符科技,做身份管理类SaaS,2020年公司被腾讯收购。随后,他在腾讯参与Agent模型的⼯程化落地,又经历了语⾳克隆、多模态模型和Coding等不同技术阶段,也是语⾳克隆开源项⽬Mockingbird的作者。


联合创始⼈陈前具有北⼤、清华和MIT的教育背景,此前曾任百川智能用户增长及运营负责人。⾸席科学家Zeyue Tian最早系统研究音视频联合生成的研究员之一,他开源的全曲生成模型ChatMusician曾被杨立昆转发。


团队其他成员来⾃Meta、Dolby、TikTok等公司和实验室,覆盖声⾳模型、多模态预训练、空间⾳频、产品⼯程和商业增长等⽅向,同时大多成员兼职乐队乐手及音乐创作。


构建声学智能基础设施


在音频模型领域,Noiz不把⾃⼰定义为单⼀的配⾳⼯具或⾳频⽣成产品,⽽是⼀家从通⽤⾳频模型出发,逐步构建音视频智能底座的公司。在Noiz看来,新一代音频模型是对声⾳的产⽣、传播、空间响应及感知过程统⼀理解、⽣成与模拟的能⼒。


公司创立初期,Noiz自研开源音频模型底座AudioX,并以创作者⾳频产品Noiz AI进⼊市场,将技术放入产品接受付费验证。


Noiz AI⾯向短视频、内容制作和泛娱乐场景的创作者,提供语⾳、⾳乐、⾳效、视频配⾳和声⾳编辑能⼒。目前已积累约200万海外创作者,但C端用户并非Noiz主要现金来源,而是作为模型初期的数据雷达,指引AudioX不断迭代。


这一意识来自初次创业的“教训”。当时在研发身份认证Saas时,陈伟嘉带团队打磨技术,产品问世近20个月才尝试商业化,结果市场反馈不达预期。2020年正值疫情,腾讯会议用户规模大幅跃升,公司被腾讯收购,这才意外得到一个商业出口。以市场反馈指引技术也因此在陈伟嘉心里扎根。Noiz模型从第一代起就根据⽤⼾的实际制作和付费⾏为迭代。


获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发

△Noiz AI团队参与对外交流活动


C端用户外,Noiz目前还在同时用另外两类业务验证底层模型能力。一类是API与企业集成。同⼀套模型以API和系统集成的形式,进⼊内容平台、视频⽣产⼯具和企业⼯作流。企业客⼾可以根据业务需求调⽤语⾳、⾳乐、音视频、翻译和空间⾳频等不同能⼒。主要客户来自短剧、游戏、视频生产等领域。


另一类是3D与具⾝智能合作,目前Noiz正在把通⽤声⾳底座拓展到3D世界和具⾝智能。区别于给画⾯后期贴上⼀段⾳效,Noiz对于3D场景的目标在于根据⼏何结构、材质、距离和听者位置,⽣成匹配的空间声场。


对于机器⼈而言,听觉具有全向、连续和不受视线遮挡的特征。机器⼈可能通过声⾳更早感知⾝后的脚步、周围的碰撞、设备内部异常摩擦、⼀次动作是否产⽣了合理的物理结果等。


今年6月,团队发布AudioX-Turbo进⼀步解决⽣成速度问题。在团队看来,在⽆声视频⽣成声⾳的场景中,模型需要让脚步、碰撞、运动和画⾯中的事件尽可能同步发⽣,⽽非等待长时间离线渲染。这一模型也是帮助团队从离线内容制作⾛向交互式声学系统的基础,他们认为当声⾳能够⾜够快地⽣成,才有机会进⼊实时视频、游戏、虚拟⻆⾊和⼈机交互系统。


目前,随着底层模型逐渐统⼀,公司正在从“⽣成⾳频内容”,进⼀步⾛向“实时音视频交互”。


寻找物理状态下的模型数据


2022年,做声音克隆和情绪模型训练时,陈伟嘉就感受到仅靠文本转语音,无法还原人说话时的真实状态。


“跳出语言,一个咳嗽声、非语言的声音、重重关门的声音,本身还有很多信息量。甚至,这些信息量代表着事件发生了,会有什么后续。”他认为,过去的声音AI完全没有捕捉到这些,声音需要连接到环境上下文,而非文本的上下文。


在他看来,目前声音模型的竞争主要集中在语音识别、TTS和实时对话上,行业普遍依赖互联网音频,再通过文本标签或多模态模型补充事件描述。但这类数据通常只告诉模型“发生了关门”,不会记录房间结构、门的材质、施力大小、声源距离、遮挡关系和听者位置。模型因此能够复现一段听起来合理的声音,却很难判断在一个全新的空间里,声音是如何发生。


在Noiz看来,这也是声⾳模型长期面临的数据问题导致。互联⽹上有⼤量⾳频,但很少有数据会系统标注声⾳背后的物理条件。例如,⼀声关门通常不会同时标注房间的⼤⼩和结构、门的材质和厚度、声源与麦克风的距离、空间中的混响和反射、施加在⻔上的力度,以及听者所在的位置和⽅向等,但它们却是训练声学智能所需要的变量。


获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发

△创始人陈伟嘉出席交流活动


为了构建这一核心壁垒。Noiz正在着重采集具备物理条件的训练数据,并搭建三类数据来源。


第一类是真实世界采集,通过专门设计的流程控制空间、材质、距离、方向和事件,获得未经重度后期加工的高保真声音,比如来自“杜比声”的数据采集成员会用空间音频方法,在录制时使用两个或四个麦克风,处理声道同步、设备位置统一和空间信息。


第二类是物理声学仿真,批量生成现实中难以穷举的材质、空间和声源组合,以扩大训练条件的覆盖范围。


第三类来自产品端,创作者在noiz.ai中的生成、重试、编辑、保留、导出和付费行为,会被转化为偏好信号,帮助模型判断哪些声音更匹配画面、哪些情绪更有表现力。真实采集保证真实性,仿真补足规模,用户行为提供审美反馈,三者共同形成数据闭环。


音频生成的蓝海在哪?


做模型这件事,陈伟嘉认为:“跟文本走得越近越卷,反之则越蓝海。”


在Noiz提出的声学智能框架下,语⾳并不是声⾳智能的全部,⽽是其中⼀个重要特例。当模型真正理解声⾳如何发⽣时,情绪、空间感和距离感就不需要作为后期效果附加上去,⽽可以成为同⼀个⽣成和理解过程中的内⽣变量。这也是Noiz与传统TTS、素材型⾳效⽣成,以及以对话为中⼼的Audio Language Model之间最主要的区别。


Noiz正在推进的下⼀代模型,希望让声⾳随着环境变化⽽变化。⼀扇⻔被打开或关闭;物体从⽊材变成⾦属;听者从房间⾛到⾛廊;声源从正前⽅移动到⾝后;空间由铺设地毯的卧室变成空旷的地下车库。在这些情况下,Noiz希望声⾳表现可以根据新的空间、材质、位置和事件状态实时产⽣变化。这意味着模型要从“⽣成⼀段看起来合理的声⾳”,进⼀步⾛向“在当前条件下推演此刻应该听见什么”,根据正在发生的事件,实时生成匹配的音效、音乐和环境声。


在单一的配音或音效工具之外,Noiz希望从通用音频模型出发,构建理解声音产生、传播和感知过程的声学智能底座,使模型从复现既有数据分布的“generator”,进一步变成能够根据空间、材质、事件和位置推演声音的“simulator”。


与之相对应,陈伟嘉正在聚焦实时交互内容平台与具身智能市场。


在他看来,传统短剧、视频或游戏,只在制作阶段调用一次模型,生成的声音可以反复使用;但在互动游戏、虚拟世界等实时交互内容平台中,用户每做一个动作,系统都要根据场景、材质、距离和方向实时生成声音。只要用户在线,平台就需要持续调用API,因此调用频率和收入上限更高。


音频模型在具身智能领域的机会,被陈伟嘉概括为“给机器人戴上耳朵”。


他认为,机器人不能只靠摄像头和语音指令,还需要持续理解环境声音。比如杯子从身后掉落、隔壁房间发生碰撞、设备出现异常摩擦,这些都可能处于视觉盲区;机器人如果能听懂声音来自哪里、发生了什么,就能主动采取行动。再往后,声音还可用于多机器人协作以及机器人与人的长期互动。


目前Noiz已与一家具身智能公司合作。Noiz以技术咨询和模型适配的方式参与,为对方提供模型,帮助识别空间声音事件。据陈伟嘉介绍,机器人已经能通过声音判断身后或旁边有杯子掉落,并主动处理,未来也将进一步拓展相关合作。


文章来自于"智能涌现",作者 "赵芮"。

关键词: AI新闻 , Noiz , Noiz AI , AI音频
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
声音克隆

【开源免费】MockingBird是一个5秒钟即可克隆你的声音的AI项目。

项目地址:https://github.com/babysor/MockingBird

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales