老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了
9833点击    2026-08-05 11:30

CUDA又双叒叕被创了…


这回动手的,还是英伟达亲手喂大的AI。


一家成立仅一年的小公司,用AI编程Agent,只花10小时,就搭出了一套「类CUDA软件」。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


停停停。


你是说这套英伟达花了近20年搭起来的软件帝国,就这么被复刻了??


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


不止如此。DeepSeek也在尝试少写一点底层CUDA。


他们已经开源了一套名为TileKernels的GPU算子库,用TileLang来编写,省去了大量手写底层CUDA代码的工作。


不过类似的「CUDA危机」,咱也不是第一次听了。


每隔一段时间,CUDA都要被拎出来鞭打一番,动辄替代了、击穿了、护城河又被颠覆了…


真的是这样么?


10小时「复刻」CUDA


提起英伟达,很多人的第一反应是GPU。


H100、Blackwell、Rubin,靠着一代代性能更强的芯片,英伟达吃下了这一轮AI浪潮的最大红利。


但英伟达真正难以撼动的优势,其实不是硬件,而是软件


芯片可以买,参数可以追,制程也会迭代。真正让客户用了英伟达之后很难再换走的,是围绕GPU建立起来的整套软件生态


CUDA,就是这套软件帝国的核心。


CUDA全称Compute Unified Device Architecture,由英伟达高管Ian Buck带队,花了近20年打造。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


它常被叫作编程语言,但更准确地说,CUDA是一整套围绕英伟达GPU建立的软件平台


如果简单拆成三层,最底下是内核层,直接让芯片干活的Kernel、编译器和运行时。


中间是库层——cuBLAS、cuDNN等经过高度优化的计算库,以及调试、验证和性能分析工具。


最上面,则是PyTorch、TensorFlow等开发框架,企业积累的海量代码和工作流,以及围绕CUDA成长起来的开发者生态。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了AI生成


这么说可能有点抽象,但你可以把英伟达GPU想象成一家工厂。


CUDA最底层负责告诉机器每一步怎么干,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。


所以,对客户来说,买到的不只是英伟达的一块卡,而是一座开箱即用的工厂。


现在,一位名叫Jeremy Nixon的老哥,带着AI Agent来了。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


Nixon是AI软件初创公司Infinity的创始人,此前也在Google Brain当研究员。


他的团队开发了一套名为Ignition的AI研究Agent,专门给不同AI芯片编写底层软件。


它可以生成GPU Kernel、运行测试、寻找错误、测量性能,再根据结果自动改写代码。


人类工程师负责给出高层方向,剩下那些琐碎又费脑子的工作,就交给Agent反复循环。


就这样,Infinity用Ignition为AI芯片初创公司d-Matrix搭建了一套类CUDA软件。


只花了10小时


啊??


那些过去需要芯片软件工程师反复调试的底层代码,现在真能交给AI了?


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


还真不能说完全是炒作。


AI Agent确实很适合这种具有明确反馈的编程任务。


代码能不能编译,结果算得对不对,性能有没有提高,都可以通过实际运行得到答案。


于是,Agent能够形成一个完整闭环:


写代码→编译→运行→测试正确性和性能→根据反馈继续修改


不过,Infinity主要攻入的是CUDA的第一层:为不同芯片生成和优化推理Kernel,并围绕这些Kernel搭建底层软件能力。


它正在开发一套面向多种芯片的通用推理库,但这不等于它在10小时内复制了CUDA近20年积累的完整生态。


但是…


但是!


你实际上并不需要复制一个CUDA,就可以拿下1500万美元的融资


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


这家公司目前的估值也已经来到了1亿美元


有没有威胁到英伟达不知道,反正资本是相当买账的。(doge)


推理侧,第二战场启动!


如果说AI Agent是攻城的武器,那推理市场就是城墙上的缺口。


大模型的计算主要分成两段:


训练是造模型,需要上万块卡协同跑几个月;推理是用训好的模型回答问题,小集群甚至单卡就能跑。


在训练侧,CUDA目前依然近乎无解。


大规模训练对性能、稳定性和集群协同极为敏感。芯片之间的通信、显存的调度、程序出错后如何恢复,任何一点效率损失,放大到数千乃至数万块芯片上,都会变成真实的时间和成本。


因此,企业选择训练平台时往往极其保守。


其他芯片即使纸面参数不错,只要软件不够成熟、集群不够稳定,省下来的硬件成本,很可能从开发和试错成本里加倍偿还。


但在推理侧,游戏规则变了


韩国AI芯片公司Rebellions首席商务官Marshall Choy就认为:


在推理侧,CUDA不再是决定因素。这将是一场开源软件的竞争。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


为什么竞争者都盯上了推理?


因为训练在乎「极致性能」,而推理在乎的是「每个回答的成本」。


训练需要上万块卡协同,推理可以拆分到小集群甚至单卡;训练不敢换芯片,但推理可以。


反正只要能跑、便宜,客户就愿意试。


更关键的是,推理软件可以跨芯片运行。如果推理框架能支持多种芯片,用户就能在不同硬件之间切换,不用重写代码——


CUDA最大的锁定效应,就此失效。


这就给专用推理芯片留下了机会。


推理任务并不都需要CUDA从训练到集群协同的全部能力。针对特定模型、特定场景重新设计的芯片,只要能够跑得更快、更便宜或者更省电,就有机会从英伟达手里切下一块市场。


比如d-Matrix,本身就是一家主打推理的芯片公司。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


这家公司成立于2019年,主攻生成式AI推理芯片。


联合创始人兼CEO Sid Sheth曾回忆,他们很早便判断,AI推理带来的机会最终会超过训练


Infinity用AI Agent花10小时搭建的类CUDA软件,服务的正是d-Matrix的推理芯片。


于是,「10小时事件」的完整故事就连起来了:


新芯片想进入推理市场,但缺少成熟软件;AI Agent快速生成和优化底层Kernel,把原本可能耗费数月乃至数年的适配工作压缩到小时或天。


Sid还明着放话:


虽然英伟达在训练领域保持主导地位,但在推理方面,护城河有所削弱。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


盯上这个缺口的,也不止d-Matrix一家。


主攻推理的Rebellions、d-Matrix,押注晶圆级芯片的Cerebras,亚马逊的Inferentia、谷歌的TPU、AMD的MI300X……


各路芯片厂和云计算巨头,早已在推理市场排兵布阵,准备从英伟达手里抢下一块肉。


对这些公司来说,他们不需要立刻替代英伟达。


他们只需要证明,在某些推理任务中,不依赖英伟达的全套硬件和CUDA生态,也能跑得更快或者更便宜。


这就足够了。


英伟达护城河,到底颠没颠覆


答案可能是…还差得远


前面也说了,10小时重写的是「一块芯片的适配代码」,而CUDA生态还有20年积累的库、调试工具、社区、几百万开发者。


这并不是轻轻松松就能被颠覆的。


更关键的是,代码能生成,不等于能用。


INT21创始人Bing Xu,上一家AI芯片软件公司HippoML被英伟达收购,他本人今年4月才离开英伟达。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


他的判断是:Agent能在短时间内生成大量代码,但验证才是最大瓶颈


AI生成一万行代码很快,但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢。


CUDA最深的资产恰恰是它的验证工具链——所以他认为,Agent时代,验证生态会成为CUDA的下一道护城河


Modular联合创始人兼CEO Chris Lattner,也泼了盆冷水。


老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了


他认为编码Agent带来的改进是渐进式的,「炒作被严重夸大」。


理由有三:第一,写代码只是软件工程的一小部分,生产级优化才决定芯片性能,直接决定跑AI的成本;


第二,芯片软件是小众精英领域,公开代码远少于应用开发,AI在这块能学的训练数据本来就少;


第三,几百万行存量代码的迁移成本还在,这不是技术能解决的,属于组织决策。


还有一点容易忽略的是:英伟达自己也在使用AI


英伟达开发者生态副总裁Ankit Patel表示:


我们也在使用AI Agent来更快地开发CUDA,并在更大规模上进行验证。


以己之矛,攻彼之盾,进攻方的相对优势也会打折。


Bing Xu总结下来:这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。


但很显然,这家全球最大的芯片制造商,「并没有在睡觉或原地踏步」。


总的来说,短期内英伟达的护城河安然无恙,但变化会先在推理侧悄悄发生。


长期的真正悬念是:护城河正在从「代码的存量」迁移到「验证和优化的生态」。


谁先占住新位置,谁才是下一个赢家。


参考链接:

[1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8


文章来自于"量子位",作者 "听雨"。

关键词: AI新闻 , Nixon , Infinity , Ignition
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md