
4月24日,DeepSeek正式发布V4系列——Pro和Flash两个版本,全部开源。推理性能超越所有已知开源模型,Agent能力号称史上最强,百万字超长上下文直接标配。但整场发布中真正让行业震动的,不是参数,不是跑分,而是一个被刻意低调处理的细节:V4的推理端,全面运行在华为昇腾950PR芯片上,软件架构从英伟达CUDA彻底转向了华为自研的CANN框架。

这不是一次普通的产品升级。这是中国AI体系第一次在真实生产环境中,系统性地尝试在非CUDA平台上承载顶级模型能力。它不再是一个实验室项目,而是一场面向产业链的"压力测试"。
表面是模型发布,背后是生态路线的摊牌
先看事实。DeepSeek V4-Pro拥有1.6万亿参数,激活参数490亿,预训练数据33万亿token;V4-Flash则是一个2840亿参数、130亿激活的精简版。两个版本均标配百万token上下文——大约相当于一次性处理75万汉字,接近读完《三体》三部曲的总量。
性能数据同样硬核。在Agentic Coding评测中,V4-Pro已居开源模型之首。DeepSeek官方披露,公司内部员工已将其用作日常编程模型,使用体验优于Anthropic的Sonnet 4.5,交付质量逼近Opus 4.6的非思考模式。在世界知识评测中,V4-Pro大幅领先所有开源模型,仅略逊于谷歌的Gemini Pro 3.1。数学、STEM、竞赛型代码——V4-Pro全线超越已知开源模型,成绩直接对标GPT和Gemini这两个顶级闭源体系。
定价延续了DeepSeek一贯的普惠路线。Flash版缓存命中后每百万token仅需0.2元,Pro版也不过1元起步。有分析指出,这一价格仅为GPT-5.4等竞品的二十分之一甚至更低。
但问题在于,这些亮眼数据背后的算力来源,才是理解这次发布真正含义的钥匙。
过去几年,中国做大模型的公司几乎离不开英伟达GPU。从训练到推理,整个技术栈都长在CUDA生态上。一旦遭遇出口管制或供应链波动,AI落地的节奏就会被人从底层掐住。DeepSeek V4这次明确选择华为昇腾作为推理主力,等于公开宣告: 国产算力,至少在某些关键环节,已经可以撑住世界级的AI模型了。

受此带动,4月24日当天,国证半导体芯片指数逆势上涨1.06%,海光信息涨超6%,龙芯中科涨近6%。市场的反应从来不说谎。
真正难的不是换芯片,是突破一套用二十年建成的生态锁
普通人可能会问:不就是把模型从英伟达换到华为上跑吗,有什么难的?
要把这个问题讲清楚,得先理解CUDA到底是个什么东西。CUDA——全称统一计算设备架构——表面上看是英伟达提供的一套编程工具。但本质上,它是一个横跨硬件和软件的双层垄断体系。硬件层,英伟达定义了流式多处理器(SM)的物理结构和Tensor Core的计算逻辑;软件层,CUDA又提供了cuBLAS、cuDNN等与硬件1:1完美咬合的闭源加速库。两者叠加,形成了一个极其恐怖的现实:全球超过600万AI开发者,写代码时已经在用英伟达硬件特性的语言思考了。
打个比方。这就好比全世界的建筑师,画图时默认所有建材都是某一家公司的规格。你想换材料?可以,但图纸、施工标准、验收流程全部要重来,而且新材料的承重逻辑跟旧的不一样——表面看只是换了块砖,实际要改的是整栋楼的结构设计。DeepSeek V4这次的迁移就是如此。
更进一步说,英伟达的垄断比当年PC时代的Wintel联盟更难打破。微软和英特尔毕竟是两家公司,彼此有利益博弈,给Linux、AMD、苹果留出了缝隙。而英伟达在AI领域是"微软加英特尔的合体"——硬件和软件一手包办,所有创新都被吸进一个黑洞。有研究指出,全球90%以上的AI创新红利都被CUDA生态捕获。
华为的CANN框架——全称神经网络异构计算架构——是眼下唯一有机会挑战这个局面的替代方案。但它的路径从一开始就面临一个两难选择:是完全自建一套独立的编程模型,还是先兼容CUDA以求快速落地?
CANN选择了后者。CANN Next版本通过SIMT编程模型实现了超过95%的CUDA接口兼容性,把模型迁移时间从"数周甚至数月"压缩到了"小时级"。这一策略短期内极为成功——阿里、字节、腾讯等巨头已提前向华为采购数十万颗新一代昇腾芯片,据外媒报道芯片价格一度上涨约20%。

但兼容是把双刃剑。当你为了兼容而设计系统时,你天然继承了对方架构的底层假设。一旦涉及前沿创新——比如DeepSeek V4在适配过程中尝试引入非Transformer架构的算子优化时——CANN兼容层的边界就暴露了出来。有工程团队的公开记录显示,这些冷门算子在CANN上性能抖动剧烈,需要手动重写,效率远不及在CUDA上的"开箱即用"。
更深层的问题在于,兼容策略默认CUDA仍然是隐性标准。你可以换硬件,但开发范式依然是别人定义的。这就像换了一台国产发动机,却依然要按照进口发动机的点火时序来写控制程序——短期能跑,长期会被锁死在模仿者的轨道上。
各方都没有看上去那么轻松
把视线拉高一层,这场博弈里没有真正的赢家,至少目前没有。
对英伟达来说,DeepSeek V4转向华为是一个明确的警告信号:中国市场正在加速寻找替代方案。美国出口管制固然卡住了高端芯片流入中国,但也逼出了一个越来越有竞争力的对手。伯恩斯坦的预测数据显示,华为昇腾在中国AI加速器市场的份额,2025年已与英伟达并列约40%,2026年还在继续攀升。英伟达丢掉的不只是当下的订单,更是一个可能催生独立生态的战略市场。

对中国AI产业来说,V4的成功迁移固然提振信心,但代价是实打实的。据多家媒体确认,V4的发布窗口从今年初一再推迟至4月下旬,核心原因就是推理端与华为昇腾的深度适配远比预想复杂。DeepSeek创始人梁文锋在内部沟通中直言,这只是"万里长征的第一步"。还有分析指出,在全球AI算力总量中,国产芯片占比目前仅为5%左右,顶尖人才不得不将超过一半的研发精力消耗在"解决老旧芯片的信号衰减"和"适配不成熟编译器"这类问题上——而同期的美国AI公司,已经在用Blackwell的高带宽互联跑10万亿参数的Scaling Laws了。
对华为而言,CANN兼容CUDA的路径越成功,摆脱CUDA影子的紧迫感就越强。一旦英伟达未来在架构层面出现范式转型——比如从当前的Transformer主导转向完全不同的计算范式——一直处于"影子状态"的国产算力栈可能瞬间面临技术断层。
说白了,这轮博弈里最难受的地方在于:谁都有被卡住的东西,谁也做不到一步到位。












