Qwen3.8在Qoder抢先开测,DeepSeek V4完成接口换代 ypxx.net

导语: 7月19日,阿里千问确认 Qwen3.8-Max-Preview 已经率先上线 Qoder、QoderWork 和 Token Plan,模型总参数达到 2.4T,并宣布正式版即将发布和开放权重。与此同时,DeepSeek 官方计划在7月24日停用 deepseek-chat 与 deepseek-reasoner 两个旧模型名,让 API 用户全面切换到 DeepSeek V4。两条消息放在一起看,国产大模型的竞争已经明显从“聊天回答得好不好”,转向超大规模模型、代码智能体、长程任务和低成本部署的综合较量。

Qwen 官方标识,图片来源:Qwen 官网

Qwen3.8真的已经来了,但目前仍是“可体验、难验证”

关于 Qwen3.8,当前能够确认的核心信息其实不复杂。

7月19日,阿里千问对外表示,Qwen3.8 即将正式发布并开放权重,总参数规模达到 2.4万亿。最强版本目前使用的名称是 Qwen3.8-Max-Preview,预览版已经首发上线阿里的 Token Plan、Qoder 和 QoderWork。换句话说,这并不是只存在于内部测试名单中的“传闻模型”,普通用户已经可以通过阿里的产品入口接触它,只是暂时还没有独立的公开 API 价格表和完整技术报告。

阿里的官方定位非常激进:Qwen3.8 被描述为当前最强大的模型之一,性能可与世界前沿模型相比,并称其“仅次于 Fable 5”。官方还提到,相比不久前上线的 Qwen3.7-Max,Qwen3.8-Max-Preview 在全栈开发、数据分析、Office 办公工作流,以及复杂的多智能体和长程任务中有明显提升。

这里最值得注意的并不是一句“仅次于谁”,而是阿里为什么选择 Qoder作为首发入口之一。

Qoder 并不是普通聊天机器人,而是面向真实软件工程的 Agentic 编码平台。它需要模型理解整个代码仓库,连续调用工具,修改多个文件,运行命令,读取报错,再根据结果继续修正。一个模型在聊天界面回答编程问题很漂亮,不代表它可以在几十轮工具调用中稳定完成任务。因此,Qwen3.8 首发进入 Qoder,本质上是在真实的软件工程工作流中接受压力测试。

这也说明 Qwen3.8 的目标可能不只是刷新几个数学或知识榜单,而是成为阿里下一代代码智能体、办公智能体和企业智能体的底层模型。

不过,必须给这轮热度踩一下刹车。截至目前,阿里还没有公布 Qwen3.8 的完整技术报告,也没有公布可以交叉验证的官方跑分表。外界尚不知道它采用纯稠密架构还是 MoE 混合专家架构,不知道每次推理实际激活多少参数,也不知道上下文长度、最大输出、训练数据规模和每百万 token 的独立 API 价格。

因此, 2.4T 是已经确认的总参数规模,但不能直接等同于每个 token 都要调用2.4T参数,更不能仅凭参数量判定它一定强于参数更小的模型。如果它采用 MoE 架构,真正决定推理成本的还包括激活参数、专家路由、显存通信和服务端并行效率。

DeepSeek V4不是“即将第一次发布”,7月24日真正发生的是接口换代

另一边,DeepSeek V4 的消息容易被误读。

DeepSeek 官方早在4月24日就已经上线并开源 V4 预览版,提供 DeepSeek-V4-Pro和 DeepSeek-V4-Flash两个版本,网页、App和API均已可以使用。此次临近7月24日,真正要发生的变化是旧模型名退出历史舞台。

DeepSeek 官方文档明确写明:deepseek-chat 和 deepseek-reasoner 将在北京时间 2026年7月24日23时59分停止使用。在过渡期内,这两个旧名称实际上已经分别指向 DeepSeek-V4-Flash 的非思考模式和思考模式。开发者需要把模型名改为 deepseek-v4-flash 或 deepseek-v4-pro。

所以,把7月24日称为“DeepSeek V4正式版发布日”并不完全准确。更准确的说法是: DeepSeek将结束兼容过渡期,API体系全面进入V4时代。

当然,这个节点仍然很有意义。旧接口名停用,意味着 DeepSeek 不再把 V4 藏在兼容层后面,而是要求开发者明确选择 Flash 或 Pro。这通常代表模型服务、价格体系、并发限制和工程生态已经趋于稳定。近期 DeepSeek 在 Hugging Face 上持续更新技术报告,也进一步增强了外界对V4进入成熟阶段的判断。

2.4T对1.6T,两家模型的体量应该怎么理解?

项目

Qwen3.8-Max-Preview

DeepSeek-V4-Pro

DeepSeek-V4-Flash

---

---:

---:

---:

总参数

2.4T

1.6T

284B

激活参数

官方未公布

49B

13B

架构

官方未公布

MoE

MoE

上下文长度

官方未公布

1M tokens

1M tokens

最大输出

官方未公布

384K tokens

384K tokens

训练数据

官方未公布

超过32T tokens

超过32T tokens

当前状态

Qoder等平台预览

已开源、API可用

已开源、API可用

从总参数看,Qwen3.8 的2.4T确实超过DeepSeek-V4-Pro的1.6T。但DeepSeek公布了49B激活参数,也就是说在MoE架构下,每次处理token只激活模型的一部分专家。Qwen3.8如果同样采用MoE,必须等官方公布激活参数后,才能判断它的真实推理成本。

对于普通个人用户来说,这两款旗舰模型都不是“买一张显卡就能在本地跑”的级别。即使权重开放,完整部署也需要大型服务器集群、高速互联和成熟的分布式推理框架。所谓开源或开放权重,更大的价值是允许云厂商、科研机构和大型企业进行私有化部署、量化和二次开发,而不是让普通电脑直接运行完整版。

跑分对比:Qwen3.8目前没有公开数字,DeepSeek V4已经给出完整答卷

当前网络上最容易出现的误导,是把 Qwen3.7、Qwen3-Max 或其他模型的跑分图,改个标题就当成 Qwen3.8 的成绩。

截至本文整理时,阿里只公布了内部真实任务中的定性描述, 没有公布Qwen3.8的正式数值跑分。因此,目前无法负责任地给出 Qwen3.8 在 SWE-bench、LiveCodeBench、GPQA 或 AIME 等榜单上的具体分数。任何精确到小数点的“Qwen3.8跑分表”,如果没有来自阿里官方技术报告或独立评测机构,都应该谨慎看待。

DeepSeek V4则不同。其官方模型卡和技术报告已经公布较完整的评测数据。以推理预算最高的 DeepSeek-V4-Pro-Max 为例:

评测项目

DeepSeek-V4-Pro-Max成绩

主要考察能力

---

---:

---

LiveCodeBench

93.5

新鲜代码题与编程推理

Codeforces

3206 Rating

竞赛编程能力

SWE-bench Verified

80.6%

修复真实GitHub问题

SWE-bench Pro

55.4%

更困难的软件工程任务

Terminal Bench 2.0

67.9%

终端操作与Agent执行

BrowseComp

83.4%

网页搜索和信息整合

GPQA Diamond

90.1%

高难度科学推理

MMLU-Pro

87.5%

综合知识与复杂推理

MRCR 1M

83.5

百万上下文信息检索

DeepSeek V4官方性能与长上下文效率图,来源:DeepSeek官方模型仓库

这些成绩说明,DeepSeek V4的优势并不只是知识问答。它在代码竞赛、真实软件修复、终端智能体和长上下文任务中都达到了当前开源模型的第一梯队。

当然,官方跑分也不能完全替代真实使用。不同模型可能采用不同推理预算、工具环境和采样参数,高推理模式往往意味着更长响应时间和更高token消耗。对开发者而言,最有意义的测试仍然是把同一个真实项目、相同工具权限和相同时间预算交给不同模型,看谁能稳定交付可运行结果。

DeepSeek把价格压到了什么程度?

DeepSeek已经给出了非常清晰的API价格。按每百万token计算:

模型

缓存命中输入

缓存未命中输入

输出

---

---:

---:

---:

V4-Flash

0.02元

1元

2元

V4-Pro

0.025元

3元

6元

两个版本都支持1M上下文、思考与非思考模式,以及工具调用。V4-Flash并发限制更高,更适合大量日常请求;V4-Pro更适合复杂代码、研究、规划和高难度智能体任务。

真正的竞争已经从“模型榜单”转向“Agent交付”

Qwen3.8和DeepSeek V4代表了两种非常有中国特色、但路线不同的竞争方式。

阿里的优势是产品和云生态。Qwen3.8可以快速进入Qoder、QoderWork、Token Plan、企业办公和阿里云服务,在真实用户任务中积累反馈。模型不只是API,而是直接嵌入软件开发、数据分析和企业流程。

DeepSeek的优势则是架构效率、透明技术报告、开放权重和极低API价格。V4-Pro用1.6T总参数、49B激活参数冲击顶级能力,V4-Flash则用284B总参数、13B激活参数承担高并发和低成本任务。它的目标是让开发者可以根据任务难度选择不同档位,而不是所有请求都调用最昂贵的模型。

未来真正决定胜负的,不会只是某个榜单高一两分,而是以下几个问题:

第一,模型能否在几十轮甚至上百轮工具调用后仍然保持目标一致;第二,能否理解大型代码库和复杂企业文档;第三,推理成本能否支持大规模商业使用;第四,开放权重之后,第三方能否顺利部署和优化;第五,模型能否形成稳定、可控、可审计的Agent工作流。

接下来最值得关注的五件事

Qwen3.8正式版发布后,首先要看阿里是否公布完整技术报告和跑分表。其次要看其架构与激活参数,2.4T到底意味着多大的真实推理负担。第三要看上下文长度和最大输出,是否达到百万token级别。第四要看开放权重的具体时间、许可证以及第三方部署要求。第五则是Qoder用户的真实反馈:它能不能在大型项目中稳定完成跨文件修改、测试和修复,而不是只在演示任务中表现出色。

DeepSeek方面,7月24日旧接口名停用后,开发者要重点检查现有应用是否已经切换到新模型名。同时,也要关注V4技术报告和模型权重是否继续更新,以及Flash和Pro在真实Agent任务中的成本差距。

结语

Qwen3.8的出现,说明国产旗舰模型已经正式进入多万亿参数时代;DeepSeek V4完成API换代,则说明低成本、百万上下文和Agent能力正在成为新一代基础设施的标准配置。

但越是在模型发布密集期,越需要区分三个层次:厂商定位、官方跑分和独立实测。Qwen3.8目前已经确认上线预览,但跑分和架构仍待公布;DeepSeek V4已经有公开技术数据,但“7月24日正式发布”的说法需要修正为旧接口停止兼容。

下一轮竞争,不是谁更会在聊天窗口里写一首诗,而是谁能真正进入代码仓库、企业系统和复杂工作流,把一件需要人类数小时甚至数天完成的任务稳定交付。

公开资料来源

  • 阿里千问Qwen3.8大模型正式版即将发布并开源|第一财经
  • 阿里千问Qwen3.8预览版模型上线|IT之家
  • Qoder产品概述
  • DeepSeek-V4预览版官方公告
  • DeepSeek模型与API价格
  • DeepSeek-V4-Pro官方模型卡与评测

编辑提醒: Qwen3.8尚未公布完整跑分,本文没有使用来源不明的Qwen3.8数字成绩。涉及“仅次于Fable 5”等表述均为阿里方面的官方定位,不代表独立评测结论。