清华浙大联测Claude:工业题44.3压过次席(清华浙大引领中国AI新潮流) ypxx.net

林晓今天翻到清华、北大、浙大等团队的新基准EngiWorld(arXiv:2609.37686):把CAD、仿真、电子设计、建筑信息模型等6大领域、26款专业软件塞进同一套考场,共1301道专家题。打分看交付物几何合不合规、物理行不行得通,不是只看界面点没点对。

图1:EngiWorld总览——跨软件散热片流程与六大领域26款专业软件(来源:arXiv:2609.37686 Figure1)

七个前沿模型零样本实测里,Claude Opus 5工程总分最高,拿到44.3,压过次席GPT-5.6 Sol的38.0;千问3.8 Max约25.8,Gemini 3.7 Flash约25.3。分数看着不低,绝对值其实尴尬:300道分层抽测里,所有模型在128道题上全员零分。

图2:七模型主结果表,Claude Opus 5工程总分44.3居首、GPT-5.6 Sol次席38.0(来源:arXiv:2609.37686 Table2)

跨软件联调更惨——多软件任务整体成功率只有3.6%,Claude在该类也仅8.3分,说明会点单个软件,还远不会把设计链路走完。论文还点出常见翻车:几何/物理约束没满足、交付前不自检、跨软件传参丢约束。接口上Claude在图形界面更占优,GPT步数更省(均约54.9步对Claude约70.2步),但综合分仍落后。

图3:各工程领域得分与失败原因分布,约束未满足与未自检是主因(来源:arXiv:2609.37686 Figure4)

先说清楚:这是第三方论文基准实测,不是Anthropic或OpenAI官方发版。一句话——顶尖模型能摸专业工程软件,离工业级闭环还差一大截。想跟进可看arXiv 2609.37686。

信息来源:arXiv 2609.37686。配图按该论文整理,图注按本篇重写。