在衡量长程软件工程能力的DeepSWE v1.1测试、评估金融、编程、法律和税务等企业知识工作的Vals Index、测试企业端到端自动化执行能力的AutomationBench,以及考察长视频理解能力的…...
倒是谷歌内部对新一代旗舰模型的态度还挺有意思的。 官方还重点强调了Argon的防御性网络安全优势。 一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是…...
Kimi开始拿「K3.1」疯狂打哑谜,DeepSeek下一张Pro牌已经提前写进官方文档,Qwen4也直接亮出了新架构。该来的、可能来的、偷偷摸摸已经在考场里的,全赶到了一块儿。 结果也因此在Reddit…...
在这项测试上,Opus 5.5 拿到 40.0%,GPT-6 Sol 最好的成绩是 xhigh 档的 33.2%,差了将近 7 个百分点,而且Anthropic 注明,Opus 5.5 这次是在不启用备用模…...
A:动态工作流(Dynamic Workflows)是Anthropic与Opus4.8同步推出的新功能,目前以研究预览版形式开放。Anthropic在Opus 4.8发布公告中表示,公司正加快推进相关安…...
antirez 的回应是,问题不在于是否透明,而在于如果 Anthropic 明知道 GPT-5.5 在编码上比 Opus 4.7 强得多,即使后者在某些基准测试中得分更高,却仍然把这些数字呈现为“模型更强”…...
Anthropic在官方迁移指南中指出,Opus 4.7 相比4.6存在若干行为变化,同时也强调,Opus 4.7仍是其当前综合能力最强的通用可用模型,在长周期智能体任务、知识型工作、视觉任务和记忆任务方面…...
在Artificial Analysis的测试中,Muse Spark拿下了高达52分的战绩,仅次于Gemini 3.1Pro、GPT-5.4和Opus 4.6。 Meta自己也承认了,在代码和长时间Ag…...
这意味着Gemini 3.1 Pro在代码生成、调试和优化等方面已经具备了与顶尖模型相媲美的能力,能够为开发者提供更强大的支持。其推理性能的翻倍、代码能力的提升以及多源数据综合和复杂任务拆解的优势,为人工智能…...
Claude Opus 4.6的规划更缜密,能更持久地执行AI Agent任务,在超大规模代码库中运行也更加可靠。 这种能力延伸到了长上下文任务中,它可以在数十万Token中保存和跟踪信息,且漂移更少,并且…...