标签:"Opus"相关文章

谷歌反击!Gemini 4 Argon性能比肩Astra,成本仅60%(谷歌Gemini反代一直通不过验证)

谷歌反击!Gemini 4 Argon性能比肩Astra,成本仅60%(谷歌Gemini反代一直通不过验证)

在衡量长程软件工程能力的DeepSWE v1.1测试、评估金融、编程、法律和税务等企业知识工作的Vals Index、测试企业端到端自动化执行能力的AutomationBench,以及考察长视频理解能力的…...

谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让(谷歌Gemini反代一直通不过验证)

谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让(谷歌Gemini反代一直通不过验证)

倒是谷歌内部对新一代旗舰模型的态度还挺有意思的。 官方还重点强调了Argon的防御性网络安全优势。 一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是…...

全球基模决战!AI圈休不了十一长假了(全球顶尖模型)

全球基模决战!AI圈休不了十一长假了(全球顶尖模型)

Kimi开始拿「K3.1」疯狂打哑谜,DeepSeek下一张Pro牌已经提前写进官方文档,Qwen4也直接亮出了新架构。该来的、可能来的、偷偷摸摸已经在考场里的,全赶到了一块儿。 结果也因此在Reddit…...

Anthropic、OpenAI同夜上新:Opus 5.5多项性能超过Astra,GPT-6 Sol赢在价格(anthropic和openai的coding工具对比)

Anthropic、OpenAI同夜上新:Opus 5.5多项性能超过Astra,GPT-6 Sol赢在价格(anthropic和openai的coding工具对比)

在这项测试上,Opus 5.5 拿到 40.0%,GPT-6 Sol 最好的成绩是 xhigh 档的 33.2%,差了将近 7 个百分点,而且Anthropic 注明,Opus 5.5 这次是在不启用备用模…...

至顶头条(今日头条置顶多少钱)

至顶头条(今日头条置顶多少钱)

A:动态工作流(Dynamic Workflows)是Anthropic与Opus4.8同步推出的新功能,目前以研究预览版形式开放。Anthropic在Opus 4.8发布公告中表示,公司正加快推进相关安…...

InfoQ(inform)

InfoQ(inform)

antirez 的回应是,问题不在于是否透明,而在于如果 Anthropic 明知道 GPT-5.5 在编码上比 Opus 4.7 强得多,即使后者在某些基准测试中得分更高,却仍然把这些数字呈现为“模型更强”…...

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

Anthropic在官方迁移指南中指出,Opus 4.7 相比4.6存在若干行为变化,同时也强调,Opus 4.7仍是其当前综合能力最强的通用可用模型,在长周期智能体任务、知识型工作、视觉任务和记忆任务方面…...

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

Anthropic在官方迁移指南中指出,Opus 4.7 相比4.6存在若干行为变化,同时也强调,Opus 4.7仍是其当前综合能力最强的通用可用模型,在长周期智能体任务、知识型工作、视觉任务和记忆任务方面…...

刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作#azz小扎扎

刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作#azz小扎扎

在Artificial Analysis的测试中,Muse Spark拿下了高达52分的战绩,仅次于Gemini 3.1Pro、GPT-5.4和Opus 4.6。 Meta自己也承认了,在代码和长时间Ag…...

刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作#小扎扎是什么意思

刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作#小扎扎是什么意思

在Artificial Analysis的测试中,Muse Spark拿下了高达52分的战绩,仅次于Gemini 3.1Pro、GPT-5.4和Opus 4.6。 Meta自己也承认了,在代码和长时间Ag…...

谷歌重磅发布Gemini 3.1 Pro:推理性能翻倍,开启AI新征程(谷歌新政策2021)

谷歌重磅发布Gemini 3.1 Pro:推理性能翻倍,开启AI新征程(谷歌新政策2021)

这意味着Gemini 3.1 Pro在代码生成、调试和优化等方面已经具备了与顶尖模型相媲美的能力,能够为开发者提供更强大的支持。其推理性能的翻倍、代码能力的提升以及多源数据综合和复杂任务拆解的优势,为人工智能…...

刚刚, Claude Opus 4.6登顶编程之王! 杀入Office全家桶, 15亿打工人变天(刚刚晃了一下是地震了吗)

刚刚, Claude Opus 4.6登顶编程之王! 杀入Office全家桶, 15亿打工人变天(刚刚晃了一下是地震了吗)

Claude Opus 4.6的规划更缜密,能更持久地执行AI Agent任务,在超大规模代码库中运行也更加可靠。 这种能力延伸到了长上下文任务中,它可以在数十万Token中保存和跟踪信息,且漂移更少,并且…...