Anthropic推出Claude Opus 5:新的模型几乎达到了Fable 5的水平,但价格便宜一半
了解Anthropic的Claude Opus 5——一款新的AI模型,几乎达到了Fable 5的水平,但价格是其一半。阅读我们的评论!
QRazy 的主要發現
- Anthropic推出了Claude Opus 5——一款强大的用于编程和科学研究的人工智能模型。
- 新模型在基准测试中显示出了更好的成绩,超过了公司以前的开发和竞争对手。
- 在执行长期任务能力方面的重要改进使得Opus 5成为复杂自动化的理想解决方案。
Anthropic发布了新的旗舰人工智能模型Claude Opus 5,专注于复杂编程、自主AI代理和需要深入分析的任务。公司声称,新的系统在能力上接近于更强大的Claude Fable 5,同时保持了显著更低的成本。
针对复杂任务和自主工作的新模型
先进AI模型的市场竞争日益加剧:Anthropic同时面临OpenAI解决方案的发展和中国开发的快速增长。在这种背景下,公司推出了Claude Opus 5——一款被定位为专业编码、科学研究和复杂智力任务的新水平的模型。
Claude Opus 5取代了Opus 4.8,并保持了之前的API访问成本。同时,该模型成为Claude Max订阅者的主模型,并且是Claude Pro用户可用的最强大的版本。
根据Anthropic的报告,在多个流行的测试中,Opus 5不仅超越了公司的前版本模型,还超越了竞争对手的解决方案,包括Fable 5和GPT-5.6 Sol。
测试结果显示能力显著增强
Anthropic发布了一些基准测试的结果,这些结果应该能展示新模型在实际使用场景中的优势。
- Frontier-Bench v0.1: Claude Opus 5获得了43.3%的成绩,创下了被测试模型中的新纪录。这一成绩是Opus 4.8的两倍多,同时任务执行成本降低。
- CursorBench 3.2: 在最大计算努力水平下,Opus 5的成绩比Fable 5的峰值结果只低了0.5%,尽管其使用成本大约便宜一半。
- ARC-AGI 3: 在解决新、以前未知任务的能力测试中,该模型的表现比最近的竞争对手高出约三倍。
- Zapier AutomationBench: Opus 5在相同成本下,成功完成的任务数比下一个最佳模型多出大约1.5倍。
- OSWorld 2.0: 新模型的成本略高于Fable 5的三分之一。
| Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol | |
|---|---|---|---|---|
| 代理终端编码 Frontier-Bench v0.1 | 43.3% | 33.7% | 21.1% | 34.4% |
| 知识工作 GDPval-AA v2 | 1861 | 1747 | 1593 | 1736 |
| 新问题解决 ARC-AGI-3 | 30.2% | — | 1.5% | 7.8% |
| 代理搜索 BrowseComp | 90.8% | 87.4% | 84.3% | 90.4% |
| 跨学科推理 人类最后的考试 | 56.3% 无工具 64.7% 有工具 | 56.5% 无工具 63.9% 有工具 | 49.8% 无工具 57.9% 有工具 | — |
| 计算机使用 OSWorld 2.0 | 70.6% | 66.1% | 55.7% | 62.6% |
| 业务工作流程 AutomationBench | 26.0% | 17.4% | 17.0% | 18.1% |
| 生物学 BioMistryBench | 49.4% 困难 90.1% 人为求解 | 46.5% 困难 89.0% 人为求解 | 42.4% 困难 88.5% 人为求解 | — |
模型在长时间任务上的表现更好
Anthropic特别指出,在需要AI长时间执行一系列操作的场景中有所改善。公司表示,Claude Opus 5能更好地检查自己的工作,寻找错误的根本原因,而不仅仅是修复问题的外部表现。
该模型也更频繁地返回已完成的步骤,并继续改进结果,直到任务真正解决为止。这对于编程、过程自动化和处理大项目尤为重要,因为单一的答案是远远不够的。
与此同时,Anthropic承认Opus 5并不是在所有方面的绝对领导者。在某些与主动网络安全和生物学领域的特定研究相关的任务中,该模型仍然不及Mythos 5。
开发者在工具使用上获得更多自由
随着新模型的发布,Anthropic为开发者增加了另一个变化。现在,他们可以在当前对话中更改Claude可访问的工具集,而无需重置或重新创建提示缓存。
这简化了创建复杂代理系统的过程,其中可用功能的集合可以根据当前任务的需要而实时变化。
Claude Opus 5的成本保持在先前水平
Claude Opus 5已在Anthropic的所有产品中提供,并通过名为claude-opus-5的API提供。使用该模型的价格为每百万个输入令牌5美元和每百万个输出令牌25美元。
对于需要工作速度的用户,公司还推出了快速模式。该模式提供大约2.5倍的请求处理速度,但价格是标准费率的两倍。
Claude Opus 5的发布表明,AI模型之间的竞争越来越不仅仅是关于最大功率,还包括效率。以更低的成本获得更高价格模型的结果成为人工智能开发者之间竞争的主要因素之一。
