分析机构评估中超过Fable
使用费用仅为Fable的一半

人工智能(AI)企业Anthropic发布了新一代AI模型“Claude Opus 5”。


韩联社供图

韩联社供图

View original image

Anthropic于24日(当地时间)发布AI模型“Opus 5”时表示,该模型性能接近顶级公开模型“Fable 5”,但成本仅为后者的一半。


Opus 5在编程、知识工作等多个领域的性能基准测试中超过了OpenAI最新模型GPT-5.6 Sol,且在部分指标中获得了高于“Fable 5”的评价。


在衡量智能体终端环境编程能力的“Frontier-Bench v0.1”中,Opus 5取得43.3%,高于GPT-5.6 Sol的34.4%和Fable 5的33.7%。


在衡量知识工作能力的“GDPval-AA v2”中,Opus 5也以1861分高于另外两款模型;其智能体搜索能力得分为90.8%,同样位居第一。


不过,在反映一般环境下智能体编程能力的“DeepSWE v1.1”指标中,Opus 5得分为68.8%,落后于GPT-5.6 Sol的72.7%;在衡量专家级推理能力的“人类最后考试”(HLE,不使用工具标准)中,其56.3%的成绩也略低于Fable 5的56.5%。

在近期备受担忧的网络安全相关能力方面,Opus 5也取得了显著进展。


Anthropic解释称:“尽管我们有意避免针对网络安全任务训练Opus 5,但随着整体执行能力提升,该模型在此类安全任务中也有所进步。”


不过,Anthropic强调,Opus 5发现安全漏洞的能力虽与仅向部分可信合作伙伴提供的顶级模型“Mythos 5”处于相近水平,但其利用这些漏洞并转化为网络威胁的黑客攻击能力,仍明显落后于Mythos 5。


该公司还表示,Opus 5在可能导向生物武器等开发的长时间自主科学研究方面,仍存在重要局限。


AI性能分析机构Artificial Analysis将Opus 5的智能指数评为61分,比Fable 5高1分,使其跃居已公开AI模型首位。


Opus 5面向开发者的价格与上一代Opus 4.8相同,每100万令牌为5至25美元,为Fable 5的一半;与竞争对手OpenAI的GPT-5.6 Sol每100万令牌5至30美元相比,也处于相近或略低水平。



Anthropic按照性能将AI模型Claude划分为多个层级的细分模型,从顶级的Mythos、Fable,到Opus、Sonnet,再到最轻量级的Haiku,陆续对外发布。


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。