4种主流人工智能模型试玩《文明VI》
“国王”难度全败,惨遭失利
在玩家中因极易令人沉迷而被称为“全球三大恶魔游戏”之一的《席德·梅尔的文明》面前,主流人工智能模型接连败下阵来。人工智能模型历经23局游戏后,交出了“3胜20负”的惨淡战绩。
由英国牛津大学等机构参与的联合研究团队本月初在论文预印本网站arXiv发布了题为《CivBench:评估工具使用型智能体在〈文明VI〉中长期执行能力的基准》的论文。该论文分析了4种主流人工智能模型试玩《文明VI》的结果,并将其作为评测基准提出。
《文明》系列是一款回合制策略模拟游戏,曾催生“你玩文明了吗”这一流行语。玩家从人类石器时代一路发展至太空开拓时代,领导并发展一个文明;该系列最新作品已推出至《文明VII》。
研究选择《文明VI》作为研究工具,是因为每局游戏需经历超过300个回合,作出数千次决策,并同时管理科技、文化、经济、军事、外交、城市和领土等事项。换言之,这并非答对一两次问题,而是要将数百项决策连贯地付诸执行。参与游戏测试的4种人工智能模型分别为:Anthropic的Claude Opus 4.6、OpenAI的GPT-5.4、谷歌的Gemini 3.1 Pro,以及月之暗面人工智能的Kimi K2.5。
这些人工智能模型与内置电脑对手进行的23局游戏中,仅取得“3胜20负”的低迷成绩。在19局王子(普通)难度游戏中获得3胜,而在高一级的国王难度4局游戏中则一胜未得。具体战绩为:Claude Opus 4.6为2胜6负,Gemini 3.1 Pro为1胜5负,GPT-5.4为0胜8负,Kimi K2.5为0胜1负。国王难度下,Opus 4.6与GPT-5.4各进行了两局比赛。不过,研究团队表示,由于样本规模较小,难以断言各模型之间的优劣。
这项研究旨在了解:“若让人工智能完整游玩《文明VI》,能在多大程度上观察其长期思考能力?”本次研究最值得关注的发现是,“人工智能没有关注其应当关注的信息”。研究团队要求人工智能每20回合确认一次胜利进度,但实际测试中,人工智能平均每30至75回合才确认一次。更令人意外的是,甚至出现了临近游戏结束仍未进行确认的情况。对此,研究团队说明:“人工智能无法获得信息,与其能够获得信息却不去确认,完全是两回事。这意味着这并非暂时性错误,而是人工智能模型普遍具有的倾向。”
另一个问题是,即使制定计划,人工智能也不会将其付诸执行。研究团队每次都要求人工智能“为接下来的行动制定计划”。例如,当人工智能称“未来10个回合将在这座城市生产兵力,并加强边境防御”时,研究人员便核查其在随后10个回合内是否实际执行了这一计划。针对“计划执行评分”,即在10回合内完成预定计划得1分、部分执行得0.5分、未执行得0分,再换算为百分制,人工智能各模型仅获得48.2至65.8分。换言之,其将自己为近期未来制定的计划转化为实际行动的比例不足一半,最高也仅约三分之二。
综合本次研究结果,人工智能虽能制定长期计划,但在300个回合中持续查找重要信息并执行自身计划的“持续管理能力”方面,仍存在相当大的漏洞。研究团队指出:“仅改善推理能力,难以确保长期任务的可靠性和完整性。还需要采取强制定期查询状态、为监测工具设定优先级等补充措施。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。