查看: 78|回复: 0

把6个AI扔进塔防厮杀,谁能活到最后?谁表现最拉,谁又被严重低估?

[复制链接]

3075

主题

0

回帖

9264

积分

超级版主

积分
9264
发表于 2026-8-28 08:48:23 | 显示全部楼层 |阅读模式
6个国内主流AI大模型,放进同一个塔防游戏里,谁的推理和决策能力更强? 这次我把豆包、MiniMax、千问、Kimi、GLM、DeepSeek拉到一起,统一规则、统一环境,不考察视觉能力,只看它们如何根据实时战场信息做决策。有人稳扎稳打,有人疯狂攒钱,也有人看似马上要输了却一路苟到最后。 六位选手鏖战五关,最后谁拿到了第一?又是谁紧随其后?真正的结果,看到最后一刻才知道。 当然一场游戏不能定义一个AI大模型,但这种让AI真正“自己做决策”的比拼,确实比单纯跑Benchmark有意思得多~
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|天翼网

相关侵权、举报、投诉及建议等,请发 E-mail:2026@typc.net

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|晋ICP备2026008270号-1|晋公网安备14010602111293号

QQ客服返回顶部