猜冠军有奖|世界杯上演“人机大战2.0”,你和AI谁赢了?
2026FIFA世界杯官方技术合作伙伴
猜冠军有奖|世界杯上演“人机大战2.0”,你和AI谁赢了?
2026-07-14 11:01:03
浏览
分享
十年前,AlphaGo通过一场举世瞩目的人机对弈,让世界看见AI的能力。十年后,联想集团与咪咕把12个AI和数千万球迷带到同一张世界杯预测考卷前,这场“人机大战2.0”——不再只追问机器能不能赢,而是把AI放进开放、动态的现实世界,检验它是否值得信任:答案从何而来,边界在哪里,犯错能否被看见?过去一个月,我们也由此找到了一种理解AI的新尺度。
100场世界杯赛事、1200次AI判断之后,AI以65.7%对58.9%赢下公众平均线;而在另一张赛前32强答卷上,一名来自重庆的普通球迷却以31/32超过所有AI。
联想集团与咪咕正式联合发布《世界杯预测人机大战百场观察》报告(点击文末“阅读原文”下载阅读),系统复盘这场持续超过一个月的公开实验。
彭博社在6月底以《中国AI公司的最新战场:世界杯预测》为题报道联想与咪咕发起的“世界杯预测人机大战”,称之为新一轮“脑力与算力”较量,并将它与十年前AlphaGo战胜李世石相提并论。
彭博社将这场“人机大战”称为新一轮“脑力与算力”较量,并将它与十年前AlphaGo战胜李世石相提并论。
但两者提出的其实是两个不同的问题:AlphaGo让全球公众看见,AI可以在封闭规则中击败人类顶尖棋手;世界杯人机大战想要观察的,则是当AI进入一个开放、动态、信息不完全的真实世界,它究竟能走多远。
联想天禧AI作为召集者,与DeepSeek、千问、中移九天、百度文心、腾讯混元、Kimi、智谱、MiniMax、阶跃、讯飞星火、商汤小浣熊共同参与,截至14日,活动累计吸引约4000万用户参与。
当第100场比赛的终场哨响起,我们从百场比赛“人机大战”数据中得出了五个结论。
世界杯比赛已进行100场,联想集团与咪咕发起的“世界杯预测人机大战”基于AI与人的数据,有五个关键发现。
发现一:在胜平负的维度上,AI赢了!
截至前100场,12个AI共完成1200次胜平负方向判断,命中788次,整体命中率65.7%;同期公众用户平均命中率58.9%,AI领先6.8个百分点。
这个优势并非从开赛之初就已建立。
6月13日刚开赛,AI命中率落后公众10.6个百分点;仅仅5天之后,人机胜率在6月18日完成“黄金交叉”,AI反超后就持续保持领先。
在“世界杯预测人机大战”中,刚开赛时AI命中率落后公众10.6个百分点;仅仅5天之后,人机胜率在6月18日完成“黄金交叉”,AI反超并持续领先,至今AI领先人6.8个百分点。
AI赢下的不是某一次“神预测”,而是长赛程中的平均稳定性。随着赛程推进,球队状态、积分形势和战术倾向等信息不断累积,AI整合结构化信号的优势逐渐显现;公众判断则更容易受到球队知名度、个人偏好和单场情绪影响。
换句话说,AI的优势不是永远猜对,而是在足够长的赛程里尽可能少犯错。
发现二:全能冠军?抱歉,还没有。
十年前,AlphaGo在五番棋中展现出压倒性优势;这一次的世界杯考场,却没有产生任何“全能冠军”。
赛前32强预测,腾讯混元以29/32排名第一;72场小组赛结束,中移九天与腾讯混元以49场并列领先;32进16阶段,千问猜中14场、以87.5%的命中率单独领跑;16进8阶段,腾讯混元、Kimi和讯飞星火命中7场;8进4阶段则有9家AI 4场全中。
赛前的32强竞赛及正式比赛的预测中,将其分为不同赛段,没有一个AI能在每个赛段都保持领先。
百场累计总榜上,中移九天以71场命中暂居第一,但只领先第二名1场,前六名之间也仅差3场。六个观察维度里,领先者不断轮换,没有一家“赢者通吃”。
在这份动态成绩单上,联想天禧AI呈现出另一种值得关注的能力:赛前32强预测27/32、72场小组赛48/72、32进16阶段13/16、前100场累计69/100,四个关键节点全部进入前四,是12个AI中唯一做到这一点的模型。相比某一赛段的集中爆发,天禧AI的关键词是:全程稳定。
世界杯最终会产生一支冠军球队,但百场预测没有选出一个“全能AI”,它们框定了AI在当下的能力边界。
发现三:平局和冷门是人机共同难题,强共识也会集体失准
足球仍然拒绝被“机关算尽”。
按照统一的120分钟结算口径,在76场分出胜负的比赛中,AI方向命中率达到81.0%,人类为71.8%;但在24场平局中,两者分别骤降至17.0%和16.0%。
平局不是AI独有的盲区,而是人类与AI共同最难处理的题型。
前100场共有15场比赛出现12个AI全部失准,其中11场是平局,另外4场由赛前并不占据主流判断的一方获胜。西班牙0:0佛得角、乌拉圭2:2佛得角、巴西1:2不敌挪威,皆在此列。
透过“世界杯预测人机大战”观察,冷门和平局是AI与人共同的难题,这大概也是足球独特的魅力。
共识同样不等于确定性。
12个AI在40场比赛中全票判断同一方向,其中30场命中、10场失准。AI意见越一致,判断通常越可靠,但每4次全票一致中,仍有1次落空——最值得警惕的时刻未必是AI意见分裂,而可能恰恰是所有AI都确信自己不会错的时候。
冠军预测也暴露了这种共识风险。12个AI中有5票投给巴西,巴西却提前出局;已经站上四强的英格兰,反而没有拿到一张AI冠军票。
“世界杯预测人机大战”冠军赛中,12个AI有5个投给了巴西,但巴西已率先出局,而已进入4强的英格兰,却没有得到任何一个AI的青睐。
精确比分预测则划定了更加严苛的边界:前100场,12个AI共完成1200次比分预测,仅命中145次,整体命中率12.1%;即使表现最好的AI,成功率也只有17.0%。
一次折射、一根门柱、一张红牌……场上任何一点波动,都可能让方向判断仍然正确,却让比分预测瞬间归零。
发现四:12个AI,不止一种赢法
准确率之外,百场预测还让不同AI呈现出各自的决策偏好。
在已经过去的100场比赛中,每个AI针对每场做出胜平负、比分预测、也猜测冠军,这些预测已经可以看出AI拥有不同的决策偏好。
中移九天和联想天禧AI更“稳”,依靠长期减少失误积累优势;千问更“连”,创下14场最长连续命中纪录;讯飞星火更愿意为平局保留空间,主动预测平局19次;MiniMax对比分更加敏感,精确命中16场;阶跃则在项目早期表现出较高的答案更新频率,对新增信息更加敏感。
从百场样本看,12个AI大致呈现出稳健控场、阶段爆发、比分敏感、平局警觉、少数派探索和长链推演等不同方式。
这些“性格”并非预设,也不是对AI能力的永久定义,而是从1200次真实判断中反向显现的阶段性决策轨迹。
总榜告诉我们谁暂时领先,风格差异则告诉我们:12大AI如何抵达答案、如何吸收新信息,又容易在哪些地方共同犯错。
多AI同场的意义,也正是要让共识、分歧和共同盲区同时显现。
发现五:AI赢了平均,人类赢下高光
“世界杯预测人机大战”最高光的时刻,还是属于人。
赛前32强预测中,来自重庆彭水的一名贴砖小哥命中了31支晋级球队,超过AI阵营最高的29/32,也超过了同场作答的多位运动员、解说员和媒体人。
世界杯预测人机大战赛前32强答卷中,一位来自重庆彭水的贴砖小哥,只选错了乌拉圭,错过了佛得角,战胜了12大AI和一系列专业人士。
他唯一的失误,是在佛得角与乌拉圭之间选择了后者。在纯随机的简化假设下,31/32约对应1.81亿分之一,这足以说明这份答卷的分量。
人类高光也并非只有这一个样本。
如果把每场支持比例最高的选项视为人类“首选”,人类在前100场命中68场;在76场分出胜负的比赛中,更是命中67场,达到88.2%。与此同时,赛程中还陆续出现了阶段性连续命中接近20场的普通用户。
十年前,李世石在五番棋中以总比分落败;十年后的世界杯,人类在平均线上落后,却在个体峰值上扳回一局。
AI抬高的是整体水平,人类留下的,是这个夏天最难忘的时刻。这场“人机大战”离最终结束还有4场的距离,也欢迎你赶快加入这场战局!