這屆世界盃出現了至少四種「AI 預測」。把它們混在一起比較,準確率很容易越算越糊塗。
聯想與咪咕至少留下了連續百場記錄,比隨手問一句「誰奪冠」紮實。AI vs the World Cup 再往前一步:統一資料與提示詞、鎖定版本,還要求模型給出概率;它另將賽前整套預測做成數字指紋留檔。Opta 則根本不是聊天機器人,它是一條體育數據和概率的模擬pipeline。
從目前公開的連續記錄來看,大模型預測足球比賽,整體命中率大多在六成多。
聯想和咪咕統計了世界盃前 100 場比賽。12 款模型每場都要判斷主勝、平局還是客勝,攢下 1200 次預測,整體命中率 65.7%。同場活動裏的普通用戶呢,58.9%。
所以十二款模型加一塊兒比來比去,也就比普通人多對了不到 7 個百分點。
另一個項目
AI vs the World Cup
,則讓 5 款模型使用同一份資料和同一套提問方式,持續預測整屆世界盃。最終,各模型猜對比賽走向的比例約爲
68.0%—70.2%
。小組賽階段,它們判斷的是 90 分鐘內誰勝、誰平、誰負;進入淘汰賽後,問題變成了哪支球隊能夠晉級。
不過,這兩組數字不能直接拿來排高低。
它們測試的不是同一批模型,使用的資料、提問方式和更新時間不同,連「猜對」的定義也不完全一樣。聯想與咪咕主要統計勝平負,AI vs the World Cup 到淘汰賽階段統計的則是晉級結果。因此,68% 不一定就比 65.7% 更強。
這些項目真正有價值的地方,是把每一場預測都提前記錄下來,而不是比賽結束後只挑猜中的結果展示。至於大模型究竟比普通競猜強多少,還需要在相同題目、相同信息和相同評分規則下,與簡單預測方法以及賽前賠率進行比較。
而 Opta 做的事情又不太一樣。
大模型往往是讀完資料後,直接給出「誰會贏」的判斷;Opta 則先建立一套專門的足球數據系統,再根據這些數據計算不同結果發生的概率。
它的數據來自長期、標準化的比賽記錄。每場比賽都會有專業人員按照同一套規則,記錄射門、傳球、犯規等 60 多類場上事件。比賽進行時,還有其他工作人員同步檢查;比賽結束後,數據還會再複覈一遍,儘量減少漏記和錯記。
說白了,Opta 的概率不是靠幾篇賽前新聞「猜」出來的,背後依賴的是大量、長期、反覆覈對過的比賽數據。
下面這段 3D 重建來自 X 用戶 Alexander Bogachev。他稱每一次傳球、射門和進球都根據 Opta 比賽事件數據還原。它不是 Opta 官方視頻,但把一串結構化事件數據重新拼成了一場能看的比賽。