Welk AI-model voorspelt sportuitslagen het nauwkeurigst? Die vraag onderzocht Bureau Onder tijdens het WK voetbal 2026. Zes weken lang lieten de onderzoekers vijf populaire AI-modellen alle 104 wedstrijden voorspellen. Uiteindelijk kwam ChatGPT als winnaar uit de bus, gevolgd door Claude. Gemini eindigde als hekkensluiter.
Voor het experiment voorspelden ChatGPT, Claude, Gemini, Copilot en Perplexity iedere wedstrijd van het wereldkampioenschap. De prestaties werden gedurende het toernooi bijgehouden met het puntensysteem van Scorito.
ChatGPT eindigt bovenaan
ChatGPT behaalde de hoogste totaalscore en eindigde met een voorsprong van 35 punten op Claude. Toch laat het onderzoek zien dat ook het best presterende model verre van onfeilbaar is.
Van de 104 wedstrijden voorspelde ChatGPT 33 keer de verkeerde uitslag. Slechts 14 keer wist het model de exacte eindstand correct te voorspellen.
Gemini presteerde het minst goed en eindigde als laatste van de vijf onderzochte AI-modellen.
Drie modellen kozen de uiteindelijke wereldkampioen
Alle modellen kregen exact dezelfde opdracht. Ze ontvingen onder meer het officiële FIFA-speelschema, de FIFA-ranglijst, de resultaten van de laatste vijf wedstrijden van iedere deelnemer en de instructie om hun voorspellingen te onderbouwen.
Vooraf wezen drie modellen – ChatGPT, Claude en Perplexity – Spanje aan als toekomstige wereldkampioen. Copilot voorspelde dat Argentinië de titel zou pakken, terwijl Gemini zijn kaarten op Brazilië zette.
Consensus bleek vaak een goede graadmeter
Opvallend was hoe vaak de modellen dezelfde voorspellingen deden. ChatGPT week tijdens het hele toernooi slechts één keer af van de andere vier modellen. Juist die afwijkende voorspelling bleek uiteindelijk volledig juist.
Claude week vier keer af van de groep, Gemini zes keer, Perplexity zeven keer en Copilot acht keer. Dat laatste model zat zelfs in de WK-finale als enige niet op één lijn met de overige AI-systemen.
AI blijft geen voetbalorakel
Volgens Bureau Onder laat het experiment vooral zien dat AI-antwoorden kritisch moeten worden beoordeeld. Het WK bood een zeldzame mogelijkheid om AI-voorspellingen objectief te vergelijken, omdat iedere voorspelling achteraf eenvoudig kon worden gecontroleerd.
Het model dat het dichtst bij de consensus bleef, ChatGPT, behaalde uiteindelijk de beste score. Gemini, dat gemiddeld de meeste doelpunten voorspelde en daarmee de meest aanvallende verwachtingen had, eindigde juist onderaan.
Toch waarschuwen de onderzoekers ervoor om AI niet blindelings te vertrouwen. Zelfs het best scorende model zat bij bijna een derde van alle wedstrijden fout. Volgens Bureau Onder onderstreept dat het belang van het vergelijken van meerdere AI-antwoorden en het controleren van informatie aan de hand van onafhankelijke bronnen.
Voor marketeers, contentmakers en andere professionals die AI gebruiken, is de conclusie helder: kunstmatige intelligentie kan een waardevol hulpmiddel zijn, maar vervangt het eigen oordeel nog altijd niet.
