Google DeepMind dominerer toppen av en ny rangering av språkmodellers evne til å svare korrekt på korte faktaspørsmål. I Epoch AIs SimpleQA Verified-test får Gemini 3.1 Pro Preview en nøyaktighet på 77,3 prosent, foran Gemini 3 Pro Preview med 72,9 prosent.
OpenAIs GPT-5.6 Sol (max) tar tredjeplassen med 71,6 prosent. Deretter følger Gemini 3.7 Flash (high) med 71,2 prosent og Gemini 3.6 Flash (high) med 68,7 prosent.
Rangeringen bygger på Epoch AIs egne kjøringer av 78 modeller. Den måler ikke hvor kreative, hjelpsomme eller gode modellene er til å skrive lange tekster. I stedet tester den en mer avgrenset, men praktisk viktig egenskap: Om en modell kan gi presise svar på konkrete spørsmål med fasitsvar.
Topp fem i SimpleQA Verified:
1. Gemini 3.1 Pro Preview, Google DeepMind: 77,3 prosent ± 1,3 prosent
2. Gemini 3 Pro Preview, Google DeepMind: 72,9 prosent ± 1,4 prosent
3. GPT-5.6 Sol (max), OpenAI: 71,6 prosent ± 1,4 prosent
4. Gemini 3.7 Flash (high), Google DeepMind: 71,2 prosent ± 1,4 prosent
5. Gemini 3.6 Flash (high), Google DeepMind: 68,7 prosent ± 1,5 prosent
SimpleQA Verified består av 1.000 faktaspørsmål innen politikk, vitenskap og teknologi, kunst, sport, geografi, musikk og historie. Politikk er den største enkeltkategorien, med 18 prosent av spørsmålene, mens vitenskap og teknologi utgjør 16 prosent. Svarene skal typisk være korte og entydige, som en dato, en person, et tall eller et sted.
Det gjør testen særlig relevant for brukere som benytter KI til research, kundestøtte, skolearbeid, oppsummeringer eller raske oppslag. En modell som formulerer seg overbevisende, kan fortsatt gi feil svar. Selv toppmodellen i denne målingen svarer feil på om lag 23 av 100 spørsmål.
Samtidig bør resultatene leses med varsomhet. Usikkerhetsmarginene overlapper delvis mellom flere av modellene på topplisten. Forskjellen mellom GPT-5.6 Sol på 71,6 prosent og Gemini 3.7 Flash på 71,2 prosent er for eksempel mindre enn den oppgitte statistiske usikkerheten. Det er derfor mer presist å si at modellene ligger i samme sjikt enn å konkludere med en tydelig praktisk forskjell mellom akkurat disse to.
Epoch AI opplyser at SimpleQA Verified bygger videre på SimpleQA, som opprinnelig ble utviklet av OpenAI. Spørsmålene ble først laget av menneskelige bidragsytere og valgt ut fordi de var vanskelige for tidligere modeller, blant annet GPT-4. Google har senere bidratt med å fjerne svært like spørsmål, balansere temaene bedre og forbedre kvaliteten på fasitsvarene.
Testen sier heller ikke alt om KI-modellenes faktiske kvalitet i en vanlig samtale. Modeller kan prestere annerledes når de får tilgang til nettsøk, dokumenter, kalkulatorer eller andre verktøy. De kan også være gode på resonnering, kode eller lange analyser uten å være like sterke på korte faktaspørsmål. Men som temperaturmåler på ren, lukket faktakunnskap viser resultatene at feltet fortsatt har et betydelig forbedringsrom.
For vanlige brukere er hovedlærdommen enkel: KI kan være et effektivt startpunkt, men ikke en endelig autoritet. Opplysninger om politikk, helse, økonomi, juss og nyheter bør fortsatt kontrolleres mot primærkilder eller pålitelige redaksjonelle kilder før de brukes videre.