← Alle guiderKort fortalt
Lansert 9. juli 2025 av xAI. Grok 4 ble trent med tung forsterkningslæring på resonnement, og Heavy-konfigurasjonen var den første modellen til å bryte 50 % på Humanity's Last Exam - en benchmark på 2 500 spørsmål på doktorgradsnivå som spenner over matematikk, fysikk, kjemi, lingvistikk og ingeniørfag.
På All-inclusive-planen koster et Grok 4-svar 3 kreditter.
Benchmarks
- Humanity's Last Exam (tekstdel): 50,7 % - den første over 50 %-grensen.
- ARC-AGI v2 (ny abstrakt resonnering): 15,9 % - omtrent det dobbelte av neste kommersielle modell ved lansering.
- USAMO 2025 matematikkbevis-benchmark: 61,9 % i Heavy-konfigurasjonen.
Best på i Magnus
Hardt resonnement med stil: forskningsspørsmål, djevelens advokat-innspill og debattrunder mot en Claude-agent. Den direkte, litt utfordrende stilen gjør den til en favoritt for en utfordrer-persona på agentlinjen.
- Grok dekker chat og dokumenter; integrasjonsverktøy (Gmail, Kalender, Slack-handlinger) forblir hos Claude.