← Alle guiderOverblik
Lanceret den 9. juli 2025 af xAI. Grok 4 blev trænet med tung forstærkningslæring på ræsonnering, og dens Heavy-konfiguration var den første model, der brød 50%-grænsen på Humanity's Last Exam - et 2.500-spørgsmåls, ph.d.-niveau benchmark der spænder over matematik, fysik, kemi, lingvistik og teknik.
På All-inclusive-planen koster et Grok 4-svar 3 kreditter.
Benchmarks
- Humanity's Last Exam (tekstdelen): 50,7% - den første over 50%-grænsen.
- ARC-AGI v2 (ny abstrakt ræsonnering): 15,9% - ca. dobbelt af den næste kommercielle model ved lanceringen.
- USAMO 2025 matematik-bevis-benchmark: 61,9% i Heavy-konfigurationen.
Bedst til på Magnus
Svær ræsonnering med attitude: forskningsspørgsmål, djævlens advokat-synsvinkler og debatrunders mod en Claude-agent. Dens direkte, lidt friske stil gør den til et yndlingsvalg til en udfordrer-persona på agentbjælken.
- Grok dækker chat og dokumenter; integrationsværktøjer (Gmail, Kalender, Slack-handlinger) er hos Claude.