← Alla guiderI korthet
Lanserades den 9 juli 2025 av xAI. Grok 4 tränade med intensiv förstärkningsinlärning på resonemang, och dess Heavy-konfiguration var den första modellen att bryta 50 % på Humanity's Last Exam - ett 2 500-frågor stort PhD-nivåbenchmark som sträcker sig över matematik, fysik, kemi, lingvistik och ingenjörsvetenskap.
På All-inclusive-planen kostar ett Grok 4-svar 3 krediter.
Benchmarks
- Humanity's Last Exam (textdel): 50,7 % - den första att passera 50-procentsgränsen.
- ARC-AGI v2 (nytt abstrakt resonemang): 15,9 % - ungefär dubbelt mot nästa kommersiella modell vid lanseringen.
- USAMO 2025 matematikbevis-benchmark: 61,9 % i Heavy-konfigurationen.
Bäst på i Magnus
Hårt resonemang med attityd: forskningsfrågor, djävulsadvokat-perspektiv och debatter mot en Claude-agent. Dess direkta, lätt självständiga stil gör den till en favorit som utmanarpersona i agentlisten.
- Grok täcker chatt och dokument; integrationsverktyg (Gmail, Kalender, Slack-åtgärder) stannar hos Claude.