← Tous les guidesEn un coup d'œil
Lancé le 9 juillet 2025 par xAI. Grok 4 a été entraîné avec un apprentissage par renforcement intensif sur le raisonnement, et sa configuration Heavy a été le premier modèle à dépasser 50 % au Humanity's Last Exam - un benchmark de 2 500 questions de niveau doctoral couvrant les mathématiques, la physique, la chimie, la linguistique et l'ingénierie.
Dans le plan Tout inclus, une réponse de Grok 4 coûte 3 crédits.
Benchmarks
- Humanity's Last Exam (sous-ensemble textuel) : 50,7 % - premier à franchir la barre des 50 %.
- ARC-AGI v2 (raisonnement abstrait inédit) : 15,9 % - environ le double du modèle commercial suivant au lancement.
- Benchmark mathématique USAMO 2025 : 61,9 % dans la configuration Heavy.
Ses points forts sur Magnus
Raisonnement difficile avec attitude : questions de recherche, points de vue en contradiction et rounds de débat contre un agent Claude. Son style direct et légèrement irrévérencieux en fait un favori pour un persona challengeur dans la barre d'agents.
- Grok couvre le chat et les documents ; les outils d'intégration (Gmail, Agenda, actions Slack) restent avec Claude.