← Alle AnleitungenAuf einen Blick
Am 9. Juli 2025 von xAI veröffentlicht. Grok 4 wurde mit intensivem Reinforcement Learning für das Denkvermögen trainiert, und seine Heavy-Konfiguration war das erste Modell, das beim Humanity's Last Exam - einem 2.500-Fragen-Benchmark auf Doktorandenniveau, der Mathematik, Physik, Chemie, Linguistik und Ingenieurwesen umfasst - die 50%-Marke überschritt.
Im All-inclusive-Tarif kostet eine Grok 4-Antwort 3 Credits.
Benchmarks
- Humanity's Last Exam (Text-Teilmenge): 50,7 % - als erstes über die 50%-Marke.
- ARC-AGI v2 (neuartiges abstraktes Denkvermögen): 15,9 % - ungefähr doppelt so hoch wie das nächste kommerzielle Modell zum Zeitpunkt der Veröffentlichung.
- USAMO 2025 Mathematik-Beweis-Benchmark: 61,9 % in der Heavy-Konfiguration.
Am besten geeignet für auf Magnus
Hartes Denkvermögen mit Haltung: Forschungsfragen, Gegenpositionen und Debattenrunden gegen einen Claude-Agenten. Sein direkter, leicht respektloser Stil macht ihn zu einem Favoriten für eine Challenger-Persona in der Agentenleiste.
- Grok deckt Chat und Dokumente ab; Integrations-Tools (Gmail, Kalender, Slack-Aktionen) bleiben bei Claude.