← Totes les guiesEn un cop d'ull
Llançat el 9 de juliol de 2025 per xAI. Grok 4 es va entrenar amb un fort aprenentatge per reforç en raonament, i la seva configuració Heavy va ser el primer model a superar el 50% a Humanity's Last Exam - un benchmark de 2.500 preguntes de nivell de doctorat que abasta matemàtiques, física, química, lingüística i enginyeria.
Al pla Tot inclòs, una resposta de Grok 4 costa 3 crèdits.
Benchmarks
- Humanity's Last Exam (subconjunt de text): 50,7% - el primer a passar la marca del 50%.
- ARC-AGI v2 (raonament abstracte nou): 15,9% - aproximadament el doble del següent model comercial al llançament.
- Benchmark de demostracions matemàtiques USAMO 2025: 61,9% en la configuració Heavy.
On brilla a Magnus
Raonament dur amb actitud: preguntes de recerca, punts de vista d'advocat del diable i rondes de debat contra un agent Claude. El seu estil directe i una mica irreverent el converteix en un favorit per a un personatge desafiador a la barra d'agents.
- Grok cobreix xat i documents; les eines d'integració (Gmail, Calendar, accions de Slack) es queden amb Claude.