← Tutte le guideIn sintesi
Lanciato il 9 luglio 2025 da xAI. Grok 4 è stato addestrato con un intenso apprendimento per rinforzo sul ragionamento, e la sua configurazione Heavy è stato il primo modello a superare il 50% su Humanity's Last Exam: un benchmark di 2.500 domande a livello di dottorato che spazia tra matematica, fisica, chimica, linguistica e ingegneria.
Con il piano All-inclusive una risposta di Grok 4 costa 3 crediti.
Benchmark
- Humanity's Last Exam (sottoinsieme testo): 50,7% - primo oltre il 50%.
- ARC-AGI v2 (ragionamento astratto inedito): 15,9% - circa il doppio del modello commerciale successivo al lancio.
- Benchmark di dimostrazione matematica USAMO 2025: 61,9% nella configurazione Heavy.
Il meglio su Magnus
Ragionamento difficile con attitudine: domande di ricerca, posizioni da avvocato del diavolo e turni di dibattito contro un agente Claude. Il suo stile diretto e leggermente irriverente lo rende il preferito per una persona sfidante nella barra agenti.
- Grok gestisce chat e documenti; gli strumenti di integrazione (Gmail, Calendar, azioni Slack) restano con Claude.