← Todos os guiasEm resumo
Lançado a 9 de julho de 2025 pela xAI. O Grok 4 foi treinado com aprendizagem por reforço pesada em raciocínio, e a sua configuração Heavy foi o primeiro modelo a ultrapassar os 50% no Humanity's Last Exam - um benchmark de 2500 perguntas ao nível de doutoramento que abrange matemática, física, química, linguística e engenharia.
No plano Tudo incluído, uma resposta do Grok 4 custa 3 créditos.
Benchmarks
- Humanity's Last Exam (subconjunto de texto): 50,7% - primeiro a passar a marca dos 50%.
- ARC-AGI v2 (raciocínio abstrato novo): 15,9% - aproximadamente o dobro do próximo modelo comercial no lançamento.
- Benchmark matemático USAMO 2025: 61,9% na configuração Heavy.
Melhor para no Magnus
Raciocínio difícil com atitude: questões de investigação, perspetivas de advogado do diabo e rondas de debate contra um agente Claude. O seu estilo direto e ligeiramente irreverente torna-o um favorito para uma persona desafiadora na barra de agentes.
- O Grok cobre chat e documentos; as ferramentas de integração (Gmail, Calendar, ações do Slack) ficam com o Claude.