← Todas las guíasDe un vistazo
Lanzado el 9 de julio de 2025 por xAI. Grok 4 fue entrenado con aprendizaje por refuerzo intensivo en razonamiento, y su configuración Heavy fue el primer modelo en superar el 50% en el Examen Final de la Humanidad: un benchmark de 2.500 preguntas a nivel doctoral que abarca matemáticas, física, química, lingüística e ingeniería.
En el plan Todo incluido, una respuesta de Grok 4 cuesta 3 créditos.
Benchmarks
- Humanity's Last Exam (subconjunto de texto): 50,7% — el primero en superar el umbral del 50%.
- ARC-AGI v2 (razonamiento abstracto novedoso): 15,9% — aproximadamente el doble que el siguiente modelo comercial en el lanzamiento.
- Benchmark de pruebas matemáticas USAMO 2025: 61,9% en la configuración Heavy.
Lo mejor en Magnus
Razonamiento difícil con actitud: preguntas de investigación, perspectivas de abogado del diablo y rondas de debate contra un agente de Claude. Su estilo directo y ligeramente irreverente lo hace favorito para una persona desafiante en la barra de agentes.
- Grok cubre chat y documentos; las herramientas de integración (acciones de Gmail, Calendario y Slack) se quedan con Claude.