← Semua panduanSekilas
Diluncurkan 9 Juli 2025 oleh xAI. Grok 4 dilatih dengan reinforcement learning intensif pada penalaran, dan konfigurasi Heavy-nya adalah model pertama yang melampaui 50% di Humanity's Last Exam - benchmark tingkat PhD dengan 2.500 pertanyaan mencakup matematika, fisika, kimia, linguistik, dan teknik.
Pada paket All-inclusive, balasan Grok 4 memerlukan 3 kredit.
Benchmark
- Humanity's Last Exam (subset teks): 50,7% - pertama melampaui tanda 50%.
- ARC-AGI v2 (penalaran abstrak baru): 15,9% - kira-kira dua kali lipat model komersial berikutnya saat rilis.
- Benchmark bukti matematika USAMO 2025: 61,9% dalam konfigurasi Heavy.
Terbaik untuk di Magnus
Penalaran keras dengan sikap: pertanyaan riset, sudut pandang devil's advocate, dan putaran debat melawan agen Claude. Gaya langsung dan sedikit tak terduganya membuatnya menjadi favorit untuk persona penantang di bilah agen.
- Grok mencakup chat dan dokumen; alat integrasi (Gmail, Kalender, tindakan Slack) tetap dengan Claude.