← Wszystkie przewodnikiW skrócie
Wydany 9 lipca 2025 przez xAI. Grok 4 był trenowany z intensywnym uczeniem ze wzmocnieniem na rozumowaniu, a jego konfiguracja Heavy jako pierwszy model przekroczyła 50% w Humanity's Last Exam - benchmarku 2500 pytań na poziomie doktoratu z matematyki, fizyki, chemii, lingwistyki i inżynierii.
Na planie All-inclusive odpowiedź Grok 4 kosztuje 3 kredyty.
Benchmarki
- Humanity's Last Exam (podzbiór tekstowy): 50,7% - pierwszy za progiem 50%.
- ARC-AGI v2 (nowe rozumowanie abstrakcyjne): 15,9% - mniej więcej dwa razy więcej niż kolejny komercyjny model w dniu premiery.
- Benchmark dowodów matematycznych USAMO 2025: 61,9% w konfiguracji Heavy.
W czym najlepszy w Magnusie
Trudne rozumowanie z pazurem: pytania badawcze, wcielanie się w adwokata diabła i rundy debat przeciwko agentowi na Claude. Jego bezpośredni, lekko bezczelny styl czyni go ulubieńcem na personę prowokatora na pasku agentów.
- Grok obsługuje czat i dokumenty; narzędzia integracji (Gmail, Kalendarz, akcje Slack) zostają przy Claude.