← כל המדריכיםבמבט מהיר
הושק ב-9 ביולי 2025 על ידי xAI. Grok 4 אומן בלמידת חיזוק כבדה על חשיבה, ותצורת ה-Heavy שלו הייתה המודל הראשון ששבר את רף ה-50% ב-Humanity's Last Exam - מדד של 2,500 שאלות ברמת דוקטורט שמקיף מתמטיקה, פיזיקה, כימיה, בלשנות והנדסה.
בתוכנית הכול-כלול תשובה של Grok 4 עולה 3 קרדיטים.
מדדים
- Humanity's Last Exam (תת-מבחן הטקסט): 50.7% - הראשון שעבר את רף ה-50%.
- ARC-AGI v2 (חשיבה מופשטת חדשנית): 15.9% - בערך כפול מהמודל המסחרי הבא בהשקה.
- מדד הוכחות המתמטיקה USAMO 2025: 61.9% בתצורת ה-Heavy.
הכי טוב ב-Magnus עבור
חשיבה קשה עם אופי: שאלות מחקר, עמדות פרקליט-השטן וסבבי דיבייט מול סוכן Claude. הסגנון הישיר, המעט חצוף שלו הופך אותו למועדף לפרסונת מאתגר בשורת הסוכנים.
- Grok מכסה צ'אט ומסמכים; כלי האינטגרציות (Gmail, יומן, פעולות Slack) נשארים אצל Claude.