איפה האלגוריתם עוצר וההברקה מתחילה

ניסוי מחשבתי הבוחן את גבולות ה-Reasoning של מודלי שפה מול חשיבה אנושית

💡
מדד הניצוץ האנושי
73.67%
ערך מוסף של המוח האנושי מעל הממוצע של ה-AI
26.33%
אחוז הצלחת המכונה (משוקלל)

דירוג המודלים (כללי)

ChatGPT 22.04%
106 / 481 רמזים
Claude 13.31%
64 / 481 רמזים
Gemini 43.66%
210 / 481 רמזים

תשבצים