תמונת מצב של יכולות ה-AI כיום.
לפי הבנצ'מרק
https://livebench.ai/ שמבוסס על שאלות עם תשובה אובייקטיבית + חסין יחסית ל"זיהום" (השאלות לא נחשפו במהלך אימון המודל), אפשר לראות ש:
1)
GPT כמעט שלא התקדם ביכולות לאחרונה - המודל החדש 4o חכם רק במעט בהשוואה לגרסה מוקדמת של GPT 4 שיצאה ב-2023 (מודל שנקרא gpt-4-1106-preview).
2)
קלוד 3.5 הוא המודל החכם ביותר והציג שיפור משמעותי בזמן קצר מאוד - קראתי פוסט של אנת'רופיק שזוקף את השיפור לדאטה סינטתי.
3)
גוגל משתרכת מאחור - המודל המתקדם ביותר של גוגל ממאי (gemini-1.5-pro-api-0514), מפגר משמעותית ביכולות מול GPT וקלוד.
צפה בקובץ המצורף 2521
*ידוע לי שקיימים בנצ'מרקים אחרים להשוואה בין מודלים כמו lmsys אבל הם סובלים מבעיות כמו Sampling bias, "זיהום" ותשובות שלא נבדקות באופן אובייקטיבי.