top of page
הקטעים בעמוד הם הסברים שרלוונטים לתוכן שאני מייצר בטלגרם

ARC AGI

מדובר בבנצ׳מאק יחודי שיצר המדען François Chollet יחד עם קבוצת חוקרים נוספים.

בגדול, מדובר במבחן ויזואלי שבו מוצגים דפוסי שינוי על רשת פיקסלים, והמודל צריך לחזות את הדפוס החסר.
המטרה היא מבחן שיחסית קל לעין אנושית, ומאד קשה למודלי שפה גדולים.

התאוריה שעומדת מאחוריו הוא שמודלי שפה גדולים הן מכונות שתכליתן הוא ״לחפש את התכנית הנכונה ולבצע אותה״, בעוד בני אדם יודעים ״להמציא תכניות״.
מכאן מגיע האתגר - כל דפוס מצריך בניה של סוג של ״תכנית מנטאלית״ כיצד לפתור אותו, משהו שבו בני אדם מצטיינים ו(נטען) שמודלי שפה לא יכולים לעשות.
הרעיון המרכזי הוא שמודל שפה אמור לא להצליח במבחן הזה גם אם הוא רק מתאמן על דוגמאות, כי כל ״תכנית״ שנבנית עבור משימה לא תתאים לאף משימה אחרת.

הבנצ׳מארק מורכב מסט אימון של 400 משימות שפתוח לכולם, סט בחינה של 400 משימות שפתוח לכולם, וסט נוסף של 100 משימות שהוא חסוי לחלוטין, והמארגנים של ARC AGI משתמשים בו כדי לתת את הציון הסופי לכל מודל.

יש כרגע (נכון ל8.12.2025) שני מבחנים כאלה שפתוחים לבדיקות. המבחן השני, ARC-AGI-2 נבנה כך שיהיה רובסטי יותר להררי ניסוי וטעיה שהמודל יכול לעשות, בהיעדר היכולת באמת ״להבין״ כיצד לפתור את הבעיה.

כמובן שהוא לא מושלם, והצלחה בו לא אומרת שבאמת באמת הגענו למודלים שמתקרבים לAGI, אך כן נראה, לאורך הזמן, שהוא משמש ״מצפן״ טוב להתקדמות המודלים.

bottom of page