סוכני AI בארגון: איך אפשר לבסס יציבות סוכני AI לאורך זמן.
ארגונים רבים מתרשמים מסוכן AI שמבצע דמו קצרה בצורה מבריקה. מנהלים רבים מגלים בהמשך שהסוכן נכשל דווקא בפרויקט אמיתי שמצריך רצף החלטות ארוך, תלות בין צעדים, וזיכרון עבודה לאורך זמן (משימות long horizon). תופעה זו אינה מקרית, והיא עומדת במרכז מחקר חדש שמציע למדוד לא רק הצלחה סופית, אלא גם את מסלול הפעולה שמוביל אליה. הכירו את HORIZON - בנצ'מרק אבחוני חוצה תחומים שמטרתו לענות על שאלה תפעולית מאוד: איפה ולמה מערכות סוכנים מבוססות מודלי שפה גדולים נשברות במשימות "ארוכות אופק". הבנצ'מרק נוצר במחקר...












