סוכני AI נמדדים מחדש: למה תשובה נכונה כבר לא מספיקה

ארגונים שמכניסים סוכני AI לתהליכי פיתוח ואוטומציה מגלים מהר מאוד שהשאלה אינה רק האם הסוכן הצליח לבצע משימה. העלות האמיתית נמצאת בדרך: כמה זמן נדרש לו, כמה טוקנים נצרכו, כמה פעמים הוא קרא לכלים, וכמה שגיאות הוא יצר לפני שהגיע לתוצאה. בעולם שבו סוכן יכול להריץ מאות משימות ביום, חוסר יעילות קטן בממשק תוכנה הופך להוצאה תפעולית מצטברת.
מדידת סוכני AI משנה את כלכלת הטוקנים בארגון
בנצ'מרק חדש סביב ספריית Transformers מדגים את השינוי הזה בצורה חדה. סוכן אחד יכול לפתור משימת סיווג סנטימנט באמצעות כתיבת סקריפט Python, טעינת מודל, שימוש בטוקנייזר, חישוב הסתברויות ותיקון שגיאות. סוכן אחר יכול להגיע לאותה תשובה באמצעות פקודת CLI אחת. מבחינת נכונות שתי הדרכים זהות, אך מבחינת עלות, יציבות ותחזוקה הן שונות לחלוטין. לכן מדד הצלחה שמסתפק בודק רק אם התשובה נכונה כבר אינו מספק למערכות ארגוניות.
בפועל צריך למדוד גם זמן חציוני לביצוע, צריכת טוקנים, מספר ניסיונות, שיעור שגיאות, קריאות לקבצים וכלים, ואיכות מסלול הפעולה שהסוכן בחר. ספרייה עם API לא ברור או תיעוד עמוס אינה רק בעיית חוויית מפתח. היא מכפיל עלות במערך אוטומציה מבוסס AI. כאשר מודל גדול עולה יותר לכל קריאה, וכאשר מודל קטן מבזבז יותר זמן על הבנת סביבה מורכבת, ההבדל בין ממשק ברור לממשק מסורבל הופך למדד עסקי.
תכנון Agentic AI דורש תיעוד שמכונה באמת מבינה
הממצא המעניין ביותר הוא שכלי עזר אינם משפיעים באותה צורה על כל מודל. מודלים חזקים נוטים להפיק ערך מממשקי CLI, מדוגמאות קצרות ומחבילות Skill שמסבירות את מסלול העבודה הרצוי. מודלים קטנים יותר עלולים דווקא להתבלבל מעץ קוד מלא, מדוגמאות רבות מדי או מתיעוד שאינו מבחין היטב בין כלי פנימי לבין כלי חיצוני. המשמעות ברורה: בדיקה מול מודל עילית בלבד אינה מייצגת פריסה ארגונית רחבה, שבה פעמים רבות נבחרים מודלים מקומיים, זולים או ייעודיים מטעמי עלות ואבטחת מידע.
כאשר מלווים ארגונים בהקמת סוכנים, ניכר שידע טכני לבדו לא מספיק. צריך להבין את התהליך העסקי, את נקודות הבקרה, את מדיניות האבטחה, ואת המקום שבו אדם בלולאה באמת מוסיף ערך. אם כל פעולה של סוכן דורשת אישור אנושי, לא נוצרה התייעלות. אם אין בקרה נכונה, נוצר סיכון. לכן המטרה היא לבנות סביבת עבודה שבה אדם אחד יכול לפקח על עשרות או מאות תהליכים, בזמן שהסוכנים מקבלים הוראות, כלים ותיעוד שמצמצמים ניסוי וטעייה.
פיתוח AI ארגוני חייב לכלול בדיקות שימוש לסוכנים
השלב הבא עבור צוותי מוצר, מערכות מידע ותשתיות הוא להכניס בדיקות סוכנים לתהליך CI. לא רק האם הטסטים עוברים, אלא האם סוכן מצליח לגלות את הפונקציה הנכונה, להבין את הדוגמה, להריץ את הפקודה, ולתקן שגיאה בלי לבזבז אלפי טוקנים. מדד שימושיות לסוכן יכול לכלול יעד כמו פחות משלוש קריאות לכלים למשימה פשוטה, פחות מניסיון תיקון אחד, והעדפה למסלול CLI כאשר הוא קיים.
המלצה מעשית היא להתחיל במיפוי עשר המשימות הנפוצות ביותר שסוכן אמור לבצע מול ספרייה, API או מערכת פנימית. לכל משימה כדאי למדוד נכונות, זמן, טוקנים, שגיאות והחלטות ביניים. לאחר מכן יש לפשט תיעוד, לקצר דוגמאות, לנסח הודעות שגיאה שמכוונות לפעולה הבאה, ולהוסיף ממשק CLI יציב כאשר הוא מצמצם קוד מיותר. בעולם של סוכני AI, תוכנה טובה אינה רק תוכנה שעובדת. תוכנה טובה היא תוכנה שסוכן מבין מהר, מפעיל נכון, ומנהל בעלות צפויה.


