סוכני AI נמדדים מחדש: למה תשובה נכונה כבר לא מספיקה

סוכני בינה מלאכותית נמדדים לפי יעילות שימוש בקוד ובספריות תוכנה

ארגונים שמכניסים סוכני AI לתהליכי פיתוח ואוטומציה מגלים מהר מאוד שהשאלה אינה רק האם הסוכן הצליח לבצע משימה. העלות האמיתית נמצאת בדרך: כמה זמן נדרש לו, כמה טוקנים נצרכו, כמה פעמים הוא קרא לכלים, וכמה שגיאות הוא יצר לפני שהגיע לתוצאה. בעולם שבו סוכן יכול להריץ מאות משימות ביום, חוסר יעילות קטן בממשק תוכנה הופך להוצאה תפעולית מצטברת.

מדידת סוכני AI משנה את כלכלת הטוקנים בארגון

בנצ'מרק חדש סביב ספריית Transformers מדגים את השינוי הזה בצורה חדה. סוכן אחד יכול לפתור משימת סיווג סנטימנט באמצעות כתיבת סקריפט Python, טעינת מודל, שימוש בטוקנייזר, חישוב הסתברויות ותיקון שגיאות. סוכן אחר יכול להגיע לאותה תשובה באמצעות פקודת CLI אחת. מבחינת נכונות שתי הדרכים זהות, אך מבחינת עלות, יציבות ותחזוקה הן שונות לחלוטין. לכן מדד הצלחה שמסתפק בודק רק אם התשובה נכונה כבר אינו מספק למערכות ארגוניות.

בפועל צריך למדוד גם זמן חציוני לביצוע, צריכת טוקנים, מספר ניסיונות, שיעור שגיאות, קריאות לקבצים וכלים, ואיכות מסלול הפעולה שהסוכן בחר. ספרייה עם API לא ברור או תיעוד עמוס אינה רק בעיית חוויית מפתח. היא מכפיל עלות במערך אוטומציה מבוסס AI. כאשר מודל גדול עולה יותר לכל קריאה, וכאשר מודל קטן מבזבז יותר זמן על הבנת סביבה מורכבת, ההבדל בין ממשק ברור לממשק מסורבל הופך למדד עסקי.

תכנון Agentic AI דורש תיעוד שמכונה באמת מבינה

הממצא המעניין ביותר הוא שכלי עזר אינם משפיעים באותה צורה על כל מודל. מודלים חזקים נוטים להפיק ערך מממשקי CLI, מדוגמאות קצרות ומחבילות Skill שמסבירות את מסלול העבודה הרצוי. מודלים קטנים יותר עלולים דווקא להתבלבל מעץ קוד מלא, מדוגמאות רבות מדי או מתיעוד שאינו מבחין היטב בין כלי פנימי לבין כלי חיצוני. המשמעות ברורה: בדיקה מול מודל עילית בלבד אינה מייצגת פריסה ארגונית רחבה, שבה פעמים רבות נבחרים מודלים מקומיים, זולים או ייעודיים מטעמי עלות ואבטחת מידע.

כאשר מלווים ארגונים בהקמת סוכנים, ניכר שידע טכני לבדו לא מספיק. צריך להבין את התהליך העסקי, את נקודות הבקרה, את מדיניות האבטחה, ואת המקום שבו אדם בלולאה באמת מוסיף ערך. אם כל פעולה של סוכן דורשת אישור אנושי, לא נוצרה התייעלות. אם אין בקרה נכונה, נוצר סיכון. לכן המטרה היא לבנות סביבת עבודה שבה אדם אחד יכול לפקח על עשרות או מאות תהליכים, בזמן שהסוכנים מקבלים הוראות, כלים ותיעוד שמצמצמים ניסוי וטעייה.

פיתוח AI ארגוני חייב לכלול בדיקות שימוש לסוכנים

השלב הבא עבור צוותי מוצר, מערכות מידע ותשתיות הוא להכניס בדיקות סוכנים לתהליך CI. לא רק האם הטסטים עוברים, אלא האם סוכן מצליח לגלות את הפונקציה הנכונה, להבין את הדוגמה, להריץ את הפקודה, ולתקן שגיאה בלי לבזבז אלפי טוקנים. מדד שימושיות לסוכן יכול לכלול יעד כמו פחות משלוש קריאות לכלים למשימה פשוטה, פחות מניסיון תיקון אחד, והעדפה למסלול CLI כאשר הוא קיים.

המלצה מעשית היא להתחיל במיפוי עשר המשימות הנפוצות ביותר שסוכן אמור לבצע מול ספרייה, API או מערכת פנימית. לכל משימה כדאי למדוד נכונות, זמן, טוקנים, שגיאות והחלטות ביניים. לאחר מכן יש לפשט תיעוד, לקצר דוגמאות, לנסח הודעות שגיאה שמכוונות לפעולה הבאה, ולהוסיף ממשק CLI יציב כאשר הוא מצמצם קוד מיותר. בעולם של סוכני AI, תוכנה טובה אינה רק תוכנה שעובדת. תוכנה טובה היא תוכנה שסוכן מבין מהר, מפעיל נכון, ומנהל בעלות צפויה.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.