ניהול סוכנים נכנס לשלב המדידה העמוק עם הכלי החדש של AWS

מפת דרכים להערכת סוכני AI בארגונים

ארגונים ממהרים להכניס סוכני AI לשירות לקוחות, מחקר פיננסי ותפעול פנימי, אבל רובם עדיין מודדים אותם כאילו היו מערכת תוכנה רגילה. השאלה האם התשובה הסופית נראית נכונה אינה מספיקה כאשר הסוכן בוחר כלים, מדלג בין מקורות, מפרש תוצאות ומחליט מה לבצע בהמשך. במערכות לא דטרמיניסטיות, איכות התהליך חשובה לא פחות מאיכות הפלט.

ניהול סוכנים דורש הערכה לאורך מסלול הביצוע

חברת AWS פרסמה את Agent-EvalKit, ערכת קוד פתוח ברישיון Apache 2.0 שמכניסה את ההערכה אל סביבת הפיתוח עצמה. המפתח מתאר יעד הערכה בשפה טבעית, והכלי קורא את קוד הסוכן, מייצר מקרי בדיקה, מוסיף Trace תואם OpenTelemetry, מריץ את הסוכן, מחשב מדדים ומפיק דוח שמפנה לשורות קוד ספציפיות. המשמעות העסקית ברורה: בקרת איכות של סוכנים עוברת ממדידת תוצאה למדידת התנהגות.

הפער הזה קריטי משום שסוכן יכול לתת תשובה מנוסחת היטב ועדיין להמציא עובדות. בדוגמה שפורסמה, סוכן תיירותי הציג איכות תשובה של 83.9 אחוזים, אבל אמינות של 32.3 אחוזים בלבד ודיוק פרמטרים בקריאות כלים של 64.5 אחוזים. הכשל המרכזי היה טיפול בתוצאות ריקות: כאשר כלי חיפוש לא החזיר מידע, הסוכן מילא את החלל בשערי חליפין, טמפרטורות ופרטי אטרקציות מפוברקים.

סיכוני AI אינם נפתרים בבדיקת פלט בלבד

בעבודה ארגונית אמיתית, זה בדיוק המקום שבו פרויקטים נראים מוצלחים בדמו אך מתקשים לשרוד ייצור. מנהל רואה תשובה טובה, המשתמש מרוצה, והסיכון המשפטי מצטבר בשקט בתוך שרשרת החלטות שלא נבדקה. בתחומים כמו ביטוח, בריאות, אשראי וייעוץ מקצועי, הזיה שמוצגת כמידע שמקורו בכלי פנימי אינה באג קוסמטי אלא כשל ממשלי, רגולטורי ותפעולי.

לכן אדם בלולאה נשאר עיקרון קריטי, אבל הוא אינו יכול להיות צוואר בקבוק על כל פעולה. המטרה הניהולית היא לבנות שכבות מדידה שמאפשרות לאדם אחד לפקח על מאות תהליכים, לזהות חריגות, לאשר מקרי קצה ולשפר מדיניות. כלי הערכה כמו Agent-EvalKit מקרבים את הארגון למודל הזה, משום שהם הופכים את מסלול החשיבה והפעולה של הסוכן לאובייקט מדיד.

פיתוח AI מקצועי מתחיל בתשתית הערכה

כאשר מקימים סוכנים בארגון, לא נכון להתחיל רק מבחירת מודל או ממשק. צריך להגדיר מדדי הצלחה לפי תהליך עסקי: נאמנות למקור, דיוק קריאת כלים, כיסוי מקרי קצה, זמן תגובה, עלות טוקנים, שיעור הסלמה לאדם ואיכות תיעוד. לאחר מכן צריך לחבר Trace, לבנות סט בדיקות חי שמתעדכן מאירועי ייצור, ולהכניס את המדדים אל תהליכי CI ואל סקירות שינוי.

הנקודה החשובה היא שפתרון כזה אינו טכני בלבד. הוא דורש הבנה של תחום התוכן, ניסיון תפעולי, אבטחת מידע, ממשל נתונים ויכולת לתרגם סיכון עסקי למדד מדיד. זו גם הסיבה שארגונים צריכים לפתח יכולת פנימית לניהול סוכנים, ולא להסתפק במומחים מזדמנים או בדמו מרשים. מחלקות מערכות מידע יהפכו בהדרגה למחלקות משאבי אנוש עבור סוכני AI: הן יגייסו, ימדדו, יכשירו, יתחקרו וישביתו סוכנים לפי ביצועים.

ההכרזה של AWS מסמנת כיוון נכון לשוק כולו. סוכני AI ייצרו ערך גדול בהתייעלות תפעולית רק כאשר הם ינוהלו כמערך עבודה מקצועי, עם בדיקות עומק, תצפיתיות, מדיניות הסלמה ושיפור מתמשך בקוד ובפרומפט. מנהלים שרוצים להטמיע סוכנים בשירות לקוחות, כספים או תפעול צריכים להתחיל בפיילוט קצר, לבחור תהליך אחד בעל ערך, להגדיר מדדי אמינות לפני העלייה לאוויר, ולחייב דוח Trace לכל כשל משמעותי. ארגון שמודד רק את התשובה מקבל תחושת ביטחון. ארגון שמודד את הדרך מקבל מערכת שאפשר לסמוך עליה.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.