סוכני AI בארגון: המילון שמפריד בין הדגמה למערכת יציבה

תמונה המדגימה תכנון וניהול סוכני בינה מלאכותית בארגון

ארגונים רבים נכנסים לעולם הסוכנים עם הנחה שגויה: אם יש להם גישה למודל חזק, יש להם סוכן. הם רוכשים רישיונות, מחברים כלי אוטומציה, מריצים הדגמה יפה, ואז מגלים שבייצור התמונה מורכבת בהרבה. החדשות האחרונות סביב המילון החדש של סוכני AI מדגישות נקודה קריטית: השפה כבר אינה עניין סמנטי, אלא תשתית ניהולית, טכנולוגית ובטיחותית.

סוכני AI אינם מודל שפה עם תוספים

הדיון סביב מודל, Scaffold ו-Harness חשוב משום שהוא משנה את הדרך שבה בונים מוצר AI ארגוני. מודל שפה גדול מקבל הקשר ומייצר טקסט, אך הוא אינו זוכר, אינו מחליט לבד מתי לעצור, ואינו מבצע פעולה בעולם החיצוני ללא שכבות ניהול. ה-Scaffold מגדיר מה המודל רואה, אילו כללים מנחים אותו, אילו כלים זמינים לו ומהו פורמט התשובה. ה-Harness הוא מנגנון ההרצה שמפעיל את המודל, קורא לכלים, מחזיר תוצאות ומנהל את הלולאה עד לסיום המשימה. כאשר שתי השכבות האלה חלשות, גם מודל מצוין כמו Claude, GPT או מודל פתוח מתקדם יפיק תוצאות לא יציבות.

לכן רכישת מודל אינה אסטרטגיית AI. במערכת תביעות ביטוח, למשל, אותו מודל יכול להיות עוזר ניסוח פשוט או סוכן שמאתר מסמכים, בודק כיסוי, מפעיל חוקים עסקיים ומעביר חריגים לאדם בלולאה. הפער אינו במספר הפרמטרים, אלא באיכות ההקשר, הכלים, מנגנוני הבקרה ותיעוד ההחלטות.

ניהול סוכנים מתחיל בהנדסת הקשר

הנדסת הקשר היא כבר לא כתיבת פרומפט יפה. היא ארכיטקטורת מידע בזמן ריצה: אילו מסמכים נכנסים לחלון ההקשר, איזה זיכרון נשמר, אילו תוצאות כלים חוזרות למודל, ואיך נמנעים מערבוב בין מידע עדכני למידע מיושן. בארגון גדול, טעות כזו עלולה להפוך להחלטה שגויה מול לקוח, הפרת הרשאות או סיכון ציות. טווחי הקשר גדולים אינם פותרים את הבעיה לבדם, משום שעודף מידע מעלה עלויות טוקנים, מאריך זמני תגובה ומגדיל רעש סמנטי.

כאשר מלווים ארגונים בהטמעה, רואים שוב ושוב שמיומנות תקשורת עם מודלים היא יכולת עסקית ולא טריק טכני. מיומנות פרומפטים, בחירת טכניקה, הגדרת תפקידים, ניהול זיכרון ותכנון מנגנוני עצירה משפיעים ישירות על איכות התוצר ועל חוויית העובד. כאן גם נכנסת החשיבות של השכלה וניסיון מקצועי: סוכן פיננסי, משפטי או תפעולי אינו יכול להיבנות רק על ידי מי שמכיר כלי חדש ברשת, אלא על ידי צוות שמבין גם AI, גם תהליך עסקי וגם סיכונים ניהוליים.

הטמעת AGENTIC AI דורשת ממשל ולא רק כלי

הטמעת Agentic AI מחייבת פלטפורמה להקמה, ניטור וניהול סוכנים. שימוש בכלים כמו Copilot Studio, N8N או Claude Code יכול להיות אפקטיבי מאוד, אך רק אם הארגון מגדיר הרשאות, לוגים, מדדי הצלחה ותהליך אישור לשימוש בכלים חיצוניים. תת-סוכן שמטפל ברכש, למשל, צריך גישה למערכת ספקים, אך לא בהכרח להרשאות תשלום. לכן מחלקות מערכות מידע יהפכו בהדרגה למחלקות משאבי אנוש של סוכני AI: גיוס, הרשאה, הדרכה, הערכה והוצאה משימוש.

הגישה הנכונה אינה להציב אדם על כל פעולה. אדם בלולאה נשאר עיקרון קריטי, אך הערך האמיתי נוצר כאשר מנהל אחד יכול לפקח על עשרות ומאות תהליכים במקום לבצע אותם ידנית. המדד החשוב אינו כמה סוכנים הושקו, אלא כמה החלטות בטוחות, מדידות וניתנות לבקרה עברו מאדם למערכת בלי לפגוע באיכות.

מנהלים צריכים להתחיל במיפוי תהליכים שבהם יש חזרתיות לצד שיקול דעת, להגדיר לכל תהליך רמת סיכון, ואז לבנות סוכן קטן עם Harness ברור, הקשר מצומצם ומדדי איכות. לאחר מכן יש להרחיב בהדרגה, עם ניטור עלות לטוקן, שיעור חריגים, זמן טיפול ושביעות רצון משתמשים. חברה שתבנה יכולת פנימית כזו תרוויח יתרון תפעולי אמיתי. חברה שתסתפק בצ׳אטבוט עם חיבור לכלים תגלה מהר מאוד שהדגמה מרשימה אינה מערכת ייצור.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.