מודלי שפה וזיכרון עובדתי: מה מחקר Gemma מלמד ארגונים

תרשים מופשט של זיכרון עובדתי במודלי שפה ארגוניים

ארגונים שמטמיעים בינה מלאכותית נתקלים שוב ושוב באותה שאלה ניהולית: האם ניתן לסמוך על מודל שפה כשהוא עונה על עובדות עסקיות. זו אינה שאלה תיאורטית. מערכת שירות שמבלבלת בין פוליסות, עוזר ידע שמצטט נהלים לא עדכניים או סוכן שמפעיל תהליך על בסיס מידע שגוי יכולים לייצר נזק תפעולי, משפטי ותדמיתי. לכן מחקר חדש על מודלי Gemma חשוב במיוחד, משום שהוא מקרב אותנו להבנה של הדרך שבה מודלי שפה מאחסנים ושולפים עובדות.

מודלי שפה אינם מסד נתונים, הם מערכת זרימה חישובית

מחקר פרשנות מכניסטית שבחן את Gemma-2B ואת Gemma-12B-IT מציע תמונה מעניינת: ידע עובדתי אינו יושב בראש קשב אחד שניתן לזהות ולתקן בקלות. בניסוי BizzaroWorld נבדקו עובדות פשוטות באמצעות טכניקת Activation Patching, שבה מחליפים הפעלות פנימיות בין הרצה תקינה להרצה משובשת ובודקים איך משתנה ההסתברות לתשובה הנכונה. זהו שינוי חשוב לעומת בדיקות דיוק רגילות, משום שהוא מחפש רמז סיבתי בתוך המודל ולא רק מודד את התוצאה החיצונית.

הממצא המרכזי הוא מעגל שליפה בשלושה שלבים. בשכבות מוקדמות ובינוניות הישות מיוצגת בזרם השיורי, כלומר בערוץ שמוביל מידע בין שכבות הטרנספורמר. לאחר מכן מנגנוני קשב מנתבים את המידע לעמדת החיזוי הסופית, אך לא דרך רכיב קסם יחיד. לבסוף, השכבות המאוחרות קוראות ייצוג שכבר התגבש קודם. המשמעות העסקית ברורה: כאשר מודל טועה בעובדה, ייתכן שהבעיה אינה רק בניסוח הפרומפט או בשכבת הפלט, אלא בייצוג פנימי שנוצר מוקדם יותר.

הזיות במודלי שפה דורשות הנדסת אמינות, לא רק פרומפטים טובים

בשטח רואים פער קבוע בין התלהבות מהירה מכלי AI לבין היכולת לבנות מערכת יציבה. פרומפט טוב יכול לשפר ביצועים, אך הוא לא מחליף ארכיטקטורה נכונה, בקרת איכות, ניטור והבנה של התהליך העסקי. תחום הבינה המלאכותית אינו עניין טכני בלבד. הוא דורש שילוב של ידע מחקרי, הבנה ניהולית וניסיון תפעולי. לכן ארגון שרוצה להפחית הזיות לא יכול להסתפק בהדרכת משתמשים או בחיבור מהיר למודל חזק. הוא צריך להגדיר איפה נמצאות העובדות הקריטיות, איך מאמתים אותן, ומתי אדם בלולאה חייב להתערב.

הנקודה הזו חשובה במיוחד במערכות ידע, חיפוש ארגוני וסוכני AI. אם כל תשובה דורשת בדיקה אנושית מלאה, לא נוצרה התייעלות אמיתית. המטרה הנכונה היא להפוך אדם שהיה אחראי על תהליך אחד למפקח על עשרות או מאות תהליכים, בעזרת מדדי סיכון, מסלולי אישור ודגימה חכמה. כאן נכנסים כלים כמו RAG, בדיקות עקביות, השוואה למקורות מאושרים וניטור חריגות. מערכות כאלה צריכות להיבנות מראש סביב אמינות, ולא להתווסף כטלאי אחרי שהפתרון כבר נכנס לייצור.

עיבוד שפה ארגוני צריך להתחיל ממיפוי ידע ותהליכים

הלקח המעשי למנהלים הוא להתחיל במיפוי שכבות הסיכון. יש להפריד בין ידע ציבורי, ידע ארגוני פנימי, נתונים משתנים בזמן אמת והחלטות שמייצרות פעולה. לכל שכבה צריך מנגנון שונה: מאגר מאומת לנהלים, RAG עם ציטוטים למסמכים, בדיקות מול מערכות ליבה לפני ביצוע פעולה, ומסלולי אסקלציה כשאמינות התשובה נמוכה. בנוסף, יש למדוד הצלחה לא רק לפי שביעות רצון משתמשים, אלא לפי שיעור תשובות מאומתות, זמן טיפול, מספר תיקונים אנושיים ושיעור טעויות קריטיות.

מחקרי פרשנות כמו זה שנעשה על Gemma מזכירים למה לאקדמיה יש תפקיד משמעותי בבשלות השוק. הם אינם מספקים מפת דרכים מיידית למערכת ארגונית, אבל הם משנים את השיח: פחות קסם, יותר הנדסה. ארגונים שיבנו יכולת פנימית להקמה וניהול של פתרונות AI, עם צוותים שמבינים גם תהליכים עסקיים וגם מגבלות מודלים, יוכלו להתקדם מהר יותר ובטוח יותר. ההמלצה ברורה: לבחור מודלים וכלים מתקדמים, אך להשקיע לא פחות בממשל נתונים, בדיקות, ניטור והכשרת מנהלים שמבינים את המשמעות האמיתית של אמינות בבינה מלאכותית.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.