זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה.
מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות אחדות.
חלון הקשר גדול עדיין משלם מחדש על העבר
חלון של מיליון טוקנים מגדיל קיבולת, אך אינו מספק זיכרון נייד. בכל מעבר לשרת חדש נדרש שלב prefill שקורא את הרצף ומייצר מחדש מפתחות וערכים בכל שכבת קשב. עבודת הקשב גדלה עם אורך הרצף, ובמימוש מלא יכולה להתקרב לעלות ריבועית. שמירת KV-cache מאפשרת להמשיך מהחישוב הקודם במקום לקרוא שוב את כל ההיסטוריה. מצב לטנטי דחוס יכול ללכת רחוק יותר ולשמר ייצוג של המשימה עצמה, ולא רק את הטקסט שהוביל אליו.
החיסכון מגיע עם מגבלת תאימות חריפה. הזיכרון תלוי בגרסת המודל, בטוקנייזר, בתצורת RoPE ובדיוק החישובי. שינוי קטן באחד מהם עלול לייצר תשובה שוטפת אך שגויה. טקסט עובר היטב בין מערכות, בעוד שמצב נוירוני עדיין אינו חוזה אוניברסלי.
זיכרון AI נוירוני חוסך זמן במעבר בין סוכנים
דמיינו סוכן תביעות שקורא תיק בן 40 עמודים, מעביר חשדות לסוכן הונאות, מקבל הערכת נזק ומנסח החלטה. נניח שכל מעבר כולל 25 אלף טוקנים, ושהתהליך רץ על 3,000 תביעות ביום. מערכת טקסטואלית משלמת שוב על העברה ועל prefill בכל תחנה. מערכת ששומרת מצב תפעולי תואם יכולה להעביר את החישוב שכבר בוצע. מסמכי הפוליסה והאסמכתאות עדיין צריכים להישלף באמצעות RAG, משום שהחלטה רגולטורית זקוקה למקור שאדם יכול לבדוק.
הטיעון הנגדי חזק: טקסט ניתן לבדיקה, להרשאה ולניוד בין ספקים, ולכן עדיף להשאיר את כל הזיכרון ב-RAG. הטיעון נכון לגבי ידע מחייב. הוא חלש יותר לגבי רצף ביצוע קצר, שבו שחזור מלא של ההקשר הוא עלות תשתיתית ללא ערך עסקי.
מערכת RAG צריכה להישאר במקום שבו נדרשות ראיות
בתכנון ארכיטקטורה כדאי לחלק זיכרון לשלוש שכבות פונקציונליות, בלי להפוך אותן לשלוש מערכות מנותקות. ידע ארגוני מבוקר יישמר במסמכים וב-RAG. הקשר זמני יישאר בחלון הפעיל. מצב נוירוני יועבר רק בתוך תחום תאימות סגור שבו גרסת המודל ותצורת ההסקה נעולות. בפיילוט יש למדוד ארבעה דברים: זמן עד הטוקן הראשון, רוחב פס, שיעור הצלחה לאחר מעבר ושיעור טעויות בטוחות. כל כשל תאימות צריך להחזיר את הסוכן למסלול טקסטואלי.
פיקוח אנושי צריך להתמקד בדגימות ובחריגות, ולא לאשר כל העברת מצב. צוות שמחבר מחקר מודלים עם הבנת התהליך העסקי יוכל לקבוע היכן דחיסה לטנטית מוצדקת. ארגון שירכוש זיכרון נוירוני לפני שהגדיר גבולות תאימות עלול להחליף צנרת יקרה בתקלה שקשה הרבה יותר להסביר.


