זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

המחשה של מעבר מזיכרון וקטורי למצב נוירוני מתמשך

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה.

מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות אחדות.

חלון הקשר גדול עדיין משלם מחדש על העבר

חלון של מיליון טוקנים מגדיל קיבולת, אך אינו מספק זיכרון נייד. בכל מעבר לשרת חדש נדרש שלב prefill שקורא את הרצף ומייצר מחדש מפתחות וערכים בכל שכבת קשב. עבודת הקשב גדלה עם אורך הרצף, ובמימוש מלא יכולה להתקרב לעלות ריבועית. שמירת KV-cache מאפשרת להמשיך מהחישוב הקודם במקום לקרוא שוב את כל ההיסטוריה. מצב לטנטי דחוס יכול ללכת רחוק יותר ולשמר ייצוג של המשימה עצמה, ולא רק את הטקסט שהוביל אליו.

החיסכון מגיע עם מגבלת תאימות חריפה. הזיכרון תלוי בגרסת המודל, בטוקנייזר, בתצורת RoPE ובדיוק החישובי. שינוי קטן באחד מהם עלול לייצר תשובה שוטפת אך שגויה. טקסט עובר היטב בין מערכות, בעוד שמצב נוירוני עדיין אינו חוזה אוניברסלי.

זיכרון AI נוירוני חוסך זמן במעבר בין סוכנים

דמיינו סוכן תביעות שקורא תיק בן 40 עמודים, מעביר חשדות לסוכן הונאות, מקבל הערכת נזק ומנסח החלטה. נניח שכל מעבר כולל 25 אלף טוקנים, ושהתהליך רץ על 3,000 תביעות ביום. מערכת טקסטואלית משלמת שוב על העברה ועל prefill בכל תחנה. מערכת ששומרת מצב תפעולי תואם יכולה להעביר את החישוב שכבר בוצע. מסמכי הפוליסה והאסמכתאות עדיין צריכים להישלף באמצעות RAG, משום שהחלטה רגולטורית זקוקה למקור שאדם יכול לבדוק.

הטיעון הנגדי חזק: טקסט ניתן לבדיקה, להרשאה ולניוד בין ספקים, ולכן עדיף להשאיר את כל הזיכרון ב-RAG. הטיעון נכון לגבי ידע מחייב. הוא חלש יותר לגבי רצף ביצוע קצר, שבו שחזור מלא של ההקשר הוא עלות תשתיתית ללא ערך עסקי.

מערכת RAG צריכה להישאר במקום שבו נדרשות ראיות

בתכנון ארכיטקטורה כדאי לחלק זיכרון לשלוש שכבות פונקציונליות, בלי להפוך אותן לשלוש מערכות מנותקות. ידע ארגוני מבוקר יישמר במסמכים וב-RAG. הקשר זמני יישאר בחלון הפעיל. מצב נוירוני יועבר רק בתוך תחום תאימות סגור שבו גרסת המודל ותצורת ההסקה נעולות. בפיילוט יש למדוד ארבעה דברים: זמן עד הטוקן הראשון, רוחב פס, שיעור הצלחה לאחר מעבר ושיעור טעויות בטוחות. כל כשל תאימות צריך להחזיר את הסוכן למסלול טקסטואלי.

פיקוח אנושי צריך להתמקד בדגימות ובחריגות, ולא לאשר כל העברת מצב. צוות שמחבר מחקר מודלים עם הבנת התהליך העסקי יוכל לקבוע היכן דחיסה לטנטית מוצדקת. ארגון שירכוש זיכרון נוירוני לפני שהגדיר גבולות תאימות עלול להחליף צנרת יקרה בתקלה שקשה הרבה יותר להסביר.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

2 דק׳ קריאה

הרצת מודלי AI נעשית פשוטה יותר, אבל האחריות ההנדסית דווקא גדלה

החיבור החדש בין Transformers לבין vLLM אינו מעניין בעיקר בגלל עוד שיפור בתפוקה. הכותרת האמיתית היא ביטול הדרגתי של מס ההנדסה ששילמו צוותים על כתיבת אותו מודל פעמיים, פעם למחקר ופעם להגשה בייצור. הערך הזה מגיע עם מחיר: ככל שהפריסה נעשית קלה יותר, כך קל יותר לדלג על בדיקות שהמימוש הייעודי אילץ את הצוות לבצע. הישג ביצועים בבדיקת מעבדה עדיין אינו מבטיח מערכת יציבה תחת תעבורה משתנה, קלט ארוך או קוד מודל מותאם. ארגון שיראה בדגל הפעלה חדש תחליף לידע בתשתיות מודלים עלול לחסוך שבועות בפיתוח ולשלם...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.