מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה.
ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי
במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים הרלוונטיים לחישוב הבא. כלי קוליברי מנצל את הדלילות הזאת וטוען מהכונן רק את מקטעי המודל שנבחרו, משחרר אותם, ואז חוזר על הפעולה בטוקן הבא. קוונטיזציה מקטינה את נפח המקטעים במחיר של אובדן דיוק מסוים. כך נחסך זיכרון, אבל כל בחירת מומחה עלולה ליצור קריאת אחסון נוספת. צוואר הבקבוק אינו מספר הפרמטרים הפעילים בלבד, אלא התדירות שבה יש להזיז אותם.
קצב ההפקה שנמדד נע בין 0.05 ל-0.1 טוקן בשנייה. שיחה שימושית דורשת בדרך כלל לפחות 20 עד 30 טוקנים בשנייה. תשובה בת 600 טוקנים תדרוש בקצב הגבוה של הניסוי כ-100 דקות, עוד לפני שמביאים בחשבון עומס מקבילי. הפער הזה אינו שיפור ביצועים קטן שממתין לעדכון תוכנה, אלא הבדל של מאות מונים.
מודל AI מקומי נכשל כשהתור העסקי מתחיל להצטבר
נניח שחברת ביטוח רוצה לנתח בלילה 40 אלף תיקי תביעה, בלי לשלוח מסמכים רפואיים לענן. הצוות מתקין מודל מקומי כדי לסווג חריגות ולנסח תקציר לכל תיק. בקצב של 0.1 טוקן בשנייה, תקציר בן 600 טוקנים צורך כ-100 דקות של הפקה. החישוב המצטבר מגיע לכ-7.6 שנות עיבוד עבור אצווה אחת על מופע יחיד. מקביליות יכולה לקצר את התור, אך היא מחזירה את ההשקעה בשרתים, בכוננים וברוחב פס. הלקח אינו שהרצה מקומית נכשלה, אלא שמדד ההצלחה חייב להיות תפוקה לתהליך שלם ולא עצם טעינת המודל.
אפשר לטעון שמדובר בהוכחת היתכנות, ולכן אין טעם לשפוט אותה לפי ביצועי ייצור. אכן, חומרה עתידית עם יותר ערוצי זיכרון ורוחב פס גבוה עשויה להפוך את השיטה למעשית. אבל ארכיטקטורה שמחליפה זיכרון בקריאות אחסון אינה מקבלת האצה בחינם. ברגע שהכונן משתפר, מגבלת הזיכרון או המעבד הופכת לדומיננטית. תכנון מקצועי נדרש כדי למדוד את השרשרת כולה.
הרצת מודלים מקומית צריכה להתחיל ממפת מומחים ועומסים
ארגון שבוחן את הגישה צריך לבנות מבחן ייעודי על התהליכים שלו ולמדוד ארבעה נתונים: שיעור פגיעות במטמון המומחים, נפח הקריאה לכל טוקן, קצב השלמת מסמך ועלות החשמל לאצווה. כדאי להתחיל במשימות ליליות שאינן אינטראקטיביות, ולהקצות בדיקה אנושית לחריגים ולדגימה במקום לכל פלט. אם אותם מומחים חוזרים לאורך מסמכים דומים, מטמון חכם עשוי לשפר את הקצב באופן חד. אם הבחירה מתפזרת בין מאות מומחים, גם כונן מהיר יהפוך לחדר המתנה יקר.


