מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

מחשב ביתי המריץ מודל בינה מלאכותית גדול באמצעות טעינה חלקית מהאחסון

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה.

ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי

במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים הרלוונטיים לחישוב הבא. כלי קוליברי מנצל את הדלילות הזאת וטוען מהכונן רק את מקטעי המודל שנבחרו, משחרר אותם, ואז חוזר על הפעולה בטוקן הבא. קוונטיזציה מקטינה את נפח המקטעים במחיר של אובדן דיוק מסוים. כך נחסך זיכרון, אבל כל בחירת מומחה עלולה ליצור קריאת אחסון נוספת. צוואר הבקבוק אינו מספר הפרמטרים הפעילים בלבד, אלא התדירות שבה יש להזיז אותם.

קצב ההפקה שנמדד נע בין 0.05 ל-0.1 טוקן בשנייה. שיחה שימושית דורשת בדרך כלל לפחות 20 עד 30 טוקנים בשנייה. תשובה בת 600 טוקנים תדרוש בקצב הגבוה של הניסוי כ-100 דקות, עוד לפני שמביאים בחשבון עומס מקבילי. הפער הזה אינו שיפור ביצועים קטן שממתין לעדכון תוכנה, אלא הבדל של מאות מונים.

מודל AI מקומי נכשל כשהתור העסקי מתחיל להצטבר

נניח שחברת ביטוח רוצה לנתח בלילה 40 אלף תיקי תביעה, בלי לשלוח מסמכים רפואיים לענן. הצוות מתקין מודל מקומי כדי לסווג חריגות ולנסח תקציר לכל תיק. בקצב של 0.1 טוקן בשנייה, תקציר בן 600 טוקנים צורך כ-100 דקות של הפקה. החישוב המצטבר מגיע לכ-7.6 שנות עיבוד עבור אצווה אחת על מופע יחיד. מקביליות יכולה לקצר את התור, אך היא מחזירה את ההשקעה בשרתים, בכוננים וברוחב פס. הלקח אינו שהרצה מקומית נכשלה, אלא שמדד ההצלחה חייב להיות תפוקה לתהליך שלם ולא עצם טעינת המודל.

אפשר לטעון שמדובר בהוכחת היתכנות, ולכן אין טעם לשפוט אותה לפי ביצועי ייצור. אכן, חומרה עתידית עם יותר ערוצי זיכרון ורוחב פס גבוה עשויה להפוך את השיטה למעשית. אבל ארכיטקטורה שמחליפה זיכרון בקריאות אחסון אינה מקבלת האצה בחינם. ברגע שהכונן משתפר, מגבלת הזיכרון או המעבד הופכת לדומיננטית. תכנון מקצועי נדרש כדי למדוד את השרשרת כולה.

הרצת מודלים מקומית צריכה להתחיל ממפת מומחים ועומסים

ארגון שבוחן את הגישה צריך לבנות מבחן ייעודי על התהליכים שלו ולמדוד ארבעה נתונים: שיעור פגיעות במטמון המומחים, נפח הקריאה לכל טוקן, קצב השלמת מסמך ועלות החשמל לאצווה. כדאי להתחיל במשימות ליליות שאינן אינטראקטיביות, ולהקצות בדיקה אנושית לחריגים ולדגימה במקום לכל פלט. אם אותם מומחים חוזרים לאורך מסמכים דומים, מטמון חכם עשוי לשפר את הקצב באופן חד. אם הבחירה מתפזרת בין מאות מומחים, גם כונן מהיר יהפוך לחדר המתנה יקר.

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

2 דק׳ קריאה

הרצת מודלי AI נעשית פשוטה יותר, אבל האחריות ההנדסית דווקא גדלה

החיבור החדש בין Transformers לבין vLLM אינו מעניין בעיקר בגלל עוד שיפור בתפוקה. הכותרת האמיתית היא ביטול הדרגתי של מס ההנדסה ששילמו צוותים על כתיבת אותו מודל פעמיים, פעם למחקר ופעם להגשה בייצור. הערך הזה מגיע עם מחיר: ככל שהפריסה נעשית קלה יותר, כך קל יותר לדלג על בדיקות שהמימוש הייעודי אילץ את הצוות לבצע. הישג ביצועים בבדיקת מעבדה עדיין אינו מבטיח מערכת יציבה תחת תעבורה משתנה, קלט ארוך או קוד מודל מותאם. ארגון שיראה בדגל הפעלה חדש תחליף לידע בתשתיות מודלים עלול לחסוך שבועות בפיתוח ולשלם...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.