כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

תרשים המתאר פריסת מודל מכומת על תשתית ענן של AWS

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת.

כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון

מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת דיוק, אף שהרגישות שלהן לשגיאות מספריות שונה. בכימות הדינמי של Unsloth כל שכבה נבחנת בנפרד: שכבות שבהן עיגול המשקולות פוגע באופן חריף בפלט נשארות ב-16 ביט, ואחרות יורדות ל-4 ביט. החיסכון נוצר משום שפחות ביטים נשמרים ומועברים מזיכרון המאיץ בכל שלב יצירה. לפי תוצאות Unsloth, גודל המודל עשוי לרדת ב-86% לצד ירידה של 14% בדיוק. היחס הזה אינו מובטח לכל מודל או משימה, ולכן הבחירה ברמת הכימות היא החלטת איכות, לא הגדרת תשתית בלבד.

פריסת SageMaker עלולה להיכשל בגלל המעטפת ולא בגלל המשקולות

נניח שצוות שירות פורס את Qwen3-VL-8B-Instruct כדי לקרוא תמונות של מוצרים פגומים ולנסח תשובה ללקוח. הגרסה המכומתת Q4_K_XL רצה על ml.g5.xlarge בעלות של כ-1.41 דולר לשעה, לעומת כ-7.09 דולר לגרסה המלאה על ml.g5.12xlarge. בבקשה בודדת התוצאה נראית מצוינת. בעומס של 20 בקשות מקבילות מתגלות תשובות קטועות, משום שהקונטיינר משתמש בתבנית צ'אט שונה מזו ששימשה באימון. כאשר מצורפות גם תמונות והיסטוריית שיחה ארוכה, זיכרון מטמון הקשב גדל אף שהמשקולות מכומתות, וזמן ההשהיה בקצה ההתפלגות מזנק. תיקון התבנית, הגבלת אורך ההקשר ובדיקת עומס משנים את התוצאה יותר ממעבר בין שתי דרגות כימות סמוכות.

בדיקה מקצועית חייבת למדוד את תמונת הפריסה המלאה: זמן אתחול, זמן השהיה באחוזון 95, קצב טוקנים ושיעור תשובות שמתקבלות בבקרת איכות. קובץ המודל צריך להישמר ב-Amazon S3 ולהיטען משרשרת אספקה נשלטת. הורדה ממקור חיצוני בזמן עליית נקודת הקצה מוסיפה תלות תפעולית ועלולה להפוך אירוע autoscaling לכשל שירות. גם ממשקי ping ו-invocations, מדיניות IAM והתנהגות הקונטיינר תחת עומס שייכים לבנצ'מרק.

אפשר לטעון שהדיוק ההנדסי הזה מיותר בפיילוט, ושמספיק להעלות קובץ GGUF למכונת EC2 קטנה ולמדוד חיסכון. לטובת הטענה עומדת מהירות הניסוי, והיא אכן מתאימה לשלב אימות ראשוני. הקושי מתחיל כשהתוצאה משמשת לאישור תקציב ייצור. בדיקה ללא מקביליות, הקשרים מייצגים ותבנית צ'אט זהה מודדת את הקובץ, לא את השירות שהארגון עומד להפעיל.

עלות inference ב-AWS נמדדת לבקשה תקינה

המסלול הנכון מתחיל בהשוואת כמה קובצי GGUF על EC2 עם אותה תבנית צ'אט ואותו מערך בדיקה עסקי. אחר כך יש לנעול את הקובץ שנבחר ב-S3 ולפרוס אותו בקונטיינר SageMaker עם הגדרות זהות. בשלב הבא מריצים מטריצה של ארבעה עומסים לפחות, המשלבת אורכי הקשר ורמות מקביליות שונות, ומשווים עלות לכל תשובה שעברה בדיקת איכות. לבסוף דוגמים תשובות אנושית ומפנים לבדיקה מלאה רק חריגים בעלי סיכון גבוה, במקום להצמיד אדם לכל בקשה. בחירה במכונה הקטנה ביותר שהצליחה במטריצה הזו מממשת את החיסכון של Unsloth בלי להפוך מספר מרשים בדוח לבעיה תפעולית בייצור.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

הרצת מודלי AI נעשית פשוטה יותר, אבל האחריות ההנדסית דווקא גדלה

החיבור החדש בין Transformers לבין vLLM אינו מעניין בעיקר בגלל עוד שיפור בתפוקה. הכותרת האמיתית היא ביטול הדרגתי של מס ההנדסה ששילמו צוותים על כתיבת אותו מודל פעמיים, פעם למחקר ופעם להגשה בייצור. הערך הזה מגיע עם מחיר: ככל שהפריסה נעשית קלה יותר, כך קל יותר לדלג על בדיקות שהמימוש הייעודי אילץ את הצוות לבצע. הישג ביצועים בבדיקת מעבדה עדיין אינו מבטיח מערכת יציבה תחת תעבורה משתנה, קלט ארוך או קוד מודל מותאם. ארגון שיראה בדגל הפעלה חדש תחליף לידע בתשתיות מודלים עלול לחסוך שבועות בפיתוח ולשלם...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.