הרצת מודלי AI נעשית פשוטה יותר, אבל האחריות ההנדסית דווקא גדלה

המחשה של הרצת מודלי בינה מלאכותית באמצעות תשתית חישוב מאוחדת

החיבור החדש בין Transformers לבין vLLM אינו מעניין בעיקר בגלל עוד שיפור בתפוקה. הכותרת האמיתית היא ביטול הדרגתי של מס ההנדסה ששילמו צוותים על כתיבת אותו מודל פעמיים, פעם למחקר ופעם להגשה בייצור. הערך הזה מגיע עם מחיר: ככל שהפריסה נעשית קלה יותר, כך קל יותר לדלג על בדיקות שהמימוש הייעודי אילץ את הצוות לבצע.

הישג ביצועים בבדיקת מעבדה עדיין אינו מבטיח מערכת יציבה תחת תעבורה משתנה, קלט ארוך או קוד מודל מותאם. ארגון שיראה בדגל הפעלה חדש תחליף לידע בתשתיות מודלים עלול לחסוך שבועות בפיתוח ולשלם עליהם אחר כך בזיכרון מבוזבז, זמני תגובה חריגים ותקלות שקשה לשחזר.

מנוע vLLM מאיץ את Transformers באמצעות שכתוב חישובי בזמן ריצה

המנגנון מתחת לפני השטח מסביר מדוע החיבור הזה מהותי. שכבת ההרצה מנתחת את גרף המודל באמצעות torch.fx, מזהה רצפים מוכרים של פעולות ומבצעת שכתוב באמצעות עץ תחביר מופשט. פעולות נפרדות יכולות להתאחד, וחלק מהחישוב מופנה לגרעינים היעילים של vLLM. התמיכה בחלוקה טנזורית, בחלוקת מומחים, ב-torch.compile ובגרפי CUDA מאפשרת לצמצם השקות חוזרות של גרעינים ולנצל טוב יותר את המאיצים.

הבדיקות כללו מודל Qwen3 צפוף עם 4 מיליארד פרמטרים על מאיץ יחיד, מודל של 32 מיליארד פרמטרים בחלוקה טנזורית, ומודל מומחים של 235 מיליארד פרמטרים בפורמט FP8 על שמונה מאיצי H100. הבקאנד של Transformers השתווה למימושי vLLM המקוריים או עקף אותם בתפוקה. המספרים מוכיחים שהפשטת שכבת המידול אינה חייבת לבוא על חשבון מהירות.

הרצת מודלי AI ללא פורטינג מעבירה את צוואר הבקבוק לבדיקות

נניח שחברת ביטוח מפעילה סוכן לבדיקת מסמכי תביעה באמצעות מודל של 32 מיליארד פרמטרים. הצוות מחזיק מימוש Transformers לצורכי הערכה ומתאם נפרד עבור vLLM בייצור. כל עדכון בארכיטקטורה מחייב התאמה כפולה, ולכן גרסת המודל בייצור מפגרת אחרי גרסת המחקר. החיבור החדש מאפשר לבדוק את הגרסה העדכנית ישירות, אך במבחן עומס הצוות עשוי לגלות שהקלטים הארוכים של מסמכים סרוקים צורכים יותר זיכרון מהמדגם שעליו נמדדה התפוקה.

אפשר לטעון שהפער הזה שולי, משום שהארגון תמיד יכול לחזור למימוש vLLM ייעודי. הטענה הוגנת עבור מודלים מרכזיים ויציבים. התשובה משתנה כשמפעילים עשרות מודלים, גרסאות וניסויים במקביל: עצם התחזוקה של שני נתיבי קוד הופכת לעלות קבועה, מאטה עדכונים ומגדילה את הסיכוי להבדל התנהגות בין הערכה לייצור.

בדיקת ביצועים ארגונית צריכה להשוות שני נתיבי הרצה על אותה תעבורה

הצעד הנכון הוא להוסיף למסלול הקבלה של מודל השוואה קבועה בין המימוש המקורי לבין הפעלה באמצעות הדגל --model-impl transformers. הבדיקה צריכה למדוד תפוקה, זמן תגובה באחוזון 95, צריכת זיכרון ותוצאות תחת חלוקה טנזורית על תעבורה מייצגת. הצוות צריך לבדוק בנפרד מודלים עם קוד מותאם מה-Hub ומנגנוני קשב ליניארי, משום ששם קיימים עדיין פערי תאימות.

הכרעה בין הנתיבים צריכה להתקבל לפי עלות כוללת לבקשה ולפי יציבות, ולא לפי טבלת תפוקה אחת. החיסכון הגדול יגיע מארגון שמסוגל לקדם מודל ממחקר לייצור בלי פורטינג, ובו בזמן מחזיק מומחים שמבינים קומפילציה, מקביליות ומגבלות זיכרון. פשטות בממשק אינה מחליפה עומק מקצועי. היא מאפשרת להפנות אותו למקום שבו הוא באמת נחוץ.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.