הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...
הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...
כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...
אוטומציה מייצרת יתרון תחרותי רק כשהיא מצמצמת את מספר ההחלטות שאדם חייב לבדוק, ולא כשהיא פשוט מריצה יותר פעולות. תהליך שבו מודל קורא מסמך ואז עובד מאשר כל שדה נשאר אותה עבודת פיקוח, רק עם ממשק חדש. הערך נוצר כשאדם שפיקח אתמול על תהליך אחד מסוגל לפקח מחר על מאות מופעים, בלי לאבד עקיבות ובלי להפוך לבלם. אוטומציה נכשלת במעבר מהבנה לביצוע אוטומציה קלאסית יודעת להעביר רשומה, לשנות סטטוס, לשלוח התראה ולתעד תוצאה. מודל שפה מוסיף שכבת הבנה לקלט שאינו מובנה, כמו דואר אלקטרוני, מסמך או בקשה חופשית....
החיבור החדש בין Transformers לבין vLLM אינו מעניין בעיקר בגלל עוד שיפור בתפוקה. הכותרת האמיתית היא ביטול הדרגתי של מס ההנדסה ששילמו צוותים על כתיבת אותו מודל פעמיים, פעם למחקר ופעם להגשה בייצור. הערך הזה מגיע עם מחיר: ככל שהפריסה נעשית קלה יותר, כך קל יותר לדלג על בדיקות שהמימוש הייעודי אילץ את הצוות לבצע. הישג ביצועים בבדיקת מעבדה עדיין אינו מבטיח מערכת יציבה תחת תעבורה משתנה, קלט ארוך או קוד מודל מותאם. ארגון שיראה בדגל הפעלה חדש תחליף לידע בתשתיות מודלים עלול לחסוך שבועות בפיתוח ולשלם...
הסיפור ב-GPT-Live-1 אינו רק שהקול נשמע טבעי יותר. החידוש החשוב הוא שממשק קולי הופך מערוץ קלט לשכבת ביצוע רציפה: הוא מאזין בזמן שהוא מדבר, שומר הקשר ומעביר פעולה למודל נוסף בלי לסגור את השיחה. ארגון שיתייחס אליו כשדרוג למוקד הטלפוני יקבל הדגמה מרשימה, אבל גם מערכת החלטה שקשה לבקר. מודל GPT-Live-1 מצמצם השהיה ומוחק גבול תפעולי הארכיטקטורה הישנה יצרה שרשרת שקל יחסית לפרק. תחילה מנוע המיר דיבור לטקסט והעביר אותו למודל שפה. לאחר יצירת התשובה, מנוע נוסף הפך את הטקסט לקול. כל שלב הוסיף השהיה...
רופא יכול לדחות המלצה של אלגוריתם ולהגן על המטופל, אך אם יקבל אותה והמטופל ייפגע, שמו יופיע בתיק. הסידור הזה אינו רק עוול משפטי, אלא כשל בתכנון המערכת. בינה מלאכותית ברפואה מפצלת את השליטה בהחלטה בין ספק, הנהלת בית החולים וצוות קליני, בעוד האחריות נשארת מרוכזת אצל האדם האחרון בשרשרת. רישוי האלגוריתם לבדו לא יפתור את הפער. כשל בבינה מלאכותית ברפואה מתחיל לעיתים בסף החלטה מערכת אבחון אינה מפיקה אמת רפואית, אלא ציון הסתברותי שעובר דרך סף החלטה. הסף נקבע במהלך האימון או ההטמעה כדי לאזן בין רגישות...
הכותרת המפתה סביב AG-UI היא שסוכן AI יכול לצייר גרף במקום לכתוב תשובה. החידוש החשוב יותר הוא חוזה התפעול שנוצר בין הסוכן, הממשק והאדם המאשר. בלי חוזה כזה, כל סוכן מוצלח נשאר הדגמה שקשה לנטר ולשדרג. עם חוזה כזה, ממשק הסוכן נעשה יחידת בקרה, ולכן Amazon Bedrock AgentCore מעניין יותר כתשתית ניהול מאשר כמנוע תצוגה. פרוטוקול AG-UI יוצר חוזה אירועים במקום תלות בקוד הממשק פרוטוקול AG-UI מייצר זרם אירועים טיפוסי בין הסוכן ללקוח. בחיבור המבוסס בדרך כלל על Server-Sent Events, השרת משאיר ערוץ HTTP פתוח...
יכולת Managed Entitlements של Amazon Bedrock מוצגת כשיפור בהרשאות, אבל הערך האמיתי שלה נמצא במקום פחות טכני: היא הופכת רכישת מודלים לתשתית ארגונית מרכזית. זה גם הסיכון שלה. אם הארגון מפיץ זכאות ל-100 חשבונות בלי לחבר אליה עלות, בעלים עסקי, מדיניות ביטול ובקרת שימוש, הוא אינו פותר את התפזרות המודלים אלא מעביר אותה לחשבון הניהול. ממשל AI אינו נוצר מעצם קיומו של רישיון מרכזי. הרשאות מודלים ב-Amazon Bedrock פועלות בשתי שכבות שונות חשבון הניהול נרשם למודל דרך AWS Marketplace ומקבל גם הצעה פרטית,...
הכותרת המתבקשת היא שמודל TabFM של גוגל מאתגר את XGBoost. בעיניי, זו הכותרת הפחות מעניינת. החידוש הארגוני הוא הורדת העלות של יצירת תחזית עד לרמה שבה אנליסט יכול להפעיל סיווג או רגרסיה מתוך BigQuery, בלי מחזור אימון מלא. דווקא הקיצור הזה מעביר את צוואר הבקבוק מהנדסת המודל אל ממשל הנתונים: מי רשאי לחזות, על אילו עמודות ובאילו תנאים מותר להכניס את הפלט לתהליך עסקי. היתרון של TabFM נולד מהקשר, לא מאימון מחדש מודל TabFM אינו מקבל טבלה כאילו הייתה משפט. סדר השורות והעמודות בטבלה אינו נושא משמעות...
מנהלים נוטים לבחון פרויקטי AI דרך השאלה איזה מודל חזק יותר, אבל בשטח השאלה החשובה יותר היא איזה מודל נכון יותר לבעיה, לדאטה ולסיכון העסקי. הניסוי האחרון בחיזוי 358 משחקים בינלאומיים ממחיש זאת היטב: רגרסיה לוגיסטית פשוטה ניצחה את XGBoost במדד log-loss, למרות שמדובר באלגוריתם שנחשב חזק בהרבה בתחרויות ובמערכות עתירות דאטה. כאשר הדאטה קטן, מעט התכונות אינן מספרות את כל הסיפור, והיעד עצמו רועש, מורכבות יכולה להפוך מיתרון לחוב. רגרסיה לוגיסטית כבחירה עסקית ולא כפשרה טכנית בניסוי נבחנו חמישה מסווגים...
ארגונים רבים מגיעים לשלב שבו עלויות ההסקה של מערכות AI כבר אינן סעיף ניסוי קטן, אלא רכיב תפעולי אמיתי בתקציב. הפיתוי ברור: לבנות שכבת ניתוב מודלים שמפנה פניות פשוטות למודל זול, ופניות מורכבות למודל חזק ויקר יותר. על פניו זו החלטה ניהולית מצוינת, פחות טוקנים יקרים, פחות עומס ענן, ואותה חוויית לקוח. בפועל, זו אחת המלכודות הנפוצות ביותר בהטמעת AI ארגוני. ניתוב מודלים אינו רק אופטימיזציה של כלכלת טוקנים הדיון סביב ניתוב מודלים מתחזק במיוחד לקראת מערכות AI ארגוניות של שנת 2026, שבהן מנהלים מצפים...
מונח Tokenmaxxing הוא מונח חדש-ישן ומאחוריו גישה שגויה שאומצה בצורה עיוורת. על פי דיווח של Financial Times מהיום, Google נאלצה להגביל את צריכת Gemini של Meta לאחר שהחברה הפכה לאחת מצרכניות טוקני AI הגדולות בעולם. אני מנסה ללא הצלחה להבין את הגישה, אבל אין בה היגיון, בטח בעידן אג'נטי. מעבר לכך ששימוש בסוכנים אוטונומיים ללא תכנון הוא בעייתי ולא יעיל בצד העסקי, הדבר העיקרי שהוא תורם הוא שריפת טוקנים עיוורת. שימוש עיוור בסוכני AI עבור פעולות פשוטות, שצורכות כמויות טוקנים אדירות, אינו אימוץ AI אלא...
ארגונים רבים כבר עברו את שלב ההתלהבות מצ'אטבוטים. השאלה הרצינית היום אינה האם מודל שפה יודע לנסח תשובה יפה, אלא האם הוא מסוגל לבצע עבודה מבוקרת בתוך תהליך עסקי אמיתי. כאן נכנס לתמונה סוכן AI מקומי, שמחבר בין מודל שפה, כלים, הרשאות ומידע עדכני בלי למסור את כל ההקשר העסקי לספק חיצוני. סוכן AI מקומי כבר אינו ניסוי של מפתחים מאמר חדש מציג בנייה מעשית של סוכן מחקר מקומי באמצעות Gemma 4, Ollama, OpenAI Agents SDK ופרוטוקול MCP לחיבור אל Tavily ככלי חיפוש. החשיבות אינה ברשימת המוצרים עצמה, אלא...
ארגונים רבים בונים היום מערכות RAG שמחברות מודלי שפה למסמכים פנימיים, נהלים, חוזים, בסיסי ידע ומערכות שירות. ההבטחה ברורה: פחות חיפוש ידני, תשובות מהירות יותר, ויכולת להפוך ידע ארגוני מפוזר לכלי עבודה חי. הבעיה מתחילה כאשר ציון הערכה מרשים, למשל 97%, הופך לתעודת ביטוח ניהולית. בפועל, ציון כזה עלול לשקף מערכת שלמדה את הבחינה ולא מערכת שמסוגלת להתמודד עם השטח. הערכת RAG חייבת להפריד בין פיתוח לבדיקה מערכת RAG נמדדת בדרך כלל בשני צירים: איכות השליפה ואיכות התשובה. בצד השליפה בודקים מדדים כמו...
ארגונים רבים כבר מבינים שהשאלה אינה האם להשתמש במודלי שפה, אלא איך לבנות סביבם תהליכים יציבים, מאובטחים וכלכליים. בעבר, בדיקה רצינית של מודל פתוח דרשה צוות תשתיות, הקצאת GPU, הקמת סביבת Serving, ניטור והרשאות. בפועל, חסם כזה גורם לצוותים לדחות ניסויים, לבחור בכלים סגורים מהר מדי, או להסתמך על הדגמות שלא עומדות בעומס עסקי אמיתי. שרת LLM פרטי כקיצור דרך לניסוי עסקי אחראי חברת Hugging Face הציגה דרך להריץ נקודת קצה פרטית למודלי שפה גדולים באמצעות HF Jobs ו-vLLM, עם תאימות לממשק OpenAI. המשמעות...
ארגונים פיננסיים אינם מתקשים היום לאסוף נתונים, הם מתקשים להפוך אותם להחלטות אשראי שאפשר להסביר, לתמחר ולבקר לאורך זמן. דירוג אשראי מודרני אינו רק ציון יפה בדשבורד, אלא שכבת תרגום בין מתמטיקה, מדיניות סיכון, רגולציה וחוויית לקוח. כאשר הציון אינו מובן למנהלי האשראי, הוא נשאר ניסוי אנליטי ולא הופך למערכת תפעולית אמינה. דירוג אשראי מתחיל בתרגום נכון של רגרסיה לוגיסטית הדיון סביב מודל דירוג אשראי עם רגרסיה לוגיסטית חשוב דווקא מפני שהוא מזכיר אמת בסיסית בעולם ה AI הפיננסי: מודל טוב אינו נמדד רק...
ארגונים רבים כבר הבינו שצ׳אטבוט טקסטואלי אינו מספיק כאשר הלקוח רוצה פתרון מיידי, אנושי וזורם. שיחה קולית היא עדיין אחד מערוצי המכירה והשירות החשובים ביותר, אבל היא גם אחד היקרים והקשים ביותר להרחבה. לכן המעבר מסקריפטים קוליים קשיחים אל סוכני קול בזמן אמת הוא לא עוד שדרוג טכנולוגי, אלא שינוי במודל התפעול של מוקדי שירות, מכירות ותמיכה. סוכני קול בזמן אמת מצמצמים את הפער בין מכונה לשיחה אנושית ההשקה של Amazon Nova 2 Sonic והיישום שבנתה Loka עבור סוכנויות רכב ממחישים לאן השוק מתקדם. במקום צינור...
ארגונים שמטמיעים בינה מלאכותית נתקלים שוב ושוב באותה שאלה ניהולית: האם ניתן לסמוך על מודל שפה כשהוא עונה על עובדות עסקיות. זו אינה שאלה תיאורטית. מערכת שירות שמבלבלת בין פוליסות, עוזר ידע שמצטט נהלים לא עדכניים או סוכן שמפעיל תהליך על בסיס מידע שגוי יכולים לייצר נזק תפעולי, משפטי ותדמיתי. לכן מחקר חדש על מודלי Gemma חשוב במיוחד, משום שהוא מקרב אותנו להבנה של הדרך שבה מודלי שפה מאחסנים ושולפים עובדות. מודלי שפה אינם מסד נתונים, הם מערכת זרימה חישובית מחקר פרשנות מכניסטית שבחן את Gemma-2B ואת...
ארגונים רבים מנסים להכניס AI לתהליכי פיתוח, אבל נתקלים באותה בעיה: קצב העבודה של המודל מהיר, בעוד מנגנוני האמון, האבטחה והאישור הארגוני נשארים איטיים. זו אינה בעיה טכנית בלבד. זו בעיית ניהול, תפעול וסיכון. כאשר תהליך שחרור תוכנה תלוי במתחזק בכיר, בבדיקות ידניות ובכתיבת הערות גרסה, אפילו צוות מצוין עלול להפוך לצוואר בקבוק. אוטומציה ב-DevOps עם AI משנה את קצב השחרור חברת Hugging Face הציגה תהליך שחרור שבועי לספריית huggingface_hub, שכבת תשתית מרכזית עבור Transformers, Datasets, Diffusers וכלים...
צור קשר
בואו נדבר על הפרויקט הגדול הבא שלכם
השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.