מודלי שפה כמייצגי אוכלוסייה: למה הממוצע עלול להטעות

מחקר על מודלי שפה וסקרים סינתטיים באוכלוסייה

מחקר על מודלי שפה וסקרים סינתטיים באוכלוסייה

מנהלים, חוקרים וגופי מדיניות מחפשים היום דרך מהירה וזולה להבין אוכלוסיות גדולות: לקוחות, מצביעים, משקי בית או שווקים שלמים. הפיתוי ברור, אם מודל שפה יכול לדמות אלפי אנשים בתוך דקות, אפשר לכאורה להחליף סקרים יקרים, קבוצות מיקוד וניסויים התנהגותיים. אבל דווקא כאן נדרשת זהירות מקצועית: מודל שמחזיר ממוצע נכון אינו בהכרח מבין ציבור, ולעיתים הוא רק משחזר את מרכז ההתפלגות שנצרב בו במהלך האימון.

מודלי שפה אינם מדגם, הם מנגנון הסתברותי

מחקר שפורסם ב־Towards Data Science בחן האם מודלי LLM מסוגלים לדמות משיבים בסקרי ציפיות אינפלציה. הממצא המרכזי חשוב במיוחד: המודלים הצליחו לקלוע לחציון של כ־3% בציפיות האינפלציה לשנה קדימה, בדומה לסקר הצרכנים של הבנק הפדרלי של ניו יורק, אך נכשלו בשחזור הפיזור האמיתי של תשובות הציבור. בעוד שבני אדם נתנו תשובות בטווח רחב, בערך ממינוס 25% ועד פלוס 27%, המודל ריכז 95% מהתשובות בתוך טווח צר של כשתי נקודות אחוז בלבד.

הפער הזה אינו תקלה שולית. הוא נוגע ללב השימוש במודלים כמייצגי אוכלוסייה. מודל שפה מאומן לחזות את ההמשך הסביר ביותר של טקסט, לא לדגום תודעה אנושית עצמאית. כאשר הוא נחשף באימון לנתוני CPI, פרסומי בנקים מרכזיים, מאמרים וכתבות כלכליות, הוא עלול להחזיר תשובה שנראית כמו סקר, אך בפועל היא קירוב אלגנטי למידע קיים. התופעה הזו מכונה mode collapse, והיא מוכרת גם בעולמות Generative AI: במקום מגוון אמיתי מתקבל ריכוז סביב תשובה אחת שנראית בטוחה.

מודלים כלכליים צריכים שונות, לא רק ממוצע

בכלכלה, בפוליטיקה ובמחקר חברתי, השונות אינה רעש. היא הנכס האנליטי. עסק שרוצה להבין ביקוש למוצר חדש צריך לדעת לא רק מה הלקוח הממוצע חושב, אלא איפה נמצאים הקצוות: מי יתנגד, מי יקנה מוקדם, מי רגיש למחיר ומי משנה עמדה אחרי חשיפה למידע. מדיניות ציבורית טובה נשענת בדיוק על ההבדלים האלה. לכן סקר סינתטי שמוחק את הקצוות עלול להוביל להחלטות שנראות מבוססות נתונים, אך מפספסות סיכון, התנגדות או הזדמנות.

החלק המעניין במחקר הוא הניסיון לתקן את הבעיה באמצעות unlearning. החוקרים יישמו על Llama-3.1-8B-Instruct שתי שיטות, Gradient Ascent ו־Negative Preference Optimization, כדי למחוק באופן ממוקד ידע על סדרות CPI וסקרים רשמיים. לאחר Gradient Ascent, שיעור התשובות שהתאימו בדיוק לתשובה השכיחה ירד מכ־92% לכ־24%, ושיעור התשובות הרחוקות ביותר משלוש נקודות אחוז עלה לכ־43%. כלומר, כאשר מחלישים את הנטייה לשלוף ידע מרכזי, המודל מתחיל להתנהג יותר כמו אוכלוסייה ופחות כמו טבלה דחוסה.

סיכוני AI בסקרים סינתטיים דורשים אדם בלולאה

המשמעות הרחבה חורגת מסקרי אינפלציה. שימוש במודלי שפה כמייצגי אוכלוסייה יכול להיות כלי מחקרי מצוין לבדיקת ניסוחים, סימולציה ראשונית של תגובות, זיהוי השערות וניסוי מהיר של תרחישים. אבל הוא אינו תחליף ישיר למדגם אנושי ללא מתודולוגיה. תחום AI אינו עניין טכני בלבד, והוא דורש שילוב של ידע סטטיסטי, הבנה מקצועית של התחום, ניסיון עסקי ומנגנוני בקרה. אדם בלולאה אינו צריך לבדוק כל תשובה, אלא לתכנן את מערכת המדידה, להגדיר מדדי שונות, לבחון הטיות ולזהות מתי המודל מספק ביטחון מזויף.

ארגונים שרוצים להשתמש בסקרים סינתטיים צריכים להתחיל ממסגרת עבודה ברורה: להשוות תמיד מול נתוני אמת קיימים, למדוד לא רק ממוצע אלא שונות, אחוזונים וקצוות, להפריד בין סימולציה לצורך חשיבה לבין ראיה לקבלת החלטה, ולתעד אילו מקורות ידע עלולים להיות נוכחים במודל. במקרים רגישים כדאי לשלב מודלים פתוחים שמאפשרים בדיקות עומק, כי יכולת בקרה על משקלים, דגימה ונתוני כיול עשויה להיות ההבדל בין תובנה שימושית לבין אשליה סטטיסטית.

העמדה שלנו ברורה: מודלי שפה יכולים להרחיב דרמטית את יכולת החשיבה והמחקר של ארגונים, אך אסור להפוך אותם לאוכלוסייה מדומיינת בלי ביקורת. הערך האמיתי יגיע למי שישלב אוריינות AI, תשתית ניסויית, פיתוח יכולות פנימיות ובקרה אנושית חכמה. המנהל שיידע לשאול לא רק מה המודל ענה, אלא איזה מגוון הוא לא הצליח לייצר, יקבל החלטות טובות יותר.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.