מודלי שפה כמייצגי אוכלוסייה: למה הממוצע עלול להטעות


מנהלים, חוקרים וגופי מדיניות מחפשים היום דרך מהירה וזולה להבין אוכלוסיות גדולות: לקוחות, מצביעים, משקי בית או שווקים שלמים. הפיתוי ברור, אם מודל שפה יכול לדמות אלפי אנשים בתוך דקות, אפשר לכאורה להחליף סקרים יקרים, קבוצות מיקוד וניסויים התנהגותיים. אבל דווקא כאן נדרשת זהירות מקצועית: מודל שמחזיר ממוצע נכון אינו בהכרח מבין ציבור, ולעיתים הוא רק משחזר את מרכז ההתפלגות שנצרב בו במהלך האימון.
מודלי שפה אינם מדגם, הם מנגנון הסתברותי
מחקר שפורסם ב־Towards Data Science בחן האם מודלי LLM מסוגלים לדמות משיבים בסקרי ציפיות אינפלציה. הממצא המרכזי חשוב במיוחד: המודלים הצליחו לקלוע לחציון של כ־3% בציפיות האינפלציה לשנה קדימה, בדומה לסקר הצרכנים של הבנק הפדרלי של ניו יורק, אך נכשלו בשחזור הפיזור האמיתי של תשובות הציבור. בעוד שבני אדם נתנו תשובות בטווח רחב, בערך ממינוס 25% ועד פלוס 27%, המודל ריכז 95% מהתשובות בתוך טווח צר של כשתי נקודות אחוז בלבד.
הפער הזה אינו תקלה שולית. הוא נוגע ללב השימוש במודלים כמייצגי אוכלוסייה. מודל שפה מאומן לחזות את ההמשך הסביר ביותר של טקסט, לא לדגום תודעה אנושית עצמאית. כאשר הוא נחשף באימון לנתוני CPI, פרסומי בנקים מרכזיים, מאמרים וכתבות כלכליות, הוא עלול להחזיר תשובה שנראית כמו סקר, אך בפועל היא קירוב אלגנטי למידע קיים. התופעה הזו מכונה mode collapse, והיא מוכרת גם בעולמות Generative AI: במקום מגוון אמיתי מתקבל ריכוז סביב תשובה אחת שנראית בטוחה.
מודלים כלכליים צריכים שונות, לא רק ממוצע
בכלכלה, בפוליטיקה ובמחקר חברתי, השונות אינה רעש. היא הנכס האנליטי. עסק שרוצה להבין ביקוש למוצר חדש צריך לדעת לא רק מה הלקוח הממוצע חושב, אלא איפה נמצאים הקצוות: מי יתנגד, מי יקנה מוקדם, מי רגיש למחיר ומי משנה עמדה אחרי חשיפה למידע. מדיניות ציבורית טובה נשענת בדיוק על ההבדלים האלה. לכן סקר סינתטי שמוחק את הקצוות עלול להוביל להחלטות שנראות מבוססות נתונים, אך מפספסות סיכון, התנגדות או הזדמנות.
החלק המעניין במחקר הוא הניסיון לתקן את הבעיה באמצעות unlearning. החוקרים יישמו על Llama-3.1-8B-Instruct שתי שיטות, Gradient Ascent ו־Negative Preference Optimization, כדי למחוק באופן ממוקד ידע על סדרות CPI וסקרים רשמיים. לאחר Gradient Ascent, שיעור התשובות שהתאימו בדיוק לתשובה השכיחה ירד מכ־92% לכ־24%, ושיעור התשובות הרחוקות ביותר משלוש נקודות אחוז עלה לכ־43%. כלומר, כאשר מחלישים את הנטייה לשלוף ידע מרכזי, המודל מתחיל להתנהג יותר כמו אוכלוסייה ופחות כמו טבלה דחוסה.
סיכוני AI בסקרים סינתטיים דורשים אדם בלולאה
המשמעות הרחבה חורגת מסקרי אינפלציה. שימוש במודלי שפה כמייצגי אוכלוסייה יכול להיות כלי מחקרי מצוין לבדיקת ניסוחים, סימולציה ראשונית של תגובות, זיהוי השערות וניסוי מהיר של תרחישים. אבל הוא אינו תחליף ישיר למדגם אנושי ללא מתודולוגיה. תחום AI אינו עניין טכני בלבד, והוא דורש שילוב של ידע סטטיסטי, הבנה מקצועית של התחום, ניסיון עסקי ומנגנוני בקרה. אדם בלולאה אינו צריך לבדוק כל תשובה, אלא לתכנן את מערכת המדידה, להגדיר מדדי שונות, לבחון הטיות ולזהות מתי המודל מספק ביטחון מזויף.
ארגונים שרוצים להשתמש בסקרים סינתטיים צריכים להתחיל ממסגרת עבודה ברורה: להשוות תמיד מול נתוני אמת קיימים, למדוד לא רק ממוצע אלא שונות, אחוזונים וקצוות, להפריד בין סימולציה לצורך חשיבה לבין ראיה לקבלת החלטה, ולתעד אילו מקורות ידע עלולים להיות נוכחים במודל. במקרים רגישים כדאי לשלב מודלים פתוחים שמאפשרים בדיקות עומק, כי יכולת בקרה על משקלים, דגימה ונתוני כיול עשויה להיות ההבדל בין תובנה שימושית לבין אשליה סטטיסטית.
העמדה שלנו ברורה: מודלי שפה יכולים להרחיב דרמטית את יכולת החשיבה והמחקר של ארגונים, אך אסור להפוך אותם לאוכלוסייה מדומיינת בלי ביקורת. הערך האמיתי יגיע למי שישלב אוריינות AI, תשתית ניסויית, פיתוח יכולות פנימיות ובקרה אנושית חכמה. המנהל שיידע לשאול לא רק מה המודל ענה, אלא איזה מגוון הוא לא הצליח לייצר, יקבל החלטות טובות יותר.


