מודל GPT-Live-1 הופך קול לשכבת ביצוע שקשה לבקר

הסיפור ב-GPT-Live-1 אינו רק שהקול נשמע טבעי יותר. החידוש החשוב הוא שממשק קולי הופך מערוץ קלט לשכבת ביצוע רציפה: הוא מאזין בזמן שהוא מדבר, שומר הקשר ומעביר פעולה למודל נוסף בלי לסגור את השיחה. ארגון שיתייחס אליו כשדרוג למוקד הטלפוני יקבל הדגמה מרשימה, אבל גם מערכת החלטה שקשה לבקר.
מודל GPT-Live-1 מצמצם השהיה ומוחק גבול תפעולי
הארכיטקטורה הישנה יצרה שרשרת שקל יחסית לפרק. תחילה מנוע המיר דיבור לטקסט והעביר אותו למודל שפה. לאחר יצירת התשובה, מנוע נוסף הפך את הטקסט לקול. כל שלב הוסיף השהיה ושגיאות, אך גם השאיר תוצר ביניים שאפשר לתעד ולבדוק. במודל שמע מאוחד, הזרם הקולי מעובד ישירות. במצב דו-כיווני מלא, המערכת ממשיכה לקודד את דברי המשתמש בזמן שהיא מייצרת תשובה, ולכן הפרעה יכולה לעצור את ההפקה ולעדכן מיד את מצב השיחה. כשהמערכת מעבירה בקשה ל-GPT-5.5 לצורך הסקה או הפעלת משימה, הגבול בין שיחה לבין פעולה נעשה דק יותר. הרצף מרגיש טבעי, אך נתיב הביקורת נעשה מורכב.
חברת OpenAI מדווחת שיותר מ-150 מיליון משתמשים מפעילים קול והכתבה ב-ChatGPT. מנהל המוצר של שירות הקול תיאר שיחות שנמשכו 30 עד 40 דקות בזמן הליכה. משך כזה אינו פרט חווייתי בלבד. שיחה ארוכה צוברת הנחות, תיקונים והרשאות משתמעות, ולכן טעות בדקה השלושים עלולה להישען על משפט שנאמר בתחילת הדרך ולהפעיל כלי חיצוני בהקשר שכבר השתנה.
עיבוד שפה בעברית יחשוף את הכשל לפני ההדגמה
דמיינו לקוח בנקאי שמבקש להעביר תשלום לספק, קוטע את הסוכן באמצע ואז מוסיף שלא יבצע עדיין משום שהסכום דורש אישור. הלקוח מדבר מרכב, הוגה שם חברה באנגלית ומשלב מספר חשבון בעברית. אם מנגנון ההפרעה מזהה את התוספת מאוחר מדי, הסוכן עשוי להשלים קריאה למערכת התשלומים לפני שהשלילה נטמעה במצב השיחה. במערכת הישנה אפשר היה לעצור בין התמלול להפעלה ולדרוש אישור מובנה. כאן צריך לתכנן את המחסום בתוך זרם שמתעדכן בזמן אמת. עברית מוסיפה הטיות, מעבר בין שפות ושמות ישויות שהמודל לא בהכרח למד בעומק מספק. הדגמת תרגום שבה נשמר מבטא אמריקאי וסגנון לא טבעי מרמזת שהפער אינו קוסמטי בלבד, אלא עשוי לפגוע גם בזיהוי כוונה.
אפשר לטעון שהמודל הקטן יחליף את מצב הקול הקיים כברירת מחדל, ולכן כדאי לאמץ אותו במהירות ולשפר תוך כדי שימוש. הטענה סבירה במוצר צרכני שבו רוב הטעויות מסתיימות בתשובה מביכה. בארגון, טעות קולית שמגיעה לכלי סליקה, לתיק רפואי או למערכת שירות אינה רק בעיית חוויה. היא אירוע הרשאה, והעלות שלה נקבעת לפי הפעולה שבוצעה ולא לפי איכות הקול.
אינטגרציה קולית דורשת מבחן הרשאות ולא רק מבחן קול
לפני חיבור ממשק התכנות של GPT-Live-1 למערכת תפעולית, כדאי לבנות ערכת קבלה ייעודית לעברית. צוות ההטמעה צריך להריץ לפחות 500 שיחות שמכסות הפרעות באמצע משפט, שתיקות ממושכות ומעבר בין עברית לאנגלית. הבדיקה צריכה למדוד את זמן קליטת ההפרעה, שיעור זיהוי השלילה, דיוק שמות הישויות והפער בין כוונת המשתמש לפעולה שנשלחה. פעולה בעלת סיכון נמוך יכולה להתבצע ישירות, ואילו שינוי כספי או רפואי צריך לעבור אישור חזותי או בקר אנושי. האדם בלולאה צריך לטפל בחריגים ובפעולות רגישות, לא לאשר כל משפט ולבטל את יתרון האוטומציה.
מחלקת מערכות מידע שתנהל סוכנים קוליים תצטרך להחזיק גרסאות של מדיניות שיחה, הרשאות וכללי הסלמה כפי שהיא מנהלת כיום עובדים ותפקידים. היתרון של GPT-Live-1 יופיע כשהקול יוכל לקדם מאות תהליכים במקביל. הסיכון יופיע בדיוק באותו מקום. מי שיבחן רק טבעיות ומבטא ימדוד את החלק הנעים של המוצר, ויחמיץ את שכבת השליטה שקובעת אם אפשר להפעיל אותו בארגון.


