חיסכון בעלויות RAG בבניית גרף ידע ארגוני

תרשים מופשט של גרף ידע ארגוני ותהליכי עיבוד מסמכים

ארגונים רבים מגלים שהעלות האמיתית של AI אינה מסתיימת בבחירת מודל. היא מתחילה בשאלה אילו חלקים מתוך מסמך ארוך באמת ראויים להגיע אל LLM. כאשר חוזים, הסכמי אשראי, פוליסות ונהלי ציות נשלחים כמעט בשלמותם לעיבוד, הארגון משלם בטוקנים, בזמן תגובה ובאיכות גרף ידע שנפגע מרעש, כפילויות וקשרים חלשים.

גישה מבנית ל RAG ולבניית Knowledge Graph

גישה חדשה בשם Proxy-Pointer RAG מציעה שינוי חשוב: לא להתייחס למסמך כאל רצף טקסט שטוח, אלא כאל עץ סמנטי של סעיפים ותתי סעיפים. במקום לפצל הכל לצ'אנקים ולשלוח לחיפוש וקטורי, המערכת בוחנת מראש את תפקידו העסקי של כל מקטע. הבדיקה בשלושה הסכמי אשראי ציבוריים גדולים של אמרסון אלקטריק, חברת AT&T וטקסס רודהאוס הציגה חיסכון שהתחיל בכ 16% מנפח העיבוד והגיע עד כ 38% לאחר העשרה מבנית. משמעות הנתון ברורה: תכנון טוב של הצנרת יכול לחסוך כסף לפני שמחליפים מודל, תשתית או ספק ענן.

מדד Graphability הוא החלק המעניין ביותר בגישה הזאת. הוא אינו שואל כמה ישויות מופיעות בסעיף, אלא כמה קשרים שימושיים הסעיף עשוי לייצר. סעיף הודעות רשמיות יכול להכיל שמות, כתובות ותאריכים רבים, אך להוסיף מעט מאוד ידע עסקי. לעומת זאת, סעיף קצר על התחייבות תשלום, ערבות, חברות בנות או אירוע הפרה עשוי ליצור קשרים קריטיים בגרף. זהו מעבר ממדידת נפח למדידת ערך.

כלכלת טוקנים מתחילה לפני הקריאה למודל

כאשר מלווים ארגונים ביישום מערכות GraphRAG, מהר מאוד רואים שהבעיה אינה רק טכנית. נדרש ידע משפטי, פיננסי, תפעולי וניהולי כדי להחליט מהו ידע בעל ערך. סעיפי הגדרות, בטוחות, מגבלות על מיזוגים, תנאי אשראי והתחייבויות דיווח הם אזורים שדורשים קריאה עמוקה. סעיפי דין חל, פורמט הודעות או נספחים גנריים יכולים לעיתים לקבל עדיפות נמוכה יותר. ארגון שלא בונה מפת חום עסקית למשפחות המסמכים שלו ימשיך לשלם למודל כדי לקרוא טקסט שהמערכת כבר הייתה יכולה לסנן.

הנקודה החשובה למנהלים היא ש AI יציב אינו נולד מהוספת מודל חזק יותר בלבד. פתרון נכון משלב הנדסת מסמכים, אונטולוגיה ארגונית, בקרת איכות, מדדי דיוק וחיבור לתהליכים עסקיים. מודל חזק יכול לחלץ יחסים בצורה טובה יותר, אבל הוא לא יודע לבדו מהו סעיף קריטי לארגון ומהו רעש חוזר. כאן בדיוק נדרש שילוב של מומחי תחום, אנשי דאטה ומובילי מערכות מידע.

אדם בלולאה במערכות AI משפטי

הסיכון המרכזי בסינון מוקדם הוא דילוג על סעיף נדיר אך מהותי. לכן אדם בלולאה חייב להישאר חלק מהארכיטקטורה, אך לא כמי שבודק כל סעיף ידנית. התפקיד הנכון הוא פיקוח על חריגים, דגימות, שינויי נוסח וסעיפים שהמדד מסווג בביטחון נמוך. כך מומחה שהיה מטפל בתהליך אחד יכול לפקח על מאות תהליכי חילוץ, בלי להפוך לצוואר בקבוק.

העמדה שלנו ברורה: ארגונים שרוצים להפוך ארכיוני מסמכים למערכות ידע פעילות צריכים להתחיל במדידת תפוקת ידע, לא בכמות טקסט. מומלץ למפות משפחות מסמכים, לסמן סעיפים בעלי Graphability גבוהה, למדוד חיסכון בטוקנים לצד איכות יחסים, ולהפעיל בקרה אנושית על חריגים. כך RAG מפסיק להיות ניסוי מרשים והופך לתשתית ייצור כלכלית, אמינה ושימושית.

2 דק׳ קריאה

מודל AI מקומי על 25 גיגהבייט זיכרון מוכיח זמינות, לא כדאיות

הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...

2 דק׳ קריאה

זיכרון AI נוירוני לא יהרוג את RAG, הוא יפריד בין ידע למצב

הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...

2 דק׳ קריאה

כימות דינמי ב-SageMaker מוזיל את המודל, לא את האחריות ההנדסית

כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...

צור קשר

בואו נדבר על הפרויקט הגדול הבא שלכם

השאירו פרטים ונחזור אליכם. שיחת היכרות קצרה עם הצוות של KO AI, כדי להבין את התהליך, את היעד ואת הדרך הנכונה להגיע אליו.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.

בואו נדבר

השאירו פרטים, ונחזור אליכם תוך יום עסקים אחד.

ערוץ פניה מועדף

נחזור אליכם תוך יום עסקים אחד.