KO AI מפתחת סוכני AI, מערכות AI ומודלי ML שרצים בייצור בחברות וארגונים, על הדאטה ובתוך המערכות של הארגון. אנו משלבים אינטגרציה של מודלים קיימים (GPT, Claude, Gemini) עם אימון מודלים ומודלים בקוד פתוח, כשנדרשת פרטיות מלאה או התמחות בנישה.
סוכן AI, בניגוד לצ'אטבוט שעונה בטקסט, מבצע פעולות: ניגש למסדי נתונים, שולח מיילים, מנתח קבצים ומריץ תהליכי עבודה מורכבים, תוך יישום עקרון אדם בלולאה (Human in the loop).
תחומי פיתוח
פיתוח סוכני AI, מערכות AI ומודלי ML
פיתוח סוכני AI לחברות
הקמת תשתיות לפיתוח וניהול סוכני AI ארגוניים. אנו מתמחים בבניית מערכות Multi-Agent, כולל תשתיות Orchestration & Governance לניהול סוכנים, Agentic Workflows, מערכי סוכנים ואוטומציות ארגוניות, בסטנדרט Enterprise-Grade לנפחי פעילות גבוהים וביצועים בזמן אמת.
פיתוח מערכות AI
פיתוח פתרונות תוכנה Custom-Made משולבי AI בכל רמות המורכבות: משלב ה-Feasibility Study, דרך פיתוח מודולרי והטמעת מודלים, ועד Deployment בסביבות ייצור, תוך עמידה בדרישות Enterprise Security, יתירות (Redundancy) ויכולת גדילה עתידית.
ניהול ואימון מודלי Generative AI
אימון (Fine-Tuning) ואופטימיזציה (PEFT/LoRA) למודלי שפה (LLMs/SLMs), קול (TTS/STT) ותמונה, עם פריסה היברידית (Hybrid Cloud / On-Premise) לפרטיות מידע וביצועים, והתאמה מדויקת ל-Domain הארגוני ולמערכות הליבה.
אימון והטמעה של מודלי ML (למידת מכונה)
פיתוח ופריסה של מודלי Machine Learning בארכיטקטורת End-to-End MLOps: מ-Data Engineering ו-Feature Engineering, דרך אימון וולידציה של מודלים לחיזוי (Predictive Analytics) וזיהוי חריגות (Anomaly Detection), ועד Production Deployment ואינטגרציה מלאה.
שירותי Data Science
ניהול מחזור חיי הדאטה והפיכת מידע גולמי לתובנות אופרטיביות: תהליכי ETL/ELT, טיוב נתונים (Data Cleansing) וניתוח סטטיסטי (EDA). התוצר הוא תשתית נתונים אחודה (Single Source of Truth) לשימוש ב-BI ולאימון מודלי AI.
MLOps & LLMOps (תשתיות ותפעול)
בנייה ותחזוקה של תשתיות DevOps ייעודיות לבינה מלאכותית: ניטור (Monitoring), ניהול גרסאות ובקרה, כדי שהמודלים יישארו יציבים ומדויקים לאורך זמן ולא יישחקו (Drift).
ממשקים ואינטגרציה
אינטגרציה עמוקה בין מערכות הליבה הארגוניות (CRM, ERP, Legacy) לבין מנועי AI. אנו הופכים תהליכים ידניים עתירי משאבים לזרימת עבודה אוטומטית, רציפה ומהירה, שמצמצמת צווארי בקבוק תפעוליים.
מודל העבודה
FDE: מהנדסים אצלכם, על הדאטה שלכם, עם יעד מדיד
הפיתוח ב-KO AI נעשה בשיטת Forward Deployed Engineering (FDE): המהנדסים עובדים בתוך הארגון, מול האנשים שעושים את העבודה ועל המערכות האמיתיות, ונמדדים מול KPI עסקי שהוגדר מראש.
שבוע 1: מיפוי התהליך, גישה לדאטה והגדרת יעד.
30 יום: POC או פיילוט על דאטה אמיתי. ברוב המקרים הפיתוח המרכזי קורה כבר כאן.
90 יום: ייצור מלא, ניטור ו-MLOps, והעברת ידע לצוות.
אנו משלבים בין מגוון רחב של יכולות. אנו מתמחים באינטגרציה של מודלים קיימים (GPT, Claude, , Gemini וכד') למערכות ארגוניות, אך גם מבצעים אימון מודלים (Fine-tuning) ושימוש במודלים בקוד פתוח (כגון Llama) כאשר נדרשת פרטיות מידע מוחלטת או התמחות בנישה ספציפית.
מה זה "סוכני AI" (AI Agents) ואיך זה שונה מצ'אטבוט רגיל?
בניגוד לצ'אטבוט פשוט שעונה תשובות טקסטואליות, סוכן AI אוטונומי מסוגל לבצע פעולות אקטיביות: לגשת למסדי נתונים, לשלוח מיילים, לנתח קבצים ולבצע תהליכי עבודה מורכבים (Workflows) ללא מגע יד אדם. אנו בונים סוכנים למגוון רחב של משימות תוך יישום עקרונות אדם בלולאה (Human In the loop).
כמה זמן לוקח לפתח פתרון AI מותאם אישית (Custom AI)?
זמני הפיתוח משתנים בהתאם למורכבות. פרויקט הוכחת היתכנות (POC) לרוב אורך בין ימים ספורים במקרים הפשוטים וכ- 3 ל-6 שבועות ברוב המקרים הסטנדרטיים, בעוד פיתוח מערכת מלאה ואימון מודלים מורכבים יכול לארוך מעט יותר מזה. אך חשוב לציין כי במרבית המקרים הפיתוח המרכזי מתבצע כבר בשלב ה POC כך שזמן הפיתוח להשלמה אורך מעט למדי. על מנת להבטיח זאת, אנו עובדים בשיטות Agile כדי לספק ערך מהיר לארגון.
מה ההבדל בין אוטומציה עסקית (Business Automation) לסוכני AI (AI Agents)?
ההבדל העיקרי הוא באוטונומיה ובקבלת ההחלטות. אוטומציה עסקית פועלת לפי תרחיש קבוע מראש (Rule-Based): "אם קורה X, בצע את Y". היא מצוינת למשימות חזרתיות וליניאריות ולרוב תכלול רכיבי AI בסיסיים לעיבוד מידע. לעומת זאת, סוכני AI (כגון מערכות Agentic AI) הם בעלי יכולת "חשיבה": הם מקבלים מטרה כללית (Goal), מנתחים את המצב, מתכננים רצף פעולות באופן עצמאי, ומסוגלים לתקן את עצמם אם נתקלו בבעיה, ללא צורך בתסריט מוכן מראש
האם אתם עובדים על פלטפורמות אוטומציה מסוימות או מפתחים בקוד?
אנו Technology Agnostic (לא כבולים לטכנולוגיה אחת) ומתאימים את הפתרון לצורך. יש לנו יכולות Low-Code/No-Code לפיתוח מהיר והטמעת סוכנים על פלטפורמות ארגוניות כמו Microsoft Copilot Studio, CrewAI Enterprise ו-n8n. במקביל, עבור ליבת העסקים (Core IP) ופתרונות מורכבים הדורשים ביצועים גבוהים (High Performance), אנו מבצעים פיתוח High-Code (קוד מלא) בשפות כמו Python ו-Go, תוך שימוש בארכיטקטורת Microservices ו-Cloud Native המבטיחה סקיילביליות וגמישות מקסימלית.
מה ההבדל בין אימון מודלי ML קלאסיים לבין אימון מודלי GenAI?
במודלי ML (Machine Learning): אנו בונים ומאמנים אלגוריתמים "מאפס" על בסיס דאטה מובנה (Tabular Data) כדי לבצע תחזיות (Predictive Analytics), סיווג או זיהוי חריגות. זהו תהליך הדורש Data Engineering מסיבי וניקוי נתונים.
במודלי GenAI (כגון LLMs): אנו לרוב לא מאמנים את המודל מאפס, אלא מבצעים התאמה למידע הארגוני. אנו משתמשים בטכניקות מתקדמות כמו Fine-Tuning (עם שיטות יעילות כמו LoRA/QLoRA), וארכיטקטורות RAG (Retrieval-Augmented Generation) ו-GraphRAG לחיבור המודל לידע הארגוני. בפתרונות זיכרון מתקדמים אנו משלבים כלים כמו cognee לניהול הקשר (Context) ארוך טווח.
למה להעדיף פיתוח פתרון Custom במקום להטמיע כלי AI מוכנים (כמו ChatGPT)?
לא תמיד עדיף וזה תלוי במטרה. כלי מדף דורשים לרוב שינוי בהרגלי העבודה של העובדים והכשרות מקיפות. לעומת זאת, בפיתוח Custom אנו יכולים לייצר סוכנים שקופים (Invisible Agents): המערכת עובדת ב-Backend, מתממשקת ישירות למערכות ה-ERP/CRM שלכם ומבצעת את העבודה השחורה באופן אוטומטי, מבלי שהעובד צריך ללמוד כלי חדש או "לצ'טט" עם בוט. במקרים אלו, הטכנולוגיה עובדת עבור העובד, ולא דורשת ממנו לעבוד איתה.
באילו טכנולוגיות אתם משתמשים? (Tech Stack)
שפות פיתוח: Python (לרוב משימות ה-AI והדאטה), Go (למערכות זמן-אמת וביצועים), TypeScript/React לממשקים.
תשתיות ענן: פיתוח Native על גבי AWS, Azure ו-GCP תוך שימוש ב-Kubernetesו-Docker לקונטיינרים.
דאטה ו-AI: שימוש ב-Vector Databases מתקדמים (כגון Pinecone/Weaviate), מסגרות עבודה כמו LangChain/LangGraph לניהול סוכנים, וספריות ML מובילות (PyTorch, TensorFlow).
המידע שלנו לא מסודר ("מלוכלך"). האם עדיין אפשר להתחיל פרויקט AI?
בהחלט, ולמעשה זה המצב ברוב הארגונים. חלק בלתי נפרד מהשירות שלנו הוא Data Engineering. אנו בונים צינורות נתונים (ETL/ELT Pipelines), מנקים את המידע, ומאחדים מקורות שונים (Data Lakes/Warehouses) כדי לייצר תשתית אמינה שה-AI יכול לעבוד עליה. לא ניתן לבנות AI טוב על דאטה רע, ולכן אנו מטפלים קודם כל בתשתית.
האם הפתרון יכול לרוץ בשרתים שלנו (On-Premise) מטעמי אבטחה?
כן. אנו מודעים לרגישות של ארגונים ביטחוניים, פיננסיים ורפואיים. אנו מתמחים בפריסת מודלים "סגורים" (Open Source LLMs כמו Llama או Mistral) שרצים באופן מקומי על השרתים שלכם (On-Prem/Private Cloud). בצורה זו, שום פיסת מידע לא יוצאת החוצה לעננים ציבוריים, ואנו מבטיחים עמידה בסטנדרטים המחמירים ביותר של אבטחת מידע ו-Compliance.
יש לכם תהליך שמחכה לסוכן AI?
ספרו לנו מה התהליך, ונחזור עם הצעה ל-POC על הדאטה שלכם, עם יעד מדיד ולוח זמנים.
הניסוי של קוליברי אינו מוכיח שמודל חזית יכול לרוץ בזול על מחשב ביתי. הוא מוכיח שאפשר להחליף מחסור בזיכרון בזמן המתנה, ולהעביר את העלות מחומרת האצה אל האחסון ומשך העיבוד. מודל GLM-5.2 כולל 744 מיליארד פרמטרים ומשקלו כ-1.5 טרהבייט, אך הוא הופעל עם 25 גיגהבייט זיכרון בלבד. ההישג ההנדסי אמיתי. הכדאיות העסקית עדיין רחוקה. ארכיטקטורת MoE הופכת את האחסון לזיכרון איטי במודל המבוסס על תערובת מומחים, ארכיטקטורת MoE, כל טוקן אינו עובר דרך כל הפרמטרים. נתב פנימי מדרג תתי-מודלים מתמחים ובוחר רק את המומחים...
הוויכוח על מותו של RAG מוקדם מדי, וגם מחמיץ את הנקודה. זיכרון AI נוירוני לא יחליף את שכבת הידע הארגונית, אלא בעיקר את הצורך לבנות מחדש מצב חישובי שכבר נוצר. ההבחנה הזאת קובעת אילו תשתיות יישארו, היכן תיחסך השהיה ואילו סיכונים חדשים ייכנסו לארכיטקטורה. מערכת RAG מפרקת מסמכים למקטעים, ממירה אותם לווקטורים, שולפת התאמות ומחזירה טקסט לחלון ההקשר. המודל נדרש אז לחשב מחדש ייצוג פנימי של מידע שכבר עובד קודם. התהליך מצוין לחיפוש ראיות, אך מסורבל כשסוכן צריך להמשיך פעולה שהחלה ברכיב אחר לפני שניות...
כימות דינמי ב-SageMaker הוא קודם כל מבחן למשמעת ההנדסית של הארגון, ורק אחר כך תרגיל בחיסכון בענן. נתון של כ-80% פחות בעלות לשעה נראה כמו אישור מיידי לעבור למכונה קטנה, אבל עלות נמוכה של נקודת קצה אינה מבטיחה עלות נמוכה לבקשה תקינה. תבנית צ'אט שגויה, הקשר ארוך או התרחבות איטית יכולים למחוק את החיסכון בלי לשנות אפילו משקולת אחת. כימות דינמי חוסך זיכרון באמצעות אי שוויון מכוון מודל בן 8 מיליארד פרמטרים בדיוק של 16 ביט דורש כ-16 ג'יגה-בייט רק עבור המשקולות. בכימות אחיד כל השכבות נדחסות לאותה רמת...