המחשת ארכיטקטורה של צינור לשיגור סוכן AI לייצור בארבעה שבועות
חזרה לבלוג
ארכיטקטורה14 דק'

פלייבוק ארכיטקטורת סוכני AI: שיגור MVP לייצור ב-4 שבועות

רוב פרויקטי הסוכנים האוטונומיים מתים בין הדמו למשתמש השלישי האמיתי. זהו פלייבוק הארכיטקטורה המלא ש-UltraMVP משתמשת בו בכל פרויקט — אותו blueprint לשיגור MVP של סוכן לייצור בארבעה שבועות, וההפניה שאנו מוסרים למהנדסים שלנו ביום הראשון.

[ תקציר ]

רוב פרויקטי הסוכנים האוטונומיים מתים בין הדמו למשתמש השלישי האמיתי. זהו פלייבוק הארכיטקטורה המלא ש-UltraMVP משתמשת בו בכל פרויקט — אותו blueprint לשיגור MVP של סוכן לייצור בארבעה שבועות, וההפניה שאנו מוסרים למהנדסים שלנו ביום הראשון.

[ 01 ]

הקשת של ארבעה שבועות, במבט-על

שבוע 1: גילוי, סט הערכה, ופרוסה אנכית דקה. שבוע 2: לולאת planner-executor, חוזי כלים, וטרייס ראשון מקצה-לקצה. שבוע 3: זיכרון, גארדריילים, בקרת עלויות והקשחה. שבוע 4: השקה הדרגתית, תצפיתיות ומסירה. כל שבוע מסתיים בדמו מול סט הערכה קפוא, לא ב"תחושה".

אם שבוע מסתיים בלי הזזת ציון ההערכה, עוצרים וחותכים היקף. עיכובי לו"ז הם כמעט תמיד בעיות היקף בתחפושת של בעיות הנדסה.

[ 02 ]

בחרו טופולוגיית סוכן לפני שכותבים קוד

שלוש טופולוגיות מכסות כ-90% מהעומסים האמיתיים. סוכן יחיד עם כלים מתאים לטריאז', חילוץ וניתוב. Planner-executor מפריד בין המודל שמחליט למודל שמבצע — זול יותר, ניתן ניפוי-שגיאות ואיכל להערכה. Multi-agent (מפקח + מומחים) שווה את המורכבות רק כשהמשימות הטרוגניות באמת וארוכות טווח.

ברירת המחדל היא planner-executor. הוא דוחס עלויות בשימוש במודל קטן לביצוע, נותן מקום טבעי להזרקת גארדריילים ומייצר טרייסים שאדם באמת יכול לקרוא בביקורת אירוע.

  • סוכן יחיד + כלים — מהיר לשיגור, קשה לניפוי בקנה מידה
  • Planner-executor — ברירת מחדל; מפריד החלטות מפעולות
  • מפקח מולטי-סוכן — רק כשההתמחות אמיתית, לא אסתטית
[ 03 ]

חוזי כלים הם ה-API האמיתי של הסוכן

הכלים שאתם חושפים מגדירים את מעטפת היכולת של הסוכן יותר מבחירת המודל. השאירו את שטח הפנים קטן — חמישה עד שנים-עשר כלים מתוכננים היטב מנצחים ארבעים חופפים בכל פעם.

כל כלי זקוק לסכמה עם טיפוסים, מפתח אידמפוטנטיות, טיים-אאוט וצורת שגיאה מובנית. החזירו כשלים קריאים למכונה שה-planner יכול לחשוב עליהם, לא stack traces. תעדו כל הפעלה עם קלטים, פלטים, latency ועלות.

  • קלטים ופלטים עם טיפוסים — Zod, Pydantic או JSON schema
  • מפתחות אידמפוטנטיות על כל כתיבה — ניסיונות חוזרים חייבים להיות בטוחים
  • שגיאות מובנות: { code, retryable, message, hint }
  • טיים-אאוט ותקרת עלות לכל כלי; חסלו קריאות סוררות
[ 04 ]

זיכרון: שלוש שכבות, לא דלי אחד

זיכרון עבודה הוא ה-scratchpad של הריצה הנוכחית — נשמר בפרומפט, מוגבל בטוקנים. זיכרון אפיזודי הוא ריצות קודמות של המשתמש או הישות — נשמר ב-Postgres עם שדות מובנים, נשלף לפי ID לא לפי דמיון וקטורי. זיכרון סמנטי הוא בסיס הידע — נשלף בשליפה היברידית BM25 + צפופה ומורדר מחדש.

כמעט כל באג "הסוכן שכח" הוא בעצם באג זיכרון אפיזודי. חיפוש וקטורי לא יכול להחליף foreign key.

[ 05 ]

הערכה היא עבודה של שבוע ראשון, לא צ'ק-ליסט להשקה

בונים את סט ההערכה לפני הסוכן. 50–200 מקרים מייצגים, שנאספו על ידי מומחה תחום, עם ground truth להצלחת משימה, בחירת כלי ו(היכן שרלוונטי) פלטים מדויקים. זה החפץ שמאפשר לשגר בביטחון.

הריצו את הסוויטה על כל שינוי פרומפט, שינוי כלי ושדרוג מודל. שלבו ניקוד אוטומטי (LLM-as-judge עם rubric ובדיקות דטרמיניסטיות) עם סקירה אנושית שבועית של 20 טרייסים אקראיים. השופט מוצא רגרסיות; האדם מוצא נקודות עיוורות שהשופט חולק עם הסוכן.

[ 06 ]

גארדריילים בארבע שכבות

שכבת קלט: redaction של PII, זיהוי prompt-injection, rate limits לכל דייר. שכבת תכנון: תקרת צעדים לריצה, תקרת קריאות כלי לצעד, חסימת רצפי כלים אסורים. שכבת פלט: אימות סכמה, מסווג מדיניות, בדיקות דטרמיניסטיות לכלים הרסניים. שכבה אנושית: שערי אישור לפעולות בעלות רדיוס נזק גבוה עם תצוגות diff ברורות.

גארדריילים זולים להוסיף בשבוע 3 ויקרים באופן כואב להוסיף אחרי אירוע.

[ 07 ]

עלות ו-latency: תקצבו אותם כמו פיצ'רים

קבעו תקרת עלות לריצה ו-SLO של latency לריצה לפני הפרומפט הראשון. נתבו תכנון טריוויאלי למודל קטן, הסלימו למודל חזיתי רק בהסתעפויות קשות. שימו במטמון באגרסיביות — prompt caching לפרומפטי מערכת יציבים, מטמון embeddings לשליפה, מטמון תוצאות-כלי לקריאות דטרמיניסטיות.

רוב סוכני הייצור מתייצבים על $0.02–$0.15 לריצה מוצלחת לאחר כיוונון. אם שלכם פי 10 מזה, הלולאה ארוכה מדי, לא המודל יקר מדי.

[ 08 ]

תצפיתיות מהיום הראשון

כל ריצה מקבלת trace ID שעוקב אחריה דרך לוגים, spans, קריאות כלי ושירותי downstream. שמרו את התמלול המלא, קלט/פלט הכלי וציון ההערכה. התריעו על רגרסיה בשיעור הצלחה, קפיצה בעלות לריצה ועלייה בשיעור שגיאות כלי — לא על latency גולמי.

OpenTelemetry + Langfuse (או המקבילה) מספיק ל-95% מהצוותים. אל תבנו dashboard מותאם בחודש הראשון.

[ 09 ]

השקה: הדרגתית, הפיכה, משעממת

שגרו מאחורי feature flag למשתמשים פנימיים ראשונים. אחר כך 1% מתנועה חיצונית במצב shadow (הסוכן רץ, אדם משגר). אחר כך 10% עם שיגור ישיר. אחר כך 100%. כל שלב רץ לפחות שלושה ימים וחייב לעבור את רף ההערכה ורף האירועים.

השקות משעממות הן איך שסוכני AI הופכים לתוכנה משעממת ואמינה — שזו המטרה האמיתית.

[ תובנות מפתח ]
  • 01ברירת מחדל planner-executor; מולטי-סוכן הוא מס, לא פיצ'ר
  • 02אספו את סט ההערכה בשבוע הראשון — הוא שער השיגור
  • 035-12 כלים עם טיפוסים טובים מנצחים 40 רשלניים
  • 04שלוש שכבות זיכרון: עבודה, אפיזודי (SQL), סמנטי (RAG היברידי)
  • 05גארדריילים בקלט, תכנון, פלט ושכבות אנושיות
  • 06עקבו אחר כל ריצה מקצה-לקצה; התריעו על שיעור הצלחה ועלות
  • 07השקה הדרגתית עם shadow mode היא בלתי ניתנת למשא ומתן
[ FAQ ]

שאלות נפוצות

אפשר באמת לשגר סוכן AI לייצור ב-4 שבועות?

+

כן, לפרוסה אנכית מוגדרת היטב עם סט הערכה אמיתי ומדד הצלחה ברור. תזמור מולטי-סוכן ארגוני לוקח יותר. ה-4 שבועות הם לסוכן יחיד שפותר workflow עסקי אחד ברמת ייצור.

על איזה framework כדאי להתייצב?

+

לרוב הצוותים: LangGraph ללולאת הסוכן, Temporal ל-workflows רב-שלביים עמידים, OpenTelemetry + Langfuse ל-tracing. Frameworks הם חלק קטן מההצלחה — החלטות הארכיטקטורה שלמעלה חשובות יותר מה-SDK.

לבנות עם מודלים בקוד פתוח או עם APIs חזיתיים?

+

התחילו עם API חזיתי להוכחת ה-workflow, ואז כווננו מודל פתוח קטן יותר (Gemma 4, Llama) על הטרייסים המנצחים כשיש נפח. זה נותן את time-to-value הטוב ביותר ואת יחידות הכלכלה הטובות ביותר לטווח ארוך.

איך מטפלים ב-prompt injection בייצור?

+

בשכבות: מסירים סמני תוכן לא-מהימן, מריצים מסווג על פלטי כלים לפני שהם חוזרים ל-planner, ולעולם לא נותנים לדאטה לא-מהימנה להפעיל כלים בעלי רדיוס נזק גבוה בלי שער אנושי. אין כדור כסף יחיד.

מה הסיבה הכי גדולה שפרויקטי סוכנים נכשלים?

+

אין סט הערכה. בלי benchmark קפוא ומנוקד, צוותים לא יכולים לומר אם שינוי שיפר או הרע את הסוכן, אז כל deploy הוא הטלת מטבע. בנו את ההערכה לפני הסוכן.

[ התחילו פרויקט ]

שגרו סוכן AI לייצור ב-4 שבועות

אנו מתכננים ומשגרים סוכני AI מותאמים מקצה-לקצה — לולאות planner-executor, הערכות, גארדריילים ותצפיתיות. קבעו שיחת גילוי וקבלו תוכנית 4 שבועות ממוקדת.

קבעו שיחת גילוי