מדריכים · בנייה עם AI
מדריכים · בנייה עם AI
סוכן AI שעובד בדמו אבל נשבר בפרודקשן כמעט אף פעם לא נשבר בגלל המודל. הוא נשבר בשכבה שמסביב למודל: אינטגרציות שמתפרקות, טוקנים של הרשאה שפגים, הרשאות שמעולם לא באמת היו לו, פעולות שהוא חוזר עליהן כי שום דבר לא הפך אותן לבטוחות לחזרה, והוצאה בלי תקרה. דמו הוא מסלול תקין אחד, שרץ פעם אחת, אצל אדם ידידותי אחד. פרודקשן הוא כל שאר המסלולים, אצל אנשים זרים, כשמאחוריהם כסף אמיתי ומידע אמיתי.
זה פרק האמינות של המדריך שלנו לבניית אפליקציה עם AI ב‑2026. אם חיברתם סוכן שיפרסם בשבילכם, שירוץ תהליך שיווקי או משימה פנימית במקום אפליקציה קלאסית, אותו דבר תקף: דמו שרץ הוא לא מערכת שאפשר לעזוב לבד. הכשלים שלמטה הם אלה שאנחנו פוגשים שוב ושוב כשסוכן עובד נתקל בשימוש אמיתי.
כי דמו בודק את המסלול היחיד שבניתם, ופרודקשן בודק את כל המסלולים שלא. אתם עוברים בלחיצות עם טוקן תקף, החשבון שלכם, וקלט שאתם כבר יודעים שעובד. ואז מגיע אדם זר שההרשאות שלו שונות, הטוקן פג באמצע משימה, API חיצוני מחזיר מבנה שלא ראיתם קודם, ושתי בקשות נוחתות באותו רגע. המודל טיפל בכל אחד מאלה מצוין. המערכת שסביבו לא.
התעשייה מגלה את זה בגדול. Gartner מעריכה שמעל 40% מפרויקטי ה‑AI הסוכני יבוטלו עד סוף 2027, בגלל עלויות שמטפסות, ערך עסקי לא ברור ובקרות סיכון לא מספקות. שימו לב מה חסר ברשימה: המודל. פרויקטים של סוכנים כמעט אף פעם לא מתים כי ה‑AI לא הצליח לבצע את המשימה. הם מתים על החלקים שסביבו.
קומץ כשלים אחראי לרוב הסוכנים שמתים אחרי העלייה לאוויר. כל אחד מהם בלתי נראה בדמו, כי דמו רץ פעם אחת, מהר, תחת השגחה. הנה איך כל אחד נראה בשטח, והתיקון בשורה.
| הכשל | איך זה נראה בשטח | התיקון |
|---|---|---|
| אינטגרציה שנשברת | API חיצוני משנה שדה או חוסם אתכם בקצב, והסוכן פועל על תשובה שהבין לא נכון | לאמת כל תשובה, להיכשל ברעש, לרדת בכוונה לפעולה חלקית |
| טוקן הרשאה שפג | הטוקן שעבד בדמו פג, והסוכן מאבד גישה בשקט באמצע משימה | לרענן טוקנים בצד השרת, להתייחס לאובדן הרשאה כשגיאה אמיתית |
| הרשאות חסרות | הסוכן מגיע לנתונים או לפעולות שאסור לו, או לא מגיע למה שכן מותר | לאכוף הרשאות בשרת, לכל בקשה, אף פעם לא בפרומפט |
| אין תקרת הוצאה | שום דבר לא מגביל כמה קריאות או ג'ובים רצים, וההוצאה מטפסת בלי גבול | הגבלות הוצאה וקצב קשיחות, ומתג עצירה שאפשר באמת ללחוץ |
| פעולה כפולה | ניסיון חוזר או לחיצה כפולה גורמים לסוכן לחייב, לפרסם או לשלוח מייל פעמיים | מפתחות idempotency, כך שאותה פעולה רצה פעם אחת לא משנה כמה פעמים היא נורית |
| אובדן state | הסוכן שוכח איפה היה אחרי קריסה או הפעלה מחדש, וממשיך במקום הלא נכון | לשמור state מחוץ לסוכן, לגרום לכל שלב להיות ניתן להמשכה |
כי הצלחה מוכפלת, לא ממוצעת. אם כל שלב בתהליך מצליח ב‑95% מהמקרים, ריצה של 20 שלבים מצליחה בערך ב‑36% מהמקרים, לא ב‑95%. זה 0.95 בחזקת 20. ככל שסוכן משרשר יותר שלבים, הסיכויים נופלים מהר יותר, וסוכנים משרשרים המון שלבים.
הדפוס נשמר בכל רמת אמינות. עשרה שלבים ב‑99% כל אחד נוחתים סביב 90%. עשרים שלבים ב‑95% נוחתים סביב 36%. חמישים שלבים ב‑99% נוחתים סביב 60%. לכן תהליך שרץ מושלם פעם אחת בדמו לא מספר לכם כמעט כלום על הריצה המאה בפרודקשן. התיקון הוא לא מודל טוב יותר. הוא פחות שלבים, בדיקה ביניהם, ודרך לחזור על השלב שנכשל בלי לעשות מחדש את כל השרשרת.
התיקונים משעממים, וזו בדיוק הנקודה. אף אחד מהם לא נוגע במודל. אלה אותן בקרות שכל מערכת פרודקשן צריכה, מיושמות על משהו שעכשיו יכול לפעול בעצמו. עברו על הרשימה הזאת לפני שסוכן נוגע במשתמשים אמיתיים.
הכשל הכי יקר שראינו לא היה קריסה. זו הייתה אפליקציה אוטומטית בלי תקרה לכמה ג'ובים רצים במקביל, בלי הגבלת הוצאה, ובלי מתג עצירה אמיתי. הבעלים הריצו אותה בלי השגחה יום אחד וקיבלו חשבון AI של מעל 1,000 דולר לפני שהגיעו אלינו.
הדמו עבד מושלם. אף אחד לא מבקש מבילדר AI הגבלת הוצאה, אז הוא אף פעם לא כתב אחת. זו הצורה של כמעט כל כשל בפרודקשן: מה שנשבר הוא הדבר שאף אחד לא ביקש מהמודל לבנות.
תקרת הוצאה היא קו הגנה אחד. הדפוס העמוק יותר, הרשאות שמנוהלות בדפדפן בלי בקרה בצד השרת, הוא זה שאנחנו מוצאים הכי הרבה באפליקציות שנבנו עם AI, והוא מתועד עם התיקונים בחורי האבטחה שאנחנו מוצאים שוב ושוב.
הריצו את אותה בדיקה עצמית שאנחנו עושים לפני שמשהו עולה לאוויר. שישה התחומים בהצ'קליסט שקובע אם האפליקציה מוכנה לפרודקשן תקפים לסוכן בדיוק כמו לאפליקציה: אבטחה בצד השרת, כללי נתונים, הגבלות, גיבויים, ניטור, ומקרי הקצה שאף אחד לא ביקש. אם אתם לא יכולים לענות כן על כל השישה, הפער הזה הוא העבודה.
אנחנו בונים ובודקים סוכנים ככה כהרגל. אנחנו חוקרים את התוכנית לפני שסוכן רץ, ומוודאים שהוא באמת סיים את המשימה במקום לסמוך על הקבלה שהוא מחזיר. לאורך 15 אפליקציות שמסרנו חיברנו כמה ספקי מודלים יחד עם הפרדת נתונים מלאה, והקשחנו סוכנים שעבדו בדמו אבל דלפו, הוציאו יותר מדי או השמיטו משימות בשקט ברגע שהשימוש האמיתי התחיל.
אם יש לכם סוכן שמנצח בדמו אבל אתם לא בטוחים שהוא שורד משתמשים אמיתיים, כסף אמיתי ומידע אמיתי, קבלו הצעת מחיר כתובה להקשחה שלו לפני העלייה לאוויר. תקבלו קריאה כנה על איפה הוא נשבר קודם, לפני שמדברים על כסף.