עלות סוכן AI לעסק - מה משלמים לספק המודל ומה למי שבונה
שאלת העלות של סוכן AI מתפצלת לשתי שאלות שונות לחלוטין: כמה עולה כל שיחה בפועל, וכמה עולה לבנות ולתחזק את המערכת שמריצה אותה. הראשונה נמדדת באגורות, השנייה בעשרות אלפי שקלים, ורוב ההצעות בשוק מדברות רק על אחת מהן.

כשעסק שואל אותנו כמה עולה סוכן AI, אנחנו מבקשים לפצל את השאלה. יש עלות תפעולית - כמה עולה כל אינטראקציה - ויש עלות פרויקט. הן לא באותו סדר גודל ולא באותו סוג של תקציב, ובלבול ביניהן הוא מקור למרבית ההפתעות.
נתחיל מהחלק שקל למדוד: מה משלמים לספק המודל.
שכבה 1: עלות המודל
ספקי מודלי שפה מתמחרים לפי מיליון טוקנים, בהפרדה בין קלט לפלט. פלט יקר משמעותית מקלט, בדרך כלל פי חמישה. הטבלה מציגה את המחירון של מודלי Claude, שהוא נקודת ייחוס נוחה כי המבנה דומה אצל רוב הספקים.
| מודל | קלט למיליון טוקנים | פלט למיליון טוקנים | למה מתאים |
|---|---|---|---|
| Claude Opus 5 | 5 דולר | 25 דולר | משימות מורכבות, ניתוח, החלטות רב-שלביות |
| Claude Sonnet 5 | 3 דולר | 15 דולר | ברירת המחדל לרוב היישומים העסקיים |
| Claude Haiku 4.5 | 1 דולר | 5 דולר | סיווג, חילוץ מידע, ניתוב, משימות בנפח גבוה |
המחירים משתנים מעת לעת וכדאי לאמת מול המחירון הרשמי לפני תכנון תקציב. בכל החישובים כאן הנחנו שער של כ-3.7 שקל לדולר, לפני מע"מ.
הפער בין הדגמים הוא פי חמישה, וזה המקום הראשון שבו אפשר לחסוך בלי לפגוע באיכות - בתנאי שמנתבים כל משימה למודל המתאים לה במקום להריץ את הכל על החזק ביותר.
עברית עולה יותר
זו נקודה שכמעט לא מוזכרת בחומרים באנגלית, והיא מהותית לעסק ישראלי. מפרקי הטקסט של המודלים אומנו בעיקר על אנגלית, ולכן טקסט עברי מתפרק ליותר טוקנים ביחס לאותה כמות מידע. בפועל, מסמך עברי יעלה בערך פי 1.5 עד 2.5 מהמקבילה האנגלית שלו.
שתי מסקנות מעשיות. ראשית, אל תעתיקו הערכות עלות ממאמרים באנגלית - הן יטעו כלפי מטה. שנית, אם הוראות המערכת שלכם ארוכות מאוד, שווה לבדוק אם כתיבתן באנגלית מוזילה משמעותית, גם כשהמענה ללקוח נשאר בעברית. זה טריק שעובד, אבל שווה למדוד לפני שסומכים עליו.
אתם משלמים על כל מילה שנכנסת למודל, לא רק על מה שהמשתמש כתב. ורוב מה שנכנס זה מה שאתם הכנסתם.
מה באמת נכנס לכל בקשה
זו התובנה שמסבירה את רוב ההפתעות בחשבון. בכל פנייה של משתמש נשלחים למודל:
- הוראות המערכת - מי הסוכן, מה מותר לו, איך לענות. בדרך כלל 800 עד 3,000 טוקנים בעברית.
- מידע רלוונטי שנשלף ממאגר - קטעי מדיניות, מחירון, מסמכים. לרוב 1,000 עד 6,000 טוקנים.
- היסטוריית השיחה - כל מה שנאמר עד עכשיו, שוב, בכל תור.
- השאלה עצמה - בדרך כלל החלק הקטן ביותר, כמה עשרות טוקנים.
ההיסטוריה היא המלכודת. בשיחה של עשרה תורים, התור העשירי שולח מחדש את כל תשעת הקודמים. עלות השיחה גדלה בקצב ריבועי ולא ליניארי, ולכן שיחה של עשרים תורים עולה הרבה יותר מפי שניים משיחה של עשרה.
חישוב עלות לשיחה
נדגים על שיחת שירות טיפוסית בעברית: שמונה תורים, הוראות מערכת של 1,500 טוקנים, מידע נשלף של 2,500 טוקנים, ותשובות של כ-300 טוקנים כל אחת. סך הקלט המצטבר על פני השיחה יוצא כ-30,000 טוקנים והפלט כ-2,400.
| מודל | עלות קלט | עלות פלט | סה"כ לשיחה | בשקלים |
|---|---|---|---|---|
| Claude Opus 5 | 0.150 דולר | 0.060 דולר | 0.210 דולר | כ-78 אגורות |
| Claude Sonnet 5 | 0.090 דולר | 0.036 דולר | 0.126 דולר | כ-47 אגורות |
| Claude Haiku 4.5 | 0.030 דולר | 0.012 דולר | 0.042 דולר | כ-16 אגורות |
במילים אחרות: 1,000 שיחות שירות בחודש על מודל הביניים עולות בערך 470 שקל. זה מספר שרוב העסקים לא מצפים לו - הם מצפים ליותר. וזו בדיוק הסיבה שהעלות התפעולית כמעט אף פעם אינה השיקול המכריע בפרויקט AI.
לשם השוואה, משימה של סיווג פנייה - 800 טוקני קלט ו-100 טוקני פלט על המודל הקל - עולה בערך חצי אגורה. אפשר להריץ אותה על עשרות אלפי פריטים בחודש בעלות של עשרות שקלים.
שלושה מנגנונים שמורידים את החשבון
מטמון הוראות
רוב הספקים מאפשרים לסמן חלק קבוע מהבקשה - הוראות המערכת, מסמכי ייחוס - כניתן למטמון. הכתיבה למטמון עולה קצת יותר מקלט רגיל, אבל כל קריאה חוזרת עולה בערך עשירית מהמחיר. במערכת שבה אלפי בקשות חולקות את אותן הוראות, זו הפחתה של עשרות אחוזים בעלות הקלט.
התנאי הוא שהחלק הקבוע יישאר זהה בייט אחר בייט. מספיק שמישהו הכניס תאריך של היום לתוך הוראות המערכת כדי שהמטמון יפסיק לעבוד לגמרי - וזה קורה הרבה.
עיבוד באצווה
למשימות שלא דורשות תשובה מיידית - סיווג של תיקיית פניות, סיכום דוחות, ניקוי נתונים - רוב הספקים מציעים מסלול אצווה בהנחה של כ-50 אחוז. התשובות מגיעות תוך שעות ולא תוך שניות. אם המשימה יכולה לחכות, אין סיבה לשלם כפול.
ניתוב בין מודלים
הטעות הנפוצה ביותר בתכנון: לבחור מודל אחד חזק ולהריץ עליו כל פעולה. בפועל, רוב הפעולות במערכת אמיתית הן פשוטות. סיווג פנייה, זיהוי שפה, חילוץ שם ומספר - כל אלה מתאימים למודל הקל. רק ההחלטה המורכבת דורשת את החזק.
| שלב במערכת | מודל מתאים | למה |
|---|---|---|
| סיווג נושא הפנייה | הקל | משימה מוגדרת עם מספר מצומצם של תשובות |
| חילוץ פרטים מטקסט | הקל | אין צורך בשיפוט, רק בזיהוי |
| ניסוח תשובה ללקוח | הביניים | דורש הבנת הקשר וטון |
| החלטה עסקית או ניתוח מורכב | החזק | כאן טעות עולה יותר מהמודל |
| בקרת איכות על פלט | הביניים | בדיקה קלה יותר מיצירה |
שכבה 2: התשתית
מסביב למודל יש מערכת, וגם היא עולה. הסעיפים האלה קטנים יחסית אבל קבועים.
| רכיב | טווח חודשי משוער | הערה |
|---|---|---|
| שרת או אירוח | כ-40 עד 300 שקל | תלוי אם מריצים n8n עצמי או שירות מנוהל |
| מסד וקטורים לחיפוש במסמכים | כ-0 עד 300 שקל | בנפח קטן אפשר לוותר לגמרי |
| שכבת אוטומציה | כ-40 עד 400 שקל | Make, n8n או Zapier |
| ניטור ותיעוד שיחות | כ-0 עד 200 שקל | ניתן לבנות עצמי, אבל בלי זה אי אפשר לשפר |
| ערוץ תקשורת - וואטסאפ, מסרונים | משתנה לפי נפח | לעיתים גדול מעלות המודל עצמה |
שימו לב לשורה האחרונה. בסוכן שעובד בוואטסאפ, עלות ההודעות היזומות יכולה בקלות לעלות על עלות המודל. עסק ששולח 5,000 הודעות תפעוליות בחודש משלם עליהן בערך 275 שקל - יותר ממה שעולה המודל בחלק מהתרחישים.
שכבה 3: בנייה ותחזוקה
כאן נמצא רוב הכסף, וכאן גם הכי קשה לתת מספר. הטווחים הבאים משקפים את מה שאנחנו רואים בשוק הישראלי לעסקים קטנים ובינוניים. הם לא הצעת מחיר.
| סוג פרויקט | טווח משוער | מה כלול |
|---|---|---|
| הוכחת היתכנות ממוקדת | כ-8,000 עד 20,000 שקל | תרחיש אחד, נתונים מדגמיים, בלי חיבור מלא למערכות |
| סוכן ייצור לתרחיש אחד | כ-20,000 עד 45,000 שקל | חיבור למקור נתונים אמיתי, בקרות, ניטור, הטמעה |
| מערכת רב-תרחישית | כ-45,000 עד 120,000 שקל | כמה תהליכים, כמה מערכות, הרשאות, דוחות |
| ליווי ותחזוקה חודשית | כ-1,500 עד 6,000 שקל | תיקונים, שיפור איכות תשובות, התאמה לשינויים |
מה שמזיז את המחיר בתוך הטווחים הוא כמעט תמיד אותם ארבעה גורמים: מצב הנתונים, מספר המערכות שצריך לחבר, רמת הדיוק הנדרשת, ומידת החשיפה של הסוכן ללקוח חיצוני. סוכן פנימי שטועה - עובד מתקן. סוכן שמדבר עם לקוחות משלמים דורש רמת בקרה אחרת לגמרי, וזה מה שמייקר.
איפה החשבון קופץ
| התקלה | מה קורה | ההגנה |
|---|---|---|
| לולאה אינסופית | הסוכן קורא לעצמו שוב ושוב אחרי כישלון | הגבלת מספר צעדים לכל בקשה, קשיחה |
| הקשר מנופח | שולחים למודל את כל מאגר הידע במקום את הקטע הרלוונטי | שליפה ממוקדת, הגבלת מספר קטעים |
| שיחות ללא סוף | היסטוריה שגדלה בלי הגבלה | דחיסה או קיצוץ של תורים ישנים |
| שימוש לרעה | מישהו מגלה את הממשק ומריץ אלפי בקשות | הגבלת קצב למשתמש ואימות |
| מודל יקר במשימה זולה | סיווג פשוט רץ על המודל החזק | ניתוב מפורש לפי סוג משימה |
| מטמון שהפסיק לעבוד | שינוי קטן בהוראות ביטל את כל החיסכון | ניטור שיעור פגיעות המטמון |
ההמלצה הפשוטה: הגדירו תקרת הוצאה בממשק הספק והתראה על חמישים אחוז ממנה. זה לוקח עשר דקות ומונע את התרחיש שבו מגלים את הבעיה בחשבון בסוף החודש.
שורה תחתונה
העלות התפעולית של סוכן AI נמוכה מכפי שרוב האנשים מניחים - אגורות לשיחה, מאות שקלים בחודש בנפח סביר. העלות האמיתית היא בבנייה, ובעיקר בתחזוקה של משהו שצריך להישאר מדויק כשהעסק משתנה.
לכן השאלה שאנחנו שואלים לפני שאלת המחיר היא אחרת: מה התהליך, כמה פעמים הוא קורה, ומה קורה כשהוא נכשל. אם התשובות לא ברורות, שום מחיר לא יהיה נכון. קודם מבינים את העסק, רק אחר כך בונים את המערכת.
שאלות שחוזרות
- מה זה טוקן ולמה זה משנה?
- טוקן הוא יחידת הטקסט שהמודל מחשב לפיה, בערך חלק ממילה. כל מחירי המודלים נקובים לפי מיליון טוקנים, נפרד לקלט ולפלט. זה משנה כי אתם משלמים על כל מה שנכנס למודל - כולל הוראות המערכת, ההיסטוריה של השיחה והמידע שצירפתם - ולא רק על השאלה של המשתמש.
- עברית יקרה יותר מאנגלית?
- כן, ובאופן מורגש. אותו משפט בעברית מתפרק לבערך פי 1.5 עד 2.5 טוקנים לעומת אנגלית, בגלל האופן שבו המפרקים מטפלים באותיות עבריות ובניקוד. משמעות מעשית: תקציב שנבנה על מדדים באנגלית יחטא בפקטור משמעותי. אם הדיוק חשוב, כדאי למדוד את הטקסטים האמיתיים שלכם מול ממשק ספירת הטוקנים של הספק.
- מה מוזיל את העלות הכי הרבה?
- שלושה דברים לפי סדר השפעה: בחירת מודל מתאים לכל משימה במקום להריץ את החזק ביותר על הכל, מטמון הוראות (prompt caching) שמפחית דרמטית את עלות הקלט החוזר, וקיצור ההקשר - לא לשלוח למודל כל מה שיש אלא רק את מה שרלוונטי. עיבוד באצווה מוזיל בחצי אבל מתאים רק למשימות לא דחופות.
- כמה עולה לבנות סוכן AI בישראל?
- הטווחים בשוק המקומי: הוכחת היתכנות ממוקדת נעה בערך בין 8,000 ל-20,000 שקל, מערכת ייצור עם חיבור לנתונים אמיתיים ובקרות בערך בין 35,000 ל-90,000 שקל, וליווי שוטף בין 1,500 ל-6,000 שקל בחודש. אלה טווחים כלליים; המחיר נקבע בעיקר לפי מצב הנתונים ומספר המערכות שצריך לחבר.
- למה עלות ה-API מפתיעה לרעה?
- כי היא משתנה לפי שימוש ולא קבועה. שיחה אחת עולה אגורות, אבל תקלה בלולאה, טעות שמצרפת מסמך ענק לכל בקשה, או פתאום פי עשרה משתמשים - כל אחד מהם יכול להכפיל את החשבון תוך יום. תמיד צריך תקרה טכנית והתראה על חריגה, לא רק תקציב על הנייר.
- האם שווה להריץ מודל בשרת עצמי כדי לחסוך?
- כמעט אף פעם לא לעסק קטן או בינוני. שרת עם כרטיס גרפי מתאים עולה מאות דולרים בחודש גם כשהוא לא בשימוש, ודורש ידע תחזוקתי אמיתי. הסף שבו זה מתחיל להשתלם כלכלית הוא נפח גבוה מאוד או דרישת פרטיות שמחייבת שהנתונים לא יצאו מהארגון - וגם אז זו החלטה של ארגון, לא של עסק בן עשרה עובדים.