RAG בעברית - איך מחברים סוכן AI לידע הפנימי של העסק
סוכן AI שלא מחובר לידע שלכם עונה בערך. RAG הוא המנגנון שמחבר אותו למסמכים האמיתיים, אבל בעברית הוא דורש עבודה נוספת שרוב המדריכים לא מזכירים. כאן נסביר מה באמת נדרש, ומתי עדיף לוותר על זה לגמרי.

כשלקוח מבקש סוכן AI שיודע הכול על העסק, הוא בעצם מבקש RAG. השם המלא הוא אחזור מידע משולב ביצירה, והרעיון פשוט: במקום לצפות שהמודל יזכור את המידע שלכם, מחפשים את הקטעים הרלוונטיים ברגע השאלה ומכניסים אותם לתוך ההקשר לפני שהמודל עונה.
הרעיון פשוט. הביצוע בעברית פחות. מרבית המדריכים בנושא נכתבו על אנגלית, וההבדלים לא זניחים. נעבור עליהם, ונתחיל דווקא במקרים שבהם אין צורך בכל זה.
מתי לא צריך RAG
אנחנו מתחילים מכאן כי זה חוסך ללקוחות כסף.
- תוכן קטן ויציב, עד כמה עשרות עמודים. פשוט מכניסים הכול להקשר. זול, מדויק, בלי תחזוקה.
- שאלות עם תשובה קבועה כמו שעות פתיחה או מדיניות. תבנית תשובה עדיפה על אחזור.
- מידע שנמצא במסד נתונים מובנה, כמו סטטוס הזמנה, יתרה או מלאי. שאילתה ישירה מדויקת יותר מחיפוש סמנטי.
- תוכן שמשתנה כל שעה. אז צריך חיבור ישיר למקור ולא אינדקס שמתעדכן.
- מקרים שבהם אין באמת תיעוד. RAG לא ממציא ידע שלא נכתב, והרבה עסקים מגלים בשלב הזה שהידע נמצא בראש של שני אנשים.
הסעיף האחרון הוא מה שאנחנו רואים הכי הרבה. מגיעים לפרויקט RAG ומגלים שהחלק הארוך הוא לא הטכנולוגיה אלא כתיבת המידע. זו עבודה שהעסק צריך לעשות בעצמו, ואנחנו אומרים את זה מראש.
למה עברית קשה למנוע חיפוש
כמה מאפיינים ספציפיים, וכל אחד מהם משפיע על איכות האחזור.
| מאפיין | דוגמה | ההשפעה |
|---|---|---|
| תחיליות דבוקות | מהחשבונית מול חשבונית | התאמה מדויקת מפספסת |
| כתיב מלא וחסר | תוכנית מול תכנית | אותו מושג, שתי צורות |
| ריבוי צורות נטייה | שילם, תשלום, לשלם, משולם | פיזור על פני הרבה וריאנטים |
| ראשי תיבות עם גרשיים | מעמ, חפ, בעמ | פירוק לא עקבי של הטקסט |
| עירוב אנגלית | לעשות reconciliation לחשבון | שבירת רצף השפה |
| טקסט מימין לשמאל עם מספרים | סכום 5,000 ₪ בתוך משפט | בעיות בחילוץ מקבצים |
| ניקוד חלקי | מסמכים משפטיים או דתיים | מילים זהות נראות שונות |
התוצאה המעשית: אם תסתמכו רק על חיפוש סמנטי, תפספסו מסמכים שמכילים בדיוק את התשובה אבל מנוסחים אחרת. ואם תסתמכו רק על חיפוש מילולי, תפספסו כל ניסוח שאינו מילה במילה. בעברית הפער הזה גדול יותר מאשר באנגלית, ולכן חיפוש היברידי הוא לא שיפור אלא דרישת בסיס.
הכנת המקורות - החלק שלוקח הכי הרבה זמן
בכל פרויקט RAG שעשינו, הכנת התוכן תפסה בין חמישים לשבעים אחוז מהזמן. אלה השלבים.
מיפוי ובחירה
לא כל מסמך צריך להיכנס. אנחנו עוברים על מה שיש ומסמנים מה מעודכן, מה מיושן, ומה סותר מסמך אחר. המסמכים הסותרים הם הבעיה: אם קיימות שתי גרסאות של מדיניות ההחזרות, הסוכן יבחר אחת מהן באקראי. צריך להחליט לפני, לא אחרי.
חילוץ טקסט
קבצי PDF בעברית הם כאב ידוע. סדר התווים לפעמים מתהפך, טבלאות מתמעכות לשורה אחת, ומסמכים סרוקים דורשים זיהוי תווים שעדיין לא מושלם בעברית. אנחנו בודקים דגימה של הטקסט המחולץ בעיניים לפני שממשיכים. זה נשמע טריוויאלי, וזה השלב שהכי הרבה פרויקטים מדלגים עליו ומשלמים אחר כך.
חיתוך לקטעים
המסמך מפורק לקטעים באורך מנוהל. הכלל שאנחנו עובדים לפיו הוא לחתוך לפי מבנה לוגי - כותרת, סעיף, שאלה - ולא לפי ספירת תווים עיוורת. קטע שנחתך באמצע טבלת מחירים חסר תועלת. לכל קטע אנחנו מוסיפים את כותרת ההקשר שלו, כדי שקטע שנשלף לבדו עדיין יובן.
העשרה במטא נתונים
תאריך עדכון, מקור, מחלקה, רמת הרשאה, וסימון אם המסמך עבר סריקה. המטא נתונים האלה הם מה שמאפשר לסנן לפי הרשאות ולהעדיף מסמך עדכני על ישן. בלעדיהם, סוכן יצטט מדיניות ישנה בביטחון מלא.
חיפוש היברידי ודירוג מחדש
המבנה שאנחנו בונים בעברית כמעט תמיד.
- 1נרמול השאילתה - טיפול בתחיליות, איחוד כתיב מלא וחסר, פתיחת ראשי תיבות נפוצים.
- 2חיפוש מילולי - תופס מספרי מסמכים, שמות מוצרים וראשי תיבות שחיפוש סמנטי מחמיץ.
- 3חיפוש סמנטי - תופס ניסוח שונה של אותו רעיון. חשוב לבחור מודל שטופל בעברית ולא להניח שכל מודל רב לשוני מספיק.
- 4מיזוג התוצאות משני המסלולים.
- 5דירוג מחדש - מודל שמסתכל על השאילתה ועל כל קטע ומדרג רלוונטיות. זה השלב עם השיפור הגדול ביותר ביחס למאמץ.
- 6בחירת שלושה עד שמונה קטעים בלבד. יותר מזה מפזר את תשומת הלב של המודל ופוגע באיכות.
בעברית, שלב הדירוג מחדש בדרך כלל משפר את האיכות יותר מאשר החלפת מודל השפה.
ציטוטים, הרשאות ומה שקורה כשאין תשובה
שלושה מנגנונים שאנחנו לא מוותרים עליהם.
ציטוטים - כל תשובה נושאת את מזהי הקטעים ששימשו לה. זה מאפשר לבדוק, וגם מאפשר לזהות תשובות חשודות אוטומטית. תשובה שנוסחה בלי קטעים תומכים מסומנת מיד.
הרשאות - הסינון חייב לקרות בשלב האחזור, לא בשלב הניסוח. אם קטע ממסמך שכר נכנס להקשר, המידע כבר דלף גם אם המודל התבקש לא לחשוף אותו. הבקשה לא מספיקה. הסינון חייב להיות מבני.
אין תשובה - כשהאחזור לא מחזיר משהו רלוונטי מספיק, המערכת צריכה לומר שאין לה את המידע ולהציע מסלול לאדם. זה נשמע מובן מאליו וזה מה שנשחק ראשון כשמנסים לשפר את שיעור המענה.
איך יודעים אם זה עובד
מערכת RAG קשה למדידה כי אין לה תשובה נכונה אחת. אנחנו מפרידים בין שתי שאלות, כי הן נשברות במקומות שונים ודורשות תיקון שונה.
השאלה הראשונה היא האם האחזור מצא את החומר. זו שאלה טכנית: בונים רשימה של חמישים עד מאה שאלות אמיתיות מהעסק, מסמנים לכל אחת איזה מסמך אמור לענות עליה, ובודקים כמה פעמים המסמך הזה הופיע בין הקטעים שנשלפו. אם הוא לא נשלף, שום שיפור במודל השפה לא יעזור.
השאלה השנייה היא האם התשובה שנוסחה נכונה בהינתן שהחומר נמצא. כאן צריך אדם שקורא. אנחנו עוברים על מדגם שבועי ומסמנים כל תשובה באחת מארבע קטגוריות: נכונה ומלאה, נכונה אבל חלקית, שגויה, או אמרה נכון שאין לה מידע. הקטגוריה האחרונה היא הצלחה ולא כישלון, וכדאי לספור אותה בנפרד כדי שלא תיראה כמו בעיה בדוח.
הפירוק הזה חוסך הרבה זמן ניפוי. כשמישהו מדווח שהסוכן ענה לא נכון, השאלה הראשונה היא תמיד האם המסמך הנכון בכלל הגיע להקשר. ברוב המקרים התשובה היא לא, והבעיה נמצאת בחיתוך או באינדוקס ולא במודל.
תחזוקה ועלויות
מערכת RAG היא לא פרויקט שמסתיים. המסמכים משתנים, וכשמסמך מתעדכן והאינדקס לא, הסוכן עונה תשובה שהייתה נכונה פעם. זו התקלה הכי מסוכנת כי היא לא נראית כמו תקלה.
- תהליך עדכון אוטומטי כשמסמך משתנה במקור.
- סקירה תקופתית של שאילתות שהחזירו אין תשובה. זו רשימת המשימות לתיעוד חסר.
- מערך שאלות בדיקה קבוע שרץ אחרי כל שינוי, כדי לוודא שלא נשברה תשובה שעבדה.
- בדיקה ידנית מדגמית של תשובות מול המקורות.
מבחינת עלויות: בנייה של מערכת RAG לבסיס ידע בינוני נעה בין 20,000 ל־50,000 שקל, כשהחלק הגדול הוא הכנת התוכן ולא הקוד. הרצה חודשית עולה בדרך כלל 200 עד 900 שקל כולל אחסון וקריאות למודל. תחזוקה נעה בין 1,500 ל־4,000 שקל בחודש. עסק שלא מתקצב את התחזוקה יקבל מערכת שעובדת מצוין בחודש הראשון ופחות טוב בכל חודש שאחריו.
שאלות שחוזרות
- מה ההבדל בין RAG לבין אימון מודל על הנתונים שלי?
- RAG שולף מידע רלוונטי בזמן השאלה ומכניס אותו להקשר. אימון משנה את המודל עצמו. לרוב העסקים RAG הוא התשובה הנכונה: הוא זול יותר, מתעדכן מיד כשמסמך משתנה, ומאפשר לדעת מאיפה הגיעה תשובה. אימון מוצדק רק במקרים מיוחדים.
- כמה מסמכים צריך כדי שזה ישתלם?
- מתחת לכעשרים עמודים של תוכן יציב, אפשר פשוט להכניס הכול להקשר בלי מנגנון אחזור. RAG מתחיל להצדיק את עצמו מכמה מאות עמודים ומעלה, או כשהתוכן משתנה תדיר.
- האם עברית באמת קשה יותר?
- כן, ובאופן מדיד. כתיב ללא ניקוד, תחיליות שנדבקות למילה, ריבוי צורות נטייה ועירוב אנגלית מקשים על התאמה בין שאילתה למסמך. הפער הצטמצם עם מודלים רב לשוניים חדשים, אבל חיפוש היברידי עדיין נחוץ בעברית יותר מאשר באנגלית.
- מה עושים עם קבצים סרוקים?
- מעבירים דרך זיהוי תווים, ובעברית התוצאה בינונית, במיוחד בטבלאות ובמסמכים ישנים. אנחנו ממליצים לתעדף מקורות דיגיטליים, ולסמן במפורש מסמכים שעברו סריקה כפחות אמינים כדי שהסוכן לא יצטט מהם נתון מספרי.
- האם RAG פותר את בעיית ההזיות?
- מצמצם, לא פותר. הוא מוריד משמעותית את שיעור ההמצאות כי המידע הנכון נמצא בהקשר. אבל מודל עדיין יכול לפרש מקור לא נכון, לצרף שני מקורות באופן שגוי, או לענות בביטחון כשהאחזור החזיר משהו לא רלוונטי. צריך גם ציטוטים וגם בדיקות.