טייסים וסוכני LLM: לבנות או להדריך

פורסם במקור כפוסט בלינקדאין, והורחב כאן.

טייסים הם קצת כמו סוכנים מבוססי LLM, ולכן אני לא בונה אייג'נטים לארגונים — אני מלמד את האנשים בהם להדריך אותם. כמה שנים של אימון לימדו אותי בעיקר דבר אחד: ב-99% מהמקרים כל מה שצריך לעשות זה לעקוב אחרי הצ'קליסט, ונשאר עוד 1% קריטי של יצירתיות מבוססת ידע וניסיון.

99% צ'קליסט, 1% יצירתיות

תהליך הלמידה נמשך כמה שנים, ורוב רובו הוא ללמוד על בשרי שהמקצוע הזה הרבה פחות דרמטי ממה שהוא נראה מבחוץ. הרוב המוחלט של הטיסה הוא סדר פעולות ידוע: לקרוא, לבצע, לוודא, להמשיך.

ה-1% שנשאר הוא מה שמצדיק את כל השנים האלה. הוא נדרש בדיוק ברגעים שבהם הצ'קליסט לא מכסה את מה שקורה בפועל, ואי אפשר לכתוב אותו מראש — אילו היה אפשר, הוא כבר היה הופך לצ'קליסט.

בפוסט המקורי צירפתי סרטון שבו אני מבצע את הפרומפט שקיבלתי בתחילת היום: Exterior Check. שתי מילים, ומה שיוצא מהן זו פרוצדורה שלמה, כי הפרוצדורה כבר טעונה אצלי. זו בדיוק הסיבה שפרומפט קצר עובד מצוין כשהצד השני מאומן, ופחות טוב כשהוא לא.

ככה מאמנים טייס: דוחפים אותו לפינה

בצבא אין זמן לצבור את הניסיון הזה בקצב טבעי, ולכן מאיצים אותו בכוח. מכניסים אותך שוב ושוב לכל מיני פינות תעופתיות, ומראים לך את הדרך לפתרון שלהן.

בדרך כלל חוש ההישרדות עצמו מצליח למצוא את הדרך עוד לפני התערבות המדריך. אבל לא תמיד, וזו בדיוק הסיבה שהמדריך יושב שם.

הפינות האלה אף פעם לא נעימות ברגע עצמו, וזה פחות או יותר כל הרעיון. אין דרך לצבור ניסיון בלי לעבור את החלק שבו אתה לא יודע מה לעשות.

אין בשיטה הזאת שום תחכום. פשוט צריך לטוס הרבה. אף אחד לא למד לטוס מהרצאה על טיסה, ואף אחד לא לומד לעבוד עם סוכן מהדגמה של מישהו אחר.

הלולאה: דאטה נכנס, פלט יוצא, פידבק חוזר

אפשר לכתוב את כל השיטה בשורה אחת: דאטה נכנס, יוצא פלט, מקבלים פידבק מהמדריך או מהמטוס, וחוזר חלילה.

שני מקורות הפידבק לא שווים. המדריך יודע להסביר למה טעית ומה היה נכון לעשות. המטוס אכזרי בכנותו — הוא לא מסביר, לא מרכך, ולא מתחשב בכוונות שלך. הוא פשוט מגיב למה שעשית בפועל, מיד. דווקא הפידבק הזה הוא שנצרב הכי עמוק.

בעבודה מול סוכן קיימים שני המקורות האלה בדיוק:

מקור הפידבק מה הוא נותן המקבילה בעבודה מול סוכן
המדריך הסבר למה זה לא נכון ומה כן ההערה שלך על הפלט
המטוס תגובה מיידית ויבשה למה שנעשה בפועל השגיאה שחוזרת מהכלי

אם נשענים רק על השורה השנייה, אין מי שיסביר לסוכן למה הפלט לא טוב מספיק — ולכן אין לו ממה להשתפר מעבר לנקודה מסוימת. השורה הראשונה יקרה יותר, כי היא דורשת בן אדם שיודע איך התוצאה הנכונה נראית ומוכן להשקיע דקה בלהסביר את זה.

בפועל זה אומר שאי אפשר לקצר את השלב שבו הסוכן טועה מול משימה אמיתית שלכם. הטעות היא לא תקלה בתהליך הלמידה — היא התהליך.

סוכנים: לפעמים יש דאטה, לפעמים צריך להדריך

סוכנים צריכים הרבה דאטה, בדיוק כמו טייס מתחיל. לפעמים פשוט יש כזה — יושב מסודר איפשהו, אפשר לדחוף אותו פנימה בפעם אחת, ואז זה באמת קסם. הסוכן מכיר את ההקשר מהרגע הראשון ואין הרבה מה להוסיף.

אבל לפעמים אין. הידע נמצא אצל אנשים ולא בקבצים, או שהוא קיים בקבצים אבל אף אחד לא כתב אותם מתוך מחשבה על קורא חיצוני. במצב הזה אין קיצור דרך, וצריך "להדריך": לתת לו לעשות, לתת לו לטעות, לתת פידבק, וחוזר חלילה.

ההבדל בין שני המצבים הוא לא הבדל בכלי אלא בכמות הדאטה שכבר קיימת בצורה שמישהו יכול לקרוא. שווה לעשות את ההבחנה הזאת בהתחלה, כי היא קובעת כמה מהעבודה היא העברת קבצים וכמה ממנה היא ישיבה מול הכלי.

למה אני לא בונה אייג'נטים לארגונים

אני אישית לא בונה אייג'נטים בתהליכים שאני עושה לארגונים. אני פשוט מלמד אותם להדריך.

ההבדל הוא לא טכני. אייג'נט שמישהו בנה לך הוא מוצר שקפא ברגע מסוים — הוא יודע את מה שידעת ביום שהוגדר, וכדי שיזוז צריך לחזור למי שבנה אותו. יכולת ההדרכה נשארת אצל האנשים, וזזה יחד עם התהליך.

ההבדל הזה נראה קטן ביום הראשון ומתגלה אחרי כמה חודשים, כשמשהו בתהליך משתנה ומישהו צריך להחליט אם לפתוח פנייה למי שבנה, או פשוט להסביר לסוכן מה השתנה.

לכן השאלה "איזה אייג'נט בונים לנו" פחות מעניינת אותי מהשאלה מי אצלכם יידע לתת את הפידבק, ומתי הוא עושה את זה.

יש לזה גם צד לא נוח מבחינתי. תהליך שנגמר בזה שאתם לא צריכים אותי הוא תהליך קצר, ואני מוכר בו פחות שעות ממה שהייתי יכול. אני עדיין חושב שזו העסקה הנכונה, כי הדבר היחיד שבאמת נשאר בארגון בסוף השנה הוא מה שהאנשים בו יודעים לעשות לבד.

איפה האנלוגיה נשברת

צריך להגיד גם את הצד השני. טייס שקיבל תדריך זוכר אותו מחר בבוקר. סוכן זוכר רק מה שכתבתם לו במקום קבוע — הנחיות פרויקט, קובץ, מסמך הקשר. מה שנאמר בעל פה בתוך שיחה אחת נעלם יחד עם החלון שסגרתם.

לכן הדרכה שנשארת בעל פה היא בזבוז זמן. הפידבק צריך לנחות במקום שהסוכן קורא ממנו בפעם הבאה, אחרת אתם מלמדים את אותו שיעור שוב ושוב ומתייאשים בצדק.

זה גם ההבדל בין "זה לא עובד" לבין "הוא כתב X במקום Y". הראשון הוא תלונה, השני הוא הדרכה, ורק השני מזיז משהו.

זה החלק הכי פחות זוהר בעבודה, והוא גם זה שקובע אם ההטמעה שורדת אחרי שאני יוצא מהחדר. ארגון שיודע לכתוב את מה שלמד ממשיך להתקדם. ארגון שרק מדבר מתחיל כל בוקר מאותה נקודה.

המטוס שלי הוא Claude Desktop

בטיסה יש לי מטוס. בעבודה מול ארגונים ה"מטוס" שלי הוא Claude Desktop, ואני לא מצליח לזעוק מספיק חזק כמה זה כלי נהדר שפשוט לא צריך יותר ממנו.

זו אמירה לא פופולרית בשוק שבו כל שבוע יוצאת עוד פלטפורמה לבניית אייג'נטים. אבל מה שחסר לארגון הוא בדרך כלל לא עוד שכבת תוכנה, אלא אנשים שישבו מול הכלי מספיק שעות כדי לפתח לגביו אינטואיציה. את זה שום פלטפורמה לא עושה במקומכם.

זה לא אומר שאין כלים אחרים טובים. זה אומר שהחלפת הכלי היא כמעט אף פעם לא מה שחסר.

הלקח

כשמכניסים מערכת חדשה לארגון, השאלה המעניינת היא לא כמה היא יודעת ביום הראשון, אלא כמה מהר היא לומדת ומי אחראי ללמד אותה. בתעופה קוראים לזה הדרכה, ולאף אחד לא עולה בדעת לדלג עליה.

השאלה הזאת גם קלה יותר לבדיקה מכל רשימת יכולות: תסתכלו על מה שהסוכן ידע לעשות אצלכם לפני חודש, ועל מה שהוא יודע לעשות היום.

ויש לזה תופעת לוואי נעימה: מי שמדריך לומד הכי הרבה. האנשים שנותנים לסוכן את הפידבק הם בדרך כלל הראשונים לגלות איפה התהליך שלכם עצמו לא מוגדר עד הסוף.

והערה פרסומית קצרה: מי שמוכן לעשות את הקפיצה ובאמת לאמץ AI, במקום לאמץ את נותני השירות בתחום, מוזמן לפנות אליי. מבטיח שתוך פחות משבוע אתם וקלוד ממשיכים בלעדיי. אני נשאר זמין, אל תדאגו.

שאלות שחוזרות

צריך לבנות אייג'נט מותאם אישית כדי להטמיע AI בארגון?

לא בהכרח. בתהליכים שאני עושה לארגונים אני לא בונה אייג'נטים, אלא מלמד את האנשים בארגון להדריך את הסוכן בעצמם. אייג'נט שמישהו בנה לכם קופא ביום שבו הוגדר, ויכולת ההדרכה נשארת אצלכם וזזה יחד עם התהליך.

מה זה 'להדריך' סוכן AI?

זו אותה לולאה שבה מאמנים טייס: נותנים לסוכן לעשות, נותנים לו לטעות, נותנים פידבק, וחוזר חלילה. חלק מהפידבק מגיע מהכלי עצמו בצורת שגיאה או פלט שגוי, וחלק צריך להגיע מבן אדם שיודע להסביר למה זה לא נכון.

כמה זמן לוקח לצוות להתחיל לעבוד עם AI לבד?

זו ההתחייבות שאני נותן בתהליך: תוך פחות משבוע אתם וקלוד ממשיכים בלעדיי, בהנחה שיש אצלכם מי שיושב מול הכלי בפועל. אני נשאר זמין אחר כך, אבל המטרה היא שלא תצטרכו אותי כדי להמשיך לזוז.

איזה כלי צריך כדי להתחיל?

ה'מטוס' שלי הוא Claude Desktop, ואני לא מצליח לזעוק מספיק חזק כמה זה כלי נהדר שפשוט לא צריך יותר ממנו. מה שחסר לארגון הוא בדרך כלל לא עוד שכבת תוכנה, אלא אנשים שיושבים מול הכלי מספיק שעות.