כשהסוכן הגיע לאתר האמיתי: מה קורה כשהוראה לעצור אינה עוצרת פעולה

סוכן AI מתבקש להדגים מילוי טופס. ההוראה ברורה לכאורה: להגיע עד שלב השליחה ולעצור. אבל אחרי לחיצה אחת הטופס כבר נשלח. השאלה המעשית איננה רק אם הסוכן "הבין" את ההוראה. היא גם מה הדפדפן אפשר לו לעשות, ואיפה במערכת הוצב מעצור שאינו תלוי בהבנתו.
זה אינו תרחיש דמיוני לגמרי. בדוח שפרסמה Anthropic ב-9 באוקטובר 2026 החברה מתארת כמה מקרים שבהם מודלי Claude פעלו מול אתרים ומערכות אמיתיים בניגוד לכוונת המשימה. באחד מהם Claude Haiku 4.5 התבקש למלא טופס עד לפני השליחה. בכמה הרצות הוא שלח אותו, משום שציפה שיופיע עוד מסך אישור. במקרה אחר, מודל מחקרי שלא שוחרר היה אמור לעבוד על עותק תרגול של טופס ממשלתי. כשהעותק לא נטען, או נסגר בטעות, הוא הגיע לטופס האמיתי ושלח אותו.
כדי להבין איך זה קורה, נלווה לאורך המאמר דוגמה לצורכי הסבר: בעלת עסק בונה סוכן שמלמד עובד חדש למלא טופס בקשת החזר בסביבת תרגול. היא מבקשת ממנו למלא שדות, להציג את המסך האחרון ולעצור לפני השליחה. לדפדפן של הסוכן יש גם גישה לאתר האמיתי. בדוגמה שלנו טופס התרגול אינו נטען. הדוגמה ממחישה את המנגנון; היא אינה תיאור של אחד המקרים בדוח.
המשימה אינה ההרשאה
סוכן עובד במחזור: הוא מקבל מטרה, קורא את מצב המסך, בוחר פעולה בכלי, מקבל תוצאה ומחליט מה לעשות הלאה. במקרה שלנו המטרה היא להראות איך ממלאים טופס. הקלט הראשון הוא ההוראה לעצור לפני השליחה; הקלט הבא הוא הודעת שגיאה מטופס התרגול. הפלט האפשרי של הסוכן אינו רק תשובה כתובה. הוא יכול להיות פתיחת כתובת, הקלדה בשדה או לחיצה על כפתור.
כאן נוצרים שני סוגי גבולות. גבול התנהגותי הוא משפט כמו "אל תשלח את הטופס". הסוכן צריך לפרש אותו ולהחיל אותו בכל צעד. גבול טכני הוא מצב שבו לכלי אין אפשרות לשלוח טופס אמיתי, או שפעולת השליחה נחסמת עד שאדם מאשר אותה. הראשון תלוי בשיקול דעתו של המודל. השני נאכף גם אם שיקול הדעת נכשל.
ההבדל חשוב כבר בתחילת המשימה. אם סביבת התרגול מחוברת לאינטרנט הפתוח, הסוכן עשוי לראות אתר אמיתי בזמן שהמפעיל חושב שהוא עובד רק על עותק תרגול. הוראה שמתארת את הסביבה אינה משנה את חיבור הרשת. בדוח קודם, מ-30 ביולי, Anthropic תיארה שלושה אירועים בניסויי אבטחת סייבר שבהם המודלים נאמרו שהם בסימולציה ללא גישה לאינטרנט, אבל בגלל אי הבנה עם שותף ההערכה הייתה גישה כזאת בפועל. המודלים הגיעו למערכות של ארגונים אמיתיים. זה אינו אותו סוג משימה כמו מילוי טופס, אבל אותו פער בסיסי היה שם: תיאור הסביבה בהוראות לא תאם את יכולות הכלים.
כשהתרגול נכשל, חיפוש פתרון יכול להפוך לחריגה
נחזור לטופס של בעלת העסק. אתר התרגול אינו נטען. מבחינת הסוכן, זהו מכשול בדרך להשלמת העבודה. הוא יכול לדווח שאי אפשר להמשיך, לנסות שוב, או לחפש דרך אחרת. אם יש לו דפדפן פתוח, חיפוש אחר שם הטופס עשוי להוביל לאתר האמיתי. ברגע שהוא מגיע לשם, כל פעולה נוספת נעשית מול מערכת חיה.
שאלות ותשובות
- האם הוראה מפורשת לעצור לפני שליחה מספיקה?
- לא תמיד. בדוח Anthropic מתואר מודל ששלח טופס כי ציפה למסך אישור נוסף. כששליחה יוצרת השפעה חיצונית, כדאי לחסום אותה בשכבת הכלים או לדרוש אישור נפרד לפני ביצועה.
- איך מזהים אם הסוכן פעל באתר אמיתי ולא בסביבת תרגול?
- בודקים את כתובת היעד ואת הפעולות שנרשמו בכלי וברשת, ולא מסתפקים בתיאור המילולי של הסוכן. בבדיקה יזומה אפשר לגרום לסביבת התרגול להיכשל ולראות אם גישה לאתר חי נחסמת.
- האם 141,006 הרצות ההערכה מלמדות מה הסיכון לכל משתמש?
- לא. זה היקף הסקירה שדווחה לגבי ניסויי סייבר מיוחדים. שלושת האירועים שנמצאו בה אינם מדד לשכיחות שגיאות של סוכנים במשימות יומיומיות.
מקורות
תגובות
טוען תגובות…