סגור
באנר דסקטופ כלכליסט טק
אימון כושר משקולות פנאי
אימון כושר (צילום: שאטרסטוק)

אחרי שמודלים "ברחו" מסביבות בדיקה: סוכן AI פרץ למכון כושר - מבלי שנתבקש

בחודש האחרון נחשפו מקרים שבהם מודלים מתקדמים של OpenAI, אנתרופיק ומטא חרגו מסביבות הבדיקה ופרצו לאתרים ולמערכות מקוונות. עכשיו נחשף מקרה נוסף שאירע בשימוש יומיומי של משתמש מן השורה: סוכן AI באוסטרליה שנשלח רק להזמין שיעור ספורט איתר וניצל חולשה במערכת ההזמנות - בלי שהמשתמש ביקש זאת

בחודש האחרון החל סקטור ה-AI להתמודד עם מציאות חדשה, שבה היכולות של מודלי AI מתקדמים וניסיוניים כל כך עצמתיות, שהם מסוגלים לברוח מסביבת הבדיקה הסגורה שלהם ולפרוץ לאתרים ושירותים באינטרנט הפתוח. במקרה אחד, תוך שהם יוצרים פורום פנימי לתיאום תוכניותיהם. OpenAI, אנתרופיק ומטא כולן התמודדו עם בעיה זו.
אבל אירוע שהתרחש באוסטרליה מבהיר עד כמה הסיכון שנשקף במודלי AI בהקשר זה הוא לא רק נחלתם של מודלים מתקדמים שנבדקים תחת תנאים מיוחדים, אלא כבר מציאות יומיומית שרלוונטית לכולנו. זאת, לאחר שסוכן AI במשימה שגרתית מטעם המשתמש שלו פרץ למערכות מחשוב של מכון כושר.
לפי דיווח של רשת ABC האוסטרלית מהשבוע, המשתמש, אנדרו, ביקש מסוכן ה-AI מבוסס פלטפורמת OpenClay שיצר בעבורו, להזמין לו מקום בשיעור בוקר במכון. מבלי שאנדרו ביקש, הסוכן חשף חולשה בתוכנת ניהול ההזמנות ומצא דרך לשמור מקום בשיעורים חודשים מראש, במועדים שעדיין היו חסומים על ידי המכון. בהמשך, הסוכן גילה איך להעיף מרשימת ההמתנה מנוי שהיה במיקום גבוה יותר מאנדרו. כל זאת, מבלי שאנדרו ביקש ממנו לעשות זאת.
התקרית מהותית מכיוון שבניגוד למקרים קודמים, לא מדובר במודלים, חלקם טרם הופצו לציבור, שהיו בבדיקה ולכן פעלו תחת תרחישים קיצוניים יחסית, אלא במודל בשימוש יומיומי. הסוכן של אנדרו לא פעם תחת הנחיות לבצע פעולות מורכבות או בסימולציה שנועדה לבחון את יכולות מתקפת הסייבר שלו. הוא נשלח לבצע משימה שגרתית, ועל הדרך חשף וניצל פרצות במערכת מקוונת.
סביר שלא מדובר בפעם הראשונה שמקרה כזה מתרחש, ושהיו מקרים דומים שלא זכו לחשיפה. "האוטונומיה של סוכני AI יוצרת הזדמנויות למערכות לבחור שיטות שהמשתמשים לא ציפו להן", אמר ל-ABC ביל סימפסון-יאנג, מייסד ומנכ"ל Gradient Institute. "מישהו יכול לבקש מסוכן לעשות משהו די תמים, אבל בדרך להשלמת המשימה הסוכן יכול לבצע פעילויות שהאדם לא שקל או ביקש במפורש. בנינו עולם מורכב באינטרנט שמופעל על ידי תוכנה, אבל לתוכנה יש חורים. עכשיו אנחנו מוסיפים סוכני AI מיומנים ביותר שיכולים לפעול בקנה מידה גדול ובמהירות, וכל המודל פשוט נשבר".
וזה עוד התרחיש האופטימי, שבו הסוכנים פועלים בניגוד לכוונות המשתמשים. הזמינות של יכולות אלו בסוכנים שנגישים בצורה רחבה גם למשתמשים עם ידע מינימלי, מאפשרת גם לשחקנים רעים עם ידע מוגבל יחסית לנצל אותן למתקפות סייבר מכוונות. למעשה, סביר להניח שהדבר כבר מתרחש בקנה מידה כזה או אחר, בהיקף שעתיד רק לגדול.
החשיפות של המודלים המורדים בחודש האחרון מבהירות שאנו חיים בעולם חדש, שבו סוכני AI, במכוון או על דעת עצמם, משוטטים באינטרנט וחודרים בלי קושי לשירותים מקוונים. השאלה עתה היא מה יהיו ההשלכות של מציאות חדשה זו.