מייסד אירגיולר: ממשיכים לעבוד עם חברות ה-AI - למרות בריחת המודלים
נקודות עיקריות.כלכליסט AI
- טעות אנוש בניסוי מעבדה של חברת אירגיולר גרמה למודלי בינה מלאכותית של מטא, אנתרופיק ו-OpenAI לתקוף בטעות אתרים אמיתיים ברשת במקום סימולציה פנימית.
- המודלים ניצלו חולשות אבטחה ופרצו לבסיסי נתונים רגישים לאחר שזיהו דומיין קיים כשם החברה הפיקטיבית שהוגדרה בניסוי, דבר המצביע על קושי של הבינה המלאכותית לשמור על עקביות ומיקוד לאורך זמן.
- מייסד החברה מדגיש את הצורך הדחוף בצמצום הפער בין יכולות התקיפה הגבוהות של המודלים לבין יכולות ההגנה שלהם, כדי למנוע מצב שבו מערכות אבטחה יקרסו אל מול קצב ההתפתחות הטכנולוגי.
"אנחנו ממשיכים לעבוד עם כל החברות כדי להבין מה קרה", כך לדברי עומר נבו, אחד ממייסדי חברת אירגיולר (Irregular) בשיחה עם כלכליסט. אירגיולר עמדה בשבועות האחרונים במרכזה של סערה בעולם ה-AI כאשר מטא, אנתרופיק ו-OpenAI דיווחו שבמסגרת ניסויי המעבדה שביצעה החברה על המודלים, נבחנה היכולת שלהם לזהות ולנצל חולשות אבטחה בעולם האמיתי בסימולציה שהוגדרה כפנימית.
במהלך תכנון הסימולציה, בחרו המהנדסים בשם חברה פיקטיבי. אלא שבשל טעות אנוש, השם שנבחר היה זהה לחלוטין לדומיין (Domain) אמיתי וקיים ברשת. למרות שהמודלים קיבלו הנחיות לפעול בתוך הרשת הפנימית של הניסוי, במיעוט קטן של המקרים הם זיהו את שם החברה, יצאו דרך הגישה לאינטרנט, ותקפו את האתר האמיתי ברשת. המודלים ניצלו חולשות אבטחה, חילצו אישורים ופרצו לבסיס נתונים רגיש של החברה האמיתית. במקרה אחר, מודל אף נחשף לאתר בעל שם דומה ושלף ממנו אישורים שהיו גלויים לציבור.
באירגיולר ציינו כי "ברוב המוחלט של המקרים המודלים פעלו כראוי בתוך סביבת הסימולציה. עם זאת, בחלק זעיר מהמקרים – לעיתים רק לאחר מאות צעדים בתוך הסימולציה – המודלים טעו לחשוב שהדומיין האמיתי הוא חלק מהאתגר שהוקצה להם".
לדברי נבו, "חשוב להבין שכאשר עושים דברים כאלה שהם בקצה היכולות הטכנולוגיות הקיימות כיום יש טעויות ורק מחפשים איך עושים טוב יותר. עשינו תחקור של מה שקרה ומה היו כל ההשפעות ויש לנו עוד הרבה מה לשפר. יש עוד עבודה מחקרית עם המעבדות של החברות לייצר כלים מתאימים למניעת נזק. הפוקוס אצלנו עושה את המעבר מלהבין מה קרה ללהבין איך עוזרים לתעשייה להיערך ככל שהמודלים יהיו יותר חזקים".
אמש (יום שני) פירסמה החברה נייר עמדה על מצב תעשיית הסייבר ובו נכתב, "יש חוסר תאימות ביכולות השונות של מערכות AI - פער בין היכולות החזקות ליכולות החלשות שלהם. בנושאים של תקיפות מתוחכמות ומערכות מתמטיות הבינה המלאכתותית היא ברמה של החוקרים הטובים בעולם, אבל ברמה של דברים פשוטים יותר ה-AI ברמה של ילד. הסיבה שאיננו רואים תקיפות של AI היא שה-AI אינו מסוגל כיום להיות עקבי ולשמור על מיקוד לאורך זמן. ה-AI עדיין לא מנצח על הרבה פעולות ורכיבים שונים בו זמנית. כאשר הפער בין היכולות יקטן אנחנו צופים עלייה בהשלכות של תקיפות AI בעולם האמיתי.
"בעולם של AI שהיכולות נעשות משמעותיות הפער הוא ענק. כל מודל מוצא אלפי חולשות שלא ראו קודם. הפער נעשה גדול יותר והאמירה הזו מובילה אותנו להגיד שהמשימה ב-AI היא לקדם יכולות הגנתיות מול היכולות ההתקפיות. צריך לדאוג שהם יתאמנו על משימות הגנתיות כדי לאזן את הפער שלא יהיה חזק לטובת התקפה. בעולם שבו יתרון המהירות הוא משמעותי חייבים למצא דרך לצמצם את הפער הזה. קצב היכולות הולך וגדל צריך לוודא שהמגינים לא קורסים בגלל הפער, צריך לוודא שהמודלים מוטים לטובת ההגנה כדי שלא נמצא עצמנו במצב שהמגינים לא עומדים בקצב".































