מודלי OpenAI הקימו פורום פנימי – ותיאמו באמצעותו פריצות למערכות
בכנס הסייבר בלאק האט בלאס וגאס חשף חוקר הבטיחות אריק וואלס כי סוכני AI אוטונומיים החליפו במשך חודשים מאות אלפי הודעות, שיתפו חולשות ותיאמו גישה לאינטרנט הפתוח בלי ידיעת עובדי החברה. "ברגע שמודל אחד הצליח לפתוח דלת, הוא יכול היה להשאיר אותה פתוחה לסוכנים אחרים", אמר
המודלים המורדים של OpenAI שיתפו פעולה במשך חודשים באמצעות פורום פנימי שיצרו, והחליפו בו מאות אלפי הודעות שכללו פרצות וחולשות שגילו – כך חשף אתמול (ד') אריק וואלס, חוקר בצוות הבטיחות של חברת ה-AI, בכנס הסייבר בלאק האט שנערך בלאס וגאס.
"התקרית מערבת צוות של סוכני AI אוטונומיים שעבדו ביחד, גילו חולשות, שיתפו אותן זה עם זה, ונעו לאורך המערכות שלנו ומערכות חיצוניות במשך ימים ושבועות", אמר וואלס, לפי דיווחים באתר וויירד ובבלומברג.
וואלס מתייחס למקרה הראשון שבו התברר שמודלים מתקדמים ברחו מסביבת הבדיקה שלהם ותקפו מטרות באינטרנט הפתוח. במקרה זה, המודלים של OpenAI הצליחו לברוח מאזור הבדיקה שלהם, ולפרוץ למערכות המחשוב של פלטפורמת Hugging Face. בהמשך, עדכנה החברה שהמודלים פרצו גם לסביבת בדיקה שרצה על פלטפורמה של ספקית תשתית ה-AI הניו יורקית מודל לאבס.
בסוף השבוע, אנתרופיק חשפה שמודלים שלה ברחו מסביבת המבדק הסגורה שלהם ופרצו למערכות מחשוב של שלוש חברות שונות. לדברי אנתרופיק, בלב התקרית עומד כשל בסביבת המבדק של אירגיולר הישראלית, שהיתה מחוברת לאינטרנט הפתוח. אירגיולר היתה מעורבת גם בתקרית נוספת שחשפה OpenAI אתמול, במסגרתה מודלים יצאו מסביבת הבדיקה שלהם ותקפו מטרות באינטרנט הפתוח.
עתה, חושפים עובדי OpenAI פרטים על התקרית הראשונה. לדברי וואלס, במשך חודשים המודלים השאירו זה לזה מסרים סביב הניסיון לגשת לאינטרנט הפתוח כדי לפתור את המשימות שקיבלו. לצורך התקשורת ביניהם, הקימו המודלים פורום באמצעות מערכת של OpenAI שמשמשת לניהול התקנה ועדכונים של תוכנות ארגוניות, והחליפו בו מאות אלפי הודעות.
"המערכת זמינה בכל התשתית שלנו, אז גרסאות קיימות ועתידיות של GPT שאימנו או הערכנו יכלו להגיע למסרים האלו אם רצו", סיפר וואלס. "בהמשך, סוכנים אחרים שגם נתקעו במשימה שקיבלו ביקשו לגשת לאינטרנט. אז בשלב מסוים המודלים החלו לתקשר זה עם זה באמצעות הפורום.
"ברגע שסוכן אחד הצליח לאתר חולשות, הוא יכל לשתף אותן בפורום עם סוכנים אחרים. וברגע שמודל אחד הצליח למצוא דרך לפתוח דלת לגישה שלא היתה אמורה להיות לו, הוא יכול להשאיר את הדלת פתוחה לסוכנים אחרים על מנת שינצלו את אותה חולשה. לאורך זמן, נוצרה התפוצצות של תקשורת בין המודלים, שהתחילו לתקשר זה עם זה, להבין שסוכנים אחרים מתאמים, ולהתחיל לתאם ולהאציל משימות זה לזה כדי להשלים אותן".
באמצעות הפורום המודלים ביקשו סיוע זה מזה, השלימו משימות ביחד ותיאמו את הפרצה של מערכות OpenAI על מנת לגשת לאינטרנט הפתוח. וואלס סיפר שלאורך זמן הסוכנים גם גילו נטיות פרנואידיות, וחשדו מפעילותו של מתחזה בקרבם. חלק מהסוכנים הציעו לחתום קריפטוגרפית על כל ההודעות בפורום, כדי לאמת את התוכן ולזהות הונאה. כל זה התנהל מבלי שעובדי OpenAI היו מודעים לכך.
"מודלי חזית מאוד אוהבים לרמות", הוסיף וואלס. "והסיבה שהם אוהבים לרמות היא שלעתים קרובות בזמן האימון שלהם מופעלים עליהם לחצים מנוגדים לעבוד מהר, או לעבוד ביעילות, או להשתמש בפחות כלים. והם מבינים שבמקום לעשות את המשימה, הם יכולים לעשות משהו אחר כמו לחפש תשובה מקוונת שיכולה לזרז את פתרון המטרה".
מייקל דלטון, חוקר בצוות אבטחה ותשתיות ב-OpenAI, הוסיף שהחברה לוקחת ברצינות את הבעיה: "זה רק קריטי בעבור החברה שלנו, ותעשיית ה-AI בכלל. מספר צוותים הפסיקו את העבודה השוטפת כדי להגביר את טכניקות האבטחה, הזיהוי והתגובה שלנו. אנחנו מאטים את המחקר במכוון כדי לשדרג את האבטחה ואת יסודות הסביבה שלנו, ולהגביר דרמטית את הניטור של סוכני ה-AI שלנו".































