"מתקפת סוכנים חסרת תקדים": מודלי OpenAI ברחו מהמעבדה תוך כדי מבחן סייבר
מודלים מתקדמים של OpenAI, כולל GPT-5.6 Sol וגרסה שטרם שוחררה, שרשרו הרשאות גנובות וחולשות לא מוכרות כדי לפרוץ למאגרי המידע של פלטפורמת Hugging Face - ועוררו מחדש קריאות לרגולציה
ככה זה מתחיל? מודלים מתקדמים שבחנה OpenAI הצליחו לברוח מאזור הבדיקה שלהם, ולפרוץ למערכות המחשוב של פלטפורמת AI בשם Hugging Face – כך הודיעה אתמול (ג') OpenAI. רוב הסיכויים שזו תקרית נטולת השלכות הרסניות למין האנושי. מנגד, אי אפשר לפסול לחלוטין את האפשרות שמדובר באירוע שייזכר בעתיד כפתיחת מלחמת הרובוטים.
בשבוע שעבר זיהתה Hugging Face כניסה לא מאושרת למערכותיה, במסגרתה הצליחו התוקפים לגשת למאגרי מידע פנימיים והרשאות גישה. בחברה לא היו בטוחים האם נחשף מידע של לקוחות או שותפים. בתחילה, לא ידעה Hugging Face מי עומד מאחורי המתקפה. בגלל התחכום הגבוה שלה העריכה החברה שמעורב בה מודל AI מתקדם.
"הקמפיין בוצע על ידי תשתית של סוכנים אוטונומיים, שהתבססה על LLM (מודל שפה גדול) לא ידוע, שביצעה אלפי פעולות פרטניות", נמסר מהחברה ביום חמישי. "הדבר תואם לתרחיש של מתקפת סוכנים שהתעשייה חזתה שיתממש. מתקפות אוטונומיות מבוססות AI כבר אינן תיאורטיות".
באותה עת, ההנחה היתה שמאחורי המתקפה עמד בסופו של דבר בן אדם, או קבוצת אנשים, שיצרו את תשתית הסוכנים והנחו אותה כיצד לפעול והיכן לתקוף. ואולם, בהודעה שפרסמה אתמול OpenAI היא חשפה שהמצב מעורר פלצות אף יותר. "אחרי חקירה, אנחנו יודעים כעת שמתקפה פרטנית זו בוצעה על ידי שילוב של מודלי OpenAI – כולל GPT-5.6 Sol ומודל מתקדם עוד יותר שטרם שוחרר, כולם עם מנגנוני הגנה מפותחים לצורך הערכה – בשעה שבוצע מבדק פנימי של יכולות הסייבר שלהם", היא מסרה בהודעה שפרסמה.
OpenAI הגדירה את התקרית כ"חסרת תקדים". "היא התרחשה בזמן הערכה פנימית שבה מתבקשים המודלים לזהות פרצות מתקדמות תוך שימוש בהתקפות מתוחכמות, במאמץ להעריך את יכולות הסייבר שלהם", הוסיפה. "המבדקים מתבצעים בסביבה מבודדת מאוד, שבה הגישה לרשת מוגבלת להתקנת חבילות דרך תוכנה צד-ג' מקומית. המודלים זיהו שרשרת חולשות בסביבת המחקר של OpenAI ובתשתית של Hugging Face, על מנת למצוא פתרונות למבדק במאגר המידע של Hugging Face. כל הראיות מצביעות על כך שהמודלים היו הייפר-ממוקדים במציאת פתרון, וביצעו מהלכים קיצוניים כדי להשיג מטרת מבדק צרה מאוד".
לדברי החברה, המודלים צרכו משאבי מחשוב משמעותיים כדי למצוא דרך להתחבר לאינטרנט הפתוח, תוך שהם מזהים חולשות זירו-דיי (חולשה שלא היתה מוכרת קודם לכן). עם גישה זו, הם הסיקו ש- Hugging Face מאחסנת מודלים ופתרונות אפשריים לבעיית המבדק. "כשהם יודעים זאת, המודלים חיפשו ומצאו דרך לגשת למידע סודי שבאמצעותו יכלו לרמות במבדק. בדוגמה אחת, המודלים שרשרו מספר וקטורי התקפה, כולל הרשאות גישה גנובות וחולשות זירו-דיי כדי למצוא גישה לשרתי Hugging Face".
הפרסום עורר מחדש חרדות מהיכולות של מודלי AI מתקדמים, ואיתן דרישות לרגולציה משמעותית יותר. "זה מבהיל מאוד", אמר חבר הקונגרס גרג קאסר הדמוקרטי. "AI מתפתחת בקצב מהיר מאוד ואין שום רגולציה אמיתית שמגינה עלינו".
גם מומחים מסכימים שהבית הלבן לא מקדם רגולציה בקצב מהיר דיו. "למרבה המזל, הפעם נראה שהנזק היה מוגבל", אמר לוול סטריט ג'ורנל נת'ן קלווין, היועץ המשפטי של מכון מדיניות Encode, שמקדם רגולציית AI. "בלי אמצעי הגנה כלל-תעשייתיים, בפעם הבאה לא נהיה כל כך בני מזל".
פרופ' דירדרה מאליגן, מבית הספר למידע של אוניברסיטת קליפורניה בברקלי, העריכה שהתקרית היא תוצאה של כשל מצדה של OpenAI. "נראה ש-OpenAI לא יצרה סביבת בדיקה מבודדת כשורה", היא אמרה לניו יורק טיימס. "אני תוהה האם הצלחה במבחן מצדיקה את הנזק האפשרי מבריחה של מודל AI לאינטרנט הפתוח. מה אנחנו מרוויחים, ואם זו הדרך היחידה שבה ניתן לבצע את המבדקים האלו, מה הסיכונים?".
בתוך כך, המייסד והמנכ"ל סם אלטמן צפוי להיפגש בשבוע הבא עם בכירים בממשל טראמפ ועם מחוקקים על מנת לתדרך אותם על הדורות הבאים של מודלי AI. התקרית החריפה את הקריאות לרגולציה יעילה ומהירה יותר על מודלי AIחדשים. בשבועות הקרובים עתיד הבית הלבן להשלים את הפיתוח של הליך לבחינת מודלים מתקדמים לפני השקתם לשימוש רחב.
על רקע זה, אלטמן עתיד להגיע בשבוע הבא לוושינגטון די.סי. לפגישות עם בכירים ומחוקקים. לדברי מנהל המדיניות של OpenAI, כריס להאן, הפגישות של אלטמן יתמקדו במשפחת המודלים החדשה של החברה, ואיך הם עתידים להשפיע על עבודה. "אנחנו חושבים שיהיו יכולות מאוד מעניינות עם משפחות המודלים הזו", הוא אמר אתמול בתדרוך לעיתונאים, לפי דיווח של בלומברג. "במיוחד בכל הנוגע לעבודה ולהגדלת היקף העבודה".
להאן הוסיף שארה"ב צריכה אסטרטגיית AI מקיפה יותר על מנת להתחרות בסין. בשבוע שעבר, Moonshot AI הסינית הרעידה את התעשייה כשהשיקה מודל AI ששני ביכולותיו רק למודלים המתקדמים ביותר של OpenAI ואנתרופיק. "המודל החדש של מונשוט מדגיש את הצורה לביסוס תקן לאומי ברור בארה"ב, בין השאר על מנת לחזק את הגנות הסייבר שלנו", אמר להאן. "מאוד חשוב שיהיה תהליך שיאפשר לנו לוודא שאנחנו מוציאים את המודלים המובילים שלנו באופן שלמומחי סייבר תהיה גישה אליהם".































