ה-AI נעשה מסוכן מדי? OpenAI מאטה את פיתוח המודל החדש
אחרי סערת "המודלים המורדים", OpenAI חוששת שאסטרה מתקרב לרף שבו מודל AI מסוגל לזהות חולשות זירו-דיי ולתכנן מתקפות סייבר מתקדמות באופן עצמאי. בעקבות הממצאים היא הקשיחה את תנאי הבדיקה והגבילה את הגישה של המודל לרשת
OpenAI מאיטה את העבודה על מודל ה-AI החדש שלה אסטרה (Astra), אחרי שהגיעה למסקנה שהיא "לא יכולה לשלול יכולות סייבר קריטיות". ההודעה, שמתקבלת לאחר שהתגלה שמודלים מתקדמים של OpenAI וחברות אחרות ברחו מסביבת הבדיקה שלהם ותקפו יעדים באינטרנט הפתוח, היא הפעם הראשונה שבה חברה מודיעה על עיכוב בפיתוח מודלים בגלל שיקולי אבטחה.
ביולי דיווחה OpenAI שמודלים מתקדמים שבחנה הצליחו לברוח מאזור הבדיקה שלהם, ולפרוץ למערכות המחשוב של פלטפורמת Hugging Face. בהמשך, נחשפו תקריות דומות שבהן היו מעורבים מודלים של אנתרופיק, מטא, ושוב OpenAI. בלב מרבית תקריות אלו עמדה תקלת הגדרה בסביבת הבדיקה של אירגיולר (Irregular) הישראלית, שאפשרה את בריחת המודלים.
עתה, החליטה OpenAI לעכב את הפיתוח של אסטרה, על רקע חשש שלמודל יש "יכולות סייבר קריטיות". יכולות אלו מוגדרות על ידי החברה כמודל שמסוגל לזהות ולפתח חולשות זירו-דיי (חולשות אבטחה חדשות שלא מוכרות כיום לחוקרי סייבר) במערכות קריטיות מוקשחות בעולם האמיתי ללא התערבות בני אדם, או מודל שמסוגל לתכנן ולבצע מתקפות מלאות תוך שימוש באסטרטגיות חדשניות. לדברי OpenAI, הן יכולות "להוביל לקטסטרופה" דוגמת פרצה למערכות צבאיות או תעשייתיות. לפי הקווים המנחים שלה, יש לעצור פיתוח של מודלים כאלו עד עד לקביעת מנגנוני הגנה מתאימים.
"המבדקים הפנימיים האחרונים שלנו לאסטרה בימים האחרונים הצביעו על התקדמויות משמעותיות בקידוד אוטונומי ואבטחת סייבר", כתבה OpenAI בהודעה שפרסמה בסוף השבוע. "תוצאות אלו, בתוספת הערכות מומחים, הובילו אותנו אמש למסקנה שאנחנו לא יכולים לפסול יכולות סייבר קריטיות".
מודלים קודמים, כולל GPT-5.6-Sol, דורגו רק כבעלי יכולות סייבר גבוהות (סף נמוך יותר מיכולות קריטיות). אסטרה לא היה אחד מהמודלים המורדים שפרצו למערכות Hugging Face.
החברה הוסיפה: "אנחנו מיישמים בקרי אבטחה נוקשים יותר, כולל סביבות מבדק מבודדות, גישה מוגבלת לרשת ויכולות ניטור וזיהוי נוספות. אנחנו משהים פעולות פנימיות שקשורות לאסטרה ושלא עומדות עדיין בדרישות בקרת האבטחה הנוקשות האלו".
ואולם, יש שסבורים ש-OpenAI היתה צריכה להשהות את פיתוח אסטרה עם זיהוי המעורבות של המודלים שלה בפרצה ל-Hugging Face. "זה בהחלט מאוחר מדי", אמר לוול סטריט ג'ורנל ג'פרי לדיש, מנכ"ל Palisade Research, מעבדה ללא מטרות רווח שחוקרת את היכולות והסיכונים של מודלי AI. "אין ספק שאנחנו בשלב שבו אנחנו צריכים לאבד אמון בכך שחברות AI יכולות לבצע רגולציה עצמית".































