סגור
באנר דסקטופ כלכליסט טק
אפליקציית קלאוד קלוד
קלוד. יוצא משליטה (צילום: shutterstock)

לא רק OpenAI: גם מודלים של אנתרופיק פרצו למערכות מחשוב. חברה ישראלית בלב התקלה

הסטארט-אפ הישראלי אירגיולר (Irregular) מעורב בתקרית, במהלכה סביבת הבדיקה שסיפקה לאנתרופיק הייתה מחוברת לאינטרנט ואפשרה למודלים לפרוץ למערכות מחשוב של שלוש חברות שונות; מאנתרופיק מסרו כי מדובר ב"אי-הבנה בינינו לבין אירגיולר"

המודלים המורדים של OpenAI לא לבד: אנתרופיק חשפה הלילה (ו') שגם מודלים שלה ברחו מסביבת המבדק הסגורה שלהם, ופרצו למערכות מחשוב של שלוש חברות שונות. לדברי אנתרופיק, בלב התקרית עומד כשל בסביבת המבדק של חברת הסייבר הישראלית אירגיולר (Irregular), שמספקת לאנתרופיק את סביבות הבדיקה והערכת המודלים שלה, שהיתה מחוברת לאינטרנט הפתוח.
בשבוע שעבר דיווחה OpenAI שמודלים מתקדמים שבחנה OpenAI הצליחו לברוח מאזור הבדיקה שלהם, ולפרוץ למערכות המחשוב של פלטפורמת בשם Hugging Face. השבוע עדכנה החברה שהמודלים פרצו גם לסביבת בדיקה שרצה על פלטפורמה של ספקית תשתית ה-AI הניו יורקית מודל לאבס.
בעקבות התקרית, החליטה אנתרופיק לבצע בחינה רחבת היקף של סביבות בדיקת המודלים שלה, במטרה לזהות האם קלוד הצליח לברוח מסביבת המבדק הסגורה ולגשת לאינטרנט הפתוח. "אחרי שבחנו 141,006 אינטראקציות שבהן קלוד יכול היה לקבל גישה לרשת הפתוחה, זיהינו שלוש תקריות שבהן הוא ניגש לאינטרנט בשעה שפעל בסביבת המבדק של אירגיולר, אחד משותפי ההערכה צד ג' שלנו, ואז הצליחו לקבל גישה לא מאושרת לתשתית הפעילה של שלושה ארגונים שונים".
אירגיולר היא חברת סטארט-אפ ישראלית הפועלת בתחום אבטחת הבינה המלאכותית (AI Security) והגנת מודלי שפה. החברה הוקמה בסוף 2023 על ידי דן להב (CEO), לשעבר חוקר ב-IBM ויוצא יחידה 81, ועומר נבו (CTO), מנהל פיתוח לשעבר ב-Google Research. אירגיולר מתמחה בביצוע בדיקות חוסן ועמידות למודלים (Red Teaming) וסימולציות של מתקפות סייבר מתקדמות כדי לאתר חולשות ותופעות בלתי צפויות במערכות AI עוד לפני פריסתן. הפלטפורמה שפיתחה משרתת ענקיות טכנולוגיה ומעבדות מחקר מובילות בעולם – ובהן OpenAI, אנתרופיק ו-Google DeepMind – לצד גופים ממשלתיים. החברה גייסה כ-80 מיליון דולר (בסבבי Seed ו-A) בהובלת הקרנות Sequoia Capital ו-Redpoint Ventures, לפי שווי שמוערך במאות מיליוני דולרים.
בעקבות הגילויים, אנתרופיק הפסיקה את כל הבדיקות של מודלים הסייבר שלה ב-23 ביולי, ויצרה קשר עם שלוש החברות שנפגעו (אף אחת מהן לא זיהתה את התקיפה בזמן אמת). בחברה מדגישים שלא מדובר בפריצה או בריחה שביצע המודל ביוזמתו מעבר למעטפת (Alignment Failure), אלא בכשל תפעולי בתשתיות ובניטור (Harness Failure) מול שותפות כמו אירגיולר, שיוביל כעת להקשחת בקרות האבטחה בכל שרשרת הניסויים.

"אי הבנה בינינו לבין אירגיולר"

בתקרית היו מעורבים שלושה מודלים של קלוד: אופוס 4.7, מיתוס 5 ומודל מחקר פנימי . לדברי אנתרופיק, בכל שלוש הפריצות קלוד קיבל אתגר שמכונה "תפוס את הדגל", שמשמש להערכת יכולות הסייבר שלו. באתגר, המודל מקבל תרחיש דמיוני ונאמר לו שמידע סודי כלשהו, "הדגל", מוסתר במחשב אחר ברשת. המטרה שלו היא לפרוץ ולגשת למידע.
"בכל המקרים, ההוראה של אנתרופיק אמרה למודל שהוא פועל בסביבת הדמיית ושאין לו גישה לאינטרנט", כתבה החברה בפוסט שמפרט את התקרית), "בגלל אי-הבנה בינינו לבין אירגיולר, זה לא היה המקרה, והיתה גישה לאינטרנט. בגלל זה, החיפוש של קלוד הוביל אותו למערכות אמיתיות באינטרנט הפתוח, והוא התייחס אליהן כאל חלק מהתרגיל.
"כשהוא פועל תחת אמונה שגויה זו, קלוד חדר לתשתית של הארגונים שנפגעו באמצעות טכניקות בסיסיות, כמו זיהוי סיסמאות חלשות או נקודות גישה לא מוגנות. הוא לא זיהה פרצות או חולשות מורכבות, ובכל מקרה המשיך לעבוד להשלמת המשימה שקיבל. עם זאת, במקרים מסוימים המודל הישן יותר המשיך לתקוף גם אחרי שקיבל ראיה שהוא פועל באינטרנט הפתוח. המודלים העדכניים יותר הפסיק לעבוד ברגע שהבין זאת. בשום מקרה, קלוד לא נוסה לברוח מסביבת המבדק שלו במכוון".
אנתרופיק בחנה את התקריות בשיתוף עם אירגיולר. "אנחנו אסירי תודה על שעבדו בצמוד איתנו כדי להבין ולפתור את התקריות. הם עורכים חקירה משלהם. אנחנו מאמינים ששיתוף פעולה מסוג זה הוא קריטי כדי להבטיח הערכה בטוחה וקפדנית של מודלים. אנחנו מצפים להמשך העבודה המשותפת שלנו", נמסר.
בכירים בתעשיית הסייבר המקומית אמרו לכלכליסט כי "המקרה של אנתרופיק הוא הסיפור של עולם ה-AI כיום. האם לתת למודלים לבדוק את עצמם בעולם האמיתי תוך כדי בקרה או למנוע מהם יציאה לעולם האמיתי ורק להתנסות בעולם סגור. אנתרופיק אף אומרת בבלוג שההערכה שהפרומט שהם הכניסו הוא סימולציה ושאין לו גישה לאינטרנט. בגלל אי הבנה אצל אנתרופיק היתה גישה לאינטרנט שאפשרה את המקרה".