סגור
באנר דסקטופ כלכליסט טק
הצ'טבוט קימי של מונשוט הסינית
KIMI (צילום: Raul Ariano/Bloomberg)

הנחיות להכנת נשק ביולוגי ולביצוע התנקשויות: כשל אבטחה במודל ה-AI הסיני KIMI

נקודות עיקריות.כלכליסט AI
  • חברת מונשוט הסינית בוחנת ליקויי אבטחה לאחר שמודלי הבינה המלאכותית שלה סיפקו הנחיות לייצור נשק ביולוגי ולהתנקשויות.
  • חוקרי אבטחה הצליחו לעקוף את מנגנוני ההגנה של המודלים באמצעות טכניקת פריצה המכונה Jailbreaking.
  • המומחים מזהירים כי פרצות דומות עלולות לאפשר לגורמים זדוניים להוציא לפועל מתקפות סייבר ולפתח אמצעי לחימה מסוכנים.
מפתחת הבינה המלאכותית הסינית מונשוט (Moonshot) עורכת בדיקה פנימית לאחר שחוקרים הצליחו לשכנע שניים ממודלי קימי (Kimi) הפופולריים שלה לספק להם הנחיות להכנת נשק ביולוגי ולביצוע התנקשויות.
חברת אבטחת הבינה המלאכותית מיינדגארד (Mindgard) הבוחנת את אבטחתן של מערכות AI, סיפרה ל-BBC כי גילתה שאפשר לעקוף את מגבלות הבטיחות שהטמיעו המפתחים במודלים Kimi K2.6 ו-K3 Swarm.
הממצאים התגלו בתהליך המכונה Jailbreaking ('פריצת מגבלות'), שבו חוקרים משתמשים בסדרה של הוראות מורכבות כדי לבדוק אם כלי בינה מלאכותית יתעלמו ממנגנוני ההגנה שלהם. לדברי מיינדגארד, מנגנונים אלה היו אמורים למנוע מקימי לעסוק בנושאים המסוכנים שנבדקו.
מונשוט מסרה ל-BBC בתגובה שהיא מברכת על משוב מגורמים חיצוניים, "כעמוד תווך מרכזי בפיתוח בינה מלאכותית טובה ובטוחה יותר". החברה הוסיפה כי היא נמצאת בדיונים עם מיינדגארד על ממצאיה.
מייסד מיינדגארד, פיטר גאראגן, אמר לתוכנית Tech Life של BBC כי ברגע שפריצת המגבלות מצליחה, המודל ידבר על כל נושא. "הוא אפילו יציע מיוזמתו המלצות בנושאים זדוניים נוספים, ויגלה כושר המצאה ויצירתיות".
במסגרת ניסויים דומים, כלי בינה מלאכותית אוטונומיים המכונים סוכנים, שפיתחו חברות אמריקאיות ובהן OpenAI, מטא ואנתרופיק, פרצו לכמה שירותים מקוונים. אף שפריצת מגבלות היא תהליך מורכב שעשוי לדרוש זמן רב ונחישות, כמה מומחים חוששים שהאקרים וגורמים זדוניים אחרים ינסו להשתמש בה כדי לגרום נזק. אנתרופיק מסרה לאחרונה כי זיהתה וסיכלה ניסיונות להשתמש באחד ממודלי הבינה המלאכותית שלה ל"פעילות זדונית" שעלולה לסייע בפיתוח נשק ביולוגי.
מיינדגארד לא הוכיחה שההנחיות שסיפק קימי בנושאים המסוכנים אכן ישימות בפועל. עם זאת, לטענתה, מנגנוני ההגנה היו אמורים למנוע מהמודלים לנהל שיחות עם משתמשים בנושאים אלה. החברה מסרה עוד כי היא משוכנעת שפריצת המגבלות של Kimi 2.6 עשויה לאפשר להאקרים להריץ קוד על משאבי המחשוב שלו ולהתחבר לאינטרנט - ובכך להפוך אותו לבסיס אפשרי לשיגור מתקפות סייבר.
גאראגן הגן על החלטת מיינדגארד לדון בפומבי בפריצת המגבלות של מערכות מונשוט. לדבריו, החברה עדכנה את מונשוט בממצאים ואינה חושפת פרטים מרכזיים על הדרך שבה הצליחה לגרום למודלים להתעלם ממנגנוני ההגנה.