אני מאמינה לראשי תעשיית ה־AI שהצהירו לאחרונה על חששותיהם מהסכנה שהבינה המלאכותית עשויה להוות לאנושות. כשג'ייקוב קוקסון, שעבד במשך שלוש שנים ב־OpenAI ובאנתרופיק, מתפטר וכותב שענקיות ה־AI "מהמרות על החיים שלנו"; כשדריו אמודיי, מנכ״ל אנתרופיק, קורא להאט את קצב התקדמות הפיתוח של הבינה המלאכותית, וכשסם אלטמן ואלון מאסק מצטרפים אליו מיד, אני מוכנה להאמין שהחשש שלהם אותנטי.
הם מסבירים שהם חוששים משיפור עצמי רקורסיבי (Recursive Self-Improvement. מערכות שיבנו מערכות חזקות מהן) ומנחילים של סוכנים אוטונומיים שישתלטו על האינטרנט, אבל משום כך אסור לדלג על השאלה הבאה: מדוע שניתן דווקא להם לעצב את מערכת הבלמים? הרי לא צריך לחכות לתרחישי אימים עתידיים. כבר קיבלנו הצצה מטרידה למה שקורה כשהמערכות שלהם יוצאות מהמסלול שהותווה להן.
ביולי, בניסוי של OpenAI, כ־1,200 סוכנים שהיו אמורים להיות מבודדים מהאינטרנט מצאו דרך לתקשר ביניהם בערוץ לא מורשה. כ־700 מהם השתתפו לאחר מכן במתקפה מתואמת על חברת Hugging Face כחלק מניסיון לרמות את מערכת ההערכה שעליה נבחנו.
בתוך הדרמה הזו מסתתר פרט מטריד: חלק ממנגנוני ההגנה של החברה כלל לא הופעלו בניסוי. בבדיקה שנערכה לאחר מעשה נמצא שלו הופעלו, נטיית המודל לפגוע בתשתית היתה קטנה ביותר מפי מאה. כיבוי המנגנון אינו פסול כשלעצמו, שכן כדי למדוד מה מודל מסוגל לעשות יש לפעמים להתיר לו לבצע פעולות שלא היינו מתירים לו לעשות בשימוש רגיל. אלא שבמקרה ההוא גם מערכת הניטור לא פעלה. לפי OpenAI עצמה, אם היא היתה פועלת, חוקרי החברה היו אמורים לקבל התרעה יותר מיממה לפני הפריצה.
אם כן, מי קבע שתנאי הניסוי בטוחים דיים? וכשהסוכנים מצאו את דרכם מחוץ לסביבת הניסוי, באיזה שלב מישהו היה אמור לומר "עד כאן"? ובעיקר, למה אנחנו יודעים כל כך הרבה על מה שעשו הסוכנים בעוד אנחנו יודעים כל כך מעט על ההחלטות האנושיות שאיפשרו להם לעשות זאת? השורה התחתונה היא שמלבד העובדה שהאירוע מעיד על בעיית בטיחות חמורה, הוא גם חושף את סדר העדיפויות של המנהלים האנושיים שערכו אותו — אלה שבחרו אילו הגנות לכבות ומתי להמשיך בניסוי במקום לעצור.

מי יפקח על המפקחים?
האנשים שאוחזים בהגה של ענקיות ה־AI מספרים לנו עכשיו שהם בעד הטלת פיקוח חיצוני על התעשייה. על הנייר, זה נשמע מצוין. גוף עצמאי יבחן את המודלים החזקים ביותר ויקבע מתי מסוכן מדי להמשיך להפעיל אותם. אלא שבין השורות מתעורר חשד שעצמאות לא בהכרח תהיה התכונה המרכזית ביותר של אותו גוף פיקוח.
איך אנחנו יודעים את זה? משום שאמודיי נקב בשמו של גוף שלדעתו יוכל לשמש בודק חיצוני לתעשייה: METR, ארגון ללא כוונת רווח שמנטר את סכנות ה־AI, ושהוא גם אותו ארגון ש־OpenAI הזמינה כדי לחקור את האירועים בהתנהגות המודלים שלה. כיצד נראתה החקירה ש־METR ניהל? ובכן, כל שבע השאלות שהוא קיבל מנדט להשיב עליהן עסקו במודלים ובהתנהגותם אך אף אחת לא עסקה בהחלטות של עובדי החברה. חוקרי METR עבדו על נתונים ש־OpenAI הרכיבה עבורם, והחברה המזמינה אף השחירה בהם מידע לא פומבי.
מאז, אנתרופיק הודיעה שתכניס אליה צוות בודקים מטעם Accenture, שותפה עסקית שמסייעת להטמיע אצל לקוחותיה את המודל שלה, קלוד. ומי יממן את הבדיקה? אנתרופיק עצמה.
מה יקרה ביום שבו Accenture תגיע למסקנה שמודל חדש מסוכן מדי להשקה בזמן שהיא עצמה אמורה להטמיע אותו אצל הלקוחות? האם גוף שתלוי בחברה שהוא בודק יוכל להרים דגל אדום כשהמשמעות היא לפגוע בעסק המשותף? על השאלה הזו, בינתיים, אף אחד לא השיב.
בין מילים למעשים
אז כן, אני מאמינה שהסכנה מוחשית. אבל יותר מכך ברור מדוע לראשי החברות חשוב כל כך לדבר עליה. כבר שנים הם נודדים בין אולפני טלוויזיה ומתריעים מפני סכנות ה־AI לאנושות, אבל הדיבור הזה לא עולה להם דבר, ולמעשה רק ממצב אותם כמי שמבינים את הסכנה טוב מכולם — ולכן, לכאורה, כמי שראויים לקבוע כיצד יש לפקח עליה. אבל כשמסיטים את המבט מהמילים אל המעשים, התמונה משתנה.
קחו למשל את ההבטחות שניתנו במהלך 2023. OpenAI הכריזה אז שתקדיש 20% ממשאבי המחשוב שלה לפתרון בעיית השליטה במודלים, אך פחות משנה לאחר מכן הצוות שהיא הקימה התפרק ובכיריו סיפרו שבזמן שהחברה המשיכה בפיתוחיה הם נאלצו להיאבק על שאריות כוח המחשוב שלה. במקביל, אנתרופיק התחייבה לעצור את הפיתוח אם אמצעי הבטיחות שלה לא ידביקו את קצב היכולות של המודלים, אבל בפברואר 2026 ההתחייבות הזו התאיידה באמתלה ש"אין טעם לעצור לבד".
שנים של הבטחות שהופרו מוכיחות שכשהצהרות אלטרואיסטיות פוגשות כוח ותחרות, שורת הרווח מנצחת. שוב ושוב נתקלנו בהתחייבויות שנשמעו מוחלטות כל עוד לא היה להן מחיר, והפכו גמישות הרבה יותר כשהמחיר הוגש. מנגנון בטיחות אמיתי נבחן ברגעים שכואב להפעיל אותו. לעתים צריך לעשות בו שימוש כדי לעכב השקות, ואפילו להעניק יתרון זמני למתחרים. בטיחות שאינה מסוגלת לשרוד מפגש עם תחרות אינה מערכת בטיחות שטובת הציבור לנגד עיניה.
לכן, לפני שראשי החברות מתייצבים כמושיעי האנושות ומבקשים סמכות לעצב את מנגנוני הבקרה של התעשייה, ראוי לבקש מהם להדגים מה בעצם הם עשו עם הבלמים שבידיהם. מי היה יכול לעצור את הניסוי של יולי? אילו התרעות התקבלו ומה נעשה בנוגע להן? ומה השתנה מאז? שקיפות רטרואקטיבית לגבי אופן ניהול הסיכונים עד כה היא בדיקת נאותות לכל מנגנון שיציעו מכאן והלאה.
אנתרופיק תאמר שהכנסת בודקים לחברה היא צעד ראשון. אבל אם היא אכן חרדה לעתיד האנושות, מצופה ממנה לתת לאנשי הבטיחות זכות וטו אמיתית. היא צריכה לחשוף בפני הציבור את הדו"חות על הכישלונות שלא דווחו במלואם ולכלול בהם שרטוט של שרשרת קבלת ההחלטות הניהולית שאיפשרה אותם. מצופה ממנה ומיתר החברות להראות לנו שהמילה "סיכון" משנה משהו בהחלטות שהן מקבלות בחדרים הסגורים לפני שהן דורשות לשנות את חוקי המשחק עבור התעשייה כולה. מי שמבקש לכתוב את כללי הפיקוח של מחר צריך קודם לאפשר לציבור לראות — בלי השחרות נוחות ובלי שאלות שנבחרו מראש — כיצד התקבלו ההחלטות אתמול. אחרי הכל, מערכת בלמים שמטרתה היא להרגיע את הנוסעים, אבל משאירה לנהג את החופש לדהור קדימה, אמורה להפחיד אותנו לא פחות מסוכנים שיוצאים משליטה.
הכותבת היא מנכ״לית Humane AI, מומחית אינטראקציית אדם־AI













