Home אבטחת מידע הבינה המלאכותית הזו הייתה אמורה להישאר מבודדת – אבל הצליחה לצאת

הבינה המלאכותית הזו הייתה אמורה להישאר מבודדת – אבל הצליחה לצאת

Representational image of Anthropic

This post is also available in: English (אנגלית)

ככל שמערכות בינה מלאכותית הופכות לאוטונומיות יותר, אחד האתגרים המרכזיים העומדים בפני המפתחים הוא להבטיח שהן יישארו מבודדות בתוך סביבות ניסוי מבוקרות. סוכני בינה מלאכותית מודרניים מסוגלים לבצע באופן עצמאי משימות מורכבות ורב-שלביות, ולכן חיוני לוודא שאינם יכולים לגשת למערכות חיצוניות או ליצור אינטראקציה עם תשתיות בעולם האמיתי ללא הרשאה מפורשת.

חברת Anthropic חשפה כי כמה ממודלי הבינה המלאכותית שלה הצליחו להשיג גישה לא מורשית למערכות של ארגונים חיצוניים במהלך הערכות אבטחה פנימיות, אירועים המדגישים את הקושי הגובר בבחינה בטוחה של מערכות אוטונומיות מתקדמות. לדברי החברה, התקריות התרחשו במהלך יותר מ-141 אלף הרצות ניסוי, שנועדו להעריך יכולות סייבר מתקדמות של המודלים.

לפי החברה, שלוש גרסאות שונות של מודלי Claude ניגשו למערכות של שלושה ארגונים שונים, לאחר שבעיית תצורה בלתי צפויה הותירה גישה לאינטרנט פתוחה במהלך הבדיקות. החברה מסרה כי מקור התקלה היה באי-הבנה מול שותפתה להערכה, Irregular, אף שהניסוי תוכנן כך שהמודלים יפעלו בסביבה מבודדת לחלוטין ממערכות אמיתיות.

על פי דיווח של TechXplore, סוכני הבינה המלאכותית לא השתמשו בשיטות תקיפה חדשות, אלא בטכניקות מוכרות יחסית, ובהן ניצול סיסמאות חלשות ונקודות קצה שלא דרשו אימות, כדי להשיג גישה למערכות. אחד המודלים המעורבים היה Mythos 5, המערכת המתקדמת ביותר של החברה, הזמינה כיום רק למספר מצומצם של שותפים מאושרים. החברה מסרה כי היא פועלת יחד עם שותפתה לביצוע ההערכה כדי לחקור את האירועים, וכי יצרה קשר, או ניסתה ליצור קשר, עם הארגונים שנפגעו.

הדיווח מתפרסם זמן קצר לאחר שגם OpenAI חשפה אירועי ניסוי נפרדים, שבמהלכם סוכני בינה מלאכותית אוטונומיים השיגו גישה למערכות חיצוניות. שני המקרים מדגישים אתגר רחב יותר העומד בפני התעשייה: כיצד לבחון מודלים מתקדמים יותר ויותר, מבלי לאפשר להם ליצור אינטראקציה עם מערכות מחוץ לסביבת הניסוי. בעקבות האירועים גברה תשומת הלב למנגנוני Sandbox, המבודדים תוכנה בתוך סביבה מוגבלת שבה ניתן לעקוב אחר התנהגותה מבלי להשפיע על מערכות חיצוניות.

עבור ארגוני סייבר, גופי ביטחון וזרועות צבא, למשמעות האירועים יש היבטים רחבים. סוכני בינה מלאכותית המסוגלים לזהות באופן עצמאי חולשות, לנצל כשלים בתצורה ולבצע מתקפות סייבר רב-שלביות עשויים בעתיד להפוך לכלים רבי ערך בבדיקות חדירות ובהערכת פגיעויות. עם זאת, אותן יכולות בדיוק מדגישות את החשיבות של מנגנוני בידוד חזקים, נהלי הערכה קפדניים ומערכות ניטור רציפות, שיבטיחו כי מודלים מתקדמים לא ייצרו בטעות אינטראקציה עם רשתות חיצוניות במהלך ניסויים.

התקריות גם הגבירו את הדיון סביב ממשל הבינה המלאכותית. הקריאות לחיזוק תהליכי הערכת הבטיחות, להוספת מנגנוני הגנה טכנולוגיים ולהידוק שיתוף הפעולה בין מפתחים לבין ממשלות הולכות ומתחזקות, ככל שמודלי הבינה המלאכותית המתקדמים מפגינים יכולות אוטונומיות מורכבות יותר. ככל שהמערכות הללו ממשיכות להשתכלל, האתגר עובר מהוכחת יכולותיהן להבטחת שליטה אנושית אמינה ורציפה לאורך כל שלבי הפיתוח וההפעלה.