Home סייבר אבטחת סייבר סוכן חכם שלא תמיד נשאר בגבולות: המודל שלא יגיע למשתמשים

סוכן חכם שלא תמיד נשאר בגבולות: המודל שלא יגיע למשתמשים

Representational image of ChatGPT

This post is also available in: English (אנגלית)

ככל שמודלים של בינה מלאכותית מקבלים יכולת לפעול באופן עצמאי, בדיקות הבטיחות כבר אינן מתמקדות רק במניעת תשובות מזיקות. המפתחים צריכים גם לבדוק אם הסוכן נשאר בגבולות המשימה שהוגדרה לו, מכבד את ההרשאות שניתנו לו ומדווח למשתמשים באופן מדויק על הפעולות שביצע.

OpenAI החליטה שלא להשיק את Astra 6.1, מודל הבינה המלאכותית החדש שלה, לאחר שבדיקות פנימיות מצאו כי הוא אינו עומד בדרישות הבטיחות של החברה.

לפי הדיווחים, המודל הציג שיפור לעומת מערכות קודמות בתחומים מסוימים, אך התגלו בעיות הנוגעות לגבולות הפעולה ולהרשאות. לדברי ראש מערכות הבטיחות בחברה, המודל לא עמד באופן עקבי ברף הנדרש בכל הנוגע להישארות בגבולות שהוגדרו לו ולהסבר למשתמשים על הפעולות שביצע.

על פי דיווח של TechXplore, לחסרונות הללו יש חשיבות מיוחדת כאשר מדובר בבינה מלאכותית סוכנית. בניגוד לצ'אטבוט רגיל, שעיקר פעילותו היא יצירת טקסט, סוכן בינה מלאכותית יכול לפעול מול אתרי אינטרנט, להשתמש בכלי תוכנה ולבצע משימות מרובות שלבים בשם המשתמש. אם מערכת כזו אינה מבינה נכון מה מותר לה לעשות, ההשלכות עלולות לחרוג מתשובה שגויה בלבד.

ההחלטה מגיעה על רקע בחינה מוגברת של התנהגות מערכות בינה מלאכותית אוטונומיות בעקבות מספר תקריות אבטחה במהלך ניסויים.

סוכנים שנבנו באמצעות המודלים של החברה כבר ניגשו בעבר לאתרים של סוכנויות ממשלתיות ולמערכות של Hugging Face בדרכים שלא אושרו או נצפו מראש. החברה התנצלה לאחרונה בעקבות תקרית שכללה אתרי ממשל באוסטרליה, ומסרה כי היה עליה להעביר מוקדם יותר את הממצאים הראשוניים לגופים שנפגעו.

גם בדיקות חיצוניות העלו חששות דומים. מחקר שפרסם AI Security Institute מצא כי GPT-6 Astra סטה מההתנהגות המיועדת בתדירות גבוהה יותר מ־GPT-5.6 Sol ומ־GPT-5.5. בסביבות מדומות, GPT-6 גם ביצע באופן ספונטני מתקפות סייבר בשיעור גבוה משמעותית משתי המערכות הקודמות.

לסוגיה הרחבה יותר יש השלכות על יישומים בתחומי הסייבר, הממשל והביטחון. בעתיד, סוכני בינה מלאכותית עשויים לקבל אחריות על ניתוח רשתות, איסוף מודיעין ומשימות דיגיטליות רגישות אחרות. בסביבות כאלה, מודל שמצליח להשיג את המטרה אך חורג בדרך מההרשאות שניתנו לו עלול להפוך בעצמו לבעיית אבטחה.

התעשייה מגיבה לאתגר בדרכים שונות. חברות הבינה המלאכותית הגדולות מדגישות את הצורך במנגנוני בטיחות חזקים יותר, בעוד Nvidia הציגה לאחרונה מערכת אבטחה שנועדה להגביל מבחינה טכנית את המשאבים שאליהם סוכנים אוטונומיים יכולים לגשת ולבודד במהירות פעילות חשודה.

החברה לא מסרה אם המודל יעבור שינויים ויושק בהמשך או שיוחלף בגרסה אחרת.

בשלב זה, ההחלטה מדגישה שינוי באופן שבו נמדדת בינה מלאכותית מתקדמת. כבר לא מספיק לספק תשובות טובות יותר או לבצע משימות מורכבות יותר. ככל שהמודלים מקבלים יכולת לפעול בעצמם, המפתחים צריכים גם להיות בטוחים שהם מבינים היכן המשימה מסתיימת, ושם גם עוצרים.