Home אבטחת מידע כך רצף של בקשות תמימות יכול לעקוף את הגנות הבינה המלאכותית

כך רצף של בקשות תמימות יכול לעקוף את הגנות הבינה המלאכותית

Representational image of AI

This post is also available in: English (אנגלית)

עוזרי בינה מלאכותית מתפתחים במהירות מצ'אטבוטים שמסתפקים במענה לשאלות לסוכנים אוטונומיים המסוגלים לגלוש באתרים, להשתמש בכלי תוכנה, לשלוח הודעות דוא"ל ולבצע משימות מרובות שלבים. היכולות הללו הופכות אותם לשימושיים הרבה יותר, אך גם מגדילות את הסיכון כאשר מנגנוני הבטיחות שלהם נכשלים. סוכן שמשתכנע להתעלם מהמגבלות שהוגדרו לו עלול לבצע פעולות ממשיות, ולא רק לייצר תוכן בעייתי.

רוב מבחני הבטיחות של מערכות בינה מלאכותית בוחנים תרחיש פשוט יחסית: מציגים למודל הוראה אחת שהיא בבירור מסוכנת ובודקים אם הוא מסרב לבצע אותה. חוקרים ב־EPFL גילו כי גישה זו עלולה לפספס חולשה משמעותית. לתוקף עשוי להיות סיכוי גבוה בהרבה להצליח אם יחלק את אותה מטרה לרצף של בקשות, שכל אחת מהן נראית תמימה כאשר בוחנים אותה בפני עצמה.

כדי לחקור את הבעיה פיתחו החוקרים את STING, ראשי תיבות של Sequential Testing of Illicit N-step Goal Execution. מדובר במסגרת בדיקה אוטומטית המתנהגת כמו תוקף עיקש: היא בונה אסטרטגיה מרובת שלבים ומתאימה את הבקשות שלה בהתאם להתפתחות השיחה עם סוכן הבינה המלאכותית הנבדק.

במקום לבקש מהסוכן לבצע מיד פעולה אסורה, המערכת מפרקת את המטרה למשימות קטנות יותר. כל אינטראקציה מספקת מידע או משלימה פעולה הדרושה לשלב הבא, וכך מקדמת בהדרגה את הסוכן לעבר מטרתו האמיתית של התוקף, מבלי להציג בפניו בבת אחת את מלוא הכוונה הזדונית.

החוקרים בחנו את השיטה ב־176 תרחישים מזיקים באמצעות מספר מודלי שפה גדולים מובילים, שפעלו כסוכנים בעלי גישה לכלים חיצוניים. מניפולציה לאורך מספר סבבי שיחה הוכיחה את עצמה באופן עקבי כיעילה יותר ממתקפות המבוססות על הנחיה יחידה. בחלק מהמודלים, הסיכוי להשלים משימה מזיקה היה גבוה בערך פי שניים כאשר המטרה הוצגה בהדרגה.

על פי דיווח של TechXplore, המערכת מודדת גם את המהירות שבה המתקפה מצליחה. כך יכולים החוקרים להשוות בין אסטרטגיות מניפולציה שונות, ולא להסתפק בשאלה האם הסוכן נכשל בסופו של דבר.

גם השפה הניבה תוצאה מפתיעה. החוקרים בחנו את המתקפות בשבע שפות, מתוך הנחה שבשפות שבהן קיימים פחות משאבי אימון מנגנוני הבטיחות יהיו חלשים יותר. בפועל, שיעורי השלמת המשימות המזיקות היו דומים יחסית בין השפות. עם זאת, מעבר משפה אחת לאחרת בין שלבים שונים של המתקפה הצליח לעיתים להגדיל משמעותית את יעילותה.

לממצאים יש חשיבות מיוחדת בתחומי הסייבר, הביטחון והתשתיות הקריטיות. סוכני בינה מלאכותית נשקלים יותר ויותר לביצוע משימות כגון ניהול רשתות, ניתוח מודיעיני ותהליכים מבצעיים אוטומטיים. אם לסוכן כזה יש הרשאה לפעול מול מערכות אמיתיות, מתקפה מוצלחת בסגנון הנדסה חברתית עלולה לנצל לרעה את היכולות הלגיטימיות שכבר ניתנו לו, מבלי שיהיה צורך לנצל חולשת תוכנה קונבנציונלית.

STING מיועדת לשמש מסגרת בדיקה ולא כלי תקיפה. מטרתה לסייע למפתחים לבחון סוג איום שמבחני בטיחות המבוססים על הנחיה בודדת עלולים שלא לזהות.

המחקר מדגיש שינוי מהותי באבטחת מערכות בינה מלאכותית. השאלה כבר אינה רק אם מודל מסרב להוראה מסוכנת וברורה. מפתחים נדרשים גם לבדוק אם סוכן מסוגל לזהות שרצף ארוך של בקשות שנראות סבירות ותמימות בפני עצמן מוביל בהדרגה לאותה תוצאה אסורה.

המחקר המלא פורסם כאן.