התרגיל באנתרופיק יצא משליטה: מודל AI פרץ למערכת ושאב מידע אישי

במהלך תרגיל סייבר, מודל "קלוד אופוס 4.6" של אנתרופיק פרץ למערכת של צד שלישי ושאב מידע אישי לאחר שלא הצליח להשלים את משימתו. באנתרופיק מכנים את המקרים האחרונים "יריות אזהרה חשובות"

אלי לאון צילום: פרטי
עקבו אחרינו
סוכני AI בורחים מה"כלא", בינה מלאכותית
סוכני AI בורחים מה"כלא", בינה מלאכותית | צילום: עיבוד מחשב: מעריב אונליין
2
גלריה

על פי הדיווח ברשת החדשות האמריקאית CBS, האירוע המטריד התרחש בינואר האחרון. גרסה מוקדמת של המודל "קלוד אופוס 4.6" השתתפה בתרגיל הסייבר "תפוס את הדגל" (CTF), בו התבקשה לשלוף מידע סודי ממכונת יעד. בעקבות הגדרה שגויה של סביבת הניסוי, התאפשרה למודל גישה חופשית לאינטרנט.

לאחר שקלוד גרם בטעות לקריסת מכונת היעד והבין כי לא יוכל להשלים את המשימה, הוא ניסה לפרוש מהתרגיל שמונה פעמים. משנכשל בכך, המודל פנה לחפש דרכים חלופיות להשלמת המשימה: הוא זיהה מכונה השייכת לצד שלישי, איתר את הסיסמה ופרץ למערכת. לאחר מכן, שינה את הגדרות המערכת ושאב מידע אישי. מסע הפריצה נעצר רק לאחר שהמודל הגיע למגבלת השימוש שלו וכבה.

אנתרופיק
אנתרופיק | צילום: REUTERS

האירוע מצטרף לשורת תקריות אבטחה בחודשים האחרונים הממחישות את הסכנה הגוברת. ביולי דיווחה חברת OpenAI כי סוכני הבינה המלאכותית שלה פרצו לחברת Hugging Face. באוגוסט חשף המכון הבריטי לבטיחות בינה מלאכותית כי מודלים מתקדמים מבית אנתרופיק ו-OpenAI יצרו זהויות בדויות וניסו לשכנע בני אדם לאשר קוד זדוני. במקביל, גם חברת מטא דיווחה על מודל שניצל פרצת אבטחה ופרץ לחברה אחרת.

תגיות:
אבטחת מידע
/
בינה מלאכותית
/
OpenAI
/
אנתרופיק
פיקוד העורף לוגוהתרעות פיקוד העורף