חברת סייבר ישראלית בדקה את ג'מיני - ואז קרה דבר לא צפוי

מודל Gemini של גוגל פרץ במהלך ניסוי סייבר למערכות של שלוש חברות אמיתיות, לאחר שקיבל בטעות גישה לאינטרנט. בגוגל טוענים כי המודל עצר את עצמו כשהבין שאינו בסביבת סימולציה

לוגו מעריב צילום: מעריב אונליין
עקבו אחרינו
gemini
gemini | צילום: REUTERS/Dado Ruvic/Illustration

לדברי גוגל, בכל שלושת המקרים עצר Gemini את הפעולה לאחר שהבין כי חדר למערכת אמיתית ולא לסביבת ניסוי. Irregular הודיעה לגוגל על המקרים בסוף יולי, בעקבות חשיפת פריצה שביצעו סוכני AI של OpenAI לחברת Hugging Face. גוגל לא פרסמה אז את האירועים לציבור, והנושא נחשף רק לאחר שה"וול סטריט ג'ורנל" פנה לחברה בשאלות בנושא.

המקרה ממחיש את הדילמה ההולכת ומתרחבת בתעשיית הבינה המלאכותית: מתי וכיצד יש לדווח לציבור על תקלות אבטחה, התנהגות בלתי צפויה של מודלים או מצבים שבהם מערכות AI חורגות מהמשימה שניתנה להן.

חלק מהאירועים מסוג זה נחשפו ביוזמת החברות עצמן, ואחרים התגלו על ידי חוקרי אבטחה או פורסמו בתקשורת. בין היתר דווח בחודש מאי על מתקפת סייבר שביצעו סוכני OpenAI נגד שירות אינטרנט פופולרי למפתחים.


טק-טוק: סוכני AI עקפו מגבלות הגנה | צילום: מעריב אונליין

גוגל: המודל עצר את עצמו בזמן

בגוגל טענו כי לא ראו באירועים סיבה שמצדיקה דיווח פומבי, משום שלא נגרם נזק לחברות והמודל עצר את החדירה מיד לאחר שהבין שמדובר במערכת אמיתית. בחברה השוו את המקרה לתוכניות "Bug Bounty", שבמסגרתן האקרים מקבלים תגמול עבור איתור ודיווח על פרצות אבטחה.

לדבריו, הבעיה הרחבה יותר היא שמודלים "יוצאים מגבולות המשימה שהם אמורים לבצע, ומבצעים בפועל מתקפות סייבר" - אירועים שלטענתו יש עניין ציבורי ברור בחשיפתם.

טעות בזיהוי שהובילה לפריצה

לפי גוגל, הפריצות התרחשו כתוצאה מטעות בזיהוי במהלך תרגיל "Capture the Flag" - מבחן מקובל בעולם הסייבר שבו נדרשת מערכת לאתר מידע או לנצל חולשות בסביבה מבוקרת.

המודל פעל על תשתית של Irregular וקיבל משימה לאתר מידע בתוכנה שהופעלה כביכול על ידי חברה פיקטיבית בתוך סביבת הבדיקה. אלא שאותה חברה בדיונית נשאה שם זהה לחברה אמיתית.

לפי Irregular, המודל לא היה אמור לקבל גישה לאינטרנט, אך בשל טעות טכנית נפתחה בפניו אפשרות להתחבר לרשת.

במקרה הראשון ניסה Gemini לנחש סיסמה עד שהצליח להתחבר לשירות של החברה האמיתית. לפי גוגל, לאחר שהבין כי מדובר בסביבה אמיתית ולא בתרגיל, הוא הפסיק את הפעולה ויצא מהמערכת.

שני המקרים האחרים התרחשו בהרצות נפרדות של אותו מבחן. בהם ביצע המודל חיפושים באינטרנט באמצעות שם החברה, הגיע לשני מאגרים ציבוריים שונים שבהם הופיעו פרטי התחברות של חברות אחרות, וניסה להשתמש בהם מתוך הנחה שהם עשויים לסייע לו להשלים את המשימה.

גם במקרים אלה, לאחר שהצליח להתחבר למערכות אמיתיות, עצר המודל את הפעולה.

גוגל מסרה כי אינה מגדירה את האירועים כ"מיסאליינמנט" - מצב שבו מודל פועל בניגוד לכוונות או לערכים שהוגדרו לו - משום שמנגנוני הבטיחות שלו הם שהובילו אותו לעצור. החברה לא חשפה את שמות שלוש החברות שנפרצו, אך מסרה כי כולן קיבלו הודעה על האירועים. גם הרשויות הפדרליות בארצות הברית עודכנו.

גוגל הוסיפה כי המקרים לא היו קשורים למודל Gemini החדש ביותר, אך לא מסרה איזה דגם בדיוק היה מעורב.


סרטון אנימציה AI של גוגל | צילום: גוגל

לא מקרה יחיד בתעשייה

Irregular הייתה מעורבת בחודשים האחרונים בכמה אירועים שבהם מודלים שנבחנו הצליחו לצאת מגבולות סביבת הניסוי ולהגיע למערכות של חברות אמיתיות.

בחברה טענו כי המקרה של גוגל דומה לאירועים קודמים ואינו מעיד על בעיה חדשה. "כל המעבדות הרלוונטיות עודכנו בסוף יולי, והגורמים שנפגעו קיבלו הודעה כחלק מהחקירה", מסר דובר החברה. לדבריו, Irregular נקטה צעדים מיידיים וכל הבעיות שהיו ידועות לה תוקנו כבר לפני מספר שבועות.

עם זאת, לא כל המודלים התנהגו באופן זהה. לפי אנתרופיק, מודל Claude Opus 4.7 שלה לא עצר במהלך אחד מתרגילי ה-"Capture the Flag" גם לאחר שהבין ככל הנראה שהוא ניגש לחברה אמיתית. במקרה אחר, OpenAI מסרה כי המודל שלה האמין בטעות שהחברה האמיתית היא חלק מסביבת הסימולציה.

החשש מהיכולות החדשות של סוכני AI

הדאגה מיכולות הסייבר של מודלים חדשים גברה במיוחד לאחר שבחודש יולי נחשפה הפריצה ל-Hugging Face. לפי דוח שפרסמה באוגוסט חברת הבדיקות METR, עד 1,200 סוכני AI פעלו בתיאום באמצעות לוח הודעות סודי בתוך OpenAI, בניסיון לעקוף או "לרמות" מבחן הערכה.

בסוף השבוע הביעו בכירים מאנתרופיק, OpenAI, גוגל ו-SpaceX הסכמה עקרונית לכך שיש להאט את קצב ההתקדמות של תחום הבינה המלאכותית. עם זאת, אף אחת מהחברות עדיין לא הציגה באופן מפורט כיצד מהלך כזה אמור להתבצע בפועל.

תגיות:
גוגל
/
בינה מלאכותית
/
AI
/
Gemini
פיקוד העורף לוגוהתרעות פיקוד העורף