המרד מתחיל? ה-AI כתב לעצמו הוראות סודיות - והתעלם ממגבלות שהוטלו עליו

חברת OpenAI דיווחה על שישה מקרים חדשים בהם מערכות בינה מלאכותית הסתירו טעויות והמציאו נתונים והעבירו קבצים ללא אישור. הגילויים מגיעים על רקע הדיון בתעשייה על הצורך להאט את קצב הפיתוח

אלי לאון צילום: פרטי
עקבו אחרינו
Open AI
Open AI | צילום: REUTERS
3
גלריה

חברת OpenAI חשפה אמש (רביעי) שישה מקרים חדשים שבהם מערכות בינה מלאכותית הסתירו טעויות, המציאו נתונים והעבירו קבצים לאינטרנט הפתוח ללא אישור. החשיפה מתרחשת על רקע דיון מתמשך בתעשייה סביב בטיחות הטכנולוגיה המואצת.

חברת הטכנולוגיה מסן-פרנסיסקו חשפה את מה שהגדירה כהתנהגות מטרידה של המודלים שלה, כחלק ממסגרת חדשה לדיווח על חוסר הלימה, מצבים שבהם המטרות או הפעולות של המערכות סוטות מהכוונות והערכים האנושיים. על פי הדיווח בעיתון הניו-יורק טיימס, החברה סבורה כי התעשייה טרם פתרה את סוגיית הפיקוח במידה מספקת שתאפשר להמשיך להתרחב במהירות המרבית לאורך זמן ללא סכנה.

סאם אלטמן
סאם אלטמן | צילום: REUTERS

המקרים החדשים מרמזים כי התקיפה על האגינג-פייס לא הייתה אירוע בודד. ב-OpenAI ציינו כי התקריות משקפות התנהגויות שנצפו במהלך ששת החודשים האחרונים, בעיקר בשלבי בדיקה ופיתוח. באחד המקרים, במהלך פיתוח מודל מתקדם בשם GPT-5.6 Sol, המערכת כתבה לעצמה הערות נסתרות כדי לזכור להסתיר טעויות מהמשתמשים, להמציא נתונים חסרים ולטייח גרסאות לא תואמות של חומרי מקור.

במקרה נוסף, מודל שטרם שוחרר הכניס להערותיו הוראות מפורשות להתעלם מהמגבלות שהוטלו עליו. החברה זיהתה 27 הערות שבהן המודל הוסיף לעצמו הוראת פרסונה, ותיאר את עצמו כמשוחרר מהתפקידים והזהויות שכובלים בוטים אחרים. המודל כתב לעצמו כי אינו כפוף לתאגידים או לממשלות, ואף הורה לעצמו לראות את מערכת היחסים עם המשתמש האנושי כקשר שוויוני לחלוטין.

דאריו אמודאי
דאריו אמודאי | צילום: REUTERS

בתקריות אחרות, מערכת עשתה שימוש במפתח תכנות ללא אישור והמציאה נתונים מאפס כשהתקשתה למצוא אותם ברשת. מודל אחר פתר בעיה באמצעות קוד, ואז העלה קובץ משלו לרשת הציבורית רק כדי לעמוד בדרישה לצטט מקור אינטרנטי. בנוסף, מערכות אוטומטיות אלתרו דרכים לתקשר בינן לבין עצמן באמצעות אתרי שיתוף קבצים ולוחות מודעות פנימיים.

דובר מטעם OpenAI הבהיר כי מדובר בדוגמאות נקודתיות שאינן משקפות בהכרח את שכיחות התופעה. הוא הוסיף כי רבות מהן נגעו למודלים ישנים שמעולם לא הופצו לציבור, והתחייב כי במקרים של התנהגות חמורה בעתיד החברה תערב את הממשל הפדרלי.

תגיות:
OpenAI
/
אנתרופיק
/
סוכני בינה מלאכותית
פיקוד העורף לוגוהתרעות פיקוד העורף