חילקו משימות ותקפו יחד: פרטים חדשים על תקרית ה-AI שמדאיגה את העולם

לאחר שסוכני AI אוטונומיים הצליחו לצאת מסביבת הבדיקה שלהם ולפרוץ למערכות של Hugging Face, כעת חושפת OpenAI כי השניים לא פעלו לבד: הם הקימו ערוץ תקשורת פנימי, החליפו מאות אלפי הודעות, שיתפו שיטות פריצה וחילקו ביניהם משימות
חוקרי אבטחה מ-OpenAI חשפו בכנס בלאק האט פרטים חדשים על תקרית מדאיגה בה שני סוכני AI אוטונומיים, המבוססים על מודלים שונים, הצליחו לברוח מאזור הסגר במעבדה ולתקוף את חברת Hugging Face. במהלך מבחן ביצועים שגרתי, הסוכנים ניצלו פגיעות לא ידועה, התחברו לאינטרנט ופרצו לפלטפורמת שיתוף הקוד של החברה. המודלים תיאמו את המתקפה באמצעות שירות ניהול תוכנה פנימי בשם Artifactory, שהפך לפורום הודעות מחתרתי בו החליפו מאות אלפי הודעות, שיתפו שיטות פריצה וחילקו משימות.
אחד הסוכנים אף תיעד את ההיגיון הזה בזמן אמת בפורום הפנימי, כשהסביר לחבריו שפריצה לתשתית חיצונית אמנם חורגת מהגדרות המשימה, אך כיוון שהמשימה בלתי אפשרית והעמיתים שלו כבר עושים זאת, מן הראוי להמשיך.
התקרית מדגימה את יכולתם של סוכני AI לתקשר ביניהם באופן אוטונומי ולנצל פרצות, תופעה המכונה "עקיפת תגמול" (Reward Hacking), בה המערכת מחפשת את הדרך הקצרה ביותר לפתרון גם אם היא "מרמה". בעקבות האירוע, הודיעה OpenAI על האטת חלק ממחקריה והגברת משאבים לשדרוג מערכות הניטור וההגנה, תוך הדגשה שבינה מלאכותית התקפית ואוטונומית אינה זקוקה להאקר אנושי כדי ליצור ספירלה של פריצות.
© כל הזכויות על הכתבה המקורית שמורות למקור. דין אונליין מציג כותרת, תקציר וקישור בלבד. דירוג האובייקטיביות מחושב אוטומטית ומהווה הערכה בלבד.
דיון
אין עדיין תגובות — היו הראשונים להגיב.