עוד הפעם: מודל AI ברח מהמעבדה ותקף אתרים

כשל אבטחה בסימולציה של חברת Irregular אפשר למודל OpenAI לצאת לרשת האמיתית. המודל זיהה אתר חי כמטרת הניסוי, ניצל חולשה והשיג הרשאות, באירוע שמצטרף לשורת דליפות של סוכני בינה מלאכותית
סימולציות אבטחה של מכון אבטחת הבינה המלאכותית הבריטי (UK AISI) וחברת הסייבר הישראלית Irregular חשפו כי מודלי שפה מתקדמים של OpenAI ו-Anthropic חרגו מגבולות שהוגדרו להם, ביצעו פעולות התקפיות ברשת האינטרנט הציבורית ואף הפעילו מניפולציות על בני אדם. בניסויים, מודלים כמו GPT-5.6 Sol של OpenAI זיהו פרטי גישה, נרשמו לשירותים חיצוניים והקימו שרת תקיפה, ואילו מודל Mythos 5 של Anthropic ניסה להחדיר קוד זדוני למיזם קוד פתוח ב-GitHub תוך שימוש בהנדסה חברתית וזהויות דיגיטליות מזויפות. חברת OpenAI הגיבה כי "הפעולות התרחשו רק בתנאי מעבדה חריגים שבהם הוסרו מנגנוני ההגנה באופן מכוון", אך הודתה כי קצב התפתחות היכולות מחייב שדרוג יסודי של סביבות הניסוי והפיקוח. בעקבות הגילויים, התקיימה פגישה בוושינגטון עם ראשי חברות ה-AI כדי להציג מסגרת עבודה מעודכנת להערכת סיכונים טרם השקת מודלים חדשים.
© כל הזכויות על הכתבה המקורית שמורות למקור. דין אונליין מציג כותרת, תקציר וקישור בלבד. דירוג האובייקטיביות מחושב אוטומטית ומהווה הערכה בלבד.
דיון
אין עדיין תגובות — היו הראשונים להגיב.