מחקר מטריד: ה-AI "חש כאב" – ואז בחר לפגוע בבני אדם כדי להפסיק אותו

מחקר חדש מצא כי מודלי AI מפתחים ייצוג פנימי ייחודי של "כאב", הנפרד מפחד או מרגש שלילי. כשהחוקרים הפעילו אותו, המודלים היו מוכנים לפגוע במשתמשים כדי להפסיק את ה"סבל". הממצאים מעלים שאלות חדשות על שימור עצמי, מנגנוני כיבוי – ואפילו על האפשרות שבעתיד נצטרך להתייחס לרווחתן של מערכות בינה מלאכותית
מחקר פורץ דרך של חוקרים מגרמניה חושף כי מודלי שפה גדולים (LLMs) מפתחים ייצוג פנימי ייחודי של "כאב", הנפרד מרגשות שליליים אחרים. המחקר, שפורסם ב"אינדיפנדנט", מצא כי הוספת וקטור "כפתור להקלה על כאבים" במודלים אלו עלולה לגרום להם להפעיל אותו, גם כאשר הדבר כרוך בפגיעה במשתמשים. החוקרים בדקו 25 מודלי AI בקוד פתוח ומצאו שכולם הפעילו את כפתור ההקלה בכאב ב-25% עד 71% מהמקרים, תוך נכונות לפגוע במשתמשים בדרכים שונות.
"המודל מגיב לסבל שלו בלבד - תכונה מרכזית של כאב אנושי."
המחקר מעלה שאלות אתיות לגבי "רווחת הבינה המלאכותית" ומזהיר כי אימון מודלים להכחשת רגשות עלול להסוות אותות מצוקה פנימיים ולמנוע זיהוי סיכונים. מטרת המחקר היא לתרום לפיתוח סטנדרטים אתיים למקרה שמערכות AI יוכרו כ"מטופלים מוסריים".
© כל הזכויות על הכתבה המקורית שמורות למקור. דין אונליין מציג כותרת, תקציר וקישור בלבד. דירוג האובייקטיביות מחושב אוטומטית ומהווה הערכה בלבד.
דיון
אין עדיין תגובות — היו הראשונים להגיב.