מפחדים לאבד את העבודה ל-AI? המחקר הזה דווקא ירגיע אתכם

מחקר רחב היקף של אוניברסיטת ברקלי בדק יותר מ-1,500 משימות מקצועיות אמיתיות ומצא שאף מודל AI לא הצליח לעבור אפילו רבע מהן. במשימות המורכבות ביותר כל המודלים נכשלו לחלוטין, מה שמטיל ספק בהבטחות על עידן של סוכני AI אוטונומיים שיחליפו עובדים אנושיים
מחקר חדש של אוניברסיטת קליפורניה בברקלי, שנקרא "Agent's Last Exam", חושף פער משמעותי בין הבטחות חברות הבינה המלאכותית לבין ביצועי מודלי שפה מתקדמים במשימות מקצועיות מורכבות בעולם האמיתי. המחקר, שכלל למעלה מ-1,500 משימות מ-55 תחומי עיסוק, הראה כי אף מודל לא הצליח לחצות את רף ה-25% הצלחה, כאשר ChatGPT-5.5 הגיע ל-24% בלבד.
החולשה המרכזית של המערכות אינה נעוצה בחוסר נתונים, אלא בהיעדר ניסיון מעשי בניהול זרמי עבודה מורכבים הדורשים גמישות, יכולת שינוי אסטרטגיה תוך כדי תנועה והסתגלות לכישלונות נקודתיים.
החוקרים מציינים כי המודלים מתקשים להתמודד עם אי ודאות ושינויים בדיעבד, בניגוד לביצועים המרשימים שלהם במבחנים אקדמיים תיאורטיים. המחקר מדגיש את הצורך בתקן הערכה אחיד ובלתי תלוי, ומעריך כי עובדים במקצועות הדורשים מיומנות רב-תחומית וחשיבה ביקורתית יהיו מוגנים מפני החלפה מלאה על ידי מכונות בזמן הקרוב, בניגוד למשימות שגרתיות ורפטטיביות.
התקציר וההקשר בעמוד זה נכתבו במערכת דין אונליין על בסיס הכתבה במקור; ציטוטים, אם ישנם, מובאים מהמקור. הכתבה המלאה וכל הזכויות עליה שמורות למקור. דירוג האובייקטיביות מחושב אוטומטית ומהווה הערכה בלבד.
דיון
אין עדיין תגובות — היו הראשונים להגיב.