מיליוני ספרים נחתכו והושמדו כדי לאמן את מודל ה-AI של Claude
עודכן לאחרונה: 8.8.2026 / 15:44
פרטים חדשים על אחד הפרויקטים החריגים של אנתרופיק נחשפים ב-The Guardian, בעקבות מסמכים פנימיים של החברה שהוגשו במסגרת מאבק משפטי עם סופרים בארה"ב. לפי המסמכים, החברה שמפתחת את מודל הבינה המלאכותית Claude רכשה מיליוני ספרים מודפסים, פירקה אותם, סרקה את הדפים ולאחר מכן השמידה את העותקים הפיזיים. המבצע קיבל את שם הקוד "Project Panama", ובמזכר פנימי מאפריל 2024 הוגדרה מטרתו במילים שקשה לפספס: "המאמץ שלנו לסרוק באופן הרסני את כל הספרים בעולם". גם הסודיות הייתה מכוונת. במסמך נכתב כי החברה משתמשת בשם קוד משום שאינה רוצה שיידעו שהיא עובדת על הפרויקט, והעובדים התבקשו שלא לדבר עליו בפומבי.מאחורי הפרויקט עמדה בעיה מרכזית של חברות בינה מלאכותית: כדי לאמן מודל כמו Claude צריך כמויות עצומות של טקסט איכותי. אנתרופיק חיפשה במיוחד ספרים מהתקופה שקדמה להתפשטות מודלי ה-AI, משום שהם מכילים טקסט אנושי שלא הושפע מתוכן שכבר נוצר באמצעות בינה מלאכותית. מבחינת החברה, ספרים היו חומר אימון איכותי במיוחד בזכות הטקסטים הארוכים והמורכבים שהם מכילים. במסמכי בית המשפט נכתב כי אנתרופיק העריכה במיוחד את "העובדות שנאצרו היטב, הניתוחים המאורגנים והנרטיבים הבדיוניים המרתקים" שבספרים – תוכן שיכול ללמד את Claude לכתוב בצורה מדויקת ומשכנעת יותר.כדי להשיג את החומר הזה, אנתרופיק הוציאה מיליוני דולרים על רכישת ספרים ופנתה למפיצים ולקמעונאים כדי לקנות אותם בכמויות גדולות, כולל עותקים משומשים. לאחר מכן הספרים הועברו לספקים חיצוניים, שהסירו את הכריכות, חתכו את שדרות הספרים והפרידו את הדפים כדי להעביר אותם במהירות דרך סורקים. מכל ספר נוצר קובץ PDF שכלל את העמודים הסרוקים לצד טקסט שמחשב יכול לקרוא ולעבד. בסיום התהליך עותקי הנייר הושלכו או הועברו למחזור. זו בדיוק המשמעות של "סריקה הרסנית": לא סורקים ספר ושומרים אותו על המדף, אלא מפרקים אותו פיזית כדי להפוך אותו לקובץ דיגיטלי – והעותק המקורי לא שורד את התהליך.אלא שהספרים שנרכשו כחוק היו רק חלק ממאגר המידע של אנתרופיק. לפי המסמכים, החברה השתמשה גם בכמויות עצומות של ספרים שהגיעו ממאגרים פיראטיים: כחמישה מיליון עותקים מ-LibGen, כשני מיליון מ-Pirate Library Mirror וכ-183 אלף מ-Books3. אנתרופיק שקלה גם להשיג רישיונות מסודרים מבעלי זכויות היוצרים, אבל בתוך החברה תואר התהליך המשפטי, העסקי והמעשי הכרוך בכך כמסורבל. השימוש בספרים הפיראטיים הפך בהמשך לחלק מרכזי במאבק המשפטי מול סופרים, והחברה הגיעה להסדר מחוץ לבית המשפט בסך 1.5 מיליארד דולר בנוגע לחומרים הפיראטיים.בית המשפט, עם זאת, עשה הבחנה ברורה בין ספרים שאנתרופיק קנתה לבין עותקים שהגיעו ממקורות פיראטיים. השופט ויליאם אלסאפ קבע כי שימוש בספרים שנרכשו כחוק לצורך אימון מודל AI יכול להיחשב "שימוש הוגן" – כלומר שימוש שמותר במקרים מסוימים גם ללא אישור נוסף מבעל זכויות היוצרים. לפי ההחלטה, Claude לא הפיץ מחדש את הספרים אלא למד מאלפי יצירות דקדוק, מבנה ודרכי כתיבה כדי לייצר טקסט חדש. גם הפיכת הספרים המודפסים שנרכשו כחוק לקבצים דיגיטליים עבור ספריית המחקר של אנתרופיק לא נחשבה להפרה. לעומת זאת, בכל הנוגע לספרים הפיראטיים, השופט היה חד משמעי: הורדת ספר מאתר פיראטי היא הפרת זכויות יוצרים בפני עצמה.הפרטים שנחשפים כעת ממחישים בעיקר עד כמה חברות הבינה המלאכותית תלויות עדיין ביצירה אנושית כדי לבנות מערכות שאמורות להתחרות בה. לפי מסמכי בית המשפט, אנתרופיק ביקשה ליצור ספריית מחקר מרכזית של "כל הספרים בעולם", שתישמר "לנצח" ותאפשר לה לבחור מתוכה מאגרי ספרים שונים לאימון מודלים עתידיים. החברה מסרה כי תוכניות רכישת המידע שלה אינן קונות ומשמידות ספרים "נדירים" או "עתיקים". אלא שהפרויקט משאיר אחריו שאלה רחבה יותר: כאשר מיליוני ספרים מודפסים הופכים מבחינת תעשיית ה-AI לחומר גלם שאפשר לקנות, לחתוך, לסרוק ואז להשליך – Project Panama עשוי להיות לא רק סיפור על הדרך שבה Claude אומן, אלא הצצה לאופן שבו המרוץ אחר נתוני AI משנה גם את היחס לספרים עצמם.
חברת אנתרופיק, מפתחת מודל ה-AI קלוד, ביצעה פרויקט סודי בשם "Project Panama" במסגרתו רכשה מיליוני ספרים מודפסים, פירקה אותם, סרקה את תוכנם והשמידה את העותקים הפיזיים. מטרת הפרויקט, שהוגדרה במזכר פנימי כ"המאמץ שלנו לסרוק באופן הרסני את כל הספרים בעולם", הייתה לאמן את מודל ה-AI בטקסטים איכותיים ואנושיים שטרם הושפעו מבינה מלאכותית. החברה השקיעה מיליוני דולרים ברכישת ספרים ממפיצים וקמעונאים, והשתמשה גם בכמויות עצומות של ספרים ממקורות פיראטיים, מה שהוביל למאבק משפטי עם סופרים בארה"ב.
המאמץ שלנו לסרוק באופן הרסני את כל הספרים בעולם
בית המשפט קבע כי שימוש בספרים שנרכשו כחוק לצורך אימון מודל AI יכול להיחשב "שימוש הוגן", אך הורדת ספרים מאתרים פיראטיים מהווה הפרת זכויות יוצרים. הפרויקט מדגיש את תלותן של חברות ה-AI ביצירה אנושית ואת האופן שבו המרוץ אחר נתוני אימון משנה את היחס לספרים כחומר גלם.
© כל הזכויות על הכתבה המקורית שמורות למקור. דין אונליין מציג כותרת, תקציר וקישור בלבד. דירוג האובייקטיביות מחושב אוטומטית ומהווה הערכה בלבד.
דיון
אין עדיין תגובות — היו הראשונים להגיב.