מלחמות הסקרייפינג: רדיט תחסום את ארכיון האינטרנט
מאת: רויטל סלומון
נכתב ב-12 באוגוסט 2025
רדיט הודיעה שתחסום את הגישה של ארכיון האינטרנט, ולא תאפשר לשמור גירסאות ישנות של פוסטים באמצעות ה-Wayback Machine, אלא רק את העמוד הראשי. זה אומר, הלכה למעשה, שאי אפשר יהיה לשמור תיעודים של פוסטים ותגובות ברדיט באמצעות הווייבאק משין.
הסיבה הרשמית היא שרדיט "תפסה" חברות AI שעושות סקרייפינג למידע שלה באמצעות ארכיון האינטרנט. זה לא שרדיט לא רוצה שישמרו את המידע ארכיונית, היא פשוט רוצה כסף תמורת האינפורמציה הזו, ולכן היא חוסמת את ארכיון האינטרנט. מי שירצה לעשות סקרייפינג למידע שלה, ישלם כסף (כמו שגוגל שילמה). מצד שני, לא מן הנמנע שרדיט תשמח להקשות על שמירת עותקים מתוך הקהילות שלה, מטעמים משפטיים כאלה ואחרים. כשקשה יותר לתעד את ההיסטוריה, אפשר להסתיר דברים.
מה זה סקרייפינג ואיך הוא מתחבר למלחמות הבינה המלאכותית

סקרייפינג (Scraping) הוא תהליך של שליפת מידע מאתרים באופן אוטומטי, לרוב באמצעות סקריפטים או כלים ייעודיים, כדי לבנות מאגרי נתונים גדולים. בעולם הבינה המלאכותית, במיוחד של מודלים לשוניים גדולים (LLM), הסקרייפינג שימש בשנים האחרונות כדרך המרכזית לאסוף חומרי גלם – טקסטים, קוד, תמונות – שעליהם המודלים מתאמנים.
ב"מלחמה" בין חברות ה־AI הגדולות, הסקרייפינג הפך לשדה קרב. מצד אחד, חברות כמו OpenAI, Anthropic או גוגל מחפשות מקורות איכותיים ורבים ככל האפשר לאימון ושיפור המודלים שלהן. מצד שני, אתרים גדולים, כמו רשתות חברתיות, פורומים ואתרי חדשות, מנסים לחסום סקרייפינג כדי לשמור על שליטה בנתונים ולהגן על המודל העסקי שלהם. לכן אנחנו רואים מגמות של הצבת חומות תשלום (paywalls), מגבלות API, ואפילו תביעות משפטיות נגד חברות AI שהשתמשו בתוכן בלי רישיון.
העימות הזה מתחדד כי ה-AI עצמו מתחיל "לחתוך" את מקור ההכנסה של האתרים: במקום שהגולש ילחץ על לינק בתוצאות חיפוש ויבקר באתר כמו בעבר, הוא מקבל את כל המידע שהוא צריך ישירות ב-ChatGPT או בתקצירי AI בגוגל. המשמעות היא ירידה בהקלקות וירידה בטראפיק האורגני, מה שמצמצם הכנסות מפרסום ומגדיל את המוטיבציה של האתרים לשמור על המידע לעצמם ולמנוע גישה חופשית ממנו למודלים מתחרים.
