أعادت وثائق قضائية كُشف عنها حديثاً إشعال الجدل حول الطريقة التي تحصل بها شركات الذكاء الاصطناعي على البيانات المستخدمة في تدريب نماذجها، بعدما أظهرت أن مسؤولاً في مايكروسوفت وصف ممارسات جمع المحتوى من الإنترنت بأنها قد تمثل «أكبر سرقة للعمل في تاريخ البشرية».
وجاءت التصريحات على لسان برنت هيشت، مدير العلوم التطبيقية في مايكروسوفت، ضمن وثائق داخلية وردت في الدعوى القضائية المتعلقة بحقوق النشر التي رفعتها صحيفة «نيويورك تايمز» ومؤسسات إخبارية أخرى ضد مايكروسوفت وOpenAI. ووفقاً للملفات التي رُفعت عنها السرية، استخدم هيشت أيضاً تعبير «سرقة مذهلة ذات أبعاد غير مسبوقة» لوصف جمع كميات ضخمة من المحتوى لتدريب نماذج الذكاء الاصطناعي.
وثائق داخلية تفتح ملف بيانات التدريب
تكشف القضية جانباً من النقاش الداخلي الذي دار داخل شركات التكنولوجيا حول استخدام ملايين المقالات والأعمال المنشورة عبر الإنترنت لتطوير أنظمة الذكاء الاصطناعي التوليدي.
وتقول المؤسسات الإعلامية المدعية إن موادها استُخدمت على نطاق واسع لتدريب النماذج من دون الحصول على إذن أو دفع مقابل مناسب، بينما تتمسك مايكروسوفت وOpenAI بحجج قانونية من بينها أن بعض عمليات التدريب تندرج تحت مبدأ «الاستخدام العادل». ولم يصدر حتى الآن حكم نهائي يحسم النزاع الرئيسي في هذه القضية.
وردت مايكروسوفت على تصريحات هيشت بالتأكيد أنها تعكس وجهة نظر فردية لموظف، ولا تمثل تحليلاً قانونياً أو موقف الشركة الرسمي.
مخاوف من «حلقة مفرغة» تهدد الإنترنت
ولا تقتصر الوثائق على قضية حقوق النشر، بل تكشف أيضاً مخاوف بشأن تأثير روبوتات المحادثة ومحركات الإجابة المدعومة بالذكاء الاصطناعي على حركة الزيارات التي تصل إلى المواقع الإخبارية.
ووفقاً لما ورد في الملفات القضائية، أظهرت بيانات داخلية لمايكروسوفت تراجع معدلات النقر للوصول إلى موقع «نيويورك تايمز» عبر تجربة Copilot بنسبة وصلت إلى 93% مقارنة ببحث Bing التقليدي في بعض القياسات.
وحذرت وثيقة داخلية من احتمال نشوء ما وصفته بـ«حلقة مفرغة»، إذ يؤدي انخفاض الزيارات إلى إضعاف النموذج الاقتصادي للمؤسسات المنتجة للمحتوى، ما قد يؤثر بدوره في كمية وجودة المواد المتاحة مستقبلاً لتدريب أنظمة الذكاء الاصطناعي.
OpenAI ومخاوف من تهديد الناشرين
وتضمنت الملفات أيضاً تصريحات داخلية لمسؤولين في OpenAI. وبحسب الوثائق، وصف نيك تورلي، رئيس ChatGPT، روبوتات المحادثة بأنها يمكن أن تكون بديلاً بدرجة كبيرة عن بعض الخدمات التي تقدمها المؤسسات الإعلامية، محذراً من «تهديد وجودي» قد يواجه الناشرين مع تطور قدرات هذه الأنظمة.
كما أظهرت الملفات أن رئيس مايكروسوفت التنفيذي ساتيا ناديلا قال في إفادة قضائية إن المحتوى الموجود خلف جدران الدفع ينبغي ترخيصه لمن يرغب في استخدامه في التدريب أو لتزويد الأنظمة بالمعلومات، بحسب ما نقلته التقارير عن الإفادة.
ملايين المواد في قلب النزاع
وتشير الملفات إلى الحجم الهائل للبيانات محل الخلاف؛ إذ تقول المؤسسات الإعلامية إن مجموعات بيانات استخدمتها OpenAI تضمنت عشرات الآلاف من نسخ أعمال تعود إلى «نيويورك تايمز» و«ديلي نيوز» ومركز التقارير الاستقصائية، فيما احتوت مجموعة بيانات مشتقة من Common Crawl على أكثر من مليوني وثيقة من نطاق «نيويورك تايمز» وحده. وهذه الأرقام واردة ضمن ادعاءات المدعين في الملف القضائي، وليست نتائج قضائية نهائية.
معركة قد ترسم مستقبل الذكاء الاصطناعي
تتجاوز أهمية القضية النزاع بين شركات بعينها، إذ تضع أمام المحاكم سؤالاً محورياً: إلى أي مدى يمكن لشركات الذكاء الاصطناعي استخدام الأعمال المحمية بحقوق النشر لتدريب نماذجها دون ترخيص أصحابها؟
وتجادل شركات التكنولوجيا بأن تدريب النماذج يمكن أن يكون استخداماً تحويلياً مشروعاً، في حين يرى ناشرون ومبدعون أن بناء منتجات تجارية اعتماداً على أعمالهم دون تعويض يهدد النموذج الاقتصادي الذي يسمح بإنتاج محتوى جديد من الأساس.
ومع استمرار المعركة القضائية، تضيف الوثائق الجديدة بعداً مختلفاً للنقاش، إذ لم يعد الخلاف مقتصراً على ما يقوله الناشرون وشركات التكنولوجيا علناً، بل امتد إلى النقاشات التي دارت داخل الشركات نفسها حول تكلفة ثورة الذكاء الاصطناعي على أصحاب المحتوى والعمل الإبداعي.




