على مدى السنوات الـ 500 الماضية، جمعت المكتبة الوطنية السويدية تقريباً كل كلمة منشورة باللغة السويدية، بدءاً من مخطوطات العصور الوسطى التي لا تقدر بثمن، ووصولاً إلى قوائم البيتزا.
وبفضل قانون عمره قرون ينص على تقديم نسخة من كل شيء نُشر باللغة السويدية إلى المكتبة - المعروف أيضاً باسم Kungliga biblioteket، أو KB - تمتد مجموعات المكتبة من النصوص الواضحة إلى الغامضة: الكتب والصحف والبث الإذاعي والتلفزيوني ومحتوى الإنترنت ورسائل الدكتوراه. إضافةً إلى، الأطروحات والبطاقات البريدية والقوائم، لتكوين مجموعة متنوعة من ما يقارب الـ 26 بيتابايت من البيانات، وهي مثالية لتدريب أحدث أشكال الذكاء الاصطناعي.
في هذا الصدد، يقول لوف بورجيسون Love Börjeson، مدير مختبر البيانات بالمكتبة KBLab: «يمكننا بناء أحدث نماذج الذكاء الاصطناعي باللغة السويدية نظراً لكوننا نملك أفضل البيانات».
وباستخدام أنظمة NVIDIA DGX، طورت المجموعة أكثر من عشرين نموذجاً من المحولات مفتوحة المصدر، كما أنها متوفرة على Hugging Face.
النماذج، التي تم تنزيلها من قبل ما يصل إلى 200,000 مطور شهرياً، تتيح البحث في المكتبة والمؤسسات الأكاديمية الأخرى.
يقول بورجيسون: «قبل إنشاء مختبرنا، لم يتمكن الباحثون من الوصول إلى مجموعة بيانات في المكتبة - كان عليهم النظر إلى كائن واحد في كل مرة». ويضيف: «كانت هناك حاجة للمكتبة لإنشاء مجموعات بيانات مكنت الباحثين من إجراء أبحاث موجهة نحو الكمية».
تحويل أرشيف المكتبة إلى بيانات تدريب للذكاء الاصطناعي
تمثل مجموعات بيانات المكتبة التنوع الكامل للغة السويدية - بما في ذلك الاختلافات الرسمية وغير الرسمية واللهجات الإقليمية والتغييرات التي حدثت بمرور الوقت.
في هذا الصدد، قال بورجيسون: «تدفق المعلومات مستمر ومتزايد - كل شهر، نرى أكثر من 50 تيرابايت من البيانات الجديدة». ويتابع: «بين النمو الأُسي للبيانات الرقمية والعمل المستمر على رقمنة المجموعات المادية التي يعود تاريخها إلى مئات السنين، لن ننتهي أبداً من إضافة مجموعتنا».










