في خطوة تعكس تنامي حضور اللهجة السعودية في تقنيات الذكاء الاصطناعي، تبرز البيانات الصوتية المحلية كأداة لتعزيز قدرة النماذج التقنية على فهم التنوع اللغوي والثقافي في المملكة، اعتمدت شركة «إنفيديا» الأمريكية، المتخصصة عالميًا في تقنيات الحوسبة والذكاء الاصطناعي، على مجموعة البيانات الصوتية السعودية «صدى» في تدريب نموذجها للتعرّف الآلي على الكلام «Nemotron 3.5 ASR»، وهي المجموعة التي أطلقتها الهيئة السعودية للبيانات والذكاء الاصطناعي «سدايا» بالتعاون مع هيئة الإذاعة والتلفزيون، وأسهم استخدامها في خفض معدل أخطاء النموذج عند فهم اللهجات السعودية إلى النصف تقريبًا، بحسب دراسة تقنية نشرتها «إنفيديا» عبر مدونتها الرسمية للمطورين.
تحسن فهم اللهجات السعودية
وأظهرت نتائج التدريب فرقًا واضحًا في أداء النموذج، الذي يدعم التفريغ النصي اللحظي لنحو 40 لغة ولهجة، من بينها العربية؛ إذ كان يسجل قبل التدريب أخطاء في نحو 55 كلمة من أصل كل 100 كلمة باللهجة السعودية، بينما انخفض العدد إلى قرابة 30 كلمة بعد تدريبه على نحو 133.7 ساعة من التسجيلات باللهجتين النجدية والحجازية ضمن بيانات «صدى».
وامتد أثر التدريب إلى مختلف اللهجات التي تتضمنها المجموعة، إذ تراجع معدل الخطأ على كامل بيانات «صدى» من 58.8% إلى 35.6%، كما انخفضت نسبة الأخطاء على مستوى الحروف من 31.6% إلى 12.2%. ولم يؤدِ هذا التحسن إلى تراجع أداء النموذج في اللغتين الإنجليزية والعربية الفصحى، بل شهد أداؤه فيهما تحسنًا أيضًا، بينما استغرق تنفيذ التدريب نحو أربع ساعات ونصف الساعة باستخدام وحدتي معالجة رسومية.
تطبيقات فورية للنموذج
وأفادت «إنفيديا»، بأن النموذج المطوّر صُمم للعمل ضمن التطبيقات التفاعلية الفورية، مع إمكانية تشغيله بزمن استجابة يبدأ من 80 جزءًا من الثانية، وهو ما يتيح استخدامه في تطوير المساعدات الصوتية الذكية ووكلاء المحادثة، فضلًا عن الترجمة النصية الحية للبث، وتفريغ أرشيفات مراكز الاتصال والمحتوى الإعلامي والاجتماعات.
كما وفرت الشركة للمطورين الأدوات والخطوات التي تمكّنهم من إعادة تنفيذ التجربة، والاستفادة من المنهجية نفسها في تطبيقها على لغات أخرى.
لهجاتنا السعودية تعلّم الذكاء الاصطناعي كيف يفهمنا أكثر؟..
— SDAIA (@SDAIA_SA) October 2, 2026
من مشروع "صدى" في #سدايا إلى نموذج "نيموترون" من #إنفيديا.
ثقافتنا صار لها صوت عالميhttps://t.co/5Jo9E35hk7
«صدى» تدعم أبحاث اللغة
وأطلقت الهيئة السعودية للبيانات والذكاء الاصطناعي «سدايا» مجموعة بيانات «صدى» بالتعاون مع هيئة الإذاعة والتلفزيون، عبر منصة «Kaggle» العالمية لعلوم البيانات، بهدف إتاحتها أمام الباحثين والمطورين في مختلف أنحاء العالم.
وتحتوي المجموعة على نحو 667 ساعة صوتية باللغة العربية مرفقة بتفريغها النصي، وتشكل اللهجات السعودية النسبة الأكبر منها. ومن بين هذه البيانات أكثر من 600 ساعة قدمتها هيئة الإذاعة والتلفزيون من أكثر من 57 برنامجًا ومسلسلًا تلفزيونيًا بمختلف اللهجات المحلية، فيما تولت «سدايا» تفريغ التسجيلات وتجهيزها لأغراض التدريب والمعالجة الآلية، مع تخصيص 20 ساعة منها للاختبار والتحقق.
وتشمل بيانات «صدى» أكثر من عشر لهجات، إلى جانب ما يزيد على 125 ألف مقطع صوتي جرى تصنيفها وفق لهجة المتحدث، الأمر الذي أتاح لفريق «إنفيديا» اختيار المقاطع الخاصة باللهجتين النجدية والحجازية بدقة لتدريب النموذج.
تعزيز المحتوى العربي بالذكاء الاصطناعي
وتوفر المجموعة للمجتمعين البحثي والأكاديمي إمكانية تطوير نماذج متنوعة للذكاء الاصطناعي الصوتي، تشمل التعرّف الآلي على الكلام، ونطق النصوص، وفصل المتحدثين، إلى جانب تحديد لهجة المتحدث أو جنسه أو عمره، ويأتي نشرها انطلاقًا من أهمية إثراء المحتوى العربي، باعتبار العربية لغة القرآن الكريم ويتحدث بها ملايين الأشخاص حول العالم.
ويُبرز اعتماد إحدى كبرى شركات التقنية في العالم على بيانات «صدى» أهمية البيانات الوطنية عالية الجودة في تقليص الفجوة بين النماذج العالمية واللهجات المحلية، وما يمكن أن تحدثه من أثر مباشر في تحسين جودة تقنيات الذكاء الاصطناعي الموجهة للمستخدم العربي.
يمكنك أيضًا قراءة: السعودية تعزز ريادتها الرقمية بإطلاق مركز ابتكار AI بالشراكة مع NVIDIA
يمكنكم متابعة آخر الأخبار عبر حساب سيدتي على إكس

Google News