ذكاء اصطناعي

الذكاء الاصطناعي باللغة العربية.. هل اقتربنا من نماذج تفهم لهجات المنطقة؟

الذكاء الاصطناعي باللغة العربية يشهد تطورا متسارعا مع ظهور نماذج متخصصة تهدف إلى فهم اللغة وسياقاتها الثقافية

وخلال العامين الأخيرين، انتقل التركيز من دعم العربية الفصحى إلى معالجة تحدٍ أكثر تعقيدا، يتمثل في فهم اللهجات المحلية التي يستخدمها مئات الملايين يوميا، بدءا من اللهجة السعودية والخليجية، مرورا بالمصرية والشامية، وصولا إلى المغربية التي تختلف مفرداتها وتراكيبها بشكل كبير عن الفصحى.

Ai search tech concept, Person use laptop with AI search engine bar for data search optimization by artificial intelligence technology.

العربية.. تحدٍ مختلف

يعد تطوير نماذج لغوية للعربية أكثر تعقيدا مقارنة بلغات أخرى، فالعربية ليست لغة واحدة من الناحية العملية، وإنما منظومة تضم اللغة العربية الفصحى وعشرات اللهجات الإقليمية والمحلية، التي قد تختلف في المفردات والنطق وحتى البنية اللغوية.

ويشير باحثون في ورقة علمية نشرت ضمن أعمال المؤتمر السنوي الثالث والستين لجمعية اللغويات الحاسوبية لعام 2025 إلى أن اللهجات العربية ما تزال ممثلة تمثيلا محدودا في معظم النماذج اللغوية الكبرى، وهو ما دفعهم إلى تطوير معيار أراديس (AraDiCE) لقياس قدرة النماذج على فهم اللهجات والسياق الثقافي العربي، موضحين أن نقص البيانات الخاصة باللهجات منخفضة الموارد لا يزال يمثل أحد أكبر التحديات أمام تطوير ذكاء اصطناعي عربي حقيقي.

ولا يقتصر الأمر على اختلاف الكلمات فقط، بل يمتد إلى الأمثال الشعبية، والتعابير المحلية، والسخرية، والإشارات الثقافية التي يصعب على النماذج العامة تفسيرها إذا لم تُدرَّب عليها بصورة كافية.

من الفصحى إلى اللهجات

حتى وقت قريب، كانت معظم النماذج التجارية تحقق أداء جيدا في العربية الفصحى، لكنها تتراجع عند التعامل مع محادثة عامية طويلة.

كما أعلنت الإمارات في عام 2025 عن نموذج فالكون أرابيك (Falcon Arabic)، الذي طوره مجلس أبحاث التكنولوجيا المتقدمة، مؤكدة أنه بُني اعتمادا على بيانات عربية أصلية تعكس التنوع اللغوي الكامل للعربية، وليس عبر ترجمة بيانات بلغات أخرى، في خطوة تستهدف رفع جودة فهم اللهجات والسياقات المحلية.

وفي السعودية، أصبح نموذج علام حجر الأساس لعدد من الخدمات الذكية العربية، مع توجه واضح نحو تطوير تطبيقات تراعي الخصوصية اللغوية والثقافية للمستخدم العربي.

Person using artificial intelligence AI translation international language global digital app online chat communication futuristic technology system innovation support assistant concept adobe stock

ماذا تقول الاختبارات الحديثة؟

ورغم هذا التقدم، تشير الدراسات الحديثة إلى أن الطريق ما يزال طويلا، ففي دراسة علمية نُشرت هذا العام ضمن ورشة “أبجد إن إل بي” (AbjadNLP)، اختبر الباحثون عددا من النماذج اللغوية على ترجمة وفهم 16 لهجة عربية باستخدام قاعدة بيانات مدار (MADAR) الشهيرة.

وشملت الدراسة نماذج عربية مثل جيس ونايل، إلى جانب نماذج عالمية ومتعددة اللغات، وانتهت إلى أن أداء النماذج تحسن بصورة واضحة مقارنة بالأعوام السابقة، إلا أن التنوع الكبير بين اللهجات لا يزال يمثل تحديا حقيقيا، خصوصا في الترجمة الدقيقة والتعرف على اللهجة الصحيحة وفهم السياق الثقافي المحلي.

كما أظهرت الدراسة أن اختلاف البيانات المستخدمة في تدريب النماذج قد يؤدي إلى تفاوت كبير في النتائج، ما يجعل تقييمها عملية معقدة.

البيانات العنصر الحاسم

ويتفق خبراء الذكاء الاصطناعي على أن جودة النموذج لا تعتمد فقط على حجمه أو عدد معاملاته، بل على جودة البيانات التي تدرب عليها.

فاللهجات العربية تفتقر إلى قواعد بيانات ضخمة ومفتوحة مقارنة باللغة الإنجليزية، كما أن جزءا كبيرا من المحتوى العربي الموجود على الإنترنت مكتوب بالفصحى أو باللهجات بصورة غير معيارية، ما يصعب مهمة جمع بيانات دقيقة ومتوازنة.

ولهذا السبب، تتجه العديد من المؤسسات العربية إلى إنشاء قواعد بيانات محلية تضم محادثات واقعية ونصوصا باللهجات المختلفة، بهدف تدريب نماذج أكثر دقة.

هل نفهم اللهجة أم نقلدها؟

ورغم التحسن الكبير، يميز الباحثون بين “إنتاج” اللهجة و”فهمها”، فقد يستطيع النموذج كتابة جملة باللهجة المصرية أو الخليجية، لكنه قد يخطئ في تفسير معناها عندما تتضمن تعبيرا مجازيا أو سخرية أو إشارة ثقافية.

وفي ورقة بحثية قُدمت ضمن ورشة العمل الدولية الثالثة عشرة حول معالجة اللغة الطبيعية للغات المتشابهة والتنوعات اللغوية واللهجات في المغرب، تمكن باحثون من تكييف نماذج مفتوحة المصدر للتعامل مع 5 لهجات عربية هي المصرية، والمغربية، والفلسطينية، والسعودية، والسورية، مع اختلاف النموذج الأفضل أداء بحسب كل لهجة، وهو ما يعكس استمرار الحاجة إلى تدريب متخصص لكل بيئة لغوية.

وتشير هذه النتائج إلى أن الوصول إلى نموذج عربي واحد يفهم جميع اللهجات بالمستوى نفسه لا يزال هدفا بحثيا أكثر منه واقعا تجاريا.

AI Artificial Intelligence and Education technology concept. A man use laptops, Learn lessons and online webinars successfully in modern digital learning, Courses to develop new skills. E-learning.

مستقبل الذكاء الاصطناعي العربي

يرى متخصصون أن السنوات القليلة المقبلة ستشهد انتقال المنافسة من “دعم العربية” إلى “فهم الهوية اللغوية العربية”، فالمستخدم لم يعد يكتفي بإجابة صحيحة، بل يريد مساعدا رقميا يفهم طريقته في الحديث، ويستوعب اختلاف المصطلحات بين الرياض والقاهرة والدار البيضاء وبيروت، ويستجيب بلغة طبيعية تعكس البيئة المحلية.

لكن النجاح الحقيقي لن يقاس بعدد الكلمات التي يستطيع النموذج إنتاجها باللهجة المحلية، بل بقدرته على فهم السياق الاجتماعي والثقافي الكامن وراء تلك الكلمات، وهو التحدي الذي لا يزال يمثل الحدود الجديدة للذكاء الاصطناعي باللغة العربية.

المصدر: الجزيرة + وكالات

مقالات ذات صلة

زر الذهاب إلى الأعلى