مشكلة اللغات قليلة الموارد في الترجمة الآلية
لماذا تبدو الترجمة بين أكثر من 1600 لغة أصعب بكثير من الترجمة المتمحورة حول الإنجليزية، وكيف تسد الأساليب الجديدة هذه الفجوة.

يُتحدَّث على كوكب الأرض نحو 7000 لغة. تدعم Google Translate حوالي 130 منها، ومعظم أنظمة الترجمة الآلية التجارية تتقن أقل من 30 لغة إتقانًا جيدًا. إذا كنت تتحدث اليوربية أو الكيتشوية أو الخميرية، فتجربتك مع الترجمة الآلية تتراوح بين «بالكاد مفيدة» و«خاطئة إلى حد مضحك». والحقيقة المزعجة أن معظم التقدم في معالجة اللغات الطبيعية خلال العقد الأخير كان يبدأ من الإنجليزية، والفجوة بين اللغات الغنية بالبيانات واللغات الفقيرة بها تتسع ولا تضيق.
تسعى مبادرة Meta الأخيرة نحو الترجمة الآلية «متعددة اللغات بلا حدود»، التي تغطي أكثر من 1600 لغة، إلى تغيير هذا الواقع، وهي من أطموح المحاولات لذلك. لكن التحديات التقنية فيها تكشف افتراضات راسخة في طريقة بناء نماذج اللغة، وتوضح لماذا لا يحل مجرد التوسع في الحجم المشكلة.
ما الذي يجعل اللغة «قليلة الموارد»
في أبحاث الترجمة الآلية، يعني زوج اللغات «الغني بالموارد» أن لديك ملايين الجمل المتوازية، أي نصوص ترجمها محترفون بين اللغتين. أزواج مثل الإنجليزية-الفرنسية، والإنجليزية-الصينية، والإنجليزية-الإسبانية تملك مدونات متوازية ضخمة مصدرها البرلمان الأوروبي والأمم المتحدة والمؤسسات الإخبارية وعقود من الترجمة الاحترافية. والنماذج المدربة على هذه الأزواج تعمل بكفاءة لافتة.
اللغة «الفقيرة بالموارد» قد يتوفر لها بضعة آلاف من الجمل المتوازية، أو لا يتوفر لها شيء. لغة الفون (يتحدثها نحو مليوني شخص في بنين) تكاد تخلو من بيانات متوازية مع الإنجليزية. ولغة البامبارا (يتحدثها نحو 14 مليون شخص في مالي) لديها قدر أكبر قليلًا، لكنه لا يزال أقل بكثير مما تحتاجه أنظمة الترجمة التقليدية. وبالنسبة لكثير من اللغات، يكون أكبر مدوّنة نصية متاحة هي ترجمة للكتاب المقدس وربما بعض مقالات ويكيبيديا.
الفجوة في الموارد لا تتعلق بحجم البيانات فحسب، بل بتنوعها أيضًا. حتى عندما توجد نصوص متوازية للغة فقيرة بالموارد، فإنها تميل إلى التركز في النصوص الدينية أو الوثائق الحكومية. فيتعلم النموذج ترجمة النثر الرسمي والمتكرر، لكنه ينهار أمام الحديث اليومي أو المصطلحات التقنية أو أي شيء يخرج عن النطاق الضيق الذي تدرب عليه.
لماذا لا يكفي التوسع وحده
الغريزة السائدة في تعلم الآلة الحديث هي: بيانات أكثر، ونموذج أكبر، ونتائج أفضل. وقد نجحت هذه المعادلة بشكل لافت في المهام المتمحورة حول الإنجليزية، فنماذج على غرار GPT المدربة على تريليونات الرموز الإنجليزية تنتج نصوصًا طليقة بشكل مدهش. لكن هذا النهج يواجه ثلاثة أنماط فشل حرجة في الترجمة الآلية للغات قليلة الموارد.
- البيانات ببساطة غير موجودة. لا يمكنك استخراج نصوص فون-إنجليزية متوازية من الإنترنت إذا لم ينشر أحد كميات معتبرة منها أصلًا. فالاستخراج من الويب، الذي يغذي معظم مجموعات التدريب الضخمة للترجمة الآلية، منحاز بطبيعته نحو اللغات ذات الحضور الكبير على الإنترنت.
- التقطيع إلى رموز ينهار. معظم نماذج اللغة تستخدم محوّلات رموز مدربة في الغالب على الإنجليزية أو على عدد قليل من اللغات الغنية. وعندما تمرر نصًا أمهريًا أو بورميًا عبر محوّل BPE مدرب على الإنجليزية، فإنه يجزئ الحروف إلى تسلسلات طويلة بشكل مبالغ فيه. قد تستهلك كلمة أمهرية واحدة من 8 إلى 12 رمزًا. وهذا يعني أن النموذج يصرف معظم نافذة السياق الخاصة به على ترميز المدخل، فلا يبقى له قدر كبير من السعة لفهمه فعلًا.
- للتعلم بالنقل حدود. النماذج متعددة اللغات مثل mBERT أو XLM-R تُظهر أن التدريب على لغات كثيرة قد يساعد اللغات الفقيرة، إذ يلتقط النموذج أوجه التشابه البنيوي. لكن هذا النقل يكون أقوى بين اللغات ذات الصلة. فالنموذج الذي يجيد الفرنسية ينقل جزءًا من معرفته إلى الكريولية الهايتية، لكنه لا ينقل تقريبًا أي شيء إلى الماندرين أو النافاجو.
مشكلة الترجمة عبر لغة وسيطة
معظم أنظمة الترجمة الآلية التي تدّعي دعم مئات اللغات تمرر كل شيء عبر الإنجليزية في الواقع. هل تريد ترجمة السواحيلية إلى التايلاندية؟ يترجم النظام من السواحيلية إلى الإنجليزية ثم إلى التايلاندية. هذا النهج «المحوري» عملي، إذ لا تحتاج إلا لبناء نماذج ترجمة من الإنجليزية وإليها، لكنه يدخل أخطاء تتراكم، ونوعًا خفيًا من تسطيح الثقافات.
عندما تمر الترجمة عبر الإنجليزية، تضيع المفاهيم التي لا تتطابق بسهولة مع الإنجليزية. فاليابانية تشفّر مستويات متعددة من الأدب في صيغ الأفعال، واليوربية لها فروق نغمية تغير المعنى، والتاميلية تفرّق بين «نحن» الشاملة للمستمع و«نحن» الحصرية التي تستثنيه. وعندما تعبر هذه الفروق عنق الزجاجة الإنجليزي تضيع، لأن الإنجليزية لا تشفّرها، فلا يملك النموذج وسيلة للحفاظ عليها.
الترجمة المباشرة بين أزواج لغات غير إنجليزية، مثل السواحيلية إلى التايلاندية دون المرور بالإنجليزية، تحافظ على معلومات أكثر. لكن بناء نماذج ترجمة مباشرة لكل زوج ممكن أمر مستحيل من الناحية التوافقية. مع 1600 لغة، ستحتاج إلى 2.56 مليون زوج اتجاهي. وحتى لو اكتفيت بأكثر 100 لغة انتشارًا، فستظل تحتاج إلى 9900 زوج.
كيف تختلف الأساليب الحديثة
يتبع الجيل الحالي من نماذج الترجمة متعددة اللغات الضخمة نهجًا مختلفًا جذريًا عن استراتيجية المحور. فبدلًا من بناء نماذج منفصلة لكل زوج لغات، يدرب نموذجًا واحدًا يتعلم تمثيلًا مشتركًا لجميع اللغات في وقت واحد. وتندرج الابتكارات الرئيسية في عدة فئات.
محوّلات الرموز المستقلة عن اللغة
يجري معالجة مشكلة محوّل الرموز عبر تدريبه على مدونات متعددة اللغات متوازنة، بدلًا من مدونات يغلب عليها الطابع الإنجليزي. تستخدم منهجية Meta آلية احتياطية على مستوى الحروف تضمن ألا تحصل أي لغة على تسلسلات رموز مرضية الطول. ونماذج SentencePiece المدربة مع موازنة صريحة بين اللغات تنتج ترميزًا أكثر إنصافًا، فجملة يوربية وجملة إنجليزية بالمعنى نفسه تستهلكان تقريبًا عددًا متقاربًا من الرموز.
هذا الأمر أهم مما يبدو. إذا كان محوّل الرموز أقل كفاءة بأربع مرات للغة ما، فإن نموذجك يملك فعليًا سعة معالجة أقل بأربع مرات لتلك اللغة. ولذلك فإن إصلاح الترميز هو أعلى تحسين أثرًا على أداء اللغات قليلة الموارد.
استخراج البيانات المتوازية من الويب
من أذكى الإسهامات التقنية استخراج البيانات المتوازية تلقائيًا. الفكرة هي تدريب مشفّر جمل متعدد اللغات يحوّل الجمل من أي لغة إلى فضاء تضمين مشترك. ثم تزحف على الويب وتجد جملًا بلغات مختلفة تقع في متجهات متشابهة، وهذه على الأرجح ترجمات لبعضها.
هذه التقنية، التي ظهرت أولًا في أدوات مثل LASER وتوسعت في أعمال أحدث، استخرجت مئات الملايين من الجمل المتوازية من مجموعات زحف الويب مثل CCNet وOSCAR. وهي مشوّشة، إذ قد يكون 20 إلى 30 بالمئة فقط من الأزواج المستخرجة متوازيًا فعلًا، لكن مرشحات التصفية تحسن الدقة، وحجم البيانات الهائل يعوّض التشويش. وبالنسبة لبعض اللغات، أنتج هذا التنقيب الآلي بيانات متوازية أكثر من كل مجموعات البيانات السابقة المنقّحة بشريًا مجتمعة.
الترجمة العكسية والتدريب الذاتي
الترجمة العكسية تقنية تستخدم فيها نموذج الترجمة الحالي (وهو غير مثالي) لترجمة نص أحادي اللغة إلى اللغة الهدف، ثم تستخدم الأزواج الاصطناعية الناتجة لتدريب نموذج أفضل. إنها عملية تمهيد ذاتي، وتنجح بشكل مفاجئ.
الدورة تسير هكذا: تدريب نموذج أولي على أي بيانات متوازية متوفرة، ثم استخدامه لترجمة بيانات أحادية اللغة، ثم تصفية الترجمات الرديئة، ثم إعادة التدريب على مزيج من البيانات الحقيقية والاصطناعية، ثم التكرار. كل جولة تحسن النموذج، فيُنتج النموذج الأفضل بيانات اصطناعية أفضل، فتحسن الجولة التالية أكثر. وبالنسبة للغات التي تبدأ بضعة آلاف فقط من الجمل المتوازية، يمكن للترجمة العكسية أن تضاعف بيانات التدريب فعليًا بمقدار 10 إلى 50 مرة.
# Simplified back-translation loop
def back_translate_cycle(model, parallel_data, monolingual_target, rounds=3):
for round in range(rounds):
# Generate synthetic source from monolingual target text
synthetic_pairs = []
for target_sent in monolingual_target:
source_sent = model.translate(target_sent, direction='reverse')
score = model.score_pair(source_sent, target_sent)
if score > QUALITY_THRESHOLD:
synthetic_pairs.append((source_sent, target_sent))
# Combine real and synthetic data
combined = parallel_data + synthetic_pairs
# Retrain model on combined data
model = train_mt_model(combined)
print(f'Round {round+1}: {len(synthetic_pairs)} synthetic pairs added')
print(f'BLEU score: {evaluate(model, test_set)}')
return model
التقييم أصعب مما تظن
درجات BLEU، وهي المقياس المعتمد لجودة الترجمة الآلية، تعاني مشكلات جدية مع اللغات قليلة الموارد. فهي تقيس تداخل الـ n-grams بين مخرجات النموذج والترجمة المرجعية. وتعمل بشكل معقول مع الإنجليزية لأن ترتيب كلماتها ثابت نسبيًا وصرفها محدود. أما اللغات الإلصاقية مثل التركية والفنلندية، حيث تحمل كلمة واحدة ما تعبّر عنه الإنجليزية بعبارة كاملة، فإن BLEU يعاقب الترجمات الصحيحة التي تستخدم صيغًا صرفية مختلفة.
وهناك أيضًا مشكلة المرجع: من يكتب الترجمات المرجعية التي تُقاس عليها النتائج؟ بالنسبة للغات الغنية، لدينا مترجمون محترفون. أما كثير من اللغات قليلة الموارد، فقد أُنتجت «المعايير الذهبية» فيها على يد مبشرين، أو مترجمين حكوميين يعملون بلغة رسمية، أو طلاب دراسات عليا. وقد تكون هذه المراجع صحيحة من الناحية الفنية لكنها غير طبيعية أسلوبيًا، والنموذج الذي ينتج ترجمات أكثر طبيعية يحصل في الواقع على درجات أقل.
مقاييس أحدث مثل COMET وBLEURT تستخدم نماذج عصبية لتقدير جودة الترجمة، وترتبط بأحكام البشر بشكل أفضل. لكنها أيضًا مدربة في الغالب على بيانات اللغات الغنية، فقد لا تعمم جيدًا على لغات ذات بنى مختلفة جدًا. وبدأت بعض الفرق تجري تقييمًا بشريًا مع متحدثين أصليين لأهم أزواج اللغات لديها، لكن هذا لا يتوسع ليشمل 1600 لغة.
الأبعاد الثقافية والأخلاقية
بناء الترجمة الآلية لـ1600 لغة ليس تحديًا هندسيًا فحسب. إنه يثير أسئلة حول من يستفيد، ومن يقرر كيف تُمثَّل اللغات، وماذا يحدث عندما تشفّر النماذج ترجمات خاطئة أو متحيزة.
بالنسبة لكثير من اللغات المهددة بالاندثار، يكون متحدثوها الأساسيون من كبار السن في المناطق الريفية. وهم ليسوا من يستخدمون واجهات برمجة الترجمة الآلية. أما المستفيدون المباشرون فهم على الأرجح باحثون ومنظمات غير حكومية وحكومات، وهذا قد يكون جيدًا (وصول أفضل إلى المعلومات)، أو إشكاليًا (مراقبة أو فرض للاستيعاب) بحسب السياق. والترجمة الآلية للغات الشعوب الأصلية التي طُورت دون مشاركة مجتمعاتها لها تاريخ مؤلم.
وهناك أيضًا مسألة توحيد اللغة. كثير من اللغات قليلة الموارد تتسم بتنوع لهجي كبير، ولا يوجد شكل «معياري» واحد لها. وعندما يختار نموذج الترجمة لهجة واحدة كمرجع، عادةً ما تكون الأكثر تمثيلًا في بيانات التدريب، فإنه يهمّش ضمنيًا متحدثي اللهجات الأخرى. وهذا ليس افتراضيًا، بل يحدث بالفعل مع لغات أغنى بالموارد. فنماذج الترجمة للعربية تتعامل عادةً مع العربية الفصحى الحديثة بشكل جيد، لكنها تتعثر مع اللهجات المصرية والشامية والخليجية التي يتحدثها مئات الملايين فعليًا.
ماذا يعني هذا للمطورين
إذا كنت تبني برمجيات تخدم جمهورًا عالميًا، فإن وضع الترجمة الآلية له آثار عملية على قراراتك المعمارية وقرارات المنتج.
- لا تفترض أن جودة الترجمة الآلية متساوية. قد يستخدم تطبيقك Google Translate أو واجهة مشابهة للتعريب. الجودة للفرنسية ممتازة، أما للأمهرية فقد تكون على حافة عدم الصلاحية. اختبر مع متحدثين أصليين لكل لغة تدّعي دعمها، لا أفضل عشر لغات فقط.
- صمّم للتعامل مع فشل الترجمة الآلية بسلاسة. اعرض النص الأصلي إلى جانب الترجمات، واسمح للمستخدمين بالإبلاغ عن الترجمات السيئة. ولا تُخفِ حقيقة أن المحتوى مترجم آليًا، فالمستخدمون سيكتشفون ذلك على أي حال، وسيثقون بك أقل إذا تظاهرت بأنه بجودة بشرية.
- انتبه إلى «ضريبة الرموز». إذا كنت تستخدم نماذج لغوية (لا الترجمة الآلية وحدها) في سياق متعدد اللغات، فاعلم أن اللغات غير الإنجليزية تستهلك رموزًا أكثر. فنافذة السياق البالغة 4 آلاف رمز تتسع لنص تايلاندي أو عربي أقل بكثير مما تتسع له للإنجليزية. خطط لذلك في ميزانيتك.
- استثمر في بيانات اختبار متعددة اللغات. الجزء الأصعب في دعم اللغات قليلة الموارد ليس النموذج، بل معرفة ما إذا كانت مخرجاته صحيحة. ابنِ علاقات مع متحدثين أصليين قادرين على التحقق من الجودة. فالمقاييس الآلية ستضللك.
الطريق إلى الأمام
الدفع نحو الترجمة الآلية الشاملة مثير للحماس حقًا، رغم كل التحفظات. قبل خمس سنوات، كان بناء نموذج ترجمة للغة لديها 10 آلاف جملة متوازية سيبدو فضولًا بحثيًا. أما اليوم، فتقنيات مثل الترجمة العكسية والنقل متعدد اللغات والتنقيب الآلي عن البيانات المتوازية تجعله ممكنًا، وإن لم يكن مثاليًا، فهو قابل للاستخدام.
التحديات المتبقية اجتماعية بقدر ما هي تقنية. الحصول على بيانات تدريب للغات المهددة يتطلب شراكات مع المجتمعات، لا مجرد استخراج من الويب. وتقييم الجودة على نطاق واسع يتطلب مقاييس جديدة ومشاركة متحدثين أصليين. وضمان أن أدوات الترجمة تخدم فعلًا المجتمعات التي تتحدث هذه اللغات، لا أن تكتفي بتحقيق بند في قائمة التغطية، يتطلب تفاعلًا مستمرًا.
لكن الاتجاه صحيح. فاللغة لا ينبغي أن تكون حاجزًا أمام الوصول إلى المعلومات، ومجرد محاولتنا بناء أنظمة ترجمة لـ1600 لغة، بدلًا من تحسين الـ30 نفسها مرارًا، يمثل تحولًا مهمًا في الأولويات. الهندسة صعبة، ومشكلة الترميز وحدها استغرقت سنوات حتى تُحدَّد وتُعالج بشكل صحيح. لكن بالنسبة للمليارات من البشر الذين تجاهلت صناعة التقنية لغاتهم، فإن هذا العمل أهم من مجرد تحسين طفيف آخر في درجات BLEU للترجمة من الإنجليزية إلى الفرنسية.


