Masalah Bahasa Low-Resource dalam Machine Translation
Mengapa menerjemahkan antar 1.600+ bahasa jauh lebih sulit daripada MT berbasis Inggris, dan bagaimana pendekatan baru mulai menutup celahnya.

Ada sekitar 7.000 bahasa yang digunakan di Bumi. Google Translate mendukung sekitar 130 bahasa di antaranya. Kebanyakan sistem MT komersial hanya menangani kurang dari 30 bahasa dengan baik. Kalau kamu berbicara bahasa Yoruba, Quechua, atau Khmer, pengalamanmu dengan machine translation berkisar dari 'hampir tidak bisa dipakai' sampai 'salahnya lucu banget'. Kenyataan yang tidak enak didengar adalah sebagian besar kemajuan NLP selama dekade terakhir berpusat pada bahasa Inggris, dan jurang antara bahasa high-resource dan low-resource makin melebar, bukan menyempit.
Dorongan terbaru Meta menuju machine translation omnilingual, yang mencakup 1.600+ bahasa, adalah salah satu upaya paling ambisius untuk mengubah keadaan ini. Tapi tantangan teknisnya memperlihatkan asumsi mendasar yang tertanam dalam cara kita membangun language model, dan mengapa sekadar menambah skala tidak menyelesaikan masalahnya.
Apa yang Membuat Sebuah Bahasa 'Low-Resource'
Dalam riset MT, pasangan bahasa 'high-resource' berarti kamu punya jutaan kalimat paralel, yaitu teks yang sudah diterjemahkan secara profesional di antara kedua bahasa tersebut. Pasangan Inggris–Prancis, Inggris–Mandarin, dan Inggris–Spanyol punya korpus paralel yang sangat besar, bersumber dari Parlemen Uni Eropa, PBB, organisasi berita, dan puluhan tahun penerjemahan profesional. Model yang dilatih dengan pasangan ini bekerja luar biasa baik.
Bahasa 'low-resource' mungkin hanya punya beberapa ribu kalimat paralel, atau bahkan tidak sama sekali. Bahasa Fon (dituturkan sekitar 2 juta orang di Benin) hampir tidak punya data paralel dengan bahasa Inggris. Bambara (dituturkan sekitar 14 juta orang di Mali) punya sedikit lebih banyak, tapi tetap jauh lebih sedikit dibanding yang dibutuhkan sistem MT konvensional. Untuk banyak bahasa, korpus teks terbesar yang tersedia hanyalah terjemahan Alkitab dan mungkin beberapa artikel Wikipedia.
Kesenjangan sumber daya bukan cuma soal volume data, tapi juga keragamannya. Meskipun teks paralel untuk bahasa low-resource ada, biasanya teks itu terpusat pada naskah keagamaan atau dokumen pemerintah. Modelnya belajar menerjemahkan prosa formal yang repetitif, tapi langsung kewalahan saat menghadapi percakapan santai, istilah teknis, atau apa pun yang menyimpang dari domain sempit tempat ia dilatih.
Mengapa Kamu Tidak Bisa Sekadar Menambah Skala
Naluri di dunia ML modern adalah: data lebih banyak, model lebih besar, hasil lebih baik. Ini terbukti sangat ampuh untuk tugas yang berpusat pada bahasa Inggris. Model bergaya GPT yang dilatih dengan triliunan token bahasa Inggris menghasilkan teks yang sangat lancar. Tapi pendekatan ini punya tiga mode kegagalan kritis untuk MT low-resource.
- Datanya memang tidak ada. Kamu tidak bisa mengambil teks paralel Fon–Inggris dari internet kalau tidak ada yang pernah menerbitkan teks dalam jumlah signifikan. Web scraping, yang menjadi tulang punggung sebagian besar dataset MT berskala besar, secara inheren bias ke bahasa yang punya kehadiran besar di internet.
- Tokenisasi jadi berantakan. Sebagian besar language model memakai tokenizer yang dilatih terutama dengan bahasa Inggris (atau segelintir bahasa high-resource lainnya). Ketika kamu memasukkan teks aksara Amharik atau Burma ke tokenizer BPE yang dilatih dengan bahasa Inggris, karakternya terpecah menjadi urutan token yang panjangnya tidak masuk akal. Satu kata Amharik bisa memakan 8-12 token. Artinya, model menghabiskan sebagian besar context window-nya hanya untuk meng-encode input, dan sisa kapasitas untuk benar-benar memahaminya jadi sangat sedikit.
- Transfer learning punya batas. Model multibahasa seperti mBERT atau XLM-R menunjukkan bahwa melatih dengan banyak bahasa bisa membantu bahasa low-resource, karena model menangkap kemiripan struktural. Tapi transfer ini paling kuat di antara bahasa yang berkerabat. Model yang menguasai bahasa Prancis dengan baik bisa mentransfer sebagian pengetahuannya ke bahasa Kreol Haiti. Untuk bahasa Mandarin atau Navajo, hampir tidak ada yang bisa ditransfer.
Masalah Pivot-Language
Sebagian besar sistem MT yang mengklaim mendukung ratusan bahasa sebenarnya merutekan semuanya lewat bahasa Inggris. Mau menerjemahkan bahasa Swahili ke Thailand? Sistemnya menerjemahkan Swahili → Inggris → Thai. Pendekatan 'pivot' ini praktis, karena kamu hanya perlu membangun model terjemahan dari dan ke bahasa Inggris, tapi konsekuensinya adalah error yang menumpuk dan semacam perataan budaya yang halus.
Saat kamu melakukan pivot lewat bahasa Inggris, kamu kehilangan konsep yang tidak terpetakan dengan rapi ke bahasa Inggris. Bahasa Jepang punya beberapa tingkat kesopanan yang dikodekan dalam bentuk kata kerja. Bahasa Yoruba punya perbedaan nada yang mengubah makna. Bahasa Tamil punya 'kami' yang inklusif dan eksklusif (apakah lawan bicara termasuk atau tidak). Ketika hal-hal ini melewati bottleneck bahasa Inggris, informasinya hilang, karena bahasa Inggris tidak mengodekan pembedaan tersebut dan model tidak punya cara untuk mempertahankannya.
Penerjemahan langsung antar pasangan bahasa non-Inggris, misalnya Swahili langsung ke Thai tanpa memutar lewat bahasa Inggris, mempertahankan lebih banyak informasi. Tapi membangun model terjemahan langsung untuk setiap pasangan yang mungkin itu mustahil secara kombinatorial. Dengan 1.600 bahasa, kamu butuh 2,56 juta pasangan terjemahan berarah. Bahkan jika kamu hanya menangani 100 bahasa yang paling banyak digunakan secara langsung, tetap saja ada 9.900 pasangan.
Bagaimana Pendekatan Modern Berbeda
Generasi model MT multibahasa skala besar saat ini mengambil pendekatan yang secara fundamental berbeda dari strategi pivot. Alih-alih membangun model terpisah untuk setiap pasangan bahasa, mereka melatih satu model tunggal yang mempelajari representasi bersama untuk semua bahasa secara bersamaan. Inovasi utamanya terbagi dalam beberapa kategori.
Tokenisasi yang Agnostik Bahasa
Masalah tokenizer mulai ditangani dengan melatih tokenizer pada korpus multibahasa yang seimbang, bukan korpus yang didominasi bahasa Inggris. Pendekatan Meta memakai character-level fallback yang memastikan tidak ada bahasa yang mendapat urutan token yang secara patologis panjang. Model SentencePiece yang dilatih dengan penyeimbangan bahasa secara eksplisit menghasilkan tokenisasi yang jauh lebih adil. Kalimat Yoruba dan kalimat Inggris dengan makna yang mirip kira-kira memakan jumlah token yang setara.
Ini lebih penting dari kelihatannya. Kalau tokenizer kamu 4x kurang efisien untuk bahasa X, model kamu secara efektif punya kapasitas 4x lebih kecil untuk memproses bahasa tersebut. Memperbaiki tokenisasi adalah peningkatan dengan leverage tertinggi untuk performa bahasa low-resource.
Menambang Data Paralel dari Internet Liar
Salah satu kontribusi teknis paling cerdas adalah automated parallel data mining. Idenya: latih sentence encoder multibahasa yang memetakan kalimat dari bahasa apa pun ke dalam ruang embedding bersama. Lalu crawl web dan cari kalimat dalam bahasa berbeda yang dipetakan ke vektor yang mirip. Kalimat-kalimat ini kemungkinan besar adalah terjemahan satu sama lain.
Teknik ini dipelopori oleh alat seperti LASER dan diperluas dalam riset yang lebih baru. Teknik ini sudah mengekstrak ratusan juta kalimat paralel dari web crawl seperti CCNet dan OSCAR. Hasilnya berisik, mungkin 20-30% pasangan yang diekstrak benar-benar paralel, tapi heuristik filter meningkatkan presisi, dan volumenya yang besar mengimbangi noise tersebut. Untuk beberapa bahasa, penambangan otomatis ini sudah menghasilkan data paralel lebih banyak daripada semua dataset kurasi manusia sebelumnya digabung.
Back-Translation dan Self-Training
Back-translation adalah teknik ketika kamu memakai model MT yang sudah ada (dan masih belum sempurna) untuk menerjemahkan teks monolingual ke bahasa target, lalu menggunakan pasangan paralel sintetis itu untuk melatih model yang lebih baik. Ini bootstrapping, dan hasilnya mengejutkan bagus.
Siklusnya begini: latih model awal dengan data paralel yang ada → gunakan untuk menerjemahkan data monolingual → saring terjemahan yang buruk → latih ulang dengan gabungan data asli dan sintetis → ulangi. Setiap iterasi memperbaiki model, yang menghasilkan data sintetis lebih baik, yang kemudian meningkatkan iterasi berikutnya. Untuk bahasa yang awalnya hanya punya beberapa ribu kalimat paralel, back-translation bisa melipatgandakan data latih secara efektif hingga 10-50 kali.
# Simplified back-translation loop
def back_translate_cycle(model, parallel_data, monolingual_target, rounds=3):
for round in range(rounds):
# Generate synthetic source from monolingual target text
synthetic_pairs = []
for target_sent in monolingual_target:
source_sent = model.translate(target_sent, direction='reverse')
score = model.score_pair(source_sent, target_sent)
if score > QUALITY_THRESHOLD:
synthetic_pairs.append((source_sent, target_sent))
# Combine real and synthetic data
combined = parallel_data + synthetic_pairs
# Retrain model on combined data
model = train_mt_model(combined)
print(f'Round {round+1}: {len(synthetic_pairs)} synthetic pairs added')
print(f'BLEU score: {evaluate(model, test_set)}')
return model
Evaluasi Lebih Sulit dari yang Kamu Kira
Skor BLEU, metrik standar untuk kualitas MT, punya masalah serius untuk bahasa low-resource. BLEU mengukur overlap n-gram antara output model dan terjemahan referensi. Metrik ini cukup berfungsi untuk bahasa Inggris karena urutan katanya relatif tetap dan morfologinya terbatas. Tapi untuk bahasa aglutinatif seperti Turki atau Finlandia, di mana satu kata bisa memuat apa yang dalam bahasa Inggris butuh satu frasa penuh, BLEU menghukum terjemahan yang valid hanya karena memakai bentuk morfologi yang berbeda.
Ada juga masalah referensi: siapa yang menulis terjemahan referensi yang dipakai untuk evaluasi? Untuk bahasa high-resource, kamu punya penerjemah profesional. Untuk banyak bahasa low-resource, 'standar emas' terjemahan referensinya dibuat oleh misionaris, penerjemah pemerintah yang bekerja dengan register formal, atau mahasiswa pascasarjana. Referensi ini mungkin benar secara teknis tapi terasa tidak alami secara gaya, dan model yang menghasilkan terjemahan yang lebih alami justru mendapat skor lebih rendah.
Metrik yang lebih baru seperti COMET dan BLEURT memakai model neural untuk memperkirakan kualitas terjemahan dan lebih berkorelasi dengan penilaian manusia. Tapi keduanya juga dilatih terutama dengan data bahasa high-resource, sehingga mungkin tidak generalisasi dengan baik ke bahasa yang strukturnya sangat berbeda. Beberapa tim sudah mulai melakukan evaluasi manusia dengan penutur asli untuk pasangan bahasa yang paling kritis, tapi cara ini tidak bisa diskalakan ke 1.600 bahasa.
Dimensi Budaya dan Etika
Membangun MT untuk 1.600 bahasa bukan sekadar tantangan rekayasa. Ini menimbulkan pertanyaan tentang siapa yang diuntungkan, siapa yang memutuskan bagaimana bahasa direpresentasikan, dan apa yang terjadi ketika model mengodekan terjemahan yang salah atau bias.
Untuk banyak bahasa yang terancam punah, penuturnya utamanya adalah anggota komunitas lansia di pedesaan. Mereka bukan orang yang menggunakan API machine translation. Penerima manfaat langsungnya lebih mungkin adalah peneliti, NGO, dan pemerintah, yang bisa menjadi baik (akses informasi yang lebih mudah) atau bermasalah (pengawasan, asimilasi paksa), tergantung konteksnya. MT untuk bahasa Adat yang dikembangkan tanpa masukan komunitas punya sejarah yang kelam.
Ada juga pertanyaan soal standardisasi bahasa. Banyak bahasa low-resource punya variasi dialek yang signifikan dan tidak punya bentuk 'standar' tunggal. Ketika model MT memilih satu dialek sebagai kanonik (biasanya yang paling banyak terwakili dalam data latih), model itu secara implisit meminggirkan penutur dialek lain. Ini bukan hipotetis, dan sudah terjadi pada bahasa yang sumber dayanya lebih baik. Model MT bahasa Arab biasanya menangani Arab Standar Modern dengan baik, tapi kesulitan dengan dialek Mesir, Levant, atau Teluk yang sebenarnya dipakai oleh ratusan juta orang.
Apa Artinya untuk Developer
Kalau kamu membangun software untuk audiens global, kondisi MT saat ini punya implikasi praktis untuk keputusan arsitektur dan produk kamu.
- Jangan asumsikan kualitas MT itu seragam. Aplikasimu mungkin memakai Google Translate atau API serupa untuk lokalisasi. Kualitasnya untuk bahasa Prancis sangat bagus. Untuk bahasa Amharik, hasilnya bisa mendekati tidak bisa dipakai. Uji dengan penutur asli untuk setiap bahasa yang kamu klaim dukung, bukan hanya 10 teratas.
- Rancang untuk kegagalan MT dengan elegan. Tampilkan teks asli di samping terjemahan. Biarkan pengguna menandai terjemahan yang buruk. Jangan sembunyikan fakta bahwa konten diterjemahkan mesin, karena pengguna akan tahu juga, dan mereka akan lebih tidak percaya padamu kalau kamu berpura-pura itu kualitas manusia.
- Perhatikan pajak tokenisasi. Kalau kamu memakai language model (bukan hanya MT) dalam konteks multibahasa, sadari bahwa bahasa non-Inggris memakan lebih banyak token. Context window 4K kamu menampung teks Thai atau Arab yang jauh lebih sedikit dibanding bahasa Inggris. Atur anggarannya dengan sesuai.
- Investasikan pada data uji multibahasa. Bagian tersulit dalam mendukung bahasa low-resource bukanlah modelnya, melainkan mengetahui apakah output-mu benar. Bangun hubungan dengan penutur asli yang bisa memvalidasi kualitas. Metrik otomatis akan menyesatkanmu.
Jalan ke Depan
Dorongan menuju MT omnilingual memang sangat menarik, meskipun ada banyak catatan. Lima tahun lalu, membangun model terjemahan untuk bahasa dengan 10.000 kalimat paralel masih dianggap sebatas penelitian iseng. Hari ini, teknik seperti back-translation, transfer multibahasa, dan penambangan paralel otomatis membuatnya layak dilakukan. Memang belum sempurna, tapi sudah bisa dipakai.
Tantangan yang tersisa sama sosialnya dengan teknisnya. Mendapatkan data latih untuk bahasa yang terancam punah membutuhkan kemitraan dengan komunitas, bukan sekadar web scraping. Mengevaluasi kualitas dalam skala besar membutuhkan metrik baru dan keterlibatan penutur asli. Memastikan bahwa alat MT benar-benar melayani komunitas yang berbicara bahasa-bahasa ini, bukan sekadar mencentang kotak cakupan, membutuhkan keterlibatan yang berkelanjutan.
Tapi arahnya sudah benar. Bahasa seharusnya tidak menjadi penghalang untuk mengakses informasi, dan kenyataan bahwa kita sekarang mencoba membangun sistem terjemahan untuk 1.600 bahasa, alih-alih terus mengoptimalkan 30 bahasa yang sama berulang kali, mewakili pergeseran prioritas yang berarti. Rekayasanya memang sulit. Masalah tokenisasi saja butuh bertahun-tahun untuk diidentifikasi dan ditangani dengan benar. Tapi bagi miliaran orang yang bahasanya selama ini diabaikan industri teknologi, pekerjaan ini jauh lebih penting daripada peningkatan seperseratus persen lagi pada skor BLEU English–French.


