Artículos en profundidad sobre la tecnología que da forma al futuro.

Traducción automática y los idiomas de bajos recursos

Por qué traducir entre más de 1.600 idiomas es mucho más difícil que la TA centrada en inglés, y cómo los nuevos enfoques están cerrando la brecha.

Estante con libros bien iluminados junto a cientos de volúmenes que se desvanecen en la oscuridad

En la Tierra se hablan unos 7.000 idiomas. Google Translate admite alrededor de 130 de ellos. La mayoría de los sistemas comerciales de TA manejan bien menos de 30. Si hablas yoruba, quechua o jemer, tu experiencia con la traducción automática va desde « apenas utilizable » hasta « graciosamente incorrecta ». La verdad incómoda es que gran parte del progreso del PLN en la última década ha estado centrado en el inglés, y la brecha entre los idiomas de muchos y pocos recursos se está ampliando, no reduciendo.

El reciente impulso de Meta hacia la traducción automática omnilingüe, que abarca más de 1.600 idiomas, es uno de los intentos más ambiciosos por cambiar esta situación. Pero los desafíos técnicos que implica revelan supuestos profundos incorporados en la forma en que construimos modelos de lenguaje, y por qué simplemente escalar no resuelve el problema.

Qué hace que un idioma sea de « bajos recursos »

En la investigación de TA, un par de idiomas de « altos recursos » significa que tienes millones de oraciones paralelas: texto traducido profesionalmente entre los dos idiomas. Español–francés, inglés–chino, inglés–español: estos pares cuentan con corpus paralelos enormes provenientes del Parlamento Europeo, la ONU, medios de comunicación y décadas de traducción profesional. Los modelos entrenados con estos pares funcionan notablemente bien.

Un idioma de « bajos recursos » puede tener unos pocos miles de oraciones paralelas, o ninguna. El fon (hablado por unos 2 millones de personas en Benín) prácticamente no tiene datos paralelos con el inglés. El bambara (hablado por unos 14 millones de personas en Malí) tiene algo más, pero sigue siendo órdenes de magnitud menos de lo que necesitan los sistemas de TA convencionales. Para muchos idiomas, el mayor corpus de texto disponible es una traducción de la Biblia y quizás algunos artículos de Wikipedia.

La brecha de recursos no es solo cuestión de volumen de datos, sino de diversidad. Incluso cuando existe texto paralelo para un idioma de bajos recursos, tiende a concentrarse en textos religiosos o documentos gubernamentales. El modelo aprende a traducir prosa formal y repetitiva, pero se desmorona con la conversación casual, la terminología técnica o cualquier cosa que se salga del dominio estrecho con el que fue entrenado.

Por qué no puedes salir de este problema solo escalando

La intuición en el ML moderno es: más datos, modelos más grandes, mejores resultados. Esto ha funcionado espectacularmente para tareas centradas en el inglés. Los modelos de estilo GPT entrenados con billones de tokens en inglés producen texto notablemente fluido. Pero este enfoque tiene tres modos de fallo críticos para la TA de bajos recursos.

  • Simplemente no existen los datos. No puedes extraer de internet texto paralelo fon–inglés si nadie ha publicado nunca cantidades significativas de él. El web scraping, que alimenta la mayoría de los conjuntos de entrenamiento de TA a gran escala, está inherentemente sesgado hacia los idiomas con una fuerte presencia en internet.
  • La tokenización se rompe. La mayoría de los modelos de lenguaje usan tokenizadores entrenados principalmente con inglés (o con un puñado de idiomas de altos recursos). Cuando pasas texto en escritura amárica o en birmano por un tokenizador BPE entrenado en inglés, los caracteres se fragmentan en secuencias de tokens absurdamente largas. Una sola palabra en amárico puede consumir entre 8 y 12 tokens. Esto significa que el modelo usa la mayor parte de su ventana de contexto solo para codificar la entrada, dejando poca capacidad para entenderla de verdad.
  • El aprendizaje por transferencia tiene límites. Los modelos multilingües como mBERT o XLM-R demuestran que entrenar con muchos idiomas puede ayudar a los de bajos recursos, porque el modelo capta similitudes estructurales. Pero esta transferencia es más fuerte entre idiomas emparentados. Un modelo que conoce bien el francés puede transferir parte de ese conocimiento al criollo haitiano. Casi no transfiere nada al mandarín o al navajo.

El problema del idioma pivote

La mayoría de los sistemas de TA que dicen manejar cientos de idiomas en realidad hacen pasar todo por el inglés. ¿Quieres traducir del suajili al tailandés? El sistema traduce suajili → inglés → tailandés. Este enfoque « pivote » es práctico, porque solo necesitas construir modelos de traducción hacia y desde el inglés, pero introduce errores que se acumulan y una forma sutil de aplanamiento cultural.

Cuando pivotas por el inglés, pierdes conceptos que no se corresponden limpiamente con este idioma. El japonés tiene varios niveles de cortesía codificados en las formas verbales. El yoruba tiene distinciones tonales que cambian el significado. El tamil distingue entre un « nosotros » inclusivo y uno exclusivo (según si el oyente está incluido). Cuando estas distinciones pasan por el cuello de botella del inglés, la información se pierde, porque el inglés no las codifica y el modelo no tiene forma de conservarlas.

La traducción directa entre pares de idiomas que no son el inglés, como suajili directamente a tailandés sin el rodeo por el inglés, conserva más información. Pero construir modelos de traducción directos para cada par posible es combinatoriamente imposible. Con 1.600 idiomas, necesitarías 2,56 millones de pares de traducción dirigidos. Incluso si solo cubres directamente los 100 idiomas más hablados, siguen siendo 9.900 pares.

En qué se diferencian los enfoques modernos

La generación actual de modelos de TA masivamente multilingües adopta un enfoque fundamentalmente distinto a la estrategia pivote. En lugar de construir modelos separados para cada par de idiomas, entrenan un único modelo que aprende una representación compartida de todos los idiomas a la vez. Las innovaciones clave se agrupan en algunas categorías.

Tokenización independiente del idioma

El problema del tokenizador se está abordando entrenando tokenizadores con corpus multilingües equilibrados, en lugar de corpus cargados hacia el inglés. El enfoque de Meta usa un mecanismo de respaldo a nivel de carácter que evita que algún idioma tenga secuencias de tokens patológicamente largas. Los modelos SentencePiece entrenados con un equilibrio explícito entre idiomas producen una tokenización mucho más equitativa: una oración en yoruba y una en inglés de significado similar consumen aproximadamente el mismo número de tokens.

Esto importa más de lo que parece. Si tu tokenizador es 4 veces menos eficiente para el idioma X, tu modelo tiene, en la práctica, 4 veces menos capacidad para procesar ese idioma. Arreglar la tokenización es la mejora de mayor impacto para el rendimiento en idiomas de bajos recursos.

Extraer datos paralelos de la web

Una de las contribuciones técnicas más ingeniosas es la minería automatizada de datos paralelos. La idea: entrenar un codificador de oraciones multilingüe que proyecte oraciones de cualquier idioma a un espacio de embeddings compartido. Luego se rastrea la web y se buscan oraciones en distintos idiomas que se proyecten a vectores similares: es probable que sean traducciones entre sí.

Esta técnica, pionera en herramientas como LASER y ampliada en trabajos más recientes, ha extraído cientos de millones de oraciones paralelas de rastreos web como CCNet y OSCAR. Es ruidosa, quizás entre el 20 y el 30 % de los pares extraídos son realmente paralelos, pero los filtros heurísticos mejoran la precisión y el enorme volumen compensa el ruido. Para algunos idiomas, esta minería automatizada ha producido más datos paralelos que todos los conjuntos curados por humanos anteriores juntos.

Retrotraducción y autoentrenamiento

La retrotraducción consiste en usar tu modelo de TA existente (imperfecto) para traducir texto monolingüe al idioma objetivo, y luego usar esos pares paralelos sintéticos para entrenar un modelo mejor. Es un proceso de arranque autosuficiente, y funciona sorprendentemente bien.

El ciclo sigue este orden: entrenar un modelo inicial con los datos paralelos que existan → usarlo para traducir datos monolingües → filtrar las malas traducciones → reentrenar con los datos reales y sintéticos combinados → repetir. Cada iteración mejora el modelo, que produce mejores datos sintéticos, lo que a su vez mejora la siguiente iteración. Para idiomas en los que partes de solo unas pocas miles de oraciones paralelas, la retrotraducción puede multiplicar efectivamente tus datos de entrenamiento entre 10 y 50 veces.

# Simplified back-translation loop
def back_translate_cycle(model, parallel_data, monolingual_target, rounds=3):
for round in range(rounds):
# Generate synthetic source from monolingual target text
synthetic_pairs = []
for target_sent in monolingual_target:
source_sent = model.translate(target_sent, direction='reverse')
score = model.score_pair(source_sent, target_sent)
if score > QUALITY_THRESHOLD:
synthetic_pairs.append((source_sent, target_sent))
# Combine real and synthetic data
combined = parallel_data + synthetic_pairs
# Retrain model on combined data
model = train_mt_model(combined)
print(f'Round {round+1}: {len(synthetic_pairs)} synthetic pairs added')
print(f'BLEU score: {evaluate(model, test_set)}')
return model

La evaluación es más difícil de lo que parece

Las puntuaciones BLEU, la métrica estándar de calidad en TA, tienen problemas serios con los idiomas de bajos recursos. BLEU mide el solapamiento de n-gramas entre la salida del modelo y una traducción de referencia. Funciona razonablemente bien con el inglés porque tiene un orden de palabras relativamente fijo y una morfología limitada. Pero en idiomas aglutinantes como el turco o el finés, donde una sola palabra puede expresar lo que el inglés expresa con una frase completa, BLEU penaliza traducciones válidas que usan formas morfológicas distintas.

Además está el problema de la referencia: ¿quién escribe las traducciones de referencia contra las que evalúas? Para los idiomas de altos recursos, hay traductores profesionales. Para muchos idiomas de bajos recursos, las traducciones « estándar de oro » las produjeron misioneros, traductores gubernamentales que trabajan en registros formales o estudiantes de posgrado. Estas referencias pueden ser técnicamente correctas pero poco naturales en el estilo, y un modelo que produce traducciones más naturales puntúa en realidad más bajo.

Métricas más recientes como COMET y BLEURT usan modelos neuronales para estimar la calidad de la traducción y se correlacionan mejor con los juicios humanos. Pero también se entrenan principalmente con datos de idiomas de altos recursos, así que quizás no generalicen bien a idiomas con estructuras muy distintas. Algunos equipos han empezado a hacer evaluaciones humanas con hablantes nativos para sus pares de idiomas más críticos, pero esto no escala a 1.600 idiomas.

Las dimensiones culturales y éticas

Construir TA para 1.600 idiomas no es solo un desafío de ingeniería. Plantea preguntas sobre quién se beneficia, quién decide cómo se representan los idiomas y qué ocurre cuando los modelos codifican traducciones incorrectas o sesgadas.

En muchas lenguas en peligro, los hablantes principales son miembros mayores de comunidades rurales. No son quienes usan las APIs de traducción automática. Los beneficiarios inmediatos son más probablemente investigadores, ONG y gobiernos, lo que puede ser bueno (mejor acceso a la información) o problemático (vigilancia, asimilación forzada), según el contexto. La TA para lenguas indígenas desarrollada sin la participación de la comunidad tiene un historial conflictivo.

También está la cuestión de la estandarización lingüística. Muchos idiomas de bajos recursos tienen una variación dialectal considerable y ninguna forma « estándar » única. Cuando un modelo de TA elige un dialecto como canónico (normalmente, el más representado en los datos de entrenamiento), margina implícitamente a los hablantes de los demás dialectos. Esto no es hipotético: ya ocurre con idiomas mejor dotados de recursos. Los modelos de TA para árabe suelen manejar bien el árabe estándar moderno, pero tienen dificultades con los dialectos egipcio, levantino o del Golfo, que hablan cientos de millones de personas.

Qué significa esto para los desarrolladores

Si estás construyendo software para una audiencia global, el estado de la TA tiene implicaciones prácticas para tu arquitectura y tus decisiones de producto.

  • No asumas que la calidad de la TA es uniforme. Tu app puede usar Google Translate o una API similar para la localización. La calidad para el francés es excelente. Para el amárico, puede ser al límite de lo inutilizable. Prueba con hablantes nativos cada idioma que digas soportar, no solo los diez primeros.
  • Diseña pensando en que la TA fallará. Muestra a los usuarios el texto original junto a las traducciones. Permite que marquen las malas traducciones. No ocultes que el contenido está traducido por máquina: los usuarios lo descubrirán de todos modos, y confiarán menos en ti si fingiste que tenía calidad humana.
  • Ten en cuenta el coste de la tokenización. Si usas modelos de lenguaje (no solo TA) en un contexto multilingüe, ten presente que los idiomas distintos del inglés consumen más tokens. Tu ventana de contexto de 4K cabe bastante menos texto en tailandés o árabe que en inglés. Planifica en consecuencia.
  • Invierte en datos de prueba multilingües. La parte más difícil de dar soporte a idiomas de bajos recursos no es el modelo, sino saber si tu resultado es correcto. Crea relaciones con hablantes nativos que puedan validar la calidad. Las métricas automáticas te darán una falsa sensación de seguridad.

El camino por delante

El impulso hacia la TA omnilingüe es genuinamente emocionante, incluso con todas las salvedades. Hace cinco años, construir un modelo de traducción para un idioma con 10.000 oraciones paralelas habría sido una curiosidad de investigación. Hoy, técnicas como la retrotraducción, la transferencia multilingüe y la minería automatizada de paralelos lo hacen factible: no perfecto, pero utilizable.

Los desafíos que quedan son tanto sociales como técnicos. Obtener datos de entrenamiento para lenguas en peligro requiere alianzas con comunidades, no solo web scraping. Evaluar la calidad a escala exige nuevas métricas y la participación de hablantes nativos. Asegurar que las herramientas de TA realmente sirvan a las comunidades que hablan estos idiomas, en lugar de limitarse a marcar una casilla de cobertura, requiere un compromiso continuo.

Pero la dirección es la correcta. El idioma no debería ser una barrera para acceder a la información, y el hecho de que estemos intentando construir sistemas de traducción para 1.600 idiomas, en lugar de optimizar los mismos 30 una y otra vez, representa un cambio significativo de prioridades. La ingeniería es difícil. El problema de la tokenización por sí solo tardó años en identificarse y abordarse bien. Pero para los miles de millones de personas cuyos idiomas han sido ignorados por la industria tecnológica, este trabajo importa más que otra mejora de una fracción de punto en las puntuaciones BLEU de inglés–francés.