Artículos en profundidad sobre la tecnología que da forma al futuro.

La web pierde su memoria: cómo frenar la decadencia digital

La web pierde millones de páginas cada año. Cómo el link rot amenaza el registro histórico y qué pueden hacer los desarrolladores para evitarlo.

Libros en estanterías interminables que se disuelven en píxeles luminosos en un oscuro salón de biblioteca

En 2014, una investigadora del clima llamada Dra. Maria Chen publicó un conjunto de datos revolucionario sobre el deshielo del Ártico. Lo alojó en los servidores de su universidad, lo enlazó en tres artículos revisados por pares y lo compartió en una docena de listas de correo académicas. En 2019, la universidad migró su infraestructura web. La URL se rompió. El conjunto de datos desapareció. No existía ninguna copia de seguridad en ningún archivo público. Cinco años de trabajo de campo, reducidos a un error 404.

La historia de Chen no es inusual. Es lo normal. La web está perdiendo su memoria a un ritmo alarmante, y la mayoría de nosotros no se da cuenta hasta que necesita algo que ya no está.

Link rot y la erosión silenciosa de la historia web

Los investigadores llaman a esto link rot: el proceso lento e implacable por el que las URL dejan de funcionar. Un estudio del Pew Research Center descubrió que aproximadamente el 38 por ciento de las páginas web de 2013 se había vuelto inaccesible en una década. No es un error de redondeo. Es más de un tercio del conocimiento registrado en la web de un solo año, perdido sin más.

Las causas son banales. Las empresas se fusionan y cambian de marca. Las facturas de hosting no se pagan. Los sistemas de gestión de contenidos se reemplazan. Los gobiernos reestructuran sus sitios web después de las elecciones. El autor de un blog fallece y nadie renueva el dominio. Ninguno de estos eventos parece catastrófico por separado. Pero se acumulan. Año tras año, la web se deshace de su pasado como si fuera piel muerta.

Y las consecuencias no son abstractas. Los tribunales han citado URL en sentencias para descubrir meses después que ya no existían. Los periodistas han perdido material de fuentes. Comunidades enteras en línea (sus conversaciones, sus bromas internas, sus obras creativas, su conocimiento colaborativo) se han borrado de la noche a la mañana cuando una plataforma decidió cambiar de rumbo o cerrar. ¿Recuerdas Vine? ¿Google+? ¿El GeoCities original? Cada cierre borró un fragmento de la historia cultural que nunca podrá reconstruirse del todo.

Por qué archivar la web es cada vez más difícil, no más fácil

Uno pensaría que cada vez lo hacemos mejor. El almacenamiento es barato. El ancho de banda abunda. Tenemos herramientas de archivado maduras y organizaciones dedicadas a la preservación. Entonces, ¿por qué el problema empeora?

Dos fuerzas están convergiendo. La primera es técnica. La web moderna es mucho más difícil de archivar que las páginas HTML estáticas de los inicios de internet. Las aplicaciones de una sola página renderizan el contenido completamente con JavaScript. Los sitios basados en APIs no tienen una URL estable que capturar. Los muros de pago, las pasarelas de autenticación y los flujos de contenido personalizado generan páginas que se ven distintas para cada visitante, incluidos los rastreadores de archivo.

La segunda fuerza es política. La explosión de los modelos de lenguaje de gran tamaño ha provocado una reacción contra el rastreo web. Editores y dueños de sitios, preocupados por que su contenido se use para entrenar sistemas de IA sin permiso, han desplegado medidas de bloqueo agresivas. Están actualizando los archivos robots.txt, implementando detección de bots y bloqueando rangos de IP completos asociados con la recolección de datos.

Aquí está el daño colateral: estas medidas rara vez distinguen entre un rastreador comercial de IA y uno de archivo. La Wayback Machine del Internet Archive respeta robots.txt. Cuando un sitio bloquea a todos los bots de forma generalizada, los rastreadores de archivo también quedan fuera. El dueño del sitio quiere evitar el entrenamiento de IA. Lo que consigue en realidad es asegurarse de que ningún registro histórico de su contenido sobreviva.

Bloquear a los rastreadores de archivo para evitar el scraping de IA es como quemar una biblioteca para impedir que alguien fotocopie un libro. La intención se entiende. El daño colateral al registro histórico es enorme.

Internet Archive: bajo presión, pero sigue siendo esencial

Internet Archive es lo más parecido a una biblioteca pública que tiene la web. Su Wayback Machine ha archivado más de 800 000 millones de páginas web desde 1996. Ese número es asombroso, y aun así representa solo una fracción de todo lo publicado en línea.

La organización ha enfrentado serias dificultades. Las batallas legales por su programa de préstamo de Open Library consumieron recursos y atención. El efecto disuasorio más amplio sobre el trabajo de preservación digital ha sido real: otras instituciones observaron esas demandas y se volvieron más cautelosas con lo que estaban dispuestas a archivar.

Pero el mayor desafío es simplemente la escala. La web crece más rápido de lo que cualquier organización puede capturarla. Y el cambio hacia aplicaciones dinámicas y muy cargadas de JavaScript significa que el rastreo tradicional captura cada vez menos de lo que los usuarios realmente ven. Un rastreador que descarga el HTML bruto de una aplicación React obtiene un div vacío y un paquete de JavaScript, no el artículo, ni las imágenes, ni los elementos interactivos.

  • Las aplicaciones renderizadas en el cliente requieren navegadores headless para capturar instantáneas significativas
  • El contenido impulsado por APIs a menudo no tiene una URL estable y rastreable
  • El contenido multimedia (vídeo, podcasts, visualizaciones interactivas) exige enfoques de preservación especializados
  • La tasa de crecimiento del contenido web supera con creces la capacidad de rastreo de cualquier organización
  • La incertidumbre legal hace que las instituciones duden en archivar de forma agresiva

Esto no es una razón para renunciar a los archivos centralizados. Es una razón para dejar de depender solo de ellos.

Herramientas de archivado web autoalojadas que todo desarrollador debería conocer

La buena noticia: no necesitas ser una institución para archivar la web. Un ecosistema creciente de herramientas de código abierto hace práctico que personas y equipos pequeños ejecuten su propia infraestructura de archivo. Algunas de estas herramientas son sorprendentemente potentes.

ArchiveBox es la estrella para uso personal. Es una herramienta autoalojada que toma URL y las guarda en varios formatos: HTML, PDF, captura de pantalla, WARC y más. Pásale los marcadores de tu navegador, un feed RSS o una lista de URL en texto plano, y creará un archivo local navegable. Configurarlo lleva unos minutos:

# Set up ArchiveBox with Docker
docker pull archivebox/archivebox
mkdir -p ~/web-archive && cd ~/web-archive
docker run -v $PWD:/data -it archivebox/archivebox init --setup
# Archive some URLs
docker run -v $PWD:/data -it archivebox/archivebox add \
'https://example.com/important-report' \
'https://example.org/research-dataset'
# Launch the web UI to browse your archive
docker run -v $PWD:/data -p 8000:8000 archivebox/archivebox server 0.0.0.0:8000

Para capturar sitios muy cargados de JavaScript, Webrecorder toma un enfoque distinto. En lugar de rastrear, graba tu sesión real del navegador: cada petición de red, cada elemento cargado dinámicamente, cada interacción. El resultado es una captura de alta fidelidad guardada en formato WARC o WACZ que puede reproducirse en el navegador con ReplayWeb.page. Es la diferencia entre fotografiar un edificio y crear un recorrido 3D completo.

Browsertrix, también del proyecto Webrecorder, lleva este enfoque a otra escala. Es un sistema de rastreo nativo de la nube que usa instancias reales de navegador para renderizar y capturar páginas. Universidades, bibliotecas y agencias gubernamentales lo usan para ejecutar programas de archivado institucional. Si necesitas archivar miles de páginas con renderizado completo de JavaScript, Browsertrix es la herramienta adecuada.

Cómo integrar la preservación en tu flujo de trabajo de desarrollo

No necesitas montar un sistema de archivado completo para marcar la diferencia. Las pequeñas decisiones sobre cómo construyes y despliegas sitios web tienen un impacto enorme en si el contenido puede preservarse. Esto es lo que realmente importa.

Primero, diseña pensando en el archivado. Usa URL estables y legibles por humanos. No ates la estructura de tus URL a IDs de base de datos ni a tokens de sesión. Asegúrate de que el contenido crítico esté presente en la respuesta HTML inicial, y no cargado íntegramente con JavaScript del lado del cliente después de la carga de la página. Si estás construyendo una aplicación de una sola página, ofrece renderizado en el servidor o generación estática como alternativa. Estas no son solo buenas prácticas para el archivado. También lo son para el SEO, la accesibilidad y el rendimiento.

Segundo, sé quirúrgico con tu robots.txt. Si quieres bloquear los rastreadores que entrenan IA, bloquéalos por nombre. No eches una manta sobre todos los bots que visitan tu sitio.

# robots.txt — block AI crawlers, welcome archival bots
# Explicitly allow archival crawlers
User-agent: ia_archiver
Allow: /
User-agent: archive.org_bot
Allow: /
# Block specific AI training crawlers
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Default: allow everything else
User-agent: *
Allow: /

No es un sistema perfecto, porque las cadenas de user agent pueden falsificarse, pero es un esfuerzo de buena fe que mantiene abierta la puerta a la preservación legítima mientras la cierra al entrenamiento no deseado.

Tercero, automatiza tus envíos al archivo. Cada vez que publiques algo, envíalo a la Wayback Machine. Esto requiere unas pocas líneas de código y puede integrarse en cualquier pipeline de CI/CD o en un hook posterior a la publicación:

import requests
import time
def archive_url(url: str, retries: int = 3) -> str:
"""Submit a URL to the Wayback Machine's Save Page Now endpoint."""
save_url = f"https://web.archive.org/save/{url}"
for attempt in range(retries):
try:
resp = requests.get(save_url, timeout=30)
if resp.status_code == 200:
location = resp.headers.get("Content-Location", resp.url)
return f"Archived: https://web.archive.org{location}"
except requests.RequestException:
if attempt < retries - 1:
time.sleep(2 ** attempt)
return f"Failed to archive {url} after {retries} attempts"
# Wire this into your publish script
new_post = "https://yourblog.com/posts/new-article"
print(archive_url(new_post))

La lógica de reintentos importa. El endpoint de guardado de la Wayback Machine recibe muchísimas peticiones, y los fallos transitorios son frecuentes. Un poco de resiliencia ayuda mucho.

Entender WARC: el formato de archivo detrás de los archivos web

Si vas a trabajar con archivos web, necesitas entender WARC. Es el formato de archivo estándar ISO que usan el Internet Archive, Webrecorder y la mayoría de herramientas de archivado serias. Piensa en un archivo WARC como una grabación completa de cada petición y respuesta HTTP que intervienen al cargar una página: el HTML, las hojas de estilo, los scripts, las imágenes, las llamadas a APIs. Todo.

Esa completitud es lo que hace posible la reproducción. Un archivo WARC no solo almacena el HTML bruto: guarda todo el contexto necesario para reconstruir la página tal como se veía en el momento de la captura. Así se lee uno de forma programática:

from warcio.archiveiterator import ArchiveIterator
def inspect_warc(filepath: str):
"""List all HTTP responses captured in a WARC file."""
with open(filepath, "rb") as stream:
for record in ArchiveIterator(stream):
if record.rec_type == "response":
url = record.rec_headers.get_header("WARC-Target-URI")
status = record.http_headers.get_statuscode()
content_type = record.http_headers.get_header("Content-Type")
print(f"[{status}] {url} ({content_type})")
inspect_warc("my-archive.warc.gz")

El formato WACZ, más nuevo, se basa en WARC y añade una capa de índice y metadatos dentro de un contenedor ZIP. El beneficio práctico es enorme: los archivos WACZ pueden abrirse directamente en el navegador con ReplayWeb.page, sin necesidad de infraestructura de servidor. Puedes enviar un archivo WACZ por correo y la otra persona podrá navegar el sitio archivado de inmediato. Es el tipo de acceso sin fricción que hace que la preservación sea realmente útil, y no solo técnicamente posible.

Archivado comunitario y la red de seguridad de los voluntarios

Parte del trabajo de preservación más espectacular ocurre en modo crisis. Cuando una plataforma anuncia que cerrará, un grupo de voluntarios llamado ArchiveTeam entra en acción. Han rescatado contenido de GeoCities, Vine, Google+ y decenas de servicios más pequeños. Su método es simple: inundar la plataforma condenada con peticiones de archivado antes de que los servidores se apaguen, guardar todo en formato WARC y subirlo al Internet Archive para acceso público.

Cualquiera puede contribuir. Warrior, la herramienta de ArchiveTeam, es un dispositivo virtual que ejecutas en tu propio hardware. Se conecta a sus servidores de coordinación, recoge tareas de archivado y aporta tu ancho de banda y tu capacidad de procesamiento a cualquier operación de rescate en curso. Es el archivado distribuido en su forma más de base.

Pero los rescates de emergencia son el último recurso. El objetivo real es que la preservación sea rutinaria. Las comunidades de dominios específicos están asumiendo cada vez más este papel: proyectos de código abierto que archivan sus listas de correo y sus gestores de incidencias, grupos de patrimonio cultural que preservan recursos de lenguas indígenas, organizaciones periodísticas que mantienen archivos de su trabajo de investigación. Las herramientas existen. La parte más difícil es sostener, año tras año, la coordinación humana y la financiación necesarias para que estos esfuerzos sigan en marcha.

Un kit práctico de preservación digital

Si has llegado hasta aquí y quieres pasar a la acción, este es tu kit inicial. Son las herramientas más maduras y mejor mantenidas para archivar la web a cualquier escala.

  • ArchiveBox: archivado personal autoalojado. Guarda páginas en HTML, PDF, WARC y capturas de pantalla. Ideal para preservar tu propia investigación y tus referencias.
  • Browsertrix: rastreo basado en navegador a escala institucional. Usa instancias reales de navegador para renderizar JavaScript por completo.
  • Webrecorder: graba tu sesión del navegador para una captura interactiva de alta fidelidad. Genera archivos WARC/WACZ.
  • ReplayWeb.page: reproduce archivos WARC/WACZ directamente en el navegador. No necesita servidor.
  • SingleFile: extensión de navegador que guarda una página web completa como un único archivo HTML autocontenido. Súper sencillo.
  • warcio: biblioteca de Python para leer, escribir y procesar archivos WARC de forma programática.
  • Heritrix: el rastreador de código abierto del Internet Archive. De nivel industrial, con una curva de aprendizaje empinada.
  • ArchiveTeam Warrior: dispositivo virtual para unirte a proyectos distribuidos de archivado voluntario.
  • APIs de la Wayback Machine: acceso programático para enviar y recuperar páginas archivadas.
  • Conifer: servicio gestionado de archivado web para personas y equipos pequeños que no quieren autoalojar nada.

La web no se preservará sola

Existe un mito persistente de que internet nunca olvida. Sí olvida, y constantemente. La web se parece más a un río que a una biblioteca: el contenido fluye por ella y, a menos que alguien capture deliberadamente una instantánea, desaparece en cuanto la fuente se seca.

Los desarrolladores tenemos una cantidad inusual de influencia aquí. Escribimos los archivos robots.txt. Diseñamos los esquemas de URL. Decidimos si renderizamos en el servidor o en el cliente. Construimos los pipelines de despliegue que, con unas pocas líneas de código extra, podrían enviar cada página nueva a un archivo público. No son actos heroicos. Son decisiones técnicas pequeñas que resultan determinar si la historia de la web sobrevive.

El conjunto de datos de la Dra. Chen sigue perdido. Ningún archivo lo capturó antes de que la URL se rompiera. Pero cada día alguien publica algo que importa: una pieza de periodismo de investigación, un conjunto de datos científicos, un hilo de un foro comunitario que se citará durante años. La pregunta no es si ese contenido acabará desapareciendo. Lo hará. La pregunta es si alguien habrá guardado una copia antes.