SEO17/08/20266 min lectura

Tu LLM corrompe documentos: lo que revela DELEGATE-52

Imagina una fotocopiadora que cada vez que pasas un documento le cambia una cifra, le borra una cláusula o le atribuye una cita al autor equivocado. Eso es lo que hacen los LLM cuando les delegas la edición de contenido en bucle: no explotan, no dan error, simplemente corrompen. Y lo hacen tan bien que nadie se entera hasta que el daño está publicado.

Mascota Marketing Ultra

TL;DR: El resumen sin rodeos

  • DELEGATE-52: Microsoft evaluó 19 LLM en 52 dominios. Los mejores modelos corrompieron el 25% del contenido tras 20 iteraciones de edición.
  • Errores invisibles: no son erratas. Son cifras alteradas, atribuciones falsas y cláusulas que desaparecen sin que la revisión estándar los cace.
  • Presión de producción: las referencias de IA crecen un 197% interanual (Shopify) y los equipos producen más con menos supervisión humana.
  • A partir de la iteración 10: el riesgo de corrupción grave se dispara. Las demos de 2 rondas no predicen nada.
Veredicto: la IA multiplica tu producción de contenido, pero dejarla editar sola sin controles de QA es sembrar errores a velocidad industrial.

¿Qué dice DELEGATE-52 y por qué debería importarte?

DELEGATE-52 es un estudio de Microsoft Research publicado en abril de 2026. Evaluó 19 modelos de lenguaje en 52 dominios profesionales, simulando un proceso de edición delegada durante 20 iteraciones.

Diagrama comparativo: columna izquierda muestra demo de 2 iteraciones con error mínimo y evaluación positiva; columna derecha muestra producción real de 20 iteraciones con 25% de contenido corrompido y daño silencioso.

El resultado: los modelos frontera corrompieron de media el 25% del contenido documental. La media global de todos los modelos probados llegó al 50%. Olvídate de las erratas. Esto va de un dato que muta sin avisar y una autoría que de repente es de otro.

Lo peor: estos errores son lo bastante sutiles para que un humano con prisa (o sea, todos los que trabajamos en esto) los dé por buenos. Se acumulan en silencio, iteración tras iteración.

Ojo con las herramientas agénticas: no mejoraron nada. De hecho, empeoraron el rendimiento en un 6% de los casos. El único dominio donde los LLM mantuvieron la precisión fue Python, con más del 98% de fidelidad. Todo lo demás: corrupción silenciosa.

¿En qué iteración empieza el riesgo real?

En las dos primeras, no se nota. Casi todos los modelos evaluados mostraban rendimiento similar y errores despreciables en la segunda ronda. Si evalúas un LLM con una prueba corta, te vas encantado.

Y ahí está la trampa.

DELEGATE-52 demostró que modelos que parecían iguales en la iteración 2 se descuadraban del todo hacia la 10. A partir de las 10-15 rondas de edición, la probabilidad de corrupción grave se dispara. En la iteración 20, una cuarta parte del contenido está comprometida. Con los mejores modelos del mercado.

Traducido a tu día a día: si tu flujo de producción pasa un texto por el LLM más de un par de veces (borrador, revisión, optimización SEO, adaptación a canal), ya estás acumulando riesgo. La mayoría de equipos que conozco hacen bastante más que un par de pasadas.

Apostaría a que el motivo por el que Python se libra es simple: tiene una verdad verificable. El test pasa o falla, no hay término medio.

Con la prosa de marketing no existe ese mecanismo. Un párrafo con una cifra cambiada sigue sonando "bien". Y un texto que suena convincente con un dato falso dentro es el peor escenario para tu marca.

El pulido ES el camuflaje.

¿Qué flujos de agencia están más expuestos?

Cualquier proceso con múltiples iteraciones de edición delegada a un LLM es candidato. Pero hay unos cuantos que deberían ponerte en alerta:

Ilustración editorial: ejecutivo satisfecho revisa documentos impecables producidos por una fotocopiadora IA sin notar que cifras, atribuciones y cláusulas han sido silenciosamente alteradas.
  • Blogs con ciclo borrador-revisión-SEO-publicación: si cada paso pasa por el modelo, son 4+ iteraciones.
  • Campañas de email con variantes y personalización: cada variante es una iteración más.
  • Fichas de producto en comercio electrónico a escala: cientos de descripciones generadas y "pulidas" por IA.
  • Informes con datos de cliente: aquí un número cambiado no es un error editorial. Es un problema de confianza.

Y todo esto en un contexto de presión brutal. Según datos de Shopify, las referencias procedentes de IA crecieron un 197% interanual en el segundo trimestre de 2026. Más canales, más contenido, menos gente para revisarlo. El incentivo para delegar y no comprobar es enorme.

Como explico en la guía de automatización de contenido con IA, escalar producción con modelos de lenguaje tiene todo el sentido. Pero escalar sin controles es sembrar errores a velocidad industrial. Y a velocidad industrial, un 25% de corrupción es una crisis reputacional en diferido. Cuestión de tiempo.

Controles de QA que deberías haber montado ayer

Si ya usas LLM en producción (y probablemente los usas), sigue. Pero deja de fiarte a ciegas.

Un buen flujo editorial con revisión humana necesita barreras que el propio modelo no puede poner. En mi experiencia, estas evitan que escalar producción signifique escalar meteduras de pata:

  • Supervisión humana en cada decisión con impacto: un LLM no es la autoridad final sobre ningún documento que lleve tu marca.
  • Verificación de datos contra la fuente original: las cifras y atribuciones se comprueban contra el documento fuente, NUNCA contra la versión anterior (que ya puede estar corrompida).
  • Comparación de versiones contra el original: no contra la iteración anterior. La corrupción es acumulativa y si solo miras el último cambio, no ves la deriva.
  • Límite de iteraciones delegadas: tres pasadas por el LLM y revisión humana completa antes de seguir. No es un número mágico, pero DELEGATE-52 deja claro que cada ronda suma riesgo.
  • Lista de verificación específica para errores de IA: la revisión editorial de siempre no basta. Necesitas un paso dedicado a cazar cifras inventadas y atribuciones que no cuadran con la fuente original.

Ah, y no te fíes de las demos. Si vas a meter un LLM en tu flujo de producción, exige pruebas de al menos 20 iteraciones. Una demo de 2 rondas no te dice NADA.

El discurso de "la IA que edita sola" tiene un agujero del tamaño de DELEGATE-52: funciona hasta que deja de funcionar, y cuando falla no te avisa. Delegar la edición a un modelo sin revisión humana es negligencia con piloto automático. Así de claro.

Deja un comentario

Tu correo no se publicará. Revisamos los comentarios antes de mostrarlos.