
Alibaba ha soltado en abierto una biblioteca JavaScript que mete un agente de IA directamente dentro de la página web. El repositorio presenta Page Agent como un agente JavaScript que funciona dentro de la página y controla interfaces web con lenguaje natural. Suena demasiado bien. Vamos a ver si es verdad.
TL;DR: El resumen sin rodeos
- Dentro de la página: el repositorio lo describe como un agente JavaScript que funciona dentro de la propia página.
- Lenguaje natural: controla la interfaz web mediante instrucciones en lenguaje natural.
- Código abierto y MIT: código libre de Alibaba, con más de 29 000 estrellas en GitHub.
- Coste: licencia MIT; esta revisión no ha verificado el coste de posibles servicios externos.
- Barrera de entrada: la evidencia revisada no detalla la instalación, los modelos compatibles ni el soporte disponible en español.
En este artículo
| Qué es | Biblioteca JavaScript de Alibaba que funciona dentro de la página web y controla la interfaz mediante lenguaje natural. |
|---|---|
| Web oficial | https://github.com/alibaba/page-agent |
| Repositorio | repo |
| Licencia | MIT |
| Precio | código abierto |
| Alternativa a | browser-use, Puppeteer y otras herramientas de automatización web del lado del servidor |
Revisado el 2026-10-06
Esta herramienta forma parte de estos recopilatorios: Aplicaciones open source que sustituyen software de pago
El problema que resuelve
Page Agent es una biblioteca JavaScript de código abierto, desarrollada por Alibaba, que funciona dentro de la página web para controlar la interfaz con lenguaje natural.


Herramientas como Puppeteer, Playwright o browser-use controlan el navegador desde fuera de la página. Pueden inspeccionar el DOM y trabajar con selectores; según la herramienta, también pueden apoyarse en capturas o elementos visuales.
Page Agent le da la vuelta. El repositorio lo describe como un agente JavaScript que funciona dentro de la página y permite controlar la interfaz con lenguaje natural.
¿Y por qué debería importarte? Porque muchas herramientas de marketing no tienen API. Subir creatividades, extraer datos de un panel, comprobar una landing en móvil. Tareas que un humano hace a mano y que un agente dentro de la página podría ejecutar sin explicarle la estructura HTML.
El repositorio mostraba más de 29 000 estrellas en GitHub, 2 600 bifurcaciones y 53 solicitudes de cambio abiertas a octubre de 2026.
Cómo se pone en marcha
Page Agent es un paquete JavaScript organizado en un monorrepo (la carpeta packages/ del repositorio apunta a varios módulos). La base de todo es el repositorio oficial en GitHub, que incluye documentación en docs/ y archivos de integración con agentes de código: CLAUDE.md y AGENTS.md.
Ojo con esto. El repositorio incluye archivos para agentes de código, pero eso no confirma que Page Agent sea compatible con Claude Code o Cursor. Si ya usas agentes de código en tu flujo de trabajo, toca revisar la integración antes de darla por hecha.
El repositorio identifica el proyecto como JavaScript y la ficha recoge una licencia MIT. Lo que esta revisión no ha podido verificar es qué servicios externos necesita, qué modelos admite o cuánto costarían por utilización.
Lo honesto: el extracto revisado confirma que existen un archivo README y una carpeta docs/, pero no permite documentar la configuración paso a paso. No voy a inventarla. El punto de partida es el repositorio.
Copia esto y pégalo en Claude Code, Cursor o tu asistente de código favorito:
Clona https://github.com/alibaba/page-agent e instala las dependencias del monorrepo. Muéstrame la estructura del proyecto y configura una prueba básica de Page Agent para automatizar una tarea sencilla en una página web local de ejemplo.
La evidencia revisada no permite asegurar que puedas probarlo sin programar. Los requisitos técnicos y el proceso de configuración no están documentados aquí, así que cuenta con apoyo técnico.
Usándola en marketing real
No he probado Page Agent de primera mano, así que nada de montar un caso ficticio. Lo que sí puedo hacer es plantear dónde encajaría en un equipo de marketing con los pies en el suelo.
Imagina una agencia que gestiona campañas en varias plataformas. Cada mañana, alguien entra en tres o cuatro paneles, descarga informes, comprueba creatividades y actualiza una hoja de cálculo. Son tareas repetitivas, en interfaces sin API pública. Un agente dentro de la página que reciba "entra en el panel de X, descarga el informe de ayer" podría comerse ese trabajo sin guiones de 200 líneas llenos de selectores que se rompen cada vez que la plataforma cambia un div.
Eso es la promesa. Con la documentación aportada no puedo asegurar qué conocimientos exige la instalación ni qué modelo necesita. No es base suficiente para venderlo como "enchufar y listo".
Sobre el papel, este enfoque podría tolerar mejor algunos cambios de interfaz. Tiene sentido como hipótesis, pero esta revisión no aporta pruebas comparativas que la confirmen.
Lo que no te cuentan
El repositorio supera los 1 100 commits e incluye una carpeta docs/. Hasta ahí llega la evidencia revisada: no permite valorar la calidad de la documentación ni asegurar qué conocimientos necesita un usuario para ponerlo en marcha.
Page Agent es código abierto con licencia MIT. El extracto disponible no documenta qué modelo utiliza, qué proveedores admite ni si hay costes externos por token. Sin esos datos, echar cuentas sería jugar a la lotería.
El repositorio mostraba 43 issues abiertos durante la revisión. La evidencia aportada no permite saber en qué idiomas se atienden ni comprobar si existen foros, hilos o tutoriales en castellano fuera de GitHub.
Y queda una pregunta bastante seria: la seguridad. La evidencia revisada no documenta a qué datos puede acceder el agente, qué permisos utiliza ni adónde envía la información. Antes de meterlo en un panel con datos sensibles de clientes, toca verificar justo eso. Sin ese análisis, no hay barra libre.
Alternativas
La ficha de Page Agent lo posiciona como alternativa directa a browser-use, Puppeteer y otras herramientas de automatización web del lado del servidor.
browser-use plantea la alternativa más cercana: también usa IA para controlar el navegador, pero lo hace desde fuera de la página.
Puppeteer (Google) y Playwright (Microsoft) siguen el enfoque clásico: código y selectores, sin lenguaje natural por defecto. Pueden encajar mejor cuando se busca una automatización con más recorrido y documentación; Page Agent plantea resolver parte de ese trabajo con instrucciones en texto plano.
La diferencia de fondo es de ADN: Puppeteer y Playwright controlan desde fuera; Page Agent actúa desde dentro. No son incompatibles. Puppeteer aborda la extracción mediante automatización clásica; Page Agent propone instrucciones en lenguaje natural para interacciones puntuales en una interfaz sin API.
Veredicto
Page Agent plantea una idea potente: meter el agente de IA dentro de la página en lugar de controlarlo desde fuera. Y sí, resuelve problemas reales para cualquiera que haya sufrido una interfaz sin API o un selector que se rompe cada martes.
El repositorio confirma el enfoque técnico, pero la evidencia revisada no basta para fijar requisitos, valorar la documentación, medir la comunidad ni calcular costes externos. Para un equipo de marketing, todo eso queda por comprobar antes de plantear una implantación real.
¿Merece seguirle la pista? Cien por cien. Alibaba lo mantiene en abierto con licencia MIT y acumula más de 29 000 estrellas. Si la barrera de entrada acaba bajando, podría cambiar cómo interactuamos con plataformas de marketing que se niegan a darnos una API decente.

