{
 "id": 4337,
 "status": "publish",
 "lang": "es",
 "slug": "watch-analizar-videos-claude-code",
 "url": "https://soymarketingultra.com/watch-analizar-videos-claude-code/",
 "title": "Watch para Claude Code: el skill que convierte vídeos en contexto",
 "excerpt": "Probamos Watch con vídeo real: combina fotogramas y transcripción para que Claude Code, Codex y otros agentes entiendan lo que de verdad ocurre en pantalla.",
 "date_gmt": "2026-09-13T12:37:01Z",
 "modified_gmt": "2026-09-18T22:56:05Z",
 "categories": [
  {
   "slug": "ia-aplicada-es",
   "name": "IA Aplicada",
   "url": "https://soymarketingultra.com/category/ia-aplicada-es/"
  }
 ],
 "tags": [
  {
   "slug": "claude-code",
   "name": "claude-code"
  },
  {
   "slug": "inteligencia-artificial-es",
   "name": "Inteligencia artificial"
  },
  {
   "slug": "marketing-digital-es",
   "name": "marketing digital"
  }
 ],
 "featured_image": {
  "url": "https://soymarketingultra.com/wp-content/uploads/watch-cover-es.png",
  "alt": "La mascota de Marketing Ultra convierte un vídeo en fotogramas y una pista de audio para analizarlo",
  "width": 1536,
  "height": 864
 },
 "translation": {
  "lang": "en",
  "url": "https://soymarketingultra.com/en/watch-ai-agent-video-analysis/",
  "id": 4339
 },
 "seo": {
  "title": "Watch para Claude Code: convierte vídeos en contexto",
  "description": "Probamos Watch con vídeo real: fotogramas y transcripción para analizar demos, anuncios y grabaciones con Claude Code, Codex y otros agentes.",
  "focus_keyword": "watch claude code"
 },
 "html": "<p>Un vídeo no es un texto largo con música. Si tu agente solo recibe la transcripción, entiende lo que se dice, pero se pierde la interfaz, el montaje, los rótulos, los gestos y ese error que aparece medio segundo en una esquina. <a href=\"https://github.com/bradautomates/claude-video\" target=\"_blank\" rel=\"noopener\">Watch, de bradautomates</a>, cubre ese hueco: extrae fotogramas, consigue una transcripción con marcas de tiempo y entrega ambas capas al agente.</p>\n\n<div class=\"mu-tldr\"><div class=\"mu-tldr__header\"><img src=\"https://soymarketingultra.com/wp-content/themes/astra-child/assets/brand/despiram-sorprendido.png\" alt=\"Mascota Marketing Ultra\" class=\"mu-tldr__mascot\"><p class=\"mu-tldr__title\">TL;DR: El resumen sin rodeos</p></div><div class=\"mu-tldr__body\"><ul>\n  <li><strong>Qué hace</strong>: convierte YouTube, Loom, TikTok, Vimeo y archivos locales en fotogramas seleccionados más una transcripción con tiempos.</li>\n  <li><strong>Lo mejor</strong>: el agente deja de deducir la parte visual a partir de lo que oye.</li>\n  <li><strong>La pega</strong>: depende de yt-dlp, ffmpeg, subtítulos o Whisper. Un cambio de plataforma puede romper una descarga y los fotogramas siguen siendo una muestra.</li>\n  <li><strong>La nota</strong>: 90/100. Resuelve un problema real con un pipeline transparente y configurable.</li>\n</ul></div><div class=\"mu-tldr__footer\"><div class=\"mu-tldr__photo\"><img src=\"https://soymarketingultra.com/wp-content/themes/astra-child/assets/brand/cara-daniel.png\" alt=\"Daniel Espinosa Ramos\"></div><div><span class=\"mu-tldr__kick\">LA EXPERIENCIA DE DANIEL ESPINOSA RAMOS</span><p>En mi prueba local, Watch separó cinco estados visuales útiles y descartó ocho duplicados. Whisper solo recuperó una palabra. Los fotogramas salvaron el análisis que la transcripción no podía sostener.</p><span class=\"mu-tldr__sig\">Dani</span></div></div></div>\n\n<table class=\"mku-ficha-tabla\"><tbody>\n  <tr><td>Proyecto</td><td><a href=\"https://github.com/bradautomates/claude-video\" target=\"_blank\" rel=\"noopener\">bradautomates/claude-video</a></td></tr>\n  <tr><td>Licencia</td><td>MIT</td></tr>\n  <tr><td>Estado revisado</td><td>Versión 0.2.0; 17.165 estrellas; 1.750 forks; revisado el 14 de septiembre de 2026</td></tr>\n  <tr><td>Compatibilidad</td><td>Claude Code, Codex, Cursor, Copilot, Gemini CLI, claude.ai y más de 50 hosts de Agent Skills</td></tr>\n  <tr><td>Dependencias</td><td>Python, yt-dlp y ffmpeg; Whisper local, Groq u OpenAI cuando no hay subtítulos</td></tr>\n  <tr><td>Precio</td><td>Gratis y de código abierto; la transcripción por API puede tener coste</td></tr>\n  <tr><td>Valoración</td><td>90/100</td></tr>\n</tbody></table>\n\n<div class=\"mku-caja-roundup\"><p>Esta herramienta forma parte de estos recopilatorios: <a href=\"https://soymarketingultra.com/skills-claude-code-codex-agentes-codigo/\">Skills para Claude Code, Codex y otros agentes de código</a> · <a href=\"https://soymarketingultra.com/skills-ia-marketing/\">Recursos para hacer marketing con agentes de IA</a></p></div><h2 id=\"el-problema-que-resuelve\">El problema que resuelve</h2>\n\n<p>Los agentes actuales pueden razonar sobre imágenes y texto, pero una URL de vídeo no siempre llega como una secuencia visual utilizable. La salida fácil es bajar subtítulos y resumirlos. Eso funciona para una entrevista, pero falla en una demo de software, un anuncio o una grabación de pantalla: la frase “como ves aquí” no dice qué botón se pulsó ni qué cambió en la interfaz.</p>\n\n<p>Watch no intenta reproducir vídeo dentro del modelo. Prepara una representación manejable. Primero busca subtítulos. Después descarga el material que necesita, selecciona escenas con ffmpeg y asocia los fotogramas con una transcripción temporal. El agente recibe pruebas visuales y verbales que puede leer con sus herramientas normales.</p>\n\n<figure class=\"mu-captura wp-block-image\"><a href=\"https://github.com/bradautomates/claude-video\" target=\"_blank\" rel=\"noopener\"><img src=\"https://soymarketingultra.com/wp-content/uploads/watch-official-repo.png\" alt=\"Repositorio oficial de Watch con su estructura, licencia y versión publicada\" width=\"1440\" height=\"1100\" loading=\"lazy\"></a><figcaption><strong>Fuente:</strong> repositorio oficial de Watch, captura del 14 de septiembre de 2026. <strong>Qué demuestra:</strong> versión 0.2.0, licencia MIT, estructura autocontenida y compatibilidad declarada. <strong>Límite:</strong> popularidad y documentación no sustituyen una prueba práctica.</figcaption></figure>\n\n<h2 id=\"como-se-pone-en-marcha\">Cómo se pone en marcha</h2>\n\n<p>En Claude Code se instala desde el marketplace del autor. En Codex, Cursor, Copilot, Gemini CLI y otros hosts compatibles se distribuye mediante la CLI de Agent Skills.</p>\n\n<pre><code>/plugin marketplace add bradautomates/claude-video\n/plugin install watch@claude-video</code></pre>\n\n<pre><code>npx skills add bradautomates/claude-video -g</code></pre>\n\n<p>La primera ejecución comprueba <code>yt-dlp</code> y <code>ffmpeg</code>. En macOS puede instalarlos automáticamente con Homebrew; en Windows y Linux ofrece instrucciones. Si el vídeo trae subtítulos, no hace falta pagar una transcripción. Si no los trae, puede usar faster-whisper de forma local o enviar solo el audio extraído a Groq u OpenAI, según tu configuración.</p>\n\n<p>El control importante es la cantidad de imagen que metes en contexto. <code>transcript</code> usa cero fotogramas; <code>efficient</code> llega hasta 50; <code>balanced</code>, el modo recomendado, hasta 100; y <code>token-burner</code> elimina el tope. También puedes limitar un tramo con <code>--start</code> y <code>--end</code>, pedir marcas concretas con <code>--timestamps</code> o reducir el presupuesto con <code>--max-frames</code>.</p>\n\n<figure class=\"mu-video-embed\"><div class=\"mu-video-embed__frame\"><iframe src=\"https://www.youtube-nocookie.com/embed/Mb9952gFBrk\" title=\"Demostración reciente de Watch en Claude Code\" loading=\"lazy\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" allowfullscreen></iframe></div><figcaption>Brandon Builds muestra cómo usa Watch para aprender un flujo desde vídeo y convertirlo en material reutilizable. Es una demostración promocional, no una comparación independiente.</figcaption></figure>\n\n<h2 id=\"prueba-real\">Probándolo en un vídeo real</h2>\n\n<p>Probé el skill en dos situaciones. Con el enlace público de YouTube que usa su propia documentación como ejemplo, recuperó los subtítulos, pero la descarga de vídeo terminó en un 403. La causa visible era una versión de yt-dlp con más de 90 días y un cambio reciente en la firma de YouTube. Es reparable actualizando la dependencia, pero revela una fricción importante: “cualquier vídeo” significa cualquier vídeo que el extractor pueda obtener hoy.</p>\n\n<p>Con un WebM local de 13 segundos funcionó de principio a fin. En modo <code>balanced</code> generó 13 candidatos, descartó 8 casi duplicados y dejó 5 fotogramas. Identificó correctamente los cambios entre “Sound off”, “Sound on”, barras de color y pantalla negra. La transcripción local con Whisper produjo únicamente “you”. Si hubiese pedido un resumen basado solo en audio, el resultado sería inútil; con los fotogramas, la secuencia se entiende.</p>\n\n<figure class=\"mu-captura wp-block-image\"><a href=\"https://commons.wikimedia.org/wiki/File:Example.webm\" target=\"_blank\" rel=\"noopener\"><img src=\"https://soymarketingultra.com/wp-content/uploads/watch-hands-on-frames.png\" alt=\"Cinco fotogramas seleccionados por Watch en una prueba local de trece segundos\" width=\"1536\" height=\"576\" loading=\"lazy\"></a><figcaption><strong>Fuente:</strong> prueba propia con Example.webm de Wikimedia Commons, realizada el 14 de septiembre de 2026. <strong>Qué demuestra:</strong> la selección visual conservó los estados relevantes aunque la transcripción falló. <strong>Límite:</strong> es un clip corto y simple, no una prueba de precisión sobre vídeos largos.</figcaption></figure>\n\n<p>Para marketing, esta combinación encaja en cuatro tareas: diseccionar el montaje de un anuncio, extraer el recorrido de una demo de producto, localizar el momento exacto de un fallo en una grabación y convertir un tutorial en una checklist. En vídeos largos conviene recortar el intervalo. Cien imágenes repartidas por una hora ofrecen una orientación, no una lectura continua.</p>\n\n<h2 id=\"lo-que-no-te-cuentan\">Lo que no te cuentan</h2>\n\n<p>La primera limitación es epistemológica: Watch no “ve cada fotograma” salvo que fuerces una densidad extrema. Ve una selección. Puede perder un rótulo fugaz, una transición o un cambio pequeño entre dos muestras. El modo sin tope reduce ese riesgo, pero puede devorar contexto. La propia documentación estima que 80 fotogramas de 512 píxeles consumen aproximadamente entre 50.000 y 80.000 tokens de imagen.</p>\n\n<p>La segunda es operativa. yt-dlp persigue plataformas que cambian continuamente. YouTube, TikTok o Instagram pueden exigir una actualización, bloquear una región o pedir autenticación. Que el skill soporte una plataforma no garantiza que todos sus enlaces sean descargables en todo momento.</p>\n\n<p>La tercera es privacidad. Con faster-whisper local, el audio se queda en tu máquina. Con Groq u OpenAI, el vídeo completo no se envía, pero sí el audio extraído cuando hace falta transcribir. Para material de cliente, reuniones o grabaciones internas, esta diferencia debe decidirse antes de ejecutar el skill.</p>\n\n<h2 id=\"que-dice-la-gente\">Qué dice la gente</h2>\n\n<p>La conversación reciente tiene mucho entusiasmo y bastante marketing de afiliación. El uso que más se repite no es “resumir vídeos”, sino convertir tutoriales en skills reutilizables. Ahí está también la objeción más sensata: para contenido puramente hablado, una transcripción ya resuelve gran parte del trabajo.</p>\n\n<div class=\"mu-social-grid\">\n  <blockquote class=\"mu-social-embed\"><p>“It pulls the captions, extracts the key frames, and hands both to Claude, so it works from what was on screen.”</p><p class=\"mu-social-comment\">La frase acierta en la diferencia real del producto: no solo oye, también conserva evidencia visual seleccionada.</p><footer><a href=\"https://x.com/alex_prompter/status/2095848114074898603\" target=\"_blank\" rel=\"noopener\">@alex_prompter en X</a> · 4 sep 2026 · 254 me gusta · 23 republicaciones · 21 respuestas</footer></blockquote>\n  <blockquote class=\"mu-social-embed\"><p>Un vídeo presenta Watch como la forma de enseñar cualquier habilidad de YouTube a Claude. Dos respuestas pinchan el globo: “just transcribe the video. it takes seconds” y “I've had Google Gemini analyze YouTube videos forever”.</p><p class=\"mu-social-comment\">Ambas críticas son válidas cuando la imagen no aporta nada. Watch gana valor justo cuando lo que ocurre en pantalla sí importa.</p><footer><a href=\"https://www.tiktok.com/@bengusberg/video/7678172574592863518\" target=\"_blank\" rel=\"noopener\">@bengusberg en TikTok</a> · 26 ago 2026 · 292.690 visualizaciones · 16.439 me gusta · 225 comentarios</footer></blockquote>\n  <blockquote class=\"mu-social-embed\"><p>“I stopped watching YouTube tutorials. Claude pulls the frames and the transcript and hands me what mattered, with timestamps.”</p><p class=\"mu-social-comment\">Es una promesa potente, pero yo la rebajaría: Watch acelera el primer análisis, no sustituye comprobar el vídeo original cuando el detalle importa.</p><footer><a href=\"https://www.tiktok.com/@techyai_cj/video/7674267638108900639\" target=\"_blank\" rel=\"noopener\">@techyai_cj en TikTok</a> · 15 ago 2026 · 866 visualizaciones · 55 me gusta · 49 comentarios</footer></blockquote>\n</div>\n\n<h2 id=\"veredicto\">Veredicto</h2>\n\n<p><strong>Watch merece un 90/100.</strong> Hace una cosa muy concreta y la hace de una forma comprensible: convierte vídeo en las dos entradas que un agente maneja bien, imágenes y texto. Sus modos permiten controlar el coste, acepta archivos locales y no obliga a mandar el vídeo entero a un tercero.</p>\n\n<p>No le doy más porque la compatibilidad con plataformas depende de yt-dlp, porque muestrear no equivale a observar cada segundo y porque la calidad de Whisper varía. Lo instalaría si revisas demos, anuncios, tutoriales o grabaciones de errores dentro de Claude Code o Codex. Para podcasts o entrevistas estáticas, empezaría por la transcripción. Para decisiones visuales finas, usaría Watch como mapa y volvería al vídeo como fuente final.</p>\n\n<hr class=\"mu-faq-sep\">\n<section class=\"mu-faq\" aria-labelledby=\"faq-watch-es\"><h2 id=\"faq-watch-es\">Preguntas frecuentes sobre Watch</h2>\n  <h3>¿Watch ve todos los fotogramas de un vídeo?</h3><p>No. Selecciona escenas y muestras según la duración y el modo. Puedes pedir más densidad o marcas concretas, pero el coste de contexto aumenta.</p>\n  <h3>¿Necesita una clave de OpenAI?</h3><p>No si el vídeo tiene subtítulos o si configuras faster-whisper local. Groq y OpenAI son opciones de respaldo para transcribir audio sin subtítulos.</p>\n  <h3>¿Funciona en Codex además de Claude Code?</h3><p>Sí. El repositorio se empaqueta como Agent Skill autocontenido y declara compatibilidad con Codex, Cursor, Copilot, Gemini CLI y más de 50 hosts.</p>\n  <h3>¿Puede analizar vídeos privados?</h3><p>Puede trabajar con archivos locales que tú proporciones. En plataformas web, el acceso depende de lo que yt-dlp pueda descargar sin iniciar sesión y de las restricciones del enlace.</p>\n  <h3>¿Sustituye ver el vídeo original?</h3><p>No cuando importan transiciones rápidas, audio, tono o texto pequeño. Es excelente para orientar y estructurar el análisis; la verificación final sigue en el original.</p>\n</section>\n<script type=\"application/ld+json\" data-mku-schema=\"review\">{\"@context\":\"https://schema.org\",\"@graph\":[{\"@type\":\"SoftwareApplication\",\"name\":\"Watch\",\"applicationCategory\":\"MultimediaApplication\",\"operatingSystem\":\"macOS, Linux and Windows; compatible Agent Skills hosts\",\"url\":\"https://github.com/bradautomates/claude-video\",\"softwareVersion\":\"0.2.0\",\"license\":\"MIT\"}]}</script>",
 "markdown_url": "https://soymarketingultra.com/watch-analizar-videos-claude-code.md"
}