Dos vídeos muestran a un agente de IA manejando literalmente el ratón y el teclado dentro de un navegador — no generando código, sino operando una interfaz gráfica pensada para humanos. La capacidad de fondo, «computer use», es real en ambos casos. La fluidez con la que se presenta en cámara, no tanto.
Claude edita vídeo en CapCut sin que el usuario toque el editor
El primer vídeo usa la extensión oficial de Claude para Chrome — confirmada en la Chrome Web Store, disponible para todos los suscriptores de pago desde septiembre de 2025 — para controlar CapCut Web de principio a fin: eliminar silencios, añadir transiciones, aplicar un zoom progresivo, limpiar el ruido de audio, generar subtítulos automáticos y colocarlos en una posición concreta de la pantalla, todo a partir de instrucciones en lenguaje natural escritas en el panel lateral de chat. Claude «ve» la pantalla mediante capturas y DOM, y actúa con clics y pulsaciones simuladas — exactamente la función de «computer use» que Anthropic documenta oficialmente para la extensión.
Lo que el vídeo no muestra es la fricción real de usar esta capacidad hoy: latencia notable entre cada acción, fallos de reconocimiento cuando la interfaz de CapCut cambia (algo que sucede con frecuencia en herramientas web actualizadas constantemente), y ningún reintento visible cuando algo no sale a la primera. Anthropic mismo advierte de un riesgo adicional que ningún vídeo de este tipo suele mencionar: los agentes de navegador son vulnerables a inyección de instrucciones ocultas en el contenido de las páginas que visitan, por lo que recomienda empezar por sitios de confianza y revisar las acciones sensibles antes de aprobarlas.
Gemini navega su propia app generada para encontrar y corregir errores
El segundo vídeo encadena varias herramientas de Google: usa NotebookLM para investigar y generar wireframes paso a paso de una aplicación, exporta esos wireframes a Google AI Studio (transcrito como «iStudio» por error de reconocimiento de voz), que los convierte en HTML funcional con navegación entre pantallas, y finalmente un agente con «computer use» abre Chrome, recorre la app generada, detecta errores visuales o funcionales y los corrige directamente en el código — sin que el usuario intervenga en ese último paso.
La pieza central, la capacidad de computer use dentro del ecosistema de Google, es real: Gemini 3.5 Flash incorpora una función de «computer use» en fase preview que permite a un agente automatizar tareas dentro de un navegador aislado, con salvaguardas específicas contra inyección de instrucciones — la misma familia de riesgo que reconoce Anthropic para su propia extensión. Lo que no hemos podido confirmar es que exista una función de exportación directa e integrada entre NotebookLM y AI Studio tal como la describe el vídeo; es plausible que ese paso requiera copiar y pegar manualmente en vez de un botón de exportación automática, lo que dejaría el flujo real bastante menos fluido que «wireframe a app funcional sin intervención».
Cómo lo aplicamos nosotros
En los dos casos la tecnología de fondo — un agente que ve una pantalla y actúa sobre ella como lo haría una persona — ya no es una promesa, es una función documentada por los dos fabricantes principales del sector. Lo que cambia es la distancia entre la demo de treinta segundos y el uso real, con reintentos, revisión de acciones sensibles y una interfaz que no siempre coopera. Antes de automatizar una tarea real con un agente de navegador, probamos primero con supervisión activa — no asumimos «sin intervención» hasta comprobarlo con nuestras propias manos.
Si tu negocio quiere automatizar tareas repetitivas en el navegador con un agente de IA — con las expectativas correctas sobre supervisión y seguridad –, hablemos. Contacta con nosotros.