Google mete el "computer use" en Gemini 3.5 Flash: los agentes de escritorio ya son API
Google ha integrado el control de interfaces —browser, móvil, escritorio— directamente en Gemini 3.5 Flash. No como experimento de laboratorio: como herramienta disponible en producción vía API. ¿Estás listo para que un modelo de IA opere aplicaciones en nombre de tus usuarios?
Qué ha pasado
Google DeepMind anuncia que *computer use* —la capacidad de ver pantallas y ejecutar acciones sobre ellas— ya es una funcionalidad nativa en Gemini 3.5 Flash, accesible a través de la Gemini API y la Gemini Enterprise Agent Platform.
[Fuente oficial: deepmind.google](https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/)
- Antes era una capacidad exclusiva de un modelo standalone (Gemini 2.5); ahora está integrada en el modelo Flash de uso general
- Cubre entornos browser, móvil y desktop, y está orientada a tareas de larga duración: testing continuo, automatización de knowledge work
- Incluye dos salvaguardas enterprise opcionales: confirmación explícita del usuario para acciones sensibles o irreversibles, y parada automática si se detecta un *prompt injection* indirecto
Por qué importa
Esto no es un chatbot más inteligente. Es un modelo que puede abrir aplicaciones, navegar, rellenar formularios y ejecutar flujos sin integración de API previa. Para IT, eso tiene dos lecturas:
La buena: automatizar procesos heredados sin tocar el backend —legacy, aplicaciones de escritorio, portales sin API— de repente es más accesible.
La que requiere atención: un agente con acceso a interfaces tiene acceso a datos, credenciales y acciones reales. La superficie de riesgo es distinta a la de un LLM que solo genera texto.
Google lo sabe, por eso menciona explícitamente el riesgo de *prompt injection* en entornos en vivo y recomienda sandboxing + human-in-the-loop. Que lo digan en el anuncio de lanzamiento no es marketing: es que el riesgo es real y ya tienen que gestionarlo.
A tener en cuenta
| Aspecto | Detalle |
|---|---|
| Disponibilidad | Gemini API + Gemini Enterprise Agent Platform, ahora |
| Entornos soportados | Browser, móvil, desktop |
| Casos de uso citados | Testing continuo, automatización de knowledge work |
| Riesgo principal | Prompt injection en entornos en vivo |
| Salvaguardas opcionales | Confirmación de usuario + parada ante injection detectada |
| Referencia de seguridad | Google publica documentación de buenas prácticas |
Mi opinión
El hype dirá: "¡Los agentes autónomos han llegado!". El criterio dice: lo que ha llegado es una capacidad que reduce la barrera técnica para construir agentes que interactúan con interfaces reales, y eso tiene implicaciones de gobierno que van por detrás de la velocidad del lanzamiento.
Recomendación concreta: si estás evaluando automatización de procesos que hoy dependen de RPA o de integración manual con aplicaciones legacy, este es un buen momento para abrir una prueba de concepto controlada. Pero hazlo con las salvaguardas activadas desde el día uno —sandboxing, human-in-the-loop y scope mínimo— no como añadido posterior.
La tecnología ya no es el freno. El gobierno del agente, sí.
---
*¿Tienes identificados los procesos de tu organización donde un agente con acceso a interfaces podría actuar? Porque si no los tienes tú, alguien en tu equipo ya está pensando en conectarlos.*