← Noticias

Google mete el "computer use" en Gemini 3.5 Flash: los agentes de escritorio ya son API

30 junio 2026GOOGLE-DEEPMIND

Google ha integrado el control de interfaces —browser, móvil, escritorio— directamente en Gemini 3.5 Flash. No como experimento de laboratorio: como herramienta disponible en producción vía API. ¿Estás listo para que un modelo de IA opere aplicaciones en nombre de tus usuarios?

Qué ha pasado

Google DeepMind anuncia que *computer use* —la capacidad de ver pantallas y ejecutar acciones sobre ellas— ya es una funcionalidad nativa en Gemini 3.5 Flash, accesible a través de la Gemini API y la Gemini Enterprise Agent Platform.

[Fuente oficial: deepmind.google](https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/)

  • Antes era una capacidad exclusiva de un modelo standalone (Gemini 2.5); ahora está integrada en el modelo Flash de uso general
  • Cubre entornos browser, móvil y desktop, y está orientada a tareas de larga duración: testing continuo, automatización de knowledge work
  • Incluye dos salvaguardas enterprise opcionales: confirmación explícita del usuario para acciones sensibles o irreversibles, y parada automática si se detecta un *prompt injection* indirecto

Por qué importa

Esto no es un chatbot más inteligente. Es un modelo que puede abrir aplicaciones, navegar, rellenar formularios y ejecutar flujos sin integración de API previa. Para IT, eso tiene dos lecturas:

La buena: automatizar procesos heredados sin tocar el backend —legacy, aplicaciones de escritorio, portales sin API— de repente es más accesible.

La que requiere atención: un agente con acceso a interfaces tiene acceso a datos, credenciales y acciones reales. La superficie de riesgo es distinta a la de un LLM que solo genera texto.

Google lo sabe, por eso menciona explícitamente el riesgo de *prompt injection* en entornos en vivo y recomienda sandboxing + human-in-the-loop. Que lo digan en el anuncio de lanzamiento no es marketing: es que el riesgo es real y ya tienen que gestionarlo.

A tener en cuenta

AspectoDetalle
DisponibilidadGemini API + Gemini Enterprise Agent Platform, ahora
Entornos soportadosBrowser, móvil, desktop
Casos de uso citadosTesting continuo, automatización de knowledge work
Riesgo principalPrompt injection en entornos en vivo
Salvaguardas opcionalesConfirmación de usuario + parada ante injection detectada
Referencia de seguridadGoogle publica documentación de buenas prácticas

Mi opinión

El hype dirá: "¡Los agentes autónomos han llegado!". El criterio dice: lo que ha llegado es una capacidad que reduce la barrera técnica para construir agentes que interactúan con interfaces reales, y eso tiene implicaciones de gobierno que van por detrás de la velocidad del lanzamiento.

Recomendación concreta: si estás evaluando automatización de procesos que hoy dependen de RPA o de integración manual con aplicaciones legacy, este es un buen momento para abrir una prueba de concepto controlada. Pero hazlo con las salvaguardas activadas desde el día uno —sandboxing, human-in-the-loop y scope mínimo— no como añadido posterior.

La tecnología ya no es el freno. El gobierno del agente, sí.

---

*¿Tienes identificados los procesos de tu organización donde un agente con acceso a interfaces podría actuar? Porque si no los tienes tú, alguien en tu equipo ya está pensando en conectarlos.*

Fuente oficial ↗