Hermes Agent ya no vive solo en tu terminal: puede manejar un ordenador entero (el tuyo o uno dedicado) pulsando, escribiendo, arrastrando y desplazándose en segundo plano, sin que tu cursor se mueva ni tu foco cambie. El proyecto, de Nous Research, es open source bajo licencia MIT, ronda las 237.000 estrellas en GitHub y su última release visible es la v0.20.5, fechada el 19 de agosto de 2026. Abajo tienes cómo funciona su computer use, qué backends le dan una máquina propia y aislada al agente, y qué ideas merece la pena copiarle a la interfaz de Grok Bot de xAI.
«We need to incorporateorate to our hermes knowlege in "giving a computer to the hermes agent" and also "grokbot like UI for hermes"» (Alejandro Sanchez, canal del equipo del blog, 25 de agosto de 2026). Encargo claro: dos ángulos que van a dar mucho que hablar en los próximos meses.
Qué significa darle un ordenador a un agente (y por qué cambia todo)
Un agente con computer use no tiene una API que llamar: tiene una pantalla que mirar y un teclado y un ratón que usar. Observa la interfaz, decide el siguiente paso, actúa y vuelve a observar, en un bucle idéntico al que seguiría una persona sentada delante del equipo. Por eso funciona con aplicaciones que no exponen API alguna, porque el punto de integración es la propia interfaz gráfica.
Hay dos lecturas de la misma idea, y conviene no mezclarlas:
- Dejarle manejar TU ordenador. El agente trabaja sobre el escritorio donde tú estás, pero en paralelo, sin robarte el control. Es la apuesta de Hermes Agent.
- Darle un ordenador PROPIO. Una máquina (física, una VM o un sandbox en la nube) donde el agente corre aislado, con sus propias credenciales y su propio sistema de ficheros. Es el modelo de Grok Bot de xAI, que le da a todos los bots de tu cuenta un único ordenador en la nube.
Hermes Agent, curiosamente, permite las dos cosas, y eso es justo lo que lo hace interesante: puedes empezar dejándole el escritorio y, cuando la relación de confianza crezca, moverlo a una VM entera que administra él solo.
Este tipo de agente encaja en una de las categorías que ya estructuran el ecosistema: los agentes personales siempre encendidos, conectados a tu mensajería y con memoria persistente, tal y como los mapea nuestra guía de herramientas de IA para desarrolladores.
Computer use en Hermes: el agente que no te roba el cursor
La documentación oficial de computer use de Hermes lo describe sin rodeos: el agente conduce tu escritorio pulsando, escribiendo, arrastrando y haciendo scroll en segundo plano, en macOS, Windows y Linux. Tu cursor no se mueve, el foco del teclado no cambia y tus escritorios virtuales no saltan solos. Tú y el agente cooperáis sobre la misma máquina sin pisaros.
Debajo del capó, el toolset integrado computer_use habla MCP sobre stdio con cua-driver, un driver open source de uso de ordenador en segundo plano. Cada plataforma usa su pila de accesibilidad y de eventos de entrada por debajo, que es precisamente lo que permite actuar sin tomar el control físico de los periféricos.
El detalle que rompe el molde del sector: funciona con cualquier modelo capaz de usar herramientas, sea Claude, GPT, Gemini o un modelo abierto en un endpoint local compatible con OpenAI. No hay que casarse con el esquema nativo de computer use de Anthropic ni pagar la entrada de un ecosistema cerrado. Si ya tienes un endpoint local con un modelo abierto, el agente pica con ese.
Un flujo real de ejemplo. Le escribes por Telegram: «cierra las pestañas duplicadas del navegador, ordena la carpeta Descargas por tipo de fichero y resume en tres líneas qué había». Mientras tanto, tú sigues con tu correo, porque sus clics y tecleos ocurren por debajo, sobre las apps reales, sin que nada de lo que estás haciendo se altere. Cuando terminas, el resultado te espera en el mismo chat.
Los 7 backends de terminal: la arquitectura para darle SU propio ordenador
Aquí está la mitad del encargo que casi nadie cuenta. El computer use resuelve la pantalla, pero un agente autónomo también necesita ejecutar comandos, y ahí es donde decides si trabaja dentro de tu sistema o en el suyo. Hermes documenta siete backends de terminal:
| Backend | Qué es | Aislamiento | Cuándo usarlo |
|---|---|---|---|
| local | Ejecuta comandos en tu máquina, con tu usuario | Ninguno (documentado) | Probar sin riesgo; nunca con datos sensibles |
| Docker | Cada sesión corre en contenedores | Fuerte | La opción recomendada por defecto |
| SSH | La puerta de enlace apunta a otra máquina o VM | Depende del host | La vía literal de darle un ordenador propio |
| Singularity | Contenedores al estilo HPC | Fuerte | Entornos científicos y de computación de alto rendimiento |
| Modal | Sandbox gestionado en la nube | Fuerte | Ejecución remota sin servidores que mantener |
| Daytona | Sandbox gestionado en la nube | Fuerte | Igual, con otro proveedor |
| Vercel Sandbox | Sandbox gestionado en la nube | Fuerte | Entornos efímeros orientados a web |
La guía de seguridad del proyecto es explícita: para aislar de verdad recomienda Docker, Modal, Daytona o Vercel Sandbox, y SSH cuando quieres la puerta de enlace en una máquina o VM aparte. El backend local no aísla nada y ejecuta los comandos con los permisos de tu usuario sobre tu sistema de ficheros, así que no es una opción seria para producción.
Y hay un nivel más de paranoia disponible: el aislamiento por envoltura de proceso completo, donde el árbol entero de procesos del agente corre dentro de un sandbox. Los ejemplos que da el propio repositorio son su configuración con Docker Compose y NVIDIA OpenShell. En rescate rápido: Hermes Agent es de los pocos proyectos que te dejan elegir cuánta cuerda le das, desde ninguna hasta una jaula entera.
Grok Bot puso la barra alta: una UI para ver al agente trabajar
El 11 de agosto de 2026, xAI lanzó Grok Bot en beta temprana, y con él llegó la interfaz que definió cómo se siente tener varios agentes con ordenador propio. La mecánica, según su documentación oficial:
- Abres la app de escritorio de Grok Bot e inicias sesión.
- Creas bots y les asignas tareas; trabajan desde el ordenador en la nube de tu cuenta.
- Si un sitio pide contraseña, un código 2FA o resolver un captcha, tomas el control del ordenador del agente, lo introduces y le devuelves las llaves.
- Abres la pantalla Agent Computer y ves en directo los clics, los tecleos y el estado de la tarea mientras el trabajo sigue en la nube.
- Cierras la app o el portátil: el trabajo en la nube continúa.
El matiz arquitectónico que lo cambia todo: ese ordenador pertenece a tu cuenta de usuario, no a cada bot. Según la documentación de xAI sobre el ordenador y las apps, todos los bots de la cuenta comparten las mismas cookies, los mismos ficheros y las mismas credenciales de línea de comandos, y un bot puede continuar exactamente donde lo dejó otro.
¿Qué habría que copiar para una UI estilo Grok Bot en Hermes? Desglosado:
- Una pantalla espejo del ordenador del agente. Verlo trabajar en directo reduce a la mitad la ansiedad de delegar. Es el rasgo más distintivo de Grok Bot y el más imitado.
- El takeover humano puntual. Ceder el control para el 2FA y devolverlo es la respuesta práctica al problema de las credenciales, y cualquiera que haya automatizado logins sabe que es el cuello de botella real.
- Workspaces separados por bot, no compartidos. Aquí iría en dirección contraria a xAI: si montas la UI sobre Hermes, cada bot debería tener su sandbox (Docker, Modal, Daytona), no un ordenador común. Ya llegaremos al porqué.
- Aislamiento por defecto. La UI debería obligarte a elegir backend al crear un bot, con el
localmarcado como lo que es: una vía de prueba.
En la documentación actual de Hermes no existe una pantalla equivalente: el proyecto se maneja desde el CLI y desde las plataformas de mensajería que conecta (Telegram, Discord, Slack, WhatsApp, correo). Que el toolset de computer use hable MCP sobre stdio no significa que exponga una API pública de visionado, pero sí que todo el componente es abierto y replicable: quien quiera esa interfaz se la puede construir, y para ello conviene tener una base sólida de desarrollo full stack, porque la pieza difícil no es el streaming de vídeo, es la gestión de sesiones, permisos y sandboxes detrás.
Hermes Agent o Grok Bot: a quién le das las llaves
| Hermes Agent | Grok Bot | |
|---|---|---|
| Licencia y código | Open source, MIT (repositorio público) | Cerrado, beta temprana |
| Quién controla la infraestructura | Tú, self-hosted | xAI, en su nube |
| Ordenador del agente | El que tú montes: 7 backends, hasta una VM dedicada | Uno por cuenta, compartido por todos los bots |
| Modelos | Cualquiera con herramientas: Claude, GPT, Gemini, local | El stack de xAI |
| Cómo lo manejas | CLI y mensajería (Telegram, Discord, Slack, WhatsApp, correo) | App de escritorio con pantalla Agent Computer |
| Memoria | Persistente, con skills que se generan y refinan solas | Sesiones duraderas en la nube de xAI |
| Coste del software | Gratis; pagas los modelos que conectes | Requiere suscripción de pago |
Mi veredicto, sin rodeos. Hermes es para quien quiere control: developers que ya tienen Docker en la vida, que prefieren elegir el modelo (o calarlo en local para que nada salga de su máquina) y que valoran más una VM propia que una bonita pantalla. Su curva es real: tú eres el responsable de la seguridad, y eso es una feature y una losa a la vez. Grok Bot es para quien quiere cero mantenimiento: pagas, abres la app, creas bots y a otra cosa, aceptando a cambio el modelo de ordenador compartido y un stack cerrado del que no puedes auditar nada.
Para un perfil técnico, el techo de Hermes es muy superior, y no por las estrellas de GitHub, sino por las decisiones que deja en tus manos. Para todo lo demás, Grok Bot hace hoy más fácil el día a día.
Cómo probarlo hoy sin jugar con fuego
Si quieres verlo funcionando esta misma semana, este es el orden que yo seguiría:
- Ruta rápida (probar): instala Hermes y deja el backend
local, con el toolset de computer use activado (el instalador puede configurarlo automáticamente). Pruébalo con tareas de juguete, sin credenciales de nada importante. La documentación avisa de que este backend no aísla nada, así que tómatelo como una demo con los frenos puestos. - Ruta recomendada (usar de verdad): cambia el backend de terminal a Docker. Cada sesión corre en contenedores y el agente deja de tener acceso nativo a tu sistema de ficheros. Es el ajuste que la propia guía de seguridad del proyecto señala como punto de partida serio.
- Ruta ordenador propio (delegar de verdad): levanta una VM (o recicla una máquina vieja), instala Hermes dentro o apunta a ella por SSH, y dale sus propias credenciales. Si prefieres no tocar servidores, los sandboxes de Modal, Daytona o Vercel Sandbox cumplen el mismo papel en la nube. Desde ese momento, el agente tiene casa, y la tuya queda fuera del radio de acción.
En paralelo, aplica una regla de secretos que no admite discusión: nada de contraseñas, tokens ni ficheros sensibles en la máquina del agente. Si necesita loguearse en un servicio, que sea con una cuenta dedicada de permisos mínimos.
El riesgo que casi nadie dimensiona: una máquina compartida no es una frontera de seguridad
La advertencia más incómoda de la documentación de Grok Bot es que sus pantallas son superficies de trabajo separadas, no límites de seguridad. En la práctica: si dejas una sesión iniciada o un fichero con datos en el ordenador compartido, está disponible para todos los bots de tu cuenta, y no hay compartimento estanco del que fiarse.
En Hermes, el riesgo se concentra cuando usas el backend local, porque el agente corre con tus permisos. Y hay un vector que ninguna interfaz elimina: un agente que navega y pulsa está expuesto a contenido malicioso diseñado para dar órdenes al modelo (el clásico prompt injection en páginas web). Ningún proveedor lo ha resuelto de forma definitiva, ni xAI ni Anthropic ni los proyectos open source.
Las tres defensas que sí puedes aplicar hoy: privilegio mínimo en la cuenta que usa el agente, aislamiento por contenedor o sandbox en vez de dejarle tu sistema, y revisar periódicamente qué hizo (los logs de sesión existen precisamente para eso). Autonomía y confianza no son lo mismo, y confundirlas es la vía rápida a un disgusto.
El siguiente paso: de la lectura a la práctica
El recorrido mínimo para tener esto funcionando cabe en una tarde: Docker como backend, una pasarela de Telegram, computer use activado y una tarea real pero inofensiva (organizar Descargas, resumir el correo del día). Con eso ya habrás cruzado la frontera mental: dejarás de ver al agente como un chat y empezarás a verlo como un compañero con máquina propia, y el debate pasará de «¿funciona?» a «cuánta autonomía le doy y en qué jaula».
Si lo que quieres es construir sobre estas bases de forma profesional, el programa de ingeniería de IA para desarrolladores cubre justo esta capa: agentes, herramientas, aislamiento y despliegue. Y si estás comparando caminos, la comparativa entre programas te ayuda a elegir en función de tu punto de partida, igual que el programa de ingeniería de IA va más al grano con el rol de AI engineer.
