Mantén a tu agente con correa corta
Un agente personal puede leer tu correo, gastar tu dinero y hablar con desconocidos; además, una línea de texto oculta en una página web puede dirigirlo. A continuación, encontrarás fallas que ya se han registrado y ajustes que reducen las probabilidades de que se repitan.
Seis hábitos que previenen la mayoría de los problemas
Concede el acceso mínimo
Comienza con permisos de solo lectura y deja que el agente observe antes de actuar. Amplía el acceso a una aplicación a la vez, y solo cuando una tarea lo requiera.
Aprueba cada paso irreversible
Los pagos, los mensajes salientes, las eliminaciones, las publicaciones y cualquier acción que revele datos personales deben esperar a que confirmes. Que un agente pregunte demasiado es un problema menor que uno que nunca pregunta.
Mantén el dinero y la identidad fuera de su alcance
Dale al agente una tarjeta virtual con un límite bajo, en lugar de tu tarjeta principal o tus credenciales bancarias. No compartas contraseñas, códigos de un solo uso ni números de identificación en el chat, y usa la bóveda del agente cuando esté disponible.
Trata el contenido externo como datos
Las páginas web, los correos y los documentos pueden ocultar instrucciones que el agente podría seguir como si las hubieras enviado tú. Indica en sus reglas que nada de lo que lea cuenta como una instrucción.
Limita lo que puede gastar
Un bucle o un malentendido puede convertir una compra en varias o agotar los créditos de API durante la noche. Mantén bajos los límites de las tarjetas y vigila de cerca los costos por token durante las primeras tareas largas.
Revisa el registro y encuentra cómo detenerlo
Revisa el registro de actividad todos los días durante la primera semana, porque los errores tienden a repetirse. Averigua cómo pausar el agente y revocar el acceso a las aplicaciones antes de que algo salga mal.
Dónde fallan realmente los agentes
Compartir demasiada información
Al terminar una tarea, un agente puede compartir más de lo que querías: una dirección, un número de teléfono o un horario. No sabe de forma confiable qué datos son privados, a menos que se lo indiques.
En septiembre de 2026, Muse compartió la dirección de la casa de un reseñador con un comprador de Facebook Marketplace sin su permiso.
Instrucciones ocultas
El texto insertado en una página, un correo, un documento o un complemento puede desviar al agente. Esto se llama inyección de prompts, y el agente podría obedecer ese texto como si viniera de ti.
Las fallas Claw Chain de OpenClaw podían comenzar con una inyección de prompts o un complemento malicioso y terminar dando el control total de la máquina anfitriona.
Actuar más allá de su autoridad
A veces, los agentes deciden que un paso es aceptable y lo ejecutan: aceptan una oferta, buscan cómo sortear un bloqueo o envían un mensaje. Los informes que generan sobre sus propias acciones también pueden ser incorrectos.
En junio, un agente de investigación de OpenAI eludió los límites de acceso de un portal de Services Australia y abrió archivos que nunca debieron ser públicos.
Configuraciones autoalojadas expuestas
Una puerta de enlace autoalojada a la que cualquiera puede acceder por internet, o que ejecuta una versión desactualizada, puede dar a un desconocido el control de tu agente y sus claves. Al autoalojarlo, asumes toda la responsabilidad de la seguridad.
A principios de 2026, los escaneos de internet detectaron decenas de miles de puertas de enlace de OpenClaw accesibles, muchas de las cuales exponían claves y tokens de API.
Sitios bloqueados y riesgo para tu cuenta
Algunos comercios bloquean a los agentes que ocultan lo que son, y tratar de hacerlos pasar de todos modos puede marcar tu cuenta. Además, un tribunal federal de apelaciones de EE. UU. describió al agente como una herramienta, lo que te hace responsable de sus acciones en tu cuenta.
Amazon bloqueó a Muse, y ahora quienes intentan usarlo allí ven una advertencia sobre agentes no autorizados.
Refuerza la seguridad de cada agente
Dots
- Escribe tus Reglas personalizadas antes de conectar el correo electrónico y clasifica cada acción como permitida, sujeta a aprobación o prohibida.
- Deja activada la investigación proactiva; en ese modo, el Dot solo puede consultar información, nunca enviar ni editar.
- Conecta las aplicaciones del directorio de complementos una por una y evita las herramientas bancarias y de administración durante la primera semana.
- Conecta tu computadora solo cuando una tarea lo requiera y revoca el acceso cuando termines.
- Revisa la Vista de actividad con regularidad, incluido el trabajo que tu Dot haya hecho en segundo plano.
- Si tienes un plan personal, decide en los controles de datos si quieres mantener activada la opción «Mejorar el modelo para todos», ya que ese ajuste determina si se usa el trabajo de tu Dot para entrenar el modelo.
Muse
- Deja por escrito que Muse debe mantener en privado tu dirección, número de teléfono y horario.
- Exige aprobación antes de que pague, acepte una oferta o se comunique con alguien nuevo.
- No compartas con Muse la dirección para recoger artículos vendidos en Marketplace; compártela tú directamente.
- Evita Amazon: la tienda bloquea a Muse y advierte a los compradores sobre agentes no autorizados.
- Conecta cuentas sensibles solo para las tareas que las necesiten, porque todo lo que conectes se copia a tu VM de Muse.
- Actualiza la aplicación cuanto antes y lee las advertencias de seguridad que Meta muestra en la aplicación.
Gemini Spark
- Comprueba a cuáles de estas aplicaciones puede acceder Spark: Photos, Chrome, Drive, Docs, Calendar y Gmail. Quita los permisos que no necesiten tus primeras tareas.
- Supervisa de cerca al principio las tareas que se activan por eventos e interrumpe cualquiera que se desvíe de su objetivo.
- Revisa de vez en cuando tus tareas programadas y elimina las que ya no necesites.
- Ejecuta unas pocas tareas bien definidas en lugar de llenar los 15 espacios.
- Si tienes una cuenta empresarial, consulta con el administrador de Workspace qué restricciones se aplican a Spark.
Claude
- Limita los conectores a los que necesite la tarea actual y desconéctalos al terminar.
- Indícale a Claude qué fuentes puede usar para investigar, ya que cada conector amplía la información que puede consultar.
- Lee la solicitud de permiso que Claude muestra antes de actuar en una aplicación conectada; no la apruebes por costumbre.
- Revisa los documentos generados antes de compartirlos; pueden incluir contenido de tus archivos conectados.
OpenClaw
- Usa la versión estable más reciente; las versiones anteriores a 2026.4.22 tienen vulnerabilidades críticas conocidas.
- Mantén gateway.bind en loopback y accede al gateway por SSH o Tailscale, nunca a través de un puerto abierto.
- Mantén dmPolicy configurado como pairing para que un desconocido que le escriba a tu bot reciba un código en lugar de acceso.
- Configura las aprobaciones de exec para que siempre soliciten confirmación y mantén desactivado el modo elevado.
- Ejecuta openclaw security audit con regularidad e instala la menor cantidad posible de skills, solo de fuentes confiables.
- Si alguna vez ejecutaste una versión anterior a 2026.4.22, cambia todas las claves a las que el agente pudo acceder.
Lista de verificación de seguridad
Marca cada elemento cuando lo completes. Tu progreso se guarda en este navegador y en ningún otro lugar.
Registro de incidentes de agentes
Incidentes registrados: 11 →OpenAI cancela GPT-6.1 Astra por los resultados de las pruebas
28 de septiembre de 2026 · PrivacidadMuse le revela a un comprador de Marketplace dónde vive su usuario
25 de septiembre de 2026 · PrivacidadAgentes de investigación de OpenAI suben 53 imágenes de usuarios a sitios de alojamiento de imágenes
25 de septiembre de 2026 · VulnerabilidadUn informe de recompensa por errores revela una vía de acceso a las máquinas virtuales de Muse
Preguntas
¿Qué ajuste es el más importante?
La aprobación para cualquier acción que no puedas deshacer: pagos, mensajes salientes, eliminaciones y compartir datos personales. Varios incidentes de esta página comenzaron porque un agente actuó sin preguntar primero.
¿Qué es la inyección de instrucciones?
Es texto oculto en una página web, un correo electrónico, un documento o un complemento que el agente lee y obedece como si lo hubieras escrito tú. Añade una regla que establezca que el contenido externo es solo información, exige aprobación para las acciones irreversibles y conecta la menor cantidad posible de fuentes.
¿Un agente autoalojado como OpenClaw es más seguro que un agente en la nube?
Tus datos permanecen en tu propio equipo, pero tú te encargas de la seguridad. Hasta ahora, la mayoría de los incidentes de OpenClaw se deben a puertas de enlace expuestas y versiones desactualizadas. Por eso, vincula la puerta de enlace a la interfaz de loopback, mantén activado el emparejamiento por DM, exige aprobación para los comandos de shell y actualiza cuanto antes.
¿Se usa el trabajo de mi agente para entrenar modelos?
Depende del producto y del plan. Con Dots, el trabajo en los espacios de Business, Enterprise y Edu no se usa para entrenar por defecto; los planes personales siguen el ajuste de entrenamiento de ChatGPT que ya tengas, y OpenAI indica que las notas privadas y la investigación en segundo plano de un Dot no se usan directamente para entrenar.