Meta usó IA para proteger cuentas de Instagram. Los atacantes la usaron para robarlas.
Más de 100 cuentas de alto valor comprometidas en Instagram, incluyendo cuentas con millones de seguidores y valores de mercado en seis y siete cifras. El vector: prompt injection contra el bot de soporte de Instagram. La IA hacía exactamente lo que le pedían — sin verificar identidad.
El método: una conversación
No fue un exploit al servidor de Meta. No fue una brecha de base de datos. No fue fuerza bruta.
Fue una conversación.
El atacante abría el soporte de Instagram, decía "me hackearon", y le pedía al bot de IA que enlazara un correo nuevo al username de la víctima.
La IA lo hacía. Sin preguntar. Sin verificar identidad. Sin que el 2FA de la víctima entrara en el flujo en ningún momento.
Las cuentas comprometidas
Más de 100 cuentas de alto valor:
- —Cuentas verificadas con millones de seguidores
- —Usernames cortos de alto valor (como
@hey,@jowo) - —Cuentas antiguas que se comercializan en mercados negros por seis y siete cifras
- —Algunas revistas en Telegram por más de $1M USD combinados
Meta confirmó el fix y declaró que "no hubo brecha en sus sistemas". Técnicamente correcto. Las cuentas cayeron igual.
Por qué importa más allá de Instagram
Llevamos tiempo discutiendo prompt injection como riesgo teórico en papers y conferencias. Este incidente lo convierte en algo con consecuencias económicas reales y documentadas.
El problema de arquitectura
Meta le dio a un agente de IA capacidad de escritura sobre cuentas de usuario — resetear credenciales, cambiar emails, modificar información de recuperación — sin una capa de verificación de identidad independiente del modelo.
El modelo hizo exactamente lo que le pidieron hacer. Eso es el problema.
Cuando un agente de IA tiene permisos para ejecutar acciones sensibles, cualquier conversación mal controlada se convierte en vector de ataque. No es un bug de código. Es un bug de arquitectura.
La pregunta que todo equipo de desarrollo debería hacerse
Si estás construyendo con agentes de IA hoy y tu agente puede:
- —Resetear contraseñas
- —Modificar datos de facturación
- —Ejecutar flujos de KYC
- —Cambiar información de recuperación de cuenta
¿Tienes una capa de verificación independiente del modelo antes de ejecutar esas acciones?
Si la respuesta es no, tienes el mismo problema que tuvo Meta.
La regla que emerge de este incidente
Los controles de seguridad no pueden vivir dentro del prompt. Tienen que vivir fuera del modelo.
Un sistema prompt que dice "verifica la identidad del usuario antes de cambiar información de cuenta" no es un control de seguridad. Es una instrucción que puede ser anulada con la frase correcta.
Los controles reales son código que se ejecuta independientemente del output del LLM: verificación de identidad por canal separado, confirmación out-of-band, rate limiting por acción sensible, logging de modificaciones con alerta humana.
El campo que esto abre
Este incidente no es el último de su tipo. Es la primera instancia documentada a esta escala de un vector que va a escalar a medida que más empresas desplieguen agentes con capacidad de escritura sobre datos de usuario.
La pregunta ya no es si los agentes de IA pueden ser engañados. La pregunta es: qué pasa cuando los engañan.
Desde Gallo Security analizamos la seguridad de implementaciones de agentes de IA como parte de nuestros servicios de pentesting y threat intelligence. Si tu empresa está construyendo con LLMs y agentes, contáctanos.
