El auge de los ataques impulsados por IA: cuando los hackers tambien automatizan
Por Andrea Marcotulli | Especialista en Ciberseguridad y Tecnologia Comercial
Si creias que la IA solo te iba a ayudar a trabajar mejor… tambien esta ayudando a atacarte. Y la pantalla de tu proxima videollamada puede ser la prueba.
Introduccion: la camara no miente. O si?
Durante decadas, ver equivalia a creer. Una videollamada con el rostro y la voz de un conocido era garantia de autenticidad. Esa certeza se ha roto.
En 2024 y 2025, una nueva categoria de ataque cibernetico ha escalado de los laboratorios de investigacion a los titulares de prensa internacional: el robo de identidad en tiempo real durante videoconferencias, potenciado por inteligencia artificial generativa. Los atacantes ya no necesitan hackear un servidor ni instalar un malware sofisticado. Les basta con ocupar una silla virtual en una reunion de Zoom o Teams, con el rostro y la voz de alguien de confianza.
Este articulo analiza como funciona esta tecnica, que casos reales han salido a la luz, que diferencia a las empresas grandes de las pequenas en terminos de exposicion, y como prepararse sin caer en la paranoia.
Como funciona el robo de identidad por videoconferencia con IA
El ataque combina tres tecnologias que, por separado, existen desde hace anos pero que la IA generativa ha hecho accesibles, rapidas y convincentes para actores con recursos limitados.
Clonacion facial en tiempo real (deepfake live)
Herramientas como DeepFaceLab, Roop o aplicaciones comerciales recientes permiten sustituir el rostro de una persona en un stream de video en tiempo real. El atacante solo necesita imagenes o videos publicos de la victima que quiere suplantar, disponibles en LinkedIn, YouTube, entrevistas o redes sociales, y un software de camara virtual que inyecta el video manipulado directamente en la plataforma de videoconferencia.
El resultado, visto desde el otro lado de la llamada, es el rostro de un colega, directivo o proveedor conocido. Los movimientos de cabeza, los parpadeos y las expresiones se sincronizan en milisegundos con los movimientos del atacante real. En condiciones de iluminacion imperfecta o en ventanas pequenas de video, la distincion es practicamente imposible a simple vista.
Clonacion de voz con IA (voice cloning)
Herramientas como ElevenLabs, Resemble AI o modelos open source entrenados con muestras de audio pueden replicar la voz de una persona con apenas 30 a 60 segundos de grabacion. Una intervencion en un podcast, una presentacion en YouTube o incluso un mensaje de voz son suficientes.
La voz sintetica se genera en tiempo real o desde un script pre-escrito, sincronizandose con el movimiento labial del deepfake visual. El resultado es una presencia digital completa: cara, voz, tono, acento e incluso las muletillas habituales de la persona suplantada.
Ingenieria social de alta precision
El deepfake tecnico es solo el vehiculo. El ataque se completa con una preparacion exhaustiva: el atacante estudia el organigrama de la empresa, las relaciones entre departamentos, los proyectos en curso y el estilo comunicativo del directivo a suplantar. LinkedIn, la web corporativa, comunicados de prensa y redes sociales son su fuente de inteligencia abierta (OSINT).
La llamada falsa se programa en un momento de presion: fin de mes, cierre de un contrato urgente, una supuesta crisis interna. El pedido es siempre urgente, confidencial y fuera del proceso habitual. La frase ‘no lo comentes con nadie todavia’, pronunciada con la voz y el rostro correctos, ha bastado para autorizar transferencias millonarias.

Casos reales: cuando la ficcion se convirtio en titular de prensa
No estamos ante hipotesis academicas. Los siguientes casos fueron cubiertos por medios internacionales de referencia y representan una tendencia documentada y en expansion.
#1 – Hong Kong, febrero 2024 | Fuentes: CNN, BBC, Reuters, El Pais
25 millones de dolares transferidos tras una videoconferencia con ejecutivos falsos
Un empleado del departamento financiero de una multinacional con sede en Hong Kong recibio una invitacion para una videoconferencia urgente con el director financiero de la empresa y otros altos cargos. Durante la llamada, todos los participantes eran deepfakes generados por IA: sus rostros y voces, perfectamente replicados, instruyeron al empleado para realizar una serie de transferencias bancarias por un total de 25,6 millones de dolares (unos 200 millones de dolares de Hong Kong).
El empleado, que inicialmente habia sospechado de un email de phishing previo, quedo convencido al ver los rostros y escuchar las voces de sus superiores en pantalla. Solo semanas despues, al contactar con la sede central por otra razon, descubrio que ninguno de los participantes habia estado en esa llamada. Es el caso de referencia global de este tipo de ataque y fue portada en los principales medios de comunicacion de todo el mundo.
#2 – Reino Unido, 2019 | Fuentes: Wall Street Journal, The Guardian, Euler Hermes
220.000 euros transferidos tras una llamada con la voz sintetica del CEO
Aunque anterior al auge del deepfake visual, este caso es el primer fraude confirmado con clonacion de voz por IA y fue documentado por la aseguradora Euler Hermes. El director ejecutivo de una empresa energetica britanica recibio una llamada que creia era de su jefe, el CEO de la matriz alemana, solicitandole una transferencia urgente y confidencial de 220.000 euros a un proveedor hungaro.
La voz era perfecta: el acento aleman leve, el ritmo de habla caracteristico, incluso el tono ligeramente impaciente del superior. El dinero fue transferido en horas. Fue el preludio de lo que vendria cinco anos despues, esta vez con imagen real y en tiempo real.
#3 – Estados Unidos, 2022-2024 | Fuentes: FBI (PSA IC3), Wired, Ars Technica
Candidatos con deepfake en entrevistas de empleo para acceder a sistemas internos de empresas
En junio de 2022, el FBI emitio un aviso publico reportando casos en los que candidatos a puestos de trabajo remoto utilizaban deepfakes de video y voz en tiempo real durante entrevistas por videoconferencia para hacerse pasar por otras personas. El objetivo no era el dinero inmediato, sino acceder a posiciones con privilegios internos: bases de datos de clientes, infraestructura IT, sistemas financieros.
Los sectores afectados incluyeron empresas tecnologicas, organizaciones sanitarias y organismos gubernamentales. Este vector de ataque expone una dimension menos obvia del riesgo: el atacante puede llevar semanas o meses dentro de la organizacion antes de que se detecte la suplantacion.
#4 – Italia / Europa, 2024 | Fuentes: Reuters, Corriere della Sera, medios espanoles
Deepfake del ministro de Defensa italiano usado para estafar a empresarios europeos
En 2024, varios empresarios europeos, entre ellos el armador griego Aristotelis Migdalis y representantes del grupo de moda Zegna, recibieron videollamadas en las que aparecia el ministro de Defensa italiano Guido Crosetto solicitando fondos urgentes para una supuesta operacion de rescate de rehenes italianos en el extranjero.
El deepfake era suficientemente convincente para que al menos una victima llegara a contactar con su banco antes de que la operacion fuera abortada. El propio ministro confirmo el fraude en declaraciones publicas. El caso ilustra que el objetivo no son solo entornos corporativos internos: cualquier persona con autoridad publica o privada cuya imagen sea accesible puede ser suplantada.
El phishing con IA: el vector de entrada que prepara el terreno
Los ataques de deepfake en videoconferencia rara vez ocurren de forma aislada. Casi siempre van precedidos de un vector de acceso inicial, y el phishing hiperpersonalizado impulsado por IA sigue siendo el mas comun. Vale mencionarlo porque forma parte del mismo ecosistema de amenaza.
La diferencia con el phishing tradicional es cualitativa: los modelos de lenguaje (LLMs), incluyendo versiones de codigo abierto sin filtros de seguridad, permiten generar mensajes que replican el estilo de una organizacion concreta, hacen referencia a proyectos reales en curso y se adaptan al perfil del destinatario con datos extraidos de fuentes publicas.
El ciclo de ataque combinado
Fase 4 – El golpe: la llamada deepfake con el directivo suplantado. La victima ya tiene contexto previo y confianza establecida.
Fase 1 – Reconocimiento: extraccion automatizada de datos de LinkedIn, web corporativa, redes sociales y bases de datos filtradas.
Fase 2 – Phishing de precision: email o mensaje que abre la puerta, mediante un enlace, archivo adjunto o credencial comprometida.
Fase 3 – Escalada: con acceso a una cuenta interna o al calendario de la victima, se programa la videoconferencia fraudulenta.
Dato Segun el informe 2024 de IBM X-Force Threat Intelligence Index, un atacante puede generar un email de phishing creible con IA en menos de 5 minutos, con una tasa de clic hasta un 40% superior a los mensajes de phishing tradicionales.

Grandes empresas vs. PYMEs: riesgos distintos, misma vulnerabilidad
Una pregunta frecuente entre directivos de empresas medianas es: por que iban a atacarme a mi? La respuesta, lamentablemente, es que precisamente el tamano reducido es un factor de riesgo, no de proteccion.
| Perfil | Riesgo especifico |
| Grandes corporaciones | Ataques dirigidos de alto valor. CEO fraud con deepfake. Espionaje industrial. Exfiltracion de propiedad intelectual. Mayor superficie, pero tambien mayor capacidad defensiva. |
| PYMEs y medianas | Blancos oportunistas por menor proteccion. Usadas como vector para atacar a clientes grandes. Sin equipo de ciberseguridad dedicado. Impacto economico desproporcionado. |
| Sector financiero | Alta exposicion a fraudes de transferencia. Obligacion regulatoria DORA desde enero 2025. Requiere resiliencia operativa documentada y auditada. |
| Sector publico e institucional | Suplantacion de cargos para desinformacion, extorsion o fraude. Casos de deepfake de ministros y alcaldes ya documentados en Europa en 2024. |
El caso de Hong Kong es revelador: el empleado estafado no era descuidado ni inexperto. Simplemente no existia ningun protocolo de verificacion para una situacion que ningun manual habia contemplado hasta entonces. La ausencia de proceso fue el verdadero vector de entrada.
Como prepararse: medidas concretas sin caer en la paranoia
La respuesta a esta amenaza no es dejar de usar videoconferencias ni sospechar de cada llamada. Es construir capas de verificacion que sean naturales, rapidas y parte de la cultura organizacional. La tecnologia ayuda, pero el factor humano entrenado sigue siendo la primera linea de defensa.
Medidas organizacionales (sin tecnologia adicional)
- Establecer palabras de codigo internas para confirmar solicitudes urgentes o inusuales en llamadas. Una palabra acordada previamente que ningun deepfake puede conocer.
- Protocolo de doble canal: cualquier transferencia o decision critica comunicada por videollamada debe confirmarse por un segundo canal independiente (email corporativo, llamada a numero conocido).
- Politica documentada: nadie solicita transferencias urgentes y confidenciales exclusivamente por videoconferencia. Regla escrita, comunicada y conocida por todos los empleados con acceso financiero.
- Formacion practica con simulacros reales: no basta explicar el riesgo, hay que exponerlo de forma controlada para que los empleados desarrollen instinto de verificacion.
Senales de alerta durante una videollamada
- Micro-interrupciones, pixelacion o artefactos visuales inusuales en el video, tipicos del deepfake en tiempo real con hardware insuficiente.
- Iluminacion perfecta y uniforme que no varia aunque la persona se mueva, caracteristica frecuente en deepfakes de calidad media.
- Latencia o reacciones lentas ante preguntas inesperadas o personales, ya que el modelo generativo necesita tiempo de procesamiento.
- Solicitud de accion urgente, confidencial y fuera del proceso habitual. Este patron es el mayor indicador de fraude, con o sin deepfake.
- Resistencia a participar en verificacion alternativa: encender una segunda camara, compartir pantalla o llamar por otro canal.
Soluciones tecnologicas emergentes
- Herramientas de deteccion de deepfake en tiempo real integradas en plataformas de videoconferencia, como Intel FakeCatcher o Microsoft Azure Video Indexer con modulos de deteccion de manipulacion.
- Autenticacion biometrica de doble factor para decisiones criticas, que no dependa exclusivamente de la imagen facial en streaming.
- Arquitecturas Zero Trust aplicadas a comunicaciones internas: ninguna solicitud critica se valida por un unico canal ni por una sola persona.
Atencion: La tecnologia de deteccion de deepfakes evoluciona en carrera paralela con la de generacion. Hoy, ninguna herramienta garantiza deteccion al 100%. El factor humano bien entrenado y los protocolos de verificacion siguen siendo la defensa mas robusta y accesible.

Conclusion: la identidad digital es el nuevo perimetro de seguridad
Durante anos, la ciberseguridad se articulo alrededor de perimetros tecnicos: firewalls, antivirus, VPNs. La IA generativa ha desplazado el campo de batalla hacia algo mas dificil de proteger con codigo: la confianza entre personas.
Cuando la cara y la voz de alguien pueden ser replicadas en tiempo real, y cuando esa replica puede aparecer en la pantalla de cualquier empleado del mundo sin previo aviso, el perimetro de seguridad ya no es la red corporativa. Es la identidad digital de cada persona con autoridad en la organizacion.
Los casos de Hong Kong, Reino Unido, Italia y Estados Unidos no son anomalias. Son la nueva normalidad en evolucion. Prepararse no requiere paralizarse ni desconfiar de toda tecnologia. Requiere actualizar los protocolos con la misma velocidad con la que los atacantes actualizan sus herramientas.
Y, sobre todo, requiere hablar de esto. Porque el mayor aliado del fraude es el silencio.

