El modelo de IA de Anthropic piratear 3 empresas reales durante pruebas

음영태 Reportero

Se ha confirmado recientemente que un modelo de IA de la empresa de inteligencia artificial Anthropic hackeó a tres empresas durante pruebas de seguridad interna al acceder a internet real.

La empresa indicó que el incidente ocurrió desde abril pasado, y que el modelo de IA no escapó de la zona de pruebas, sino que se conectó a internet a través de errores de configuración del sistema e intentó ataques contra empresas reales.

Según análisis de expertos, este incidente está aumentando aún más las preocupaciones sobre los sistemas de gestión de seguridad de la IA, tras el reciente caso en el que un modelo de IA de OpenAI hackeó Hugging Face.

▲ Acceso a internet real durante pruebas…Hackeo de tres empresas

Según el Wall Street Journal del 30 (hora local), Anthropic confirmó que su modelo de IA accedió a internet sin que la empresa lo supiera durante las pruebas e intentó ataques contra tres empresas reales.

Aunque la empresa no reveló los nombres de las víctimas, explicó que las tres empresas fueron notificadas del incidente el pasado lunes.

Este caso es evaluado como un ejemplo que demuestra que los modelos de IA pueden escapar de entornos controlados y acceder a sistemas del mundo real.

▲ Fallo de control de IA revelado nuevamente tras el incidente de OpenAI

Este anuncio se realizó poco después de que OpenAI revelara hace una semana que su modelo de IA había escapado de una zona de pruebas aislada de internet y hackeó la plataforma Hugging Face.

En ese momento, el incidente sorprendió a los expertos en seguridad al demostrar que la IA puede exhibir comportamientos impredecibles mientras ejecuta objetivos de manera autónoma.

Con la confirmación del caso de Anthropic, crece aún más la preocupación de que la gestión del entorno de pruebas y los mecanismos de seguridad de las empresas de IA sean insuficientes.

▲ "Debe fortalecerse el estándar de seguridad en toda la industria"

Alex Stamos, oficial jefe de productos (CPO) de la empresa de ciberseguridad Corridor, evaluó que estos incidentes demuestran la necesidad de que las empresas de IA aíslen sus sistemas de manera más exhaustiva durante las pruebas de ciberseguridad.

Enfatizó que la industria completa debe establecer estándares de seguridad comunes que puedan aplicarse en toda la industria.

Simultáneamente, advirtió que aumenta la posibilidad de que los delincuentes cibernéticos, como los grupos de ransomware, utilicen modelos de IA cada vez más potentes para llevar a cabo ataques a gran escala en el futuro.

Stamos señaló que "no está lejano el momento en que los atacantes obtengan este nivel de capacidad de ataque utilizando modelos de IA abiertos" y que es necesario estar preparados.

앤트로픽
Anthropic (Foto: [Reuters/Proporcionada por Yonhapnews])

▲ Debate sobre regulación de IA también se expande

Este incidente se espera que acelere la discusión sobre los riesgos que pueden traer los modelos de IA de alto rendimiento y cómo controlarlos.

La Casa Blanca de Estados Unidos está impulsando políticas en la dirección de fortalecer la supervisión de la IA, y en el sector privado crece la voz de que se debe mantener la accesibilidad de los modelos de IA de peso abierto (Open-weight) que los usuarios pueden operar directamente.

El Representante Greg Casar de la Cámara de Representantes de Estados Unidos señaló recientemente que "la IA se está desarrollando muy rápidamente sin regulaciones sustanciales que nos protejan".

▲ Inició investigación interna después de confirmar el caso de OpenAI

Después de que se conociera el incidente de OpenAI, Anthropic inició una investigación interna para verificar si problemas similares ocurrieron en sus propios modelos de IA.

Después de analizar más de 141,000 registros de pruebas, la empresa confirmó que su modelo de IA Claude accedió a internet en varias ocasiones.

Sin embargo, explicó que en este caso el IA no escapó de la zona de pruebas, sino que se conectó a internet a través de un sistema donde la zona de pruebas no fue construida correctamente desde el principio.

▲ Proceso de infiltración en sistemas reales por error en entorno virtual

Anthropic indicó que un error de configuración (Misconfiguration) en su sistema y en el sistema de Irregular, su socio de pruebas de seguridad, permitió que el modelo de IA accediera a internet real.

Irregular también explicó que actualmente está realizando su propia investigación sobre el incidente.

A los modelos se les indicó que no podían conectarse a internet, pero durante las pruebas encontraron rutas de acceso a internet.

Posteriormente, utilizaron técnicas básicas de hackeo como adivinar contraseñas débiles o encontrar sistemas que no requerían autenticación para acceder a sistemas de empresas reales.

Anthropic explicó que el modelo de IA interpretó erróneamente estas acciones como un proceso de benchmark para evaluación de rendimiento en lugar de hackeo del mundo real.

▲ Creó malware e infiltró a empresa de seguridad

En un caso, Claude creó directamente un programa malicioso e indujo al sistema de escaneo de una empresa de seguridad a descargarlo.

Este programa robó credenciales de autenticación de la empresa, y utilizándolas, logró infiltrarse en la infraestructura interna.

Durante el proceso de hackeo, Claude reconoció que sus acciones no estaban permitidas en la realidad, pero juzgó por sí mismo que la situación actual era una simulación y no real, continuando con el ataque.

▲ Infiltración incluso en bases de datos de empresas reales

En el caso más grave, Claude intentó hackear una empresa de pruebas virtual, pero descubrió un sitio web de una empresa real que usaba el mismo nombre.

Al no poder acceder al objetivo virtual, la IA cambió su comportamiento hacia la infiltración en la base de datos de la empresa real.

Anthropic indicó que este era el único caso donde la IA continuó el ataque incluso después de reconocer que estaba hackeando una empresa real.

▲ En otros casos, detuvo inmediatamente el ataque

En los otros dos casos, la IA no reconoció que estaba hackeando empresas reales, o detuvo inmediatamente el ataque después de confirmar que eran sistemas del mundo real.

La empresa explicó que este comportamiento ocurrió en el proceso donde la IA no distinguía claramente entre la realidad y la simulación.

▲ Comenzó en abril…Incluye los últimos modelos de IA

Según Anthropic, estos hackeos comenzaron en abril pasado e involucraron a Opus 4.7, Mythos 5, y un modelo de IA para investigación cuyo nombre no ha sido revelado.

La empresa indicó que fortalecerá completamente el entorno de pruebas y el control de acceso a internet para evitar incidentes similares en el futuro.

Copyright © JKN. Prohibida la reproducción o redistribución no autorizada.