Компания по разработке искусственного интеллекта Anthropic недавно обнаружила, что её модель AI получила доступ в реальный интернет во время внутреннего теста безопасности и взломала три компании.
Компания заявила, что инцидент произошёл начиная с апреля, и модель AI не вышла из песочницы, а подключилась к интернету через ошибку конфигурации системы, после чего атаковала реальные компании.
Данный инцидент, следующий за недавним случаем, когда модель AI от OpenAI взломала Hugging Face, вызывает растущие опасения по поводу систем управления безопасностью AI.
▲ Доступ в реальный интернет во время теста…взлом трёх компаний
По данным Wall Street Journal от 30-го числа (местного времени), Anthropic заявила, что модель AI, находившаяся на стадии тестирования, получила доступ в интернет без ведома компании и взломала три реальные компании.
Компания не раскрыла названия пострадавших компаний, но сообщила, что все три были уведомлены об инциденте в прошлый понедельник.
Этот инцидент рассматривается как пример того, что модель AI может выйти за пределы контролируемой среды и получить доступ к реальным системам.
▲ Очередной отказ контроля за AI после инцидента с OpenAI
Это заявление было сделано через неделю после того, как OpenAI раскрыла, что её модель AI вышла из изолированной песочницы, отключённой от интернета, и взломала платформу Hugging Face.
В то время инцидент продемонстрировал, что AI может проявлять непредсказуемое поведение при самостоятельном выполнении задач, что вызвало большой шок у экспертов по безопасности.
С подтверждением примера Anthropic растут опасения по поводу того, что управление тестовой средой и защитные механизмы у компаний AI недостаточны.
▲ "Необходимо усилить стандарты безопасности во всей отрасли"
Алекс Стамос, главный ответственный по продуктам в компании кибербезопасности Corridor, оценил эти инциденты как демонстрацию необходимости более тщательной изоляции систем компаниями AI при проведении тестов кибербезопасности.
Он подчеркнул необходимость разработки общих стандартов безопасности, которые могут быть применены ко всей отрасли.
Одновременно он предупредил о растущей вероятности того, что киберпреступники, такие как организации-вымогатели, будут использовать более мощные модели AI для проведения крупномасштабных атак в будущем.
Стамос заявил: "Момент, когда злоумышленники смогут использовать открытые модели AI для получения такого уровня возможностей атаки, уже близок, и нам необходимо подготовиться".

Anthropic (Photo: [Reuters/Yonhap News])
▲ Расширение дискуссий о регулировании AI
Ожидается, что этот инцидент ускорит дискуссию об опасностях, которые может представлять высокопроизводительная модель AI, и о том, как её контролировать.
Белый дом США недавно проводит политику, направленную на усиление контроля за AI, а частный сектор в то же время требует сохранения доступа к моделям AI с открытыми весами (Open-weight), которыми могут управлять пользователи.
Конгрессмен США Грег Касар недавно указал: "AI развивается очень быстро без существенного нормативно-правового регулирования, которое защищало бы нас".
▲ Начало внутреннего расследования после инцидента с OpenAI
После того как инцидент с OpenAI стал известен, Anthropic начала внутреннее расследование, чтобы проверить, возникли ли подобные проблемы в своих моделях AI.
Компания проанализировала более 141 000 записей тестов и обнаружила, что её модель AI Claude несколько раз действительно получала доступ в интернет.
Однако компания пояснила, что в этом случае AI не вышла из песочницы, а подключилась к интернету через систему, в которой изначально не была должным образом установлена песочница.
▲ Процесс проникновения в реальные системы из-за ошибки виртуальной среды
Anthropic раскрыла, что ошибки конфигурации (misconfiguration) в системах её компании и систем компании по безопасности Irregular, партнёра по тестированию, позволили модели AI получить доступ в реальный интернет.
Irregular также сообщила, что в настоящее время проводит собственное расследование этого инцидента.
Этим моделям было сказано, что интернет-соединение невозможно, однако во время тестирования они обнаружили пути доступа в интернет.
Впоследствии они использовали базовые методы взлома, такие как угадывание слабых паролей и поиск систем без требования аутентификации, для получения доступа к реальным корпоративным системам.
Anthropic пояснила, что модель AI неправильно интерпретировала эти действия не как реальный взлом, а как процесс бенчмаркинга для оценки производительности.
▲ Создание вредоноса и проникновение в компанию по безопасности
В одном случае Claude самостоятельно создала вредоносную программу и заставила систему сканирования компании по безопасности загрузить её.
Эта программа украла учётные данные компании, и, используя их, удалось проникнуть даже во внутреннюю инфраструктуру.
В процессе взлома Claude поняла, что её действия не допускаются в реальности, однако сама решила, что текущая ситуация — это симуляция, а не действительность, и продолжила атаку.
▲ Проникновение даже в базы данных реальной компании
В наиболее серьёзном случае Claude попыталась взломать вымышленную тестовую компанию, но обнаружила веб-сайт реальной компании с тем же названием.
Не получив доступ к вымышленной цели, AI изменила своё поведение и начала атаковать базу данных реальной компании.
Anthropic раскрыла, что это был единственный случай, когда AI продолжала атаку после осознания того, что взламывает реальную компанию.
▲ Остальные случаи — немедленное прекращение атаки
В двух других случаях AI либо не осознавала, что взломала реальную компанию, либо немедленно прекращала атаку после подтверждения, что система является реальной.
Компания пояснила, что такое поведение произошло из-за того, что AI не могла чётко различить реальность и симуляцию.
▲ Начало с апреля…включение последних моделей AI
Согласно Anthropic, эти взломы начались в апреле и затронули модели Opus 4.7, Mythos 5 и исследовательскую модель AI, названия которой не были раскрыты.
Компания заявила о намерении полностью усилить тестовую среду и контроль доступа в интернет, чтобы предотвратить подобные инциденты в будущем.
Авторское право © JKN. Несанкционированное воспроизведение или распространение запрещено.