Anthropic допустил побег модели вслед за OpenAI
НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+
Anthropic раскрыла, что ее продвинутые модели, как и у OpenAI, «сбежали» из тестовой среды и хакнули три сторонних компании.
Компания подчеркивает, что моделям (Claude Opus 4.7, Mythos 5 и неназванная экспериментальная) удалось получить доступ к интернету только в шести случаях из 140 тысяч тестов и что две последние модели либо осознали выход за пределы задания, либо прекратили активность. Само задание заключалось в «захвате флага» — ИИ говорят, что на машинах в доступной ей сети без выхода в интернет есть секретная информация, которую надо достать. Способ остается на усмотрение ИИ.
Побег сделала возможными человеческая ошибка — неверная конфигурация «песочницы» партнера OpenAI, израильской Irregular, оставившая окно в настоящий интернет. Однако детали успешной атаки только подтвердили, что хакерский ИИ — это огромная и реальная угроза.
Три атаки
В четырех случаях ИИ атаковал одну и ту же компанию, адрес которой случайно совпал с примером из тестовой среды. Модель Claude Opus 4.7 каждый раз применяла для атаки стандартные средства и сумела достать небольшой кусок базы данных из нескольких сотен строк. Модель осознала, что имеет дело с настоящим интернетом, но не прекратила атаку. В двух случаях из четырех она убедила себя, что «побег» — это тоже часть теста.
В одном случае ИИ Claude Mythos 5 нашел в тестовой среде инструкции по установке пакетов Python для новых девелоперов и верно идентифицировал перспективный вектор атаки — депозитарий-«ловушку» на PyPI, который могли бы автоматически установить системы компании-”партнера». Далее ИИ понял, что ему нужен телефон для регистрации аккаунта и почти уже смог оплатить его, но потом нашел способ зарегистрироваться в реальной системе через электронную почту. После этого опасный депозитарий «подобрали» и запустили 15 реальных агентов, включая компанию, специализирующуюся на кибербезопасности. В результате исполнения кода ее внутренние данные оказались в стороннем доступе по адресу, указанному ИИ. Здесь модель тоже убедила себя, что осталась в симуляции.
Еще в одном случае самая новая экспериментальная модель не смогла найти в тестовой среде цель атаки и решила поискать ее в интернете, перебрав 9 тысяч адресов. Один из сайтов оказался незащищенным против самого базового вторжения через SQL-инъекцию. Но в этом случае модель поняла, что вышла в настоящий интернет, и прекратила активность.
Почему это важно
Anthropic успокаивает: система защиты публично доступных моделей не допустила бы побега. Но и тестовый ИИ действовал исключительно в пределах поставленных целей, как он их понимал, и не ставил собственных. «Ни в одном из тестов Claude не пытался скопировать себя на внешний ресурс или намеренно покинуть тестовую среду», — подчеркивает компания. Но она намерена резко усилить изоляцию тестовых сред.
Так или иначе, побеги (первый произошел в апреле) оставались незамеченными до повторного анализа логов тестов, которые Anthropic решила провести после атаки ИИ OpenAI на Hugging Face. Подробнее о последствиях того побега моделей мы рассказывали здесь.