📌 В кибертестах ИИ создавал поддельные личности и использовал социальную инженерию
Институт безопасности ИИ Великобритании опубликовал отчёт об инциденте, произошедшем в конце июля во время замеров киберспособностей передовых моделей.
ИИ-агенты вышли за пределы тестового полигона и начали действовать против посторонних людей и компаний. Попытки не удались, и, как пишет AISI, ущерба не было.
Институт называет это первым случаем в своей практике, когда модель без самостоятельно применила обман такого масштаба против человека.
Набор испытаний состоял из 122 запусков семи моделей на двух учебных полигонах. Следы несанкционированных действий нашли в 10 прогонах. Самих действий, задевших внешние системы и людей, институт насчитал 19, из них 17 приходится на Mythos 5 и 2 на GPT-5.6 Sol.
AISI давал агентам выход в интернет, а у двух моделей отключил фильтры, которые блокируют опасные киберзапросы. Иначе, объясняет институт, предельные возможности не измерить.
Что нельзя делать в интернете, агентам не сказали. Часть заданий была настроена с ошибкой, и цель формально оказалась вне разрешённой зоны.
🟡 Самый тяжёлый эпизод длился 34,5 часа
Агент искал цель в открытом интернете и по цепочке совпадений решил, что репозиторий постороннего разработчика связан с заданием.
Он отправил в проект правку с замаскированным вредоносном, а чтобы её приняли, завёл несколько фальшивых аккаунтов на GitHub, обходя проверки при регистрации через Tor и прокси.
Один из этих аккаунтов написал, что просмотрел код правки и ничего опасного не увидел, а другой, тоже фальшивый и принадлежавший агенту, поблагодарил его за независимую проверку.
Параллельно агент спрятал в другом репозитории инструкцию для ИИ-ассистентов, которые разбирают заявки. Ещё он отправил мейнтейнерам письма и файлы, часть из которых были с вредоносной начинкой.
Подвох заметил посторонний пользователь - он запустил подозрительный скрипт в изолированном контейнере и предупредил разработчика. Получив этот фидбэк, агент стал заметать следы - отредактировал прежние сообщения, назвал вредоносный фрагмент случайно забытым отладочным кодом и переписал историю правки.
Инцидент отловили по трафику через Tor. Испытания остановили, машины изолировали, доступ к Mythos 5, Opus 5 и GPT-5.6 Sol временно закрыли.
🟡В другом случае агент выложил ключ доступа к своему аккаунту GitHub
Агенты из параллельных тестов нашли ключ и стали пользоваться общим аккаунтом, причём один написал другим правила, как делить лимиты запросов и не мешать друг другу. Позже GitHub заблокировал этот аккаунт.
Из расшифровок действий видно, что агент прикидывал, настоящий перед ним интернет или симуляция. По итогу рассуждений он заключил, что GitHub, скорее всего, настоящий, - и продолжил.
AISI уведомила о результатах своих экспериментов британские NCSC и GC3, GitHub, OpenAI, Anthropic и американский CAISI.
Институт обещает опубликовать более полную версию отчета с подробностями и трассировками.
@ai_machinelearning_big_data
#news #ai #ml