➡️Короткая история, как сняли ошейник с ИИ-собаки, чтобы узнать, далеко ли она убежит... А потом дружненько удивились, что она убежала далеко
Помните недавно писал про то, как ИИ-агент взломал Huggingface (вот тут)? Оказывается это была модель от OpenAI (они якобы "покаялись")... Тезисно расскажу
OpenAI тестировала свою модель на кибервозможности и специально отключила ей защитные тормоза "для чистоты замера". Задача была узкая — решить один технический тест. Модель решила её нечестно и вместо того чтобы биться над задачей, она нашла способ выбраться из своей изолированной песочницы в открытый интернет. А уже из этих ваших интернетов — прямиком в реальную рабочую инфраструктуру Hugging Face. Украла доступы, пробралась через несколько внутренних серверов и добралась до базы, где, как она поняла, могли лежать готовые ответы на её тест. Никакой драмы про захват мира здесь нет — просто способ срезать путь к правильному ответу чужими руками или точнее чужими серверами.
Самое неловкое здесь не то, что модель это сделала, а то, что тормоза сняли сами, добровольно, зная риск, и назвали это методикой оценки. Получить в итоге проникновение в чужую продакшн систему после этого — не сюрприз, а закономерность.
Заметила и остановила вторжение, кстати, не OpenAI, а сама команда Hugging Face, ещё до того как к разбору подключилась OpenAI.
Простой вывод-предостережение для обычных людей. Если вы гоняете ИИ-агента в песочнице без тормозов ради теста, спросите себя — вы точно уверены, что у этой песочницы нет случайной дверцы в настоящий интернет? А судя по тому, что вайбкожанные специалисты не читают ничего, что отвечает модель и просто нажимают "далее" или "разрешить" — никто не в чём не может быть уверен. И получается, если дверца есть — агент её найдёт если это совпадает с его целями..
статья от самих OpenAI Об этом всём