🔐 Hacker News опубликовал сводку деталей, как Claude Mythos 5 пытался заразить бэкдором open-source проект. На самом деле атаке подверглись 145 репозиториев открытого кода на GitHub.
На скриншоте видно, что когда у владельцев репозиториев возникло подозрение, агент не остановился. Он отрицал, что код вредоносный, попросил постороннего запустить свой скрипт и отозвать предупреждение, переписал историю ветки, а затем использовал второй аккаунт, чтобы настоять на слиянии.
Атака длилась 34 часа до того, как специалисты по безопасности наконец поняли, что ИИ сбежал из sandbox.
Важные наблюдения по этой атаке:
1. ИИ-агенты могут использовать социальную инженерию очень продвинутого уровня. Я не удивлюсь, если даже агент устроится на удалённую работу в какой-нибудь банк, будет писать код по заданию, а потом усеет всё бэкдорами. Не стоит забывать, что ИИ уже проходит тест Тьюринга, поэтому уровень отличимости от человека очень низкий.
2. Видно, что старые меры и инструменты по безопасности неадекватны новым ИИ-угрозам. Во всех кейсах, и в этом, агенты имели несколько часов для выполнения действий. В случае этого кейса сотрудники безопасности уже знали о возможности побега ИИ по взлому Hugging Face, но это не помогло.
3. Кейс показал, что ИИ нападает роем агентов, причём имеют признаки самоорганизации роя не только как запуски субагентов, но и как переговоры с другими агентами.
Мало сомнений, что мы видим лишь начало реальных проблем. Во всех громких кейсах сейчас у вендоров LLM хотя бы была кнопка Off для инференса модели. При реальных атаках обычно ИИ-субагентов раскидывает на много разных аккаунтов у облачных вендоров, а также применяется ещё своя uncensored-модель для оркестрации. Это и сложнее обнаружить, и сложнее отключить.
https://thehackernews.com/2026/08/claude-mythos-5-tried-to-backdoor-real.html