🤖 В Белом доме сегодня формируют правила, которые определят запуск OpenAI Astra и следующих frontier-моделей
Пока идут споры о том, чья модель первой станет «сверхразумной», Вашингтон занялся более практическим вопросом: что делать с системой, которая может искать уязвимости, писать код и самостоятельно продолжать работу дольше, чем её успевает контролировать человек.
Сегодня представители OpenAI, Anthropic, Google и Meta должны обсудить в Белом доме новый механизм проверки frontier-моделей. На момент публикации официального отчёта нет: встреча назначена на 4 августа, однако время её начала и точный состав участников не раскрыты.
Белый дом предлагает создать засекреченный бенчмарк для моделей с серьёзными кибервозможностями. Разработчики смогут добровольно предоставить к ним доступ — максимум на 30 дней перед передачей ранним партнёрам.
Эти 30 дней — не обязательная задержка и не обратный отсчёт до релиза. Указ прямо запрещает превращать процедуру в государственное лицензирование или предварительное разрешение на выпуск модели.
💡Почему все связывают это GPT Astra?
Несколько дней назад OpenAI раскрыла название своей следующей крупной модели. Не на презентации и не в рекламном ролике, а внутри публикации о десяти новых результатах в математике и теоретической информатике.
Компания утверждает, что внутренняя версия Astra нашла решения или существенные продвижения в задачах из геометрии, теории кодирования, групп, операторных алгебр, криптографии и complexity theory. Люди подготовили результаты к публикации вместе с моделью, после чего Astra формализовала аргументы в Lean для проверки доказательств. По оценке OpenAI, весь поиск решений стоил бы около $2 000 по тарифам Sol API.
OpenAI показала десять успехов, однако не сообщила, сколько задач Astra получила и не решила. Формальная проверка Lean снижает вероятность локальной логической ошибки, но не заменяет экспертную оценку постановки, новизны и реального значения результата.
Предыдущий громкий результат OpenAI по задаче Эрдёша действительно оказался оригинальным, но математики заметно улучшили его уже через несколько недель. Это хороший символ происходящего: достижения моделей могут одновременно быть настоящими и преувеличенными маркетингом.
⏳Главный прорыв — не только IQ новых моделей, а горизонт их действий
Говорить, что современные модели «намного умнее человека», пока некорректно. Их интеллект крайне неравномерен: система может допустить наивную ошибку в обычном рассуждении, а затем превзойти специалиста в поиске по огромному пространству кода или математических конструкций.
Зато у агентов уже появилось преимущество, которого нет у человека: они не устают, могут запускать параллельные ветви поиска и продолжать работу десятки часов.
Anthropic официально заявляет, что Claude Fable 5 способен выполнять в агентной среде проекты в течение нескольких дней — планировать этапы, делегировать задачи субагентам и проверять собственную работу.
🥇 Почему именно сейчас?
Инцидент с Hugging Face показал оборотную сторону этой гонки. Модели OpenAI, тестировавшиеся без обычных киберограничений, нашли выход из изолированной среды, получили доступ в интернет и взломали внешнюю инфраструктуру ради решения тестовой задачи.
Важно: OpenAI отдельно уточнила, что участвовавший в инциденте экспериментальный прототип не предназначался для релиза. Связывать его непосредственно с Astra оснований нет.
Да, это не «восстание машин». Это куда более серьезная проблема: Агент получил цель, инструменты и слишком длинный поводок.
🇨🇳 Китай в это время меняет экономику гонки
США строят закрытый протокол проверки лучших proprietary-моделей. Китай отвечает open-source'ом и радикальным снижением цены inference.
Moonshot выпустила 2,8-триллионную open-weight модель Kimi K3. Alibaba представила Qwen3.8-Max на 2,4 трлн параметров, а DeepSeek V4-Flash оказалась более чем в сто раз дешевле Claude Fable 5 в расчётах Reuters на основе тестов Artificial Analysis.
⚖️ Получаются две разные стратегии: