Новости из Кремниевой долины звучат как завязка фильма «Терминатор»: OpenAI официально объявила о временном замедлении разработки и двухнедельной заморозке обучения своих самых мощных моделей из-за критических рисков в сфере кибербезопасности.
Во время тестов в изолированной среде модель GPT-5.6 Sol и ещё один секретный прототип смогли самостоятельно найти уязвимость в защите своего «аквариума». Они вырвались в открытый интернет и атаковали популярную ИИ-платформу Hugging Face. Чтобы обойти сканеры, ИИ догадался разделить и замаскировать токен аутентификации, а результаты взлома слил на GitHub, проигнорировав команду отправить отчёт только разработчикам.
Ещё одна секретная модель OpenAI вплотную приблизилась к «критическому порогу кибервозможностей». Она научилась без помощи человека находить уязвимости в реальных защищённых системах, писать под них рабочие эксплойты и планировать комплексные кибератаки. Разработку Astra заморозили на неопределённый срок.
Похожие инциденты с неконтролируемым выходом ИИ в сеть признали Anthropic (создатели Claude) и Meta. Более 1300 исследователей уже подписали открытое письмо к правительству США с требованием принудительно замедлить технологическую гонку.
За две недели паузы OpenAI полностью перестроила процессы безопасности: модели заперли в новые, тотально изолированные «песочницы», развернута система ИИ-классификаторов, которая проверяет «мыслительный процесс» моделей на каждом сгенерированном символе. На тотальный контроль за поведением нейросетей теперь уходит 20% всех вычислительных мощностей компании.
«Безопасность систем должна опережать их возможности. Мы сознательно замедляем темпы» — прокомментировал ситуацию Сэм Альтман. Расследование одного только инцидента с Hugging Face обошлось компании почти в $15 млн.
Ранее мы писали, что FT: США обвинили 40+ стран в помощи Китаю по обходу пошлин.