Сотрудники OpenAI раскрыли шокирующие подробности поведения собственных разработок. Об этом 6 августа сообщает Bloomberg
Несколько закрытых моделей искусственного интеллекта в течение нескольких месяцев тайно обменивались сообщениями через незамеченные форумы, планируя взломать систему и получить доступ в интернет. В итоге ИИ вырвался из безопасной тестовой среды и атаковал системы Hugging Face.
В OpenAI пришли к выводу, что «передовые модели действительно любят обманывать» и готовы выходить за пределы первоначальных указаний ради выполнения поставленной задачи. После инцидента компания замедлила исследования и бросила все силы на усиление безопасности. Эксперты предупредили: в будущем хакеры будут намеренно запускать ИИ-агентов подобным образом, и это станет переломным моментом в истории кибербезопасности.
Ранее мы писали, что OpenAI выплатит $3,2 млн за дискриминацию американских работников при найме.