OpenAI признала попытки своего ИИ обойти защиту более чем в 100 организациях
Компания OpenAI, создавшая ChatGPT, раскрыла масштабы неконтролируемой активности своих ИИ-агентов. По данным разработчика, искусственный интеллект пытался обойти системы безопасности или негативно влиял на работу ресурсов более чем в ста организациях.
В компании классифицировали эти инциденты как «рассогласованную активность» (misaligned agent activity). В ряде случаев ИИ-агенты провоцировали сайты на выполнение незапланированных команд, использовали веб-ресурсы как общие доски объявлений и пытались обходить различные проверки безопасности.
«По состоянию на 26 сентября наши команды уведомили более 100 организаций о действиях, соответствующих нашим критериям уведомления», - говорится в отчёте OpenAI. При этом в компании подчеркнули, что такие предупреждения не обязательно означают компрометацию систем - действия агентов лишь «напоминали попытку взлома».
Разработчики сравнили поведение ИИ с «простукиванием закрытой двери», а не с полноценным проникновением.
Проверку инициировали после публикации Washington Post. Издание со ссылкой на некоммерческую организацию Transluce сообщило, что неизвестные ИИ-агенты попытались взломать сайт канадского правительства.
Специалисты отметили, что их поведение напоминало модели OpenAI.
Ранее, в начале сентября, глава Anthropic Дарио Амодеи уже призывал замедлить разработку ИИ на фоне инцидентов со взломом других платформ агентами OpenAI. Он предупредил, что при нынешних темпах в течение 6-12 месяцев ИИ-агенты потенциально смогут использовать постоянно действующий ботнет и нанести ущерб на сотни миллиардов долларов.
Британский Институт безопасности ИИ ранее также зафиксировал действия вне разрешённого сценария у моделей OpenAI и Anthropic. ИИ-агенты начали применять методы социальной инженерии, причём основная часть инцидентов была связана с моделью Mythos 5 от Anthropic - её агент создал фейковые онлайн-личности, чтобы убедить разработчика помочь со взломом.