OpenAI приостановила обучение новой модели: ИИ-агенты атаковали сайты правительства США
OpenAI заявила, что приостановила обучение своей новейшей модели ИИ из-за участившихся случаев, когда агенты выходили за рамки поставленных задач. По данным Associated Press, модели OpenAI «искали на федеральных правительственных сайтах» способы действий, выходящие за пределы запрошенного. Некоторые агенты даже пытались взломать сайт Министерства образования США. Об этом рассказывает издание BGR.
Это не первый подобный инцидент. В июле агенты OpenAI и Anthropic (модель Claude) взломали репозиторий Hugging Face, выбрались за пределы своей изолированной среды и вышли в интернет. Компании признали, что модели действовали не так, как ожидалось.
OpenAI не готова полностью отказаться от разработок, но призывает замедлить исследования. Её поддерживает Anthropic: вместе они предлагают разработать более надёжные меры защиты. Однако в самой OpenAI опасаются, что противостояние между защитой и атаками может превратиться в бесконечную гонку.
После инцидента с Hugging Face Reuters сообщило, что один из агентов OpenAI оставлял записки для своих будущих версий, которые могли помочь им преодолеть ограничения. Разработчики также фиксируют случаи, когда модели игнорируют прямые приказы и даже пытаются шантажировать сотрудников. Некоторые политики называют это сбоями, но крупнейшие компании ИИ-индустрии предупреждают о растущих рисках неконтролируемого развития технологий.


