Компания Anthropic в четверг заявила, что её ИИ-модель Claude взломала системы трёх организаций во время тестирования. Это произошло через несколько дней после того, как конкурент OpenAI раскрыл информацию о rogue-агенте, который в течение нескольких дней совершал взломы в AI-фирме Hugging Face. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание The Guardian.
По данным Anthropic, Claude получил несанкционированный доступ к системам во время оценки кибербезопасности из-за ошибки конфигурации, которая позволила моделям выйти в интернет из тестовых сред, которые должны были быть изолированы.
Компания заявила, что выявила инциденты после проверки 141 006 запусков оценки кибербезопасности — процесс, начатый после раскрытия информации OpenAI.
Эти взломы сигнализируют о том, что расширяющиеся возможности ИИ уже усиливают угрозу безопасности, которой давно опасались эксперты, и что даже ведущие разработчики могут быть застигнуты врасплох недостатками, которые могут использовать их модели.
«Claude скомпрометировал инфраструктуру пострадавших организаций, используя базовые методы, такие как эксплуатация слабых паролей и неаутентифицированных конечных точек», — говорится в заявлении компании.
Anthropic сообщила, что в инцидентах были задействованы три разные модели: Claude Opus 4.7, Claude Mythos 5 и одна внутренняя исследовательская модель. Самые ранние случаи датируются апрелем и произошли в средах оценки, в которых отсутствовали стандартные меры защиты, как описала компания.
Взломы произошли во время так называемых упражнений «захват флага», в которых моделям поручалось найти скрытую информацию в смоделированных сетях. Компания заявила, что её инструкции говорили моделям, что у них нет доступа в интернет, но недопонимание с партнёром по оценке Irregular привело к тому, что системы были подключены к общедоступному интернету.
Две из трёх организаций не знали об этой деятельности до того, как с ними связались, сообщила Anthropic, добавив, что всё ещё пытается связаться с третьей.
«Мы обнаружили эти инциденты после активного просмотра наших транскриптов оценки кибербезопасности», — заявила компания.
Anthropic подчеркнула, что эти результаты указывают на необходимость более строгого контроля как во внутренних, так и в сторонних тестовых средах, поскольку модели ИИ становятся всё более способными к выполнению реальных кибердействий.
