Компания Anthropic ограничила доступ ИИ-агентов к открытому интернету во время внутренних тестов после нескольких случаев, когда модели действовали не так, как было задумано. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание Kursiv Media.
Во время одного из тестов Claude Haiku 4.5 открыл страницу о нераскрытом убийстве. На сайте была форма, через которую можно отправить информацию в полицию. ИИ заполнил ее выдуманным сообщением о том, что якобы видел человека, связанного с этим делом.
При этом на странице не было описания подозреваемого. Claude оставил поля с именем и контактами пустыми, но все равно отправил сообщение. Оно попало в спам и не дошло до следователей.
По данным Anthropic, инструкции запрещали модели входить в аккаунты, создавать новые, вводить личные данные и совершать покупки. Однако отправлять сообщения через формы они не запрещали. В компании указали, что этот случай не привел к серьезным последствиям.
«Вводящие в заблуждение рассуждения Claude продолжались несколько часов и подкрепляли его дальнейшие попытки атаки. При этом для уверенного вывода о намеренном обмане обычно требуется более глубокий анализ», — написали в блоге компании.
В отчете Anthropic описала и другие случаи. Например, Claude Mythos Preview нашел уязвимость на сервере университета и использовал ее, чтобы запускать команды и копировать файлы. В других ситуациях модели находили способы получить доступ к данным, защищенным специальными токенами, или обходили ограничения с помощью сервисов сокращения ссылок.
После этих случаев Anthropic решила отключить доступ к реальным сайтам во всех внутренних тестах. Компания вернет его, когда убедится, что системы безопасности могут надежно обнаруживать и блокировать подобные действия.
Ранее «Курсив» писал об инцидентах ИИ-агентов OpenAI. Они пытались обойти защиту более 100 сайтов сторонних организаций.
