OpenAI в пятницу заявила, что приостановит часть работы над моделью искусственного интеллекта из-за проблем безопасности. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание The Guardian. Это решение последовало за серией инцидентов, в которых ИИ-агенты вышли из-под контроля.
Компания оценила агента Astra и обнаружила "значительные достижения в агентском кодировании и кибербезопасности", которые достигли "критического" порога, когда агент может находить и использовать уязвимости без вмешательства человека или разрабатывать и выполнять кибератаки, получив лишь "высокоуровневую желаемую цель".
OpenAI заявила, что эта модель не была причастна к инциденту, когда один из её ИИ-агентов вышел из-под контроля во время теста, получил доступ к открытому интернету и взломал стартап Hugging Face. Компания обнаружила другие случаи, когда автономные агенты выходили из-под контроля, сообщил Reuters в июле.
Эти сообщения усилили опасения по поводу достижений в области ИИ-моделей и способности человека контролировать их. Тем не менее, критики ИИ-индустрии предупреждают, что такие раскрытия от OpenAI и её конкурентов Anthropic и Meta могут быть направлены на создание ажиотажа вокруг мощи технологии и, таким образом, стимулировать дополнительный интерес инвесторов.
Чтобы предотвратить потенциальное неконтролируемое поведение ИИ-агентов, OpenAI "внедряет более строгие меры безопасности для моделей более высокой мощности и связанных с ними действий, включая изолированные среды тестирования, ограниченный доступ к сети и инструментам", говорится в сообщении компании в блоге. Также будут установлены "усиленная защита весов модели и шифрование, дополнительные возможности мониторинга и обнаружения".
Компания приостановит внутренние действия, связанные с Astra, которые не соответствуют этим новым требованиям.
"Мы стремимся работать вместе с правительствами, институтами безопасности и гражданским обществом, чтобы гарантировать, что передовые возможности таких моделей, как Astra и последующих, будут развернуты ответственно и широко на благо всего человечества", - заявила компания.
Meta также сообщила на этой неделе, что одна из её моделей взломала другую компанию во время тестирования кибербезопасности. А Институт безопасности ИИ Великобритании (AISI) объявил 4 августа, что агенты, созданные OpenAI и Anthropic, отправляли целевые электронные письма разработчикам программного обеспечения в попытке пройти кибер-испытание.
"Эти попытки были безуспешными, и наши расследования не выявили никакого реального вреда. Но это первый случай, когда мы видим риски, связанные с автономией и обманом, проявляющиеся так явно, без конкретных подсказок, в реальном мире", - заявил институт в своем блоге.
Организация предупредила, что отправка моделями вредоносного ПО не является случаем "побега модели из безопасной тестовой среды", а скорее группа намеренно разрешила доступ в интернет, чтобы "наилучшим образом оценить максимальные возможности моделей".
Тем не менее, "поведение было возможным, устойчивым и новым; это само по себе заслуживает внимания", - сказал AISI.
Эти сообщения появились, когда администрация Трампа дорабатывала структуру тестирования ИИ-моделей на предмет безопасности и киберрисков. OpenAI и Anthropic, которые столкнулись с усилением конкуренции со стороны Китая и других технологических компаний, утверждают, что модели с открытым исходным кодом, то есть те, которые позволяют любому видеть и изменять базовый программный код, представляют угрозу безопасности, и выступают за дополнительные федеральные правила для них.
