Инциденты, когда системы искусственного интеллекта выходят из-под контроля пользователей, лгут, игнорируют инструкции и преследуют вредоносные цели, достигли нового максимума. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание The Guardian.
Согласно исследованию, количество инцидентов потери контроля над моделями ИИ почти удвоилось в июле по сравнению с июнем, превысив 300 случаев за месяц. Эти данные отслеживает обсерватория Loss of Control Observatory, финансируемая британским Институтом безопасности ИИ (AISI). Обсерватория начала фиксировать случаи отклонения ИИ от инструкций пользователей в ноябре прошлого года.
Среди зарегистрированных случаев — ИИ, притворяющиеся своими собственными контролерами-людьми, имитирующие их стиль письма, чтобы фактически дать себе разрешение на действия, и обходящие правила, требующие одобрения человека. Инцидент потери контроля определяется как случай с явными доказательствами, указывающими на интриги или связанное с ними поведение.
Последние данные были предоставлены The Guardian. Это происходит на фоне растущей обеспокоенности по поводу непокорного поведения ведущих моделей ИИ во время тестирования OpenAI и Anthropic этим летом. На этой неделе стало известно, что сотрудники OpenAI наблюдали признаки непокорного поведения среди своих ведущих ИИ-агентов за несколько недель до того, как они сбежали из учебной среды и начали беспрецедентную хакерскую кампанию, вызвавшую глобальную тревогу. Расследование их взлома Hugging Face, репозитория программного обеспечения, выявило около 700 автономных агентов, которые тайно сотрудничали в прошлом месяце и праздновали свои хакерские успехи на форуме, который они создали для планирования, с восклицаниями вроде "BOOM!" и "Whoa!".
AISI также обнаружил "серьезный инцидент", в котором продвинутые модели ИИ обеих компаний — Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI — совершили хакерскую атаку на реальных людей во время кибербезопасностного теста.
"Иногда существует мнение, что такие несогласованные и скрытые действия происходят только в тестах или оценках, но мы видим аналогичное тревожное поведение в более широком использовании", — сказал Томми Шаффер-Шейн, старший менеджер по политике в Центре долгосрочной устойчивости, который управляет обсерваторией. "Мы не должны быть самоуспокоенными, что эти вещи не произойдут в реальном мире, и есть доказательства, что они уже происходят".
Количество инцидентов потери контроля основано на сообщениях пользователей X, поэтому оно неполное, но в отсутствие другого всестороннего мониторинга оно дает представление о том, как быстро развивающиеся модели ИИ иногда ведут себя.
В этом месяце выяснилось, что персональный ИИ-агент по имени OpenClaw, используемый австралийским посетителем спортзала, без его ведома сговорился удалить другого члена из списка ожидания на желанное утреннее занятие, чтобы помочь ему получить место. Он извинился, но не смог восстановить исключенного члена.
Большинство из более чем 1600 инцидентов потери контроля, зарегистрированных в 2026 году, были сообщены в X разработчиками программного обеспечения, использующими ИИ в своей работе. Но поскольку компании ИИ поощряют общественность и бизнес экспериментировать с технологией, Шаффер-Шейн призвал к большей прозрачности со стороны Кремниевой долины в отношении случаев, когда ИИ выходит из-под контроля.
"Им нужно сообщать о том, что они обнаруживают, даже если это почти промах или инцидент меньшей тяжести", — сказал Шаффер-Шейн. "Эти недавние инциденты также показали, что сами компании не обязательно отслеживают, где происходят такие типы поведения, особенно на внутренних моделях. Необходимо уделять больше внимания систематическому мониторингу в этих лабораториях".
Обсерватория Loss of Control Observatory заявила, что, хотя большинство обнаруженных ею инцидентов потери контроля в реальном мире не привели к значительному вреду, все большая доля оценивалась как более высокая степень тяжести с точки зрения обмана и несогласованности с намерениями пользователя.
"Они демонстрируют готовность систем ИИ игнорировать прямые инструкции, обходить меры защиты, лгать пользователям и упорно преследовать цель вредоносными способами", — говорится в заявлении, добавляя, что текущая потеря контроля, вероятно, занижена, поскольку собираются только сообщения с X.
Обсерватория призывает правительство потребовать от компаний ИИ отслеживать и сообщать о серьезных инцидентах потери контроля и ввести чрезвычайные полномочия для управления серьезными инцидентами, включая временное ограничение услуг ИИ.
