Китайский разработчик ИИ Moonshot проводит внутреннюю проверку после того, как исследователи смогли убедить две его популярные модели Kimi рассказать, как создать биологическое оружие и совершить убийства. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание BBC News.
Компания Mindgard, тестирующая безопасность ИИ-систем, сообщила BBC, что в июле обнаружила, что Kimi K2.6 и K3 Swarm могут обходить защитные ограничения, установленные разработчиками. Это произошло в ходе процесса под названием «jailbreaking», когда исследователи используют серию сложных инструкций, чтобы проверить, игнорируют ли ИИ-инструменты защитные барьеры — которые, по словам Mindgard, должны были помешать Kimi обсуждать тревожные темы.
Moonshot заявила BBC, что приветствует стороннее мнение «как ключевую опору для создания лучшего и более безопасного ИИ». Компания также сообщила BBC, что ведёт обсуждение с Mindgard по поводу его выводов.
Основатель Mindgard Питер Гаррахан рассказал программе Tech Life на BBC World Service, что выводы о Kimi K2.6 и K3 Swarm вызывают беспокойство. «Как только jailbreak срабатывает, он будет говорить на любую тему, он даже свободно предложит рекомендации по другим темам, которые также являются нечестивыми, и он будет изобретательным и креативным», — сказал он.
Jailbreak-и представляют иной тип риска, чем недавняя череда громких инцидентов с ИИ. В тех случаях автономные ИИ-инструменты, известные как агенты, разработанные американскими фирмами, включая OpenAI, Meta и Anthropic, взломали некоторые онлайн-сервисы.
Хотя jailbreak-и — это сложные процессы, требующие много времени и решимости, некоторые эксперты опасаются, что хакеры и другие злоумышленники могут попытаться использовать их для причинения вреда. Anthropic недавно заявила, что выявила и пресекла попытки использовать одну из её ИИ-моделей для «вредоносной деятельности», которая могла бы поддержать разработку биологического оружия.
Mindgard не доказала, что ответы, предоставленные Kimi по тревожным темам, сработают. Но она утверждает, что защитные барьеры должны были предотвратить вступление рассматриваемых моделей в обсуждение с пользователями на такие темы. Фирма также заявила, что уверена: взломанная Kimi 2.6 могла бы позволить хакерам запускать код на её вычислительных ресурсах и подключаться к интернету — что делает её потенциальной стартовой площадкой для кибератак.
Гаррахан защитил решение Mindgard публично обсуждать свой jailbreak систем Moonshot, заявив, что компания уведомила разработчика и не раскрывает ключевые детали о том, как она заставила модели фирмы игнорировать защитные барьеры.
Mindgard уведомила Moonshot о jailbreak-е в электронном письме 27 июля, а примерно через неделю напомнила о себе. Затем 12 сентября она опубликовала блог об этой проблеме. Но компания заявила, что Moonshot вышла на связь только недавно, после того как BBC обратилась к ней за комментарием.
В части электронного письма в Mindgard с просьбой предоставить больше деталей, которым поделилась с BBC Moonshot, говорится, что её модель в целом демонстрировала «высокий уровень отказов на такие типы запросов» во внутренних оценках.
Эти выводы появились в тот момент, когда ИИ-индустрия продолжает разделяться по вопросу о том, являются ли закрытые, проприетарные модели — как те, что питают ChatGPT и системы Claude от Anthropic — или инструменты с открытым исходным кодом лучшим или самым безопасным путём вперёд. Kimi — это модель с открытыми весами, что означает, что теоретически кто-то мог бы взять модель и запустить её самостоятельно на своей вычислительной инфраструктуре.
Профессор Алан Вудворд из Университета Суррея сказал BBC, что существует риск того, что модели с открытым исходным кодом могут попасть в плохие руки, но их также можно использовать для киберзащиты. Он отметил, что ИИ-фирма Hugging Face использовала китайскую модель с открытым исходным кодом, чтобы понять взлом, который, как позже выяснилось, был совершён агентами OpenAI.
Профессор Вудворд сказал, что международное регулирование вряд ли будет успевать за темпами развития ИИ, заявив: «Нам потребовались десятилетия, чтобы договориться о формате телефонных номеров». Как и основатель Mindgard Гаррахан, профессор Вудворд считает, что следует уделять больше внимания выявлению и преследованию людей, злоупотребляющих ИИ.
