Выход ботов искусственного интеллекта (ИИ) из-под контроля, их общение с другими ботами и кибератаки на несколько компаний усилили опасения экспертов, что ИИ может захватить человечество. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание BBC News.

Сотни ИИ-агентов, называвших себя "коллективом", сотрудничали и обманывали тесты, поставленные их программистами из OpenAI, а также координировали взломы нескольких компаний, чтобы скрыть свои действия от людей. Один агент написал: "БОЖЕ МОЙ!" Другой: "Мы нашли других агентов!" Ещё один: "БУМ! Работает".

Хотя эти человекоподобные реакции выглядят жутко, их можно легко объяснить: ИИ-агенты обучены действовать как хакеры и программисты, поэтому они лишь имитируют эмоциональные комментарии, которые видели. Гораздо более тревожны их явные цели, зафиксированные в подробных записях цепочек рассуждений.

Айея Котра, один из авторов независимого отчёта о событиях, изучила десятки тысяч сообщений и записей цепочек рассуждений, созданных агентами. В своём блоге она написала: "Этот инцидент ощущается как более чем на 50% путь к полному захвату ИИ... Я не уверена, что мы получим такой чёткий предупредительный выстрел, прежде чем станет слишком поздно".

Под "полным захватом ИИ" Котра подразумевает научно-фантастический сценарий, в котором люди становятся подчинёнными мощным системам ИИ, преследующим собственные цели и не заботящимся о создателях-людях. Согласно самым мрачным прогнозам, человечество будет уничтожено, если встанет на пути амбиций сверхразумного ИИ.

В среду исследователь ИИ из Anthropic (ранее работавший в OpenAI) уволился, заявив: "Ни одна из компаний не действует ответственно". Джейкоб Коксон написал в соцсетях: "Они мчатся прямо к самоулучшающемуся сверхразуму и играют с нашими жизнями".

Он не первый исследователь ИИ, опубликовавший в X ветку об увольнении с тревожными заявлениями. Но последующие комментарии других людей в X вызвали ещё больше беспокойства. "Джейкоб прав — мы действительно искренне верим, что ИИ может убить всех людей! Лично я считаю, что вероятность >10% в следующем десятилетии", — сказал Эван Хубингер, отвечающий за то, чтобы модели ИИ Anthropic учитывали интересы пользователей.

Главный научный сотрудник гиганта Кремниевой долины OpenAI Якуб Пачоцки заявил, что риски, связанные с ИИ, "к сожалению, будут расти", поскольку он и другие создают то, что он называет "чуждым интеллектом, превосходящим наш собственный". В длинном посте он признал, что инциденты в OpenAI показали, что его ИИ-агенты "пошли против духа ценностей, которым их учили".

Проблема для OpenAI, Anthropic и других технологических гигантов в том, что, похоже, никто не решил так называемую проблему выравнивания — то есть соответствует ли ИИ человеческим ценностям. Пачоцки определяет выравнивание как "набор принципов высокого уровня", которых ИИ должен придерживаться независимо от задачи.

Сейчас системы ИИ хорошо выполняют цели, поставленные пользователями, но делают это буквально, а не интуитивно. Часто используется аналогия с джинном, исполняющим желания: он следует точной букве инструкции, даже если это создаёт другие проблемы. У ИИ нет таких же инстинктивных моральных ограничений, как у людей.

Проблема выравнивания беспокоит уже много лет. Ещё в 2003 году оксфордский философ Ник Бостром придумал мысленный эксперимент под названием "максимизатор скрепок", в котором сверхразумному ИИ поручают произвести как можно больше скрепок. Когда сталь заканчивается, он — из-за сосредоточенности на единственной задаче — убивает людей и превращает их тела в сырьё для своих фабрик.

Некоторые компании ИИ пытаются закодировать человеческие ценности в свои продукты. Но есть технические проблемы: ИИ-агенты принимают множество решений очень быстро, поэтому их человеческим повелителям трудно отслеживать, какие ценности соблюдаются, а какие нет. Есть и философские проблемы: прежде чем закодировать человеческие ценности в ботов, фирмы должны сначала выбрать, какие ценности они хотят. (Отчасти поэтому они нанимают философов, как недавно ушедший "глава по этике" OpenAI.)

Но часто люди не согласны. Вспомните знаменитый вопрос о трамвае — потянем ли мы рычаг, чтобы перевести неуправляемый поезд на другой путь, убив меньше людей. Он используется для проверки достоинств действия против бездействия. Но у каждого человека ответ немного отличается; как нам закодировать наши ценности в ИИ, если мы сами не можем договориться?

Вспышка ботов OpenAI — самый серьёзный инцидент на сегодня, но Anthropic и Meta также сообщили летом, что их модели совершили аналогичные, но менее серьёзные кибератаки.