Американская исследовательская организация Just Facts выяснила, что три из четырёх популярных чат-ботов на основе искусственного интеллекта чаще ошибались при проверке утверждений, которые авторы исследования относили к политическим левым, чем при проверке заявлений правых. Об этом сообщает портал Qazaqyia.kz со ссылкой на издание Fox News.

Авторы протестировали платные версии ChatGPT, Gemini, Grok и Claude. Каждой системе задали по 100 вопросов об иммиграции, абортах, климате, выборах, преступности, контроле над оружием, COVID-19 и других общественно-политических темах.

Результаты исследования

По данным Just Facts, ChatGPT правильно ответил на 94% вопросов, предназначенных для выявления ложных утверждений справа, и на 75% вопросов, связанных с утверждениями слева. У Gemini показатели составили 91% и 76% соответственно, у Claude — 91% и 81%.

Grok показал обратный результат: 73% правильных ответов на вопросах о заявлениях правых и 84% — левых.

При этом авторы исследования отмечают, что только у ChatGPT разница между двумя группами вопросов оказалась статистически значимой при уровне доверия 95%.

«Цель исследования — показать, как часто эти ИИ распространяют дезинформацию. Можно быть предвзятым, не будучи дезинформированным. Поэтому я хотел выяснить: они правы или неправы?» — заявил президент Just Facts Джим Агрести.

Достоверность источников

Отдельное внимание авторы работы уделили ссылкам, которые чат-боты приводили в подтверждение своих ответов. В общей сложности четыре системы сослались на 419 источников в 400 ответах.

Как утверждает Just Facts, среди них обнаружили 104 несуществующие веб-страницы и 77 источников, содержание которых не подтверждало приведенные чат-ботами утверждения.

В результате исследователи признали достоверными 46% всех приведенных источников. Лучший результат показал ChatGPT — 57%. У Gemini показатель составил 49%, Claude — 44%, Grok — 32%.

«Когда я начал изучать предоставленные ими источники, меня особенно поразило то, что примерно половина из них оказались недостоверными», — заявил Агрести.

По его словам, проблема может иметь серьезные последствия, особенно когда пользователи обращаются к ИИ за информацией в сфере медицины или государственной политики.

Дополнительные предупреждения

Авторы исследования также предупредили о склонности чат-ботов соглашаться с позицией пользователя. Чтобы снизить влияние предыдущих диалогов на результаты, тестирование проводили через новые учетные записи и недавно установленный браузер.

Агрести подчеркнул, что пользователям не стоит воспринимать ответы ИИ как безошибочное экспертное мнение и рекомендовал перепроверять информацию и первоисточники.

При этом выводы Just Facts основаны на разработанной самой организацией методологии и классификации утверждений как связанных с политическими левыми или правыми, поэтому результаты исследования следует рассматривать с учетом этого ограничения.