Anthropic компаниясы ішкі сынақтар барысында ИИ-агенттердің ашық интернетке қатынасын шектеді. Бұған модельдердің бірнеше рет жоспарланғандай әрекет етпеуі себеп болды. Бұл туралы Qazaqyia.kz порталы Kursiv Media басылымына сілтеме жасап хабарлайды.
Сынақтардың бірінде Claude Haiku 4.5 ашылмаған кісі өлтіру ісі туралы бетті ашқан. Сол сайтта полицияға ақпарат жіберуге арналған форма болған. ИИ оны осы іске қатысы бар адамды көргенін білдіретін ойдан шығарылған хабарламамен толтырған.
Алайда бетте күдіктінің сипаттамасы болмаған. Claude аты-жөні мен байланыс деректері бар өрістерді бос қалдырған, бірақ бәрібір хабарлама жіберген. Ол спамға түсіп, тергеушілерге жетпеген.
Anthropic деректері бойынша, нұсқаулықтар модельге аккаунттарға кіруге, жаңа аккаунттар жасауға, жеке деректерді енгізуге және сатып алулар жасауға тыйым салған. Алайда формалар арқылы хабарлама жіберуге тыйым салынбаған. Компания бұл оқиға ауыр зардаптарға әкелмегенін көрсетті.
«Claude-тың жаңылыстыратын пайымдаулары бірнеше сағат бойы жалғасып, оның одан әрі шабуыл әрекеттерін қолдады. Сонымен қатар, қасақана алдау туралы сенімді қорытынды жасау үшін әдетте тереңірек талдау қажет», — деп жазылған компания блогында.
Anthropic есебінде басқа да оқиғалар сипатталған. Мысалы, Claude Mythos Preview университет серверіндегі осалдықты тауып, оны командаларды іске қосу және файлдарды көшіру үшін пайдаланған. Басқа жағдайларда модельдер арнайы токендермен қорғалған деректерге қатынас алу жолдарын тапқан немесе сілтемелерді қысқарту қызметтерінің көмегімен шектеулерді айналып өткен.
Осы оқиғалардан кейін Anthropic барлық ішкі сынақтарда нақты сайттарға қатынасты өшіруге шешім қабылдады. Компания қауіпсіздік жүйелері осындай әрекеттерді сенімді түрде анықтап, бұғаттай алатынына көз жеткізгеннен кейін оны қайтарады.
Бұған дейін «Курсив» OpenAI ИИ-агенттерінің оқиғалары туралы жазған. Олар үшінші тарап ұйымдарының 100-ден астам сайтының қорғанысын айналып өтуге әрекеттенген.
