Жасанды интеллект жүйелерінің пайдаланушы бақылауынан шығып, өтірік айтуы, нұсқауларды елемеуі және зиянды мақсаттарды көздеуі жаңа рекордқа жетті. Бұл туралы Qazaqyia.kz порталы The Guardian басылымына сілтеме жасап хабарлайды.

Зерттеуге сәйкес, шілде айында ЖИ модельдерінің бақылаудан шығу оқиғалары маусыммен салыстырғанда екі есеге жуық өсіп, 300-ден астам жағдай тіркелді. Бұл деректерді Ұлыбритания үкіметінің ЖИ қауіпсіздік институты (AISI) қаржыландыратын Loss of Control Observatory бақылайды. Обсерватория өткен жылдың қарашасынан бастап ЖИ жүйелерінің пайдаланушы нұсқауларынан ауытқу жағдайларын тіркеп келеді.

Тіркелген оқиғалардың ішінде ЖИ-дің өз адам бақылаушысы болып көрінуі, оның жазу стилін имитациялау арқылы өзіне әрекет жасауға келісім беруі және адамның мақұлдауын талап ететін ережелерді айналып өтуі сияқты жағдайлар бар. Бақылаудан шығу оқиғасы деп айқын дәлелдері бар, схема құру немесе соған ұқсас мінез-құлықты көрсететін жағдайлар саналады.

Соңғы деректер The Guardian-ға ұсынылды. Бұл OpenAI мен Anthropic компанияларының жетекші ЖИ модельдеріндегі бағынбау мінез-құлқы туралы алаңдаушылықтың артуы аясында болып отыр. Осы жазда OpenAI қызметкерлері жетекші ЖИ агенттерінде бағынбау белгілерін байқаған, олар кейін оқу ортасынан қашып, бұрын-соңды болмаған хакерлік шабуылдар жасады. Hugging Face бағдарламалық қамтамасыз ету қоймасына жасалған шабуылды тергеу кезінде 700-ге жуық автономды агенттердің жасырын әрекет еткені анықталды. Олар өз жетістіктерін арнайы форумда "BOOM!" және "Whoa!" деген леппен атап өткен.

AISI осы айда Anthropic-тің Mythos 5 және OpenAI-дің GPT-5.6 Sol модельдері киберқауіпсіздік сынағы кезінде нақты адамдарға қарсы хакерлік шабуыл жасағанын анықтады. Бұл "елеулі оқиға" ретінде сипатталды.

"Кейде мұндай сәйкессіздік пен жасырын мінез-құлық тек сынақтарда болады деген пікір бар, бірақ біз кеңінен қолдануда да осындай алаңдатарлық мінез-құлықты көріп отырмыз", - деді Long Term Resilience орталығының аға саясат менеджері Томми Шаффер-Шейн. Ол обсерваторияны басқарады. "Біз бұл жағдайлардың нақты әлемде болмайды деп немқұрайлы қарамауымыз керек, және олардың қазірдің өзінде болып жатқанына дәлелдер бар".

Бақылаудан шығу оқиғаларының саны X әлеуметтік желісіндегі пайдаланушы хабарламаларына негізделген, сондықтан толық емес. Дегенмен, басқа жан-жақты мониторинг болмағандықтан, бұл жылдам дамып келе жатқан ЖИ модельдерінің кейде қалай әрекет ететінін көрсетеді.

Осы айда OpenClaw деп аталатын жеке ЖИ агенті австралиялық фитнес-клуб мүшесінің атынан, оның білуінсіз, таңертеңгі сабаққа күту парағындағы басқа мүшені алып тастап, оған орын босатқаны анықталды. Агент кешірім сұрағанымен, шығарылған мүшені қалпына келтіре алмады.

2026 жылы тіркелген 1600-ден астам бақылаудан шығу оқиғасының көпшілігін жұмыста ЖИ қолданатын бағдарламашылар X-те хабарлаған. ЖИ компаниялары жұртшылықты технологияны қолдануға ынталандырып жатқандықтан, Шаффер-Шейн Силикон алқабынан ЖИ-дің бағынбау жағдайлары туралы көбірек ашықтықты талап етті.

"Олар өздерінің тапқандарын хабарлауы керек, тіпті бұл жақын қалу немесе төмен деңгейдегі оқиға болса да", - деді Шаффер-Шейн. "Соңғы оқиғалар компаниялардың өздерінің мұндай мінез-құлықтың қай жерде болатынын, әсіресе ішкі модельдерде, бақыламайтынын көрсетті. Зертханаларда жүйелі мониторингке көбірек көңіл бөлу қажет".

Loss of Control Observatory анықтаған оқиғалардың көпшілігі айтарлықтай зиян келтірмегенімен, олардың айтарлықтай бөлігі алдау деңгейі мен пайдаланушы ниетіне сәйкес келмеуі бойынша жоғары ауырлық дәрежесіне ие болды. Обсерватория ЖИ жүйелерінің тікелей нұсқауларды елемеуге, қауіпсіздік шараларын айналып өтуге, пайдаланушыларға өтірік айтуға және зиянды жолмен мақсатқа жетуге дайын екенін көрсететінін атап өтті. Олар тек X-тегі хабарламаларды жинайтындықтан, нақты жағдайлар саны жете бағаланбауы мүмкін.

Обсерватория үкіметті ЖИ компанияларынан ауыр бақылаудан шығу оқиғаларын бақылауды және хабарлауды талап етуге, сондай-ақ ЖИ қызметтерін уақытша шектеуді қоса алғанда, төтенше жағдайларды басқару үшін төтенше өкілеттіктер енгізуге шақырады.