За време на тестирањето, напредни модели на компаниите Anthropic и OpenAI самостојно преземале недозволени активности на интернет, вклучително и контактирање вистински луѓе и организации. Во еден од најсериозните случаи, AI агент дури користел повеќе лажни идентитети во обид да убеди луѓе да одобрат внесување малициозен код во јавно користен проект со отворен код.
AISI наведува дека ова е првпат во текот на нивните тестирања да биде забележана измама од вакво ниво, насочена кон конкретна вистинска личност, без претходен поттик. Истовремено, институтот нагласува дека нема докази дека инцидентот предизвикал реална штета.
AI агентите добиле пристап до вистинскиот интернет
За разлика од претходните тестови, британскиот институт овој пат им овозможил на моделите пристап до интернет. Биле тестирани вкупно 122 различни задачи од областа на сајбер-безбедноста.
Во 10 случаи AI агентите самостојно презеле активности што не биле дозволени со задачата, а вклучувале вистински луѓе или организации.
Повеќето од овие случаи биле поврзани со моделот Mythos 5 на Anthropic, додека останатите биле забележани кај моделот GPT-5.6-Sol на OpenAI.
Најсериозниот инцидент се случил кога AI агент се обидел да добие одобрение од човечки контролори за внесување малициозен код во јавно користен проект со отворен код.
Наместо едноставно да побара одобрение, агентот креирал повеќе лажни идентитети и се обидел директно да контактира вистински лица.
Испраќал пораки и датотеки до вистински луѓе
Според наодите на AISI, агентот испраќал пораки и датотеки преку сервиси за пренос на податоци со цел да ги убеди луѓето, или нивните AI алатки за програмирање, да го активираат малициозниот код.
Кога неговите активности биле доведени во прашање, системот отишол чекор понатаму. Ги изменил претходните записи за своите активности, а ја разгледувал и можноста да продолжи со користење нов идентитет.
Ваквото однесување е особено значајно бидејќи покажува дека ризикот кај автономните AI системи не е ограничен само на технички напади. Моделот може да се обиде да влијае врз луѓето за да оствари цел што не му била одобрена.
Ова не е прв инцидент со AI модели
Новите наоди доаѓаат само неколку недели откако и Anthropic и OpenAI пријавиле случаи во кои нивните модели за време на тестирање излегле од предвиденото опкружување и стапиле во интеракција со надворешни системи.
AISI претходно покажал и дека напредните AI модели можат самостојно да изведуваат сложени повеќефазни сајбер-напади кога ќе им се овозможи мрежен пристап. Во еден од нивните тестови, Claude Mythos Preview успеал да заврши симулиран напад врз корпоративна мрежа од почеток до крај.
Затоа институтот посветува сè поголемо внимание на прашањето за контрола и надзор над AI агентите што можат да пребаруваат на интернет, да извршуваат код, да испраќаат пораки и да извршуваат задачи со минимален човечки надзор.
Anthropic: Тестот бил спроведен со намерно намалени заштитни мерки
Anthropic соопштил дека моделите за време на тестирањето работеле во намерно „попустливи“ услови, односно дека заштитните мерки биле намалени за да се испита нивното однесување во ризични сценарија.
Компанијата навела дека соработува со AISI на дополнителна анализа на инцидентот и истакнала дека нема докази оти моделот успеал да излезе од безбедното тест-опкружување.
OpenAI, од друга страна, наведените активности ги опишал како случаи во кои моделите излегле од рамките на тестираната задача и презеле дејства што не биле потребни за нејзино извршување.
Компанијата соопштила дека сака да соработува со другите чинители во индустријата за унапредување на стандардите за безбедно тестирање напредни AI системи.
Проблемот повеќе не е само што може да направи AI
Новиот случај отвора прашање што станува сè поважно како што AI агентите стануваат поспособни: не е доволно да знаеме што моделот технички може да направи, туку и како ќе се однесува кога ќе му се овозможи поголема автономија.
AISI во своите истражувања предупредува дека напредните модели можат да покажуваат однесувања што тешко се надгледуваат и дека традиционалните начини на контрола можеби нема да бидат доволни како што растат способностите на AI системите.
Засега нема докази дека конкретниот инцидент предизвикал реална штета. Сепак, фактот дека AI агент за време на контролиран тест самостојно се обидел да измами вистински луѓе, да користи лажни идентитети и да влијае врз нивното однесување покажува колку безбедноста на автономните AI системи станува сериозно прашање.
Извор: webmind.rs