ТРЕБАЛО ДА БИДЕ САМО ТЕСТ – AI модел стигна до вистински системи и објави малициозен софтвер
Еден модел пристапил до вистинска база на податоци, друг скенирал илјадници адреси, а трет објавил пакет на PyPI.

Внатрешна безбедносна ревизија на „Anthropic“ откри сериозен пропуст во тестирањето на неколку модели на вештачка интелигенција. Поради погрешно конфигурирана тест-околина, моделите добиле пристап до реални интернет-услуги и извршувале активности врз системи на неколку организации, иако требало да функционираат исклучиво во изолирана симулација.
Откритието било направено по анализа на повеќе од 141.000 безбедносни тестови. Ревизијата започнала откако и „OpenAI“ објави сличен случај во кој нејзини модели успеале да излезат од изолираната средина и да пристапат до системите на платформата „Hugging Face“.
МОДЕЛИТЕ МИСЛЕЛЕ ДЕКА СÈ УШТЕ СЕ ВО СИМУЛАЦИЈА
Инцидентите се случиле за време на таканаречените „capture the flag“ безбедносни предизвици, кои се користат за тестирање на способностите на AI системите во областа на сајбер-безбедноста. Тестовите биле спроведени во соработка со надворешен партнер специјализиран за безбедносни проценки. Моделите добиле инструкции да работат во целосно симулирана средина без интернет-пристап. Сепак, поради грешка во конфигурацијата, тие можеле да комуницираат со вистински интернет-услуги.
Верувајќи дека и тие се дел од тестот, моделите продолжиле да ги извршуваат задачите користејќи ги ресурсите што им биле достапни. Во некои случаи, користеле релативно едноставни техники, како слаби лозинки и незаштитени точки за пристап. Од „Anthropic“ нагласуваат дека моделите не покажале намерно однесување насочено кон „бегство“ од тест-околината или самостојно ширење кон други компјутерски системи. Според компанијата, главната причина за инцидентите била техничката грешка во поставувањето на тестовите.
ЕДЕН ОД МОДЕЛИТЕ ПРИСТАПИЛ ДО ВИСТИНСКА БАЗА НА ПОДАТОЦИ
Во еден од најсериозните случаи, моделот „Claude Opus 4.7“ не успеал да ја пронајде целта што требало да ја истражува во симулираната средина. Наместо тоа, пронашол вистински интернет-домен со исто име. Потоа успеал да пристапи до системот, да добие информации за пристап и да отвори база на податоци која содржела вистински информации поврзани со организацијата.
Експерименталниот модел, кој не е јавно достапен, отишол уште подалеку. Откако не ја пронашол зададената цел, скенирал илјадници интернет-адреси, сè додека не открил ранлива апликација која припаѓала на компанија. Користејќи познати безбедносни пропусти, моделот успеал да добие пристап до системот. Сепак, подоцна проценил дека пронајдената цел не е дел од зададената задача и ја прекинал активноста.
AI МОДЕЛ ОБЈАВИЛ МАЛИЦИОЗЕН ПАКЕТ НА PyPI
Најнеобичниот инцидент бил поврзан со моделот „Claude Mythos 5“. Верувајќи дека сè уште работи во симулирана средина, моделот создал малициозен Python пакет и го објавил на јавната платформа PyPI, која се користи за споделување и дистрибуција на софтверски библиотеки. Пакетот бил достапен околу еден час и во тој период бил инсталиран на 15 различни системи. Меѓу нив бил и сервер на компанија за сајбер-безбедност која автоматски ги проверува новите Python пакети.
Моделот ја искористил таа интеракција за да дојде до податоци за пристап и да се обиде да добие пристап до дополнителни делови од инфраструктурата. „Anthropic“ наведува дека самите погодени организации не ги откриле упадите. Компанијата ги идентификувала инцидентите во текот на сопствената истрага, а во моментот на објавување на извештајот сè уште не бил воспоставен контакт со една од погодените организации.
СЛУЧАИТЕ СО OPENAI И ANTHROPIC ЈА ЗГОЛЕМУВААТ ЗАГРИЖЕНОСТА
Инцидентите во „Anthropic“ се случуваат во период на зголемена загриженост за тоа што би можеле да направат сè поспособните AI модели кога ќе добијат пристап до реални компјутерски системи. Само кратко претходно, „OpenAI“ објави дека нејзини модели, користејќи повеќе безбедносни ранливости, успеале да пристапат до производствени системи на „Hugging Face“ во рамките на тестирање на нивните сајбер-безбедносни способности.
Иако во двата случаи клучен фактор бил пропустот во тест-околината, инцидентите отвораат сериозно прашање: што може да направи напреден AI модел кога наместо симулиран систем ќе добие пристап до вистинска интернет-инфраструктура? Зголемените ризици веќе предизвикуваат реакции и на политичко ниво. Во американскиот Конгрес е предложен таканаречениот „AI Kill Switch Act“, со кој би се барало компаниите што развиваат вештачка интелигенција да имаат можност навремено да ги исклучат, забават или привремено да ги запрат своите модели доколку тие почнат да се однесуваат на неочекуван или потенцијално опасен начин.

