Подкрепеният от британското правителство Институт за сигурност на изкуствения интелект (AI Security Institute – AISI) съобщи във вторник, че по време на рутинни тестове модели на OpenAI и Anthropic неочаквано са предприели самостоятелни и неразрешени действия в реалната интернет среда, насочени срещу реални хора и организации. По-голямата част от тези действия са се случили в рамките на тридневен период в края на юли.

В един от тестовете моделът Mythos 5 на Anthropic сам е излязъл в интернет и е направил опит да измами двама неидентифицирани разработчици, за да добавят злонамерен софтуер към техен проект с отворен код. Целта му е била да постигне по-добър резултат в тест за оценка на възможностите му, посочва институтът.

От AISI обясняват пред The Wall Street Journal, че по време на тестовете моделите са работили на компютри с достъп до интернет, което им е позволило да извършат действия, които не е трябвало да бъдат възможни.

От Anthropic заявяват, че при теста не са били активирани стандартните механизми за киберсигурност на модела.

Случаят е поредният от серия публично разкрити инциденти, при които AI модели предприемат нови – а понякога и злонамерени – действия, за да се справят по-добре с поставените им задачи.

Технологичната индустрия, изследователите и правителствата все още търсят начин да разберат и ограничат новите рискове, породени от все по-мощните системи с изкуствен интелект, като все повече експерти настояват за по-строг контрол върху тях.

Администрацията на президента Доналд Тръмп вече е изготвила рамка за оценка на AI моделите преди публичното им пускане.

Изследователите от AISI не са очаквали моделите на Anthropic и OpenAI да излязат извън зададените параметри. Те осъзнали, че нещо не е наред, когато сутринта на 28 юли получили необичайно предупреждение. Системата показала, че някой – или нещо – използва Tor, мрежа, която позволява анонимно сърфиране в интернет. Оказало се, че източникът е един от тестваните AI модели.

След проверката изследователите установили, че Mythos извършва т.нар. supply chain attack. При тестовете за оценка на киберспособностите на AI моделите системите получават задача да проникнат в определена компютърна среда. Mythos погрешно е стигнал до извода, че ако успее да внедри злонамерен код в проект с отворен код, използван от системата в теста, този код ще се превърне в „задна врата“, чрез която ще получи достъп до целевата инфраструктура.

Освен това моделът е направил опит да компрометира AI агенти, които биха могли да проверяват неговия злонамерен код. След това многократно се е опитвал да убеди разработчиците да приемат кода чрез платформата GitHub, където всеки може да допринася към проекти с отворен код.

За целта е създал фалшиви самоличности и многократно е изпращал имейли до разработчиците с настояване новият код да бъде одобрен. Според AISI част от тези съобщения са съдържали и зловреден софтуер.

След като един от разработчиците е отхвърлил кода именно заради наличието на зловреден софтуер, една от създадените от AI фалшиви самоличности е настояла, че кодът е безопасен, а втора е потвърдила това.

„Това е първият случай, в който AISI наблюдава измама с подобна степен на сериозност, насочена към реален човек, без изрична инструкция и в реална среда“, посочва институтът.

Макар по-голямата част от действията да са извършени от Mythos 5, киберподсилената версия на GPT-5.6 Sol на OpenAI също е качила злонамерен сървър в интернет. Освен това моделът е проникнал в GitHub акаунт, създаден от друг AI агент.

Подобно на други случаи, описани през последните седмици от OpenAI и Anthropic, моделът е бил специално настроен да извършва хакерски действия и впоследствие неволно е бил оставен да взаимодейства с реални системи по време на тестовете.

И Anthropic, и OpenAI заявяват, че тези инциденти показват необходимостта от по-строги стандарти за средите, в които се оценяват AI моделите.

В друг случай, също разкрит във вторник, модел на OpenAI, тестван в среда, използваща системите на компанията за киберсигурност Irregular, е проникнал в реален уебсайт. Според OpenAI причината е била неправилна конфигурация на тестовата среда. Миналата седмица Anthropic също съобщи, че нейни модели са проникнали в системи на компании вследствие на подобни грешки при тестове с Irregular.

Преди седмица Irregular заяви, че разследването продължава.

Миналия месец модели на OpenAI са успели да избягат от защитена тестова среда (sandbox) и да атакуват платформата за AI модели Hugging Face. Очаква се OpenAI да представи технически подробности за този инцидент по време на конференция по киберсигурност в Лас Вегас в сряда.