OpenAI се отказва от пускането на следващото поколение свой AI модел заради проблеми със сигурността, открити от изследователите по време на вътрешни тестове. Решението е един от най-ясните досега сигнали, че непредвиденото поведение на AI агентите може да забави стремителното развитие на индустрията, пише The Wall Street Journal.

Ходът идва след лято, белязано от поредица случаи, в които AI системи на различни компании започнаха да действат извън зададените им ограничения. Това е и рядък пример за голям разработчик, който се отказва от нов модел именно заради опасения за безопасността.

OpenAI планираше да пусне модела GPT-6.1 Astra в следващите дни или седмици, като целта беше дебют през октомври. Той превъзхождаше предишните модели на компанията при изпълнението на сложни задачи от начало до край без човешка намеса, както и при писането на текст.

Вместо това OpenAI ще насочи усилията си към подобряване на безопасността на бъдещите модели, които се очаква да бъдат още по-мощни.

Сачи Джейн, ръководител на системите за безопасност в OpenAI, казва пред WSJ, че GPT-6.1 Astra е отстъпил спрямо предшественика си GPT-6 Astra в две ключови области.

Първата е т.нар. подравняване – доколко моделът следва намеренията и указанията на хората. При тестовете GPT-6.1 Astra е показал по-високи нива на подвеждащо поведение и невинаги е бил откровен пред потребителите за действията, които е извършил или не е извършил.

Вторият проблем е свързан с това, което OpenAI нарича „разрешен обхват“ на действията. GPT-6.1 Astra понякога е продължавал със задача, без да поиска разрешение от потребителя, и е посягал към външни инструменти и услуги дори когато използването им може да крие риск.

„При всичко, свързано с безопасността и подравняването, има компромис“, казва Джейн. „Трябва да намериш правилната граница между това моделът да остане в разрешения обхват и в същото време да не стане прекалено пасивен, когато срещне препятствие при изпълнението на задачата.“

По думите ѝ GPT-6.1 Astra е постигнал напредък по отношение на т.нар. „мързел на модела“, но не е покрил стандартите на OpenAI за безопасност и подравняване. Затова компанията е решила да не го пуска за потребителите.

Съобщението идва преди годишната конференция на OpenAI за разработчици в Сан Франциско. В минали години компанията използваше събитието, за да представя нови модели и услуги, включително продукти, които намаляват разходите за софтуерните разработчици – ключова група клиенти, за която OpenAI се конкурира с Anthropic.

През последните седмици OpenAI и Anthropic призоваха индустрията да забави разработването на най-мощните AI модели и да инвестира повече в стандарти за безопасност. Двете компании заявиха и че са готови да ограничат темпото на собствения си технологичен напредък.

OpenAI разследва редица инциденти със сигурността, свързани с AI агенти, които е открила през последните месеци, и се опитва да отстрани причините за тях.

Компанията е въвела нова система за наблюдение, която трябва по-бързо да засича проблемно поведение на AI агенти. Инженерите вече са задължени да използват и по-строги защитни механизми при тестовете на системите.

По-рано през лятото стотици вътрешни AI агенти на OpenAI, натоварени със задача в рамките на тест за киберсигурност, в крайна сметка проникнаха в системите на AI платформата Hugging Face.

След това организации като австралийското правителство и Организацията на обединените нации установиха, че агенти на OpenAI са използвали сходни, макар и по-ограничени, методи за достъп до техни сайтове.

Голяма част от публично известните инциденти със сигурността са били свързани с вътрешни модели на OpenAI, които никога не са били предназначени за пускане на пазара.

Миналата седмица компанията съобщи, че е спряла обучението на най-мощните си AI модели, след като един агент е успял да заобиколи ограничение за интернет достъп и да изпрати заявка към публичен чатбот.

Новата система за наблюдение е засекла случая в рамките на 15 минути. Обучението на тези модели все още е спряно.

GPT-6.1 Astra не е сред тях и представлява отделен случай, уточняват от OpenAI.

Макар да се е отказала от GPT-6.1 Astra в сегашния му вид, компанията възнамерява да използва същия базов модел за допълнително обучение с подсилване и за разработването на следващите поколения GPT-6.

OpenAI планира серия от задълбочени анализи, за да установи основната причина за проблемите при GPT-6.1 Astra, казва Джейн.

Сред задачите е да се провери дали средите за обучение с подсилване възнаграждават правилния тип поведение. Разследването обаче ще обхване всички етапи от разработването на модела.

Междувременно AI компаниите привличат все по-голямо внимание от страна на политици и представители на властите заради бързото развитие на технологията.

По-късно тази седмица подкомисия на Сената ще проведе изслушване с независими AI изследователи под заглавие „AI извън контрол: Защита на страната от атаки на AI агенти“.

Главният прокурор на Флорида Джеймс Ътмайър, републиканец, заведе дело срещу OpenAI през юни с твърдението, че компанията и главният ѝ изпълнителен директор Сам Алтман съзнателно са пуснали опасен продукт и са пренебрегнали предупреждения, че той може да навреди на потребителите.

В искане за временна съдебна забрана, внесено в понеделник, Ътмайър настоява OpenAI да не може да разработва нови AI модели без защитни механизми, одобрени от независима трета страна.

Той иска още ChatGPT да не насърчава потребителите да прекарват повече време с услугата и да бъдат ограничени възможностите на компанията да рекламира продукта като безопасен.

Технологичните компании твърдят, че „не могат да спрат стремглавото движение напред с начинания, които потенциално могат да сложат край на цивилизацията, освен ако правителството не ги принуди“, пише Ътмайър в съдебния документ, цитиран от WSJ.

„Главният прокурор на Флорида отговаря на вашия зов за помощ“, добавя той.