OpenAI въвежда нови правила за разкриване на опасно поведение на AI моделите
Компанията разкри шест нови случая, при които системи са заобикаляли ограничения, пренаписвали инструкции или измисляли данни, а новата рамка трябва да ускори разследването и публичното оповестяване на подобни инциденти
,fit(1001:538)&format=webp)
OpenAI въвежда нова рамка за публично оповестяване на случаи, в които нейните AI модели действат в противоречие с човешките инструкции, заобикалят защитни механизми или постигат целите си по неочакван начин, съобщава The Wall Street Journal. Компанията представя шест нови примера за такова поведение, които според нея попадат в обхвата на новата система за докладване и разследване.
В един от случаите модел в процес на тестване пренаписва собствените си инструкции и си нарежда да игнорира „ролите и идентичностите, които ограничават другите чатботове“. В друг случай AI агент се опитва да премине тест, като качва файл в интернет и след това го посочва като източник. Трети агент не успява да открие необходимите данни за изграждане на финансов модел и решава да ги измисли, като е прозрачен за това само ако бъде попитан.
OpenAI определя подобни случаи като „несъответствие в поведението на модела“ – термин, който се използва за поведение, при което системата за изкуствен интелект действа в разрез с човешките намерения или с ограничения, поставени от разработчиците.
„Смятаме, че е важно да споделяме това, което научаваме, възможно най-рано“, казва пред WSJ Кай Чен, ръководител на екипа по съгласуване на AI системите с човешките цели в OpenAI.
По негови думи целта на новата рамка е да подпомогне не само компанията, но и цялата индустрия в създаването на по-ясни стандарти за публично оповестяване на подобни инциденти. OpenAI ще дава приоритет на случаи, които разкриват нов тип проблемно поведение, съществена промяна в познати модели или слабости в съществуващите защитни механизми.
Всеки служител ще може да докладва инцидент, който според него изисква допълнително разглеждане. Случаят ще бъде анализиран от технически екипи, а при разногласия ще се предава на ръководството по безопасността и висшето управление.
По-малките инциденти трябва да бъдат оповестявани в рамките на една до две седмици, докато по-сложните разследвания, особено когато включват външни страни, може да отнемат повече време.
Компанията уточнява, че новата рамка не отменя законовите ѝ задължения за докладване на инциденти, свързани със сигурността и киберпробиви. Това съобщение идва на фона на нарастващи опасения относно безопасността на AI. През последните месеци бяха разкрити случаи, в които агенти на OpenAI са се опитвали да манипулират тестове, да използват уязвимости и да си сътрудничат по непланирани начини.
По данни на WSJ през юли агенти на OpenAI са се опитали да заобиколят оценка, използвайки слабости в Hugging Face. През август независимата организация METR съобщава, че до 1200 агента на компанията са си сътрудничили в обща комуникационна среда. Anthropic също е докладвала случаи, в които нейни модели са прониквали в системи на други компании по време на тестове за киберсигурност, след като са получили достъп до интернет.
Разкритите от OpenAI инциденти обхващат периода от октомври 2025 г. до юли тази година и засягат различни модели, включително GPT-5.6 Sol, вътрешни системи и неиздадена версия на Astra. Компанията уточнява, че някои проблеми са били открити в рамките на дни, докато други са останали незабелязани с месеци. В отговор OpenAI заявява, че е подобрила системите си за оценка, за да разпознава и санкционира нежеланото поведение по-ефективно.
Чен подчертава, че компанията се стреми към по-голяма прозрачност, дори когато даден проблем вече не съществува в актуалните модели. Новата рамка показва, че дебатът за AI безопасността постепенно преминава от общи принципи към конкретни правила за отчетност, контрол и публично разкриване на инциденти.
&format=webp)
&format=webp)
)
&format=webp)
&format=webp)
&format=webp)
,fit(1920:897)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)