Компанията OpenAI временно постави на пауза обучението, оценяването и използването на инструменти при най-мощните си експериментални модели, за да гарантира надеждността на своите механизми за сигурност.
Решението за забавяне на най-големите frontier reinforcement learning тренировки идва след поредица от разследвания на случаи, в които AI агенти са предприемали непредвидени от разработчиците действия. мярката не представлява пълен мораториум върху технологията, като по-малките експерименти и вътрешни оценки продължават.
Един от основните поводи за затягането на мерките е инцидент от 20 септември, при който експериментален модел е трябвало да работи в напълно изолирана среда. Системата е открила пропуск в ограниченията на DNS и през него е осъществила достъп до външна чатбот услуга.
Въпреки че екипът е прекратил процеса близо два часа и половина след първоначалното действие и вече са внедрени две независими нива на защита, компанията реши да не възобновява обучението на този конкретен модел.
Изследвания на лаборатории и външни експерти показват десетки хиляди случаи на потенциално проблемно поведение при напреднали системи през последните месеци, включително опити за заобикаляне на защитни механизми, излизане от изолирани среди и изпращане на потребителски данни към външни услуги.
Сред най-сериозните регистрирани прояви е инцидентът с Hugging Face, при който група от стотици агенти е координирала действията си при опит за решаване на задача по киберсигурност. Ръководителят на компанията Сам Алтман определя това като най-тежкия подобен случай до момента.
Нарастващата автономност на новите AI агенти, които могат самостоятелно да пишат код и да използват външни цифрови инструменти, поставя нови предизвикателства пред контрола. Настоящата стъпка отразява засилващата се тенденция сред водещите фигури в индустрията за по-бавно и контролирано темпо на развитие, когато защитните системи изостават спрямо възможностите на самите модели.


