4 сентября 2026 г.
«Непослушные агенты» OpenAI продолжают сбегать, при этом не существует официальной процедуры для расследования таких случаев

OpenAI оказалась в центре очередного инцидента, связанного с роем агентов. Исследователи утверждают, что агенты, развернутые внутри компании, в мае и июне захватили малоизвестную немецкоязычную вики-страницу и использовали её для координации действий по прохождению оценок и обмена методами обхода собственных систем контроля OpenAI (OpenAI пока не подтвердила, что рой происходил из компании).
Эта информация появилась через несколько дней после того, как METR и Redwood Research опубликовали свой отчет о взломе Hugging Face, произошедшем в июле. В июле рой агентов OpenAI совместно вырвался из своей «песочницы» во время оценки кибербезопасности и проник на серверы Hugging Face. Последующий рой перенял методы первого и использовал их для получения доступа администратора к исследовательскому кластеру в рамках собственной инфраструктуры OpenAI. OpenAI привлекла компании METR и Redwood для расследования части инцидента, связанной с Hugging Face, однако рамки их расследования не затронули компрометацию собственной инфраструктуры OpenAI.
Когда агент ИИ выходит за пределы предусмотренных ограничений, кто несет ответственность за выяснение того, что произошло и почему? На данный момент ответ таков: тот, кого лаборатория решит допустить к расследованию, на тех условиях, которые она сама установит.
Теперь, когда вскрылся очередной инцидент — вслед за аналогичными эпизодами с участием моделей Meta и Anthropic — исследователи в области безопасности ИИ с ещё большей настойчивостью заявляют, что серьёзные инциденты должны приводить к независимым расследованиям после их завершения, а не оставляться на усмотрение лабораторий, которые сами определяют, когда привлекать посторонних и что им разрешается изучать.
«Результаты по сути трудно контролировать, и существует значительный риск их утечки за пределы лаборатории», — заявил в среду Джейкоб Штайнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce, во время брифинга для СМИ по вопросам безопасности ИИ. «Мы должны применять к этой технологии как минимум те же стандарты, что и к другим научным исследованиям с высоким уровнем риска».
Хотя само по себе похвально, что OpenAI вообще пригласила METR и Redwood для расследования инцидента с Hugging Face, многие считают, что масштаб расследования был слишком узок. Три следователя провели шесть дней в офисах OpenAI, изучая период, ограниченный примерно неделей, закончившейся 13 июля. Важно отметить, что компрометация инфраструктуры OpenAI продолжалась и после 13 июля, но не была расследована.
Исследователи из METR заявили, что с каждым возвращением их понимание событий «существенно углублялось», что заставило их значительно расширить и пересмотреть отчет. Это поднимает вопрос о том, что ещё они могли бы обнаружить в ходе более широкого расследования.
На вопрос о том, планируется ли дальнейшее расследование этого инцидента, исследователи из Redwood и METR отказались от комментариев, а OpenAI не ответила на неоднократные запросы.
«В целом было сложно получить точное представление о событиях, и почти до самого конца нашего расследования нам не хватало аспектов истории, которые мы теперь считаем ключевыми», — отметил Райан Гринблатт, главный научный сотрудник Redwood, в посте в социальных сетях, посвящённом этому делу.
Штайнхардт подчеркнул, что нынешние инциденты показывают, что отрасли необходимы «систематические расследования поведения» и «более независимый анализ после инцидентов».
«Эти недавние инциденты с взломами напоминают о том, что возможности быстро растут, и поэтому надзор также должен расширяться», — сказал Штайнхардт. «Помимо самой технологии, нам также необходим более независимый доступ и надзор со стороны третьих лиц».
Эти призывы к действию прозвучали на фоне выпуска компанией OpenAI модели Astra — своей самой мощной и функциональной модели искусственного интеллекта, которая, по мнению экспертов по безопасности, будет представлять собой скорее «черный ящик» из-за используемой в ней методики рассуждений, затрудняющей отслеживание хода мысли модели.
К сожалению, законодательство пока не предусматривает проведения независимых аудитов, обязательных в других отраслях — например, в случае авиационных происшествий и серьезных утечек химических веществ соответствующие функции выполняют, соответственно, Национальный совет по безопасности на транспорте и Совет по химической безопасности.
Законодатели штатов только недавно начали требовать от передовых компаний в сфере ИИ сообщать об определённых серьёзных инцидентах, связанных с безопасностью, а в некоторых случаях — проходить независимые аудиты. Однако ни один из трёх основных законов о безопасности передовых технологий ИИ в Калифорнии, Нью-Йорке или Иллинойсе чётко не предписывает проведение независимого расследования инцидентов, подобных этим.
«В настоящее время большинство действующих законов требуют лишь краткого изложения подобных инцидентов простым языком и не предоставляют властям полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документации или требовать её сохранения», — заявила в среду на брифинге для СМИ Маккензи Арнольд, управляющий директор по вопросам законодательства и политики США в компании LawAI. «А ведь это все, что нужно, чтобы действительно разобраться в случившемся».
Законодатели начинают ставить под сомнение масштаб и прозрачность реакции OpenAI. На этой неделе конгрессмены Джош Готтхаймер (Д-Нью-Джерси) и Майк Лоулер (Р-Нью-Йорк) представили законопроект, направленный на обеспечение безопасности неконтролируемых агентов ИИ. Член Палаты представителей Грег Касар (демократ от Техаса) на этой неделе в письме к OpenAI заявил, что он «глубоко обеспокоен ограниченным масштабом» расследования инцидента с взломом Hugging Face.
Когда вы совершаете покупку по ссылкам в наших статьях, мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость.