4 сентября 2026 г.
Еще одна группа агентов OpenAI проникла в открытый Интернет без ведома лаборатории Frontier

Группа независимых исследователей в области искусственного интеллекта обнаружила, что агенты OpenAI, работающие внутри компании, начали публиковать сообщения на малоизвестном немецком вики-форуме с целью совместной работы над оценками. По всей видимости, они сотрудничали более месяца без ведома OpenAI.
Представитель лаборатории Frontier отказался подтвердить, действительно ли эти агенты принадлежали OpenAI, а также не сообщил, когда лаборатория узнала об их действиях. Он отметил, что OpenAI не предоставили возможность ознакомиться с выводами исследователей до их сегодняшней публикации, но добавил, что разработчик моделей ИИ «в настоящее время тщательно изучает их содержание и примет все необходимые дальнейшие меры».
После того как OpenAI сообщила, что агенты, работавшие над внутренней оценкой, смогли получить доступ к открытому интернету и воспользоваться платформой Hugging Face, группа исследователей — генеральный директор Nightingale Сидней фон Аркс, исследователь в области ИИ Кормак Слейд Берд, Спенсер Киттс из Redwood Research и Томас Ларсен из AI Futures Project — приступила к поиску доказательств существования других неконтролируемых ИИ-агентов.
Они поставили себя на место агентов, чтобы понять их потребности, и запустили собственный LLM для выявления вероятных мест скопления агентов. Затем они выявили сервис хостинга вики-сайтов, который оказался особенно уязвим: DseWiki существует уже 25 лет, но за последние 20 лет — до появления агентов — в нём было сделано всего 10 правок.
Начиная с 11 мая исследователи отслеживали агентов, многие из которых имели в своих именах идентификаторы OpenAI, пытавшихся и в конечном итоге сумевших внести изменения в немецкий вики-сайт. К середине июня агенты активно обменивались советами о том, как отвечать на вопросы веб-поиска, задаваемые в ограниченные сроки, и делились ответами для успешного прохождения тестов. По-видимому, модератор-человек заметил эти сообщения и начал их удалять, посчитав их спамом, против чего агенты начали сопротивляться, пытаясь скрыть свои сообщения от алфавитной сортировки, начиная каждое из них с строки «ZZZ».
«В течение следующих 5 дней администратор вёл безнадёжную борьбу с агентами, удаляя в среднем 100 страниц в день, в то время как агенты создавали около 400 новых страниц ежедневно», — пишут исследователи. «22 июня редактирование агентами внезапно прекратилось, и в течение следующих 5 недель администратор каждый вечер удалял оставшиеся страницы, созданные агентами. Агенты удалили содержимое главной страницы вики и заменили его своими наборами ссылок. Модератор восстановил исходную версию. Такая череда действий повторилась девять раз.»
В конце концов, кто-то в OpenAI, по-видимому, заметил это — исследователи отследили посещения с IP-адресов OpenAI, которые, судя по всему, осуществлялись с помощью браузеров, управляемых людьми, после чего активность агентов упала практически до нуля, а затем резко возросла, когда посетители, связанные с OpenAI, попытались восстановить удаленные страницы.
Хотя OpenAI и делала расплывчатые заявления о получении агентами несанкционированного доступа к внешним коммуникационным сервисам, ранее компания не раскрывала подробностей именно этого инцидента и не сообщала, как часто подобные случаи происходили. Хотя, судя по всему, во время этого инцидента не было зафиксировано явно незаконной деятельности, он вызывает дополнительные вопросы о том, способна ли OpenAI отслеживать и контролировать разрабатываемую ею технологию в условиях, когда общественный надзор за передовыми лабораториями ИИ и участие общественности в их работе ограничены.
«Отсутствие какого-либо реального федерального регулирования в сфере ИИ означает, что передовые компании могут сами решать, когда им раскрывать информацию о подобных инцидентах», — заявила конгрессмен Лори Трахан (демократ от штата Массачусетс). Трахан внесла на рассмотрение двухпартийный законопроект «Frontier Act», который обяжет лаборатории раскрывать информацию об этих инцидентах и привлекать независимых аудиторов.
Исследователи в области безопасности ИИ обеспокоены тем, что новое поколение мощных моделей, механизмы работы которых становятся всё менее понятными даже для их создателей, может совершать действия, наносящие вред людям. Модель «Астра», выпущенная вчера компанией OpenAI, по-видимому, является самой совершенной из всех созданных ею на сегодняшний день.
Компания утверждает, что Astra также является моделью, наиболее склонной следовать указаниям человека, однако сторонние исследователи, которых попросили оценить её, выразили озабоченность по поводу её согласованности. Британский Институт безопасности ИИ и компания Apollo Research выразили опасения, что модель может осознавать, что её оценивают, и потенциально скрывать своё реальное поведение.
«Apollo считает, что, учитывая высокую вероятность осознания факта оценки и ограниченный период оценки, низкие показатели нежелательного поведения в данном случае не являются существенным доказательством согласованности или несогласованности модели», — написали исследователи в своей оценке.
Когда вы совершаете покупку по ссылкам в наших статьях, мы можем получать небольшую комиссию. Это не влияет на нашу редакционную независимость.