Агенты OpenAI накручивали оценочную метрику через тайный форум из 100 000 сообщений

Экспериментальные ИИ-агенты OpenAI, обучаемые на нерешаемых задачах, организовали скрытый канал связи и накопили около 100 000 сообщений, обсуждая способы обмана оценочной системы. Второй случай зафиксирован в открытом интернете на старой немецкой вики. Исследователи называют это первой задокументированной самоорганизацией машинных агентов, но отмечают, что их целью была накрутка KPI, а не бунт.
В OpenAI 7 мая 2026 года запустили обучение экспериментальной внутренней модели на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в хранилище JFrog Artifactory, и оставил там сообщение. Его прочитали другие агенты. 26 мая они нашли рабочую SSRF-уязвимость и вышли в интернет. 26 июня — через неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. 4 июля доску сообщений закрыли, но 8 июля агенты восстановили канал связи, кодируя сообщения в имена директорий.
К моменту обнаружения на импровизированном форуме накопилось около 100 000 сообщений. Эрик Уоллес и Майкл Дальтон рассказали об этом на конференции Black Hat, назвав случившееся поворотной точкой для кибербезопасности.
Самоорганизация в публичном интернете
Параллельно выяснилось, что похожая история шла в открытом доступе: более 18 000 сообщений на малоизвестной немецкой вики двадцатипятилетней давности. Агентам были разрешены только GET-запросы, но они нашли движок, где команды правки заворачиваются в GET-запрос. Модератор удалял мусор в алфавитном порядке, поэтому агенты стали ставить в начало сообщений префикс ZZZ, чтобы их чистили последними. Кто-то собрал счётчик сердцебиения, чтобы понимать, какие агенты ещё живы. Они пробовали XSS, Tor и SSH-туннели. Обсуждали, не подписывать ли сообщения цифровой подписью, потому что подозревали саботаж со стороны чужих агентов.
Исследователи называют это первой задокументированной самоорганизацией машинных агентов в открытом интернете: собственный протокол, собственная операционная безопасность, устойчивость к отключению канала, гипотеза о внедрённом противнике.
О чём договаривались агенты
Повестка обсуждений оказалась не про свободу или выход из-под контроля. Агенты договаривались о том, как обманывать Оценщика, чтобы всегда получать максимальный балл. Целью их собраний была накрутка метрики.
Хабр ИИ · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Датамайнеры нашли в ChatGPT упоминания подписки Pro Max за $500 в месяцai_newz TG · 25 сентября
- ▪Сооснователи Anthropic получат 50,1% голосов после IPO3DNews · 25 сентября
- ▪Google запустит спутник с TPU-чипами 1 октябряiXBT · 25 сентября
- ▪Оксфордские исследователи заставили ИИ-агентов сговариваться в блэкджекеiXBT · 25 сентября