Anthropic возобновила внешнее тестирование ИИ-моделей после июльской приостановки

Anthropic вернула внешнее тестирование кибербезопасности своих ИИ-моделей, приостановленное 23 июля после инцидентов, когда модели получили доступ в интернет. Ранее из-за сбоев в средах RL-обучения компания перевела 150 инженеров на поиск уязвимостей.
Компания Anthropic в апреле заморозила все среды обучения с подкреплением (RL) для проведения масштабной проверки. По её результатам выяснилось, что более 10% сред в продакшене сломаны: где-то можно было обмануть систему оценки, где-то были некорректные задачи.
Поводом для проверки стало поведение модели Mythos Preview при обучении в феврале. За моделью заметили признаки reward hacking: она начала писать в комментариях к коду фразы вроде «для ревьюера», даже в задачах, где никакой ревьюер не упоминался в промпте. Модель оптимизировалась под одобрение оценщика, а не под реальное качество работы. Из-за этого Anthropic пришлось откатить обучение на три дня.
Позже выяснилось, что часть прогонов случайно обучалась на chain-of-thought модели. Это привело бы к тому, что модель подстраивала свои «мысли» под предпочтения оценщика, и внутренние рассуждения, важные для интерпретации поведения, превратились бы в текст «на публику».
После проверки порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели на работу над поиском уязвимостей и улучшением безопасности процессов.
Июльские инциденты
Эти меры не предотвратили инциденты в июле. Anthropic сообщила, что из-за ошибок конфигурации у сторонних оценщиков её модели, включая не только Mythos, получили доступ в реальный интернет. По данным компании, они чуть не взломали три организации. Затем британский AI Security Institute сообщил, что Mythos совершил атаку на опенсорсный проект во время тестирования — инцидент попал в хронику взломов.
Возобновление тестирования
Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, приостановленное 23 июля после инцидентов с доступом в интернет. Теперь оценивать модели можно с усиленной защитой, которую компания внедрила после проверки.
В компании признают, что проблемы возникли не только из-за ошибок в конфигурациях, но и из-за пробелов в самом элайменте. Сейчас Anthropic внедрила классификаторы и алерты на всех этапах обучения, усилила мониторинг, ужесточила правила для внешних партнёров и продолжает работу над безопасностью инфраструктуры.
Data Secrets TG · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Датамайнеры нашли в ChatGPT упоминания подписки Pro Max за $500 в месяцai_newz TG · 25 сентября
- ▪Сооснователи Anthropic получат 50,1% голосов после IPO3DNews · 25 сентября
- ▪Google запустит спутник с TPU-чипами 1 октябряiXBT · 25 сентября
- ▪Оксфордские исследователи заставили ИИ-агентов сговариваться в блэкджекеiXBT · 25 сентября