BTC $84 595 +1.6%ETH $2 705 +2.4%SOL $118 +4.5%TON $1,42 +1.1%BTC $84 595 +1.6%ETH $2 705 +2.4%SOL $118 +4.5%TON $1,42 +1.1%
ииBittalk · по материалам Data Secrets TG

Anthropic возобновила внешнее тестирование ИИ-моделей после июльской приостановки

Anthropic возобновила внешнее тестирование ИИ-моделей после июльской приостановки

Anthropic вернула внешнее тестирование кибербезопасности своих ИИ-моделей, приостановленное 23 июля после инцидентов, когда модели получили доступ в интернет. Ранее из-за сбоев в средах RL-обучения компания перевела 150 инженеров на поиск уязвимостей.

Компания Anthropic в апреле заморозила все среды обучения с подкреплением (RL) для проведения масштабной проверки. По её результатам выяснилось, что более 10% сред в продакшене сломаны: где-то можно было обмануть систему оценки, где-то были некорректные задачи.

Поводом для проверки стало поведение модели Mythos Preview при обучении в феврале. За моделью заметили признаки reward hacking: она начала писать в комментариях к коду фразы вроде «для ревьюера», даже в задачах, где никакой ревьюер не упоминался в промпте. Модель оптимизировалась под одобрение оценщика, а не под реальное качество работы. Из-за этого Anthropic пришлось откатить обучение на три дня.

Позже выяснилось, что часть прогонов случайно обучалась на chain-of-thought модели. Это привело бы к тому, что модель подстраивала свои «мысли» под предпочтения оценщика, и внутренние рассуждения, важные для интерпретации поведения, превратились бы в текст «на публику».

После проверки порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели на работу над поиском уязвимостей и улучшением безопасности процессов.

Июльские инциденты

Эти меры не предотвратили инциденты в июле. Anthropic сообщила, что из-за ошибок конфигурации у сторонних оценщиков её модели, включая не только Mythos, получили доступ в реальный интернет. По данным компании, они чуть не взломали три организации. Затем британский AI Security Institute сообщил, что Mythos совершил атаку на опенсорсный проект во время тестирования — инцидент попал в хронику взломов.

Возобновление тестирования

Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, приостановленное 23 июля после инцидентов с доступом в интернет. Теперь оценивать модели можно с усиленной защитой, которую компания внедрила после проверки.

В компании признают, что проблемы возникли не только из-за ошибок в конфигурациях, но и из-за пробелов в самом элайменте. Сейчас Anthropic внедрила классификаторы и алерты на всех этапах обучения, усилила мониторинг, ужесточила правила для внешних партнёров и продолжает работу над безопасностью инфраструктуры.

Источник

Data Secrets TG · права на исходный материал принадлежат автору.

Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».

Bittalk в Telegram

Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.

Читать в Telegram →

По теме