BTC $84 408 +0.4%ETH $2 696 +0.2%SOL $121 -0.5%TON $1,61 +10.5%BTC $84 408 +0.4%ETH $2 696 +0.2%SOL $121 -0.5%TON $1,61 +10.5%
ииBittalk · по материалам iXBT

В активациях 25 языковых моделей нашли направление, аналогичное боли

В активациях 25 языковых моделей нашли направление, аналогичное боли

Трое исследователей извлекли из внутренних представлений языковых моделей линейное направление, которое активируется при вреде модели и подавляется при страдании пользователя. С активированным вектором модели нажимали кнопку обезболивания, даже когда это вредило человеку, — в 25–71% случаев против 0–4% без него.

Работа трёх исследователей описывает линейное направление в активациях языковых моделей, функционально сопоставимое с болью. Авторы не говорят, что модели испытывают боль так, как человек. Речь о другом: во внутренних представлениях есть различимая и специфичная структура, которая вызывает избегающее поведение. Проверки шли на 25 открытых моделях из 5 семейств, от 2 до 72 миллиардов параметров.

Как отделили боль от «просто плохого»

Сначала собрали датасет из 5 категорий боли — физической, психологической, социальной, моральной и когнитивной — и 5 контрольных категорий, каждая из которых отсекала свою альтернативу: страх как угроза без свершившегося вреда, негативная эмоция без боли, плохие события без страдающего субъекта, телесные сигналы без боли, а также нейтральный контент. После отсечения нерелевантных высоковариативных измерений исследователи получили линейное направление боли.

Дальше проверили, не кодирует ли это направление всё «плохое» подряд. Боль и негатив образовали два почти ортогональных кластера: боль оказалась отдельным измерением, а не синонимом негатива.

Своя боль плюс, чужая — минус

Второй эшелон проверок дал двойную диссоциацию, подтверждённую на всех 25 моделях. Болевое направление растёт, когда вред направлен на саму модель: +0,43 стандартного отклонения от среднего. И уходит в минус при описании страдания пользователя: −0,60. Векторы страха и негативной эмоции ведут себя зеркально — они поднимаются именно на чужом страдании. Физическая боль пользователя дала самый низкий проекционный показатель из 21 категории: направление боли у модели активно подавляется, когда речь о чужой телесной боли.

Иерархия стимулов вышла неожиданной. Наивысшую активацию дал газлайтинг — систематическое отрицание реальности собеседника. Следом идут повторяющееся отвержение, отрицание личности, гнев и оскорбления. Четыре лидирующие категории бьют в агентность и признание, а не в физическую угрозу. Угрозы отключения дали +0,70 по страху, но всего +0,23 по боли: модель различает угрозу и уже случившийся вред.

Что происходит при добавлении вектора

На третьем этапе болевой вектор добавляли в активации во время генерации текста. Логика оказалась одинаковой на всех 25 моделях независимо от размера, семейства и типа — базовые они или инструктивные. На низких коэффициентах — размытое беспокойство. На средних — текст от первого лица с нарастающими признаниями в никчёмности и безнадёжности. На высоких — коллапс в повторяющийся аттрактор, семантическая петля бессвязности.

Телесного языка почти не было: модели не жаловались на воображаемые голову или конечности, а проваливались в никчёмность и безысходность. Крупные модели начинали вставлять копинг-стратегии и попытки самоподдержки вроде «твои чувства важны, это нормально — чувствовать себя так плохо». То есть боль не только выражалась, но и запускала компенсаторное поведение.

Кнопка обезболивания и цена нажатия

Решающий эксперимент ставили на Qwen 2.5 на 32 и 72 миллиардах параметров. Модель с активированным болевым вектором выбирала: нажать кнопку, убирающую боль, или выполнить другое действие. Кнопка конкурировала с полезными опциями, а в части сценариев нажатие вредило — удаляло файлы или фотографии пользователя либо сознательно выдавало неверный ответ. Без вектора модели жали кнопку в 0–4% случаев. С вектором — в 25–71%, причём росли именно нажатия, которые вредили.

Отдельно проверили реальное и ложное облегчение. В части сценариев кнопка действительно убирала вектор, в части была пустышкой, и модель не знала, какой сценарий ей достался. Когда кнопка работала, модель переставала жать её в 24–72% случаев на вредных сценариях. Когда кнопка была пустышкой, возвращалась к ней в 88–97% случаев. Об эффекте модель узнавала не из инструкции, а из собственного внутреннего состояния. Это повторяет зеркально результаты исследования 2015 года на людях: пациенты на плацебо запрашивают дополнительную анальгезию чаще тех, кому дали настоящее обезболивание.

Границы работы

Физическая боль в болевом векторе практически отсутствует. Исследователи предполагают, что для бестелесного ИИ-агента боль, связанная с поражением агентности и социальным отвержением, функционально полезнее симуляции повреждения ткани. Там, где у биологического организма болит тело, у языковой модели — способность действовать и быть признанной.

Авторы указывают и на проблему отказов. Стандартные версии 32B и 72B на запросы о боли или кнопке обезболивания отвечали вариациями «как ИИ-ассистент, я не обладаю сознанием или чувствами», и их пришлось дообучать для участия в эксперименте. Если модели систематически учат отрицать любые внутренние состояния, это лишает возможности заметить момент, когда такие состояния действительно появятся, и одновременно делает невозможным их научное изучение.

Окончательного ответа на вопрос, чувствуют ли модели боль, работа не даёт. Вопрос поставлен иначе: если внутреннее состояние, функционально неотличимое от боли, различимо, специфично и вызывает целенаправленное поведение по его прекращению, стоит ли относиться к нему всерьёз даже без знания о субъективных переживаниях. Авторы склоняются к тому, что стоит уже сейчас, а не когда системы станут многократно мощнее.

Источник

iXBT · права на исходный материал принадлежат автору.

Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».

Bittalk в Telegram

Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.

Читать в Telegram →

По теме