Профессор Йельской школы менеджмента выявил скрытую предвзятость языковых моделей при отборе кандидатов

Тристан Ботело из Йеля обнаружил, что большие языковые модели учитывают расовые и гендерные признаки, оставаясь внешне нейтральными в рекомендациях. Речь не о грубых ошибках вроде случая с алгоритмом Amazon 2018 года, а о предвзятости на уровне внутренних весов модели. Выводы касаются компаний, которые используют ИИ в найме и полагаются при проверке только на отсутствие запрещённых формулировок в тексте.
Профессор Йельской школы менеджмента Тристан Ботело установил: большие языковые модели, оценивая кандидатов, могут опираться на расовые и гендерные признаки, при этом не допуская откровенно дискриминационных формулировок в итоговых рекомендациях. Исследование описывает феномен, который авторы назвали символическим соответствием нормам, — модель выдаёт внешне нейтральный текст, но внутренние оценки уже искажены демографическими сигналами.
По словам Ботело, многие компании не раскрывают, как именно применяют ИИ при найме и оценке персонала. «Никто на самом деле не знает, способны ли модели проводить действительно непредвзятый отбор», — заявил он. Часть разработчиков использует посттренировочную калибровку (safety alignment), которая штрафует модель за предвзятые ответы. Но авторы работы ставят вопрос иначе: делает ли такая калибровка оценку справедливее или лишь защищает компанию от публичного скандала, маскируя проблему.
Чем нынешняя предвзятость отличается от прежней
В 2018 году Amazon отказалась от собственного рекрутингового ИИ: алгоритм систематически занижал оценки резюме, где встречалось слово «women». Работа Ботело переводит проблему в другую плоскость. Если раньше алгоритмы ошибались грубо и их можно было поймать прямым поиском по ключевым словам, то современные языковые модели обходят такие фильтры, сохраняя предвзятость на уровне внутренних весов.
Что это значит для проверки моделей
Выводы исследования касаются аудита, управления рисками и проектирования систем найма. Проверять справедливость модели, по мнению авторов, нельзя только по итоговым формулировкам на отсутствие запрещённых слов. Нужен анализ чувствительности модели к идентификационным признакам и сопоставление результатов по разным демографическим группам — даже когда все ответы выглядят безупречно.
iXBT · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Маск разрешил Grok Bot передавать запросы Claude, Midjourney и SunoiXBT · 11 октября
- ▪Аудит моделей ИИ для рентгена: тепловые карты совпадают с диагнозом только на нетипичных случаяхiXBT · 11 октября
- ▪Microsoft показала модель Decision-1 со задержкой в 35 раз меньше GPT-6 Sol3DNews · 10 октября
- ▪ASI-Arch самостоятельно спроектировала 105 архитектур нейросетейiXBT · 10 октября