Эксперимент: инструкции по «дисциплине» снизили число исправленных ИИ-агентом багов на 13%

Три прогона на 100 реальных задачах из SWE-bench показали, что добавление агенту правил осторожности по мотивам советов Андрея Карпати уменьшает долю исправленных багов примерно на 13%. Ограничения, задуманные как защита от поспешных правок, в этом тесте сработали как тормоз.
Добавление ИИ-агенту правил, заставляющих писать код аккуратнее, ухудшило результат. Три прогона на 100 реальных багах из набора SWE-bench показали: «правила дисциплины», составленные по мотивам советов Андрея Карпати, снизили число исправлений примерно на 13%.
Автор эксперимента сравнил поведение агента с набором ограничений и без него. Осторожность выглядит полезной настройкой, но на практике часть задач, которые агент закрывал в базовом режиме, с инструкциями осталась нерешённой.
Разбор результатов и вывод о том, в какой момент разумные ограничения превращаются для агента в тормоза, опубликован в материале на Хабре.
Хабр ИИ · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Датамайнеры нашли в ChatGPT упоминания подписки Pro Max за $500 в месяцai_newz TG · 25 сентября
- ▪Сооснователи Anthropic получат 50,1% голосов после IPO3DNews · 25 сентября
- ▪Google запустит спутник с TPU-чипами 1 октябряiXBT · 25 сентября
- ▪Оксфордские исследователи заставили ИИ-агентов сговариваться в блэкджекеiXBT · 25 сентября