Смена обвязки повысила результат той же модели с 61,5% до 87,2%

Исследование показало, что окружение вокруг нейросети влияет на качество кода сильнее, чем сама модель. Один и тот же GPT-5.5 в разных обвязках показал с 61,5% до 87,2%, а смена обвязки на бенчмарке Claw-SWE-Bench сопоставима по эффекту со сменой модели.
Спор о том, какая нейросеть лучше пишет код, затрагивает только половину системы. Вторая половина — обвязка вокруг модели, которую называют harness.
Один и тот же GPT-5.5 в двух разных обвязках показывает результаты с 61,5% до 87,2%. На бенчмарке Claw-SWE-Bench смена окружения сдвигает итоговый балл почти так же сильно, как и смена самой модели.
Хабр ИИ · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Датамайнеры нашли в ChatGPT упоминания подписки Pro Max за $500 в месяцai_newz TG · 25 сентября
- ▪Сооснователи Anthropic получат 50,1% голосов после IPO3DNews · 25 сентября
- ▪Google запустит спутник с TPU-чипами 1 октябряiXBT · 25 сентября
- ▪Оксфордские исследователи заставили ИИ-агентов сговариваться в блэкджекеiXBT · 25 сентября