Тестирование девяти скиллов для Claude Code: часть не отличается от пустышки, один ухудшил результат

Автор сравнил девять популярных скиллов для Claude Code с нейтральным текстом той же длины. Агент 450 раз решал задачи SWE-bench и Terminal-Bench — большинство скиллов не дали прироста, один оказался хуже пустышки, и ни один не снизил стоимость работы.
Проведено сравнение девяти самых востребованных скиллов для Claude Code с нейтральным текстом той же длины, в котором не было ни одного совета по работе. Агент 450 раз решал задачи из наборов SWE-bench и Terminal-Bench — со скиллом, с пустышкой и без каких-либо дополнений вовсе.
Скилл superpowers, набравший почти 300 тысяч звёзд, по результатам не отличался от пустышки. Один из девяти показал результат хуже неё. Ни один скилл не сделал работу дешевле, чем без него: часть расходов уходит на то, что скилл постоянно присутствует в контексте.
В материале разобрано, какие два скилла всё-таки дали эффект, и как в день публикации автор обнаружил у себя ошибку, изменившую один из вердиктов.
Хабр ИИ · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Прибыль TSMC за квартал выросла на 51%, выручка достигла $46,7 млрд3DNews · 8 октября
- ▪Microsoft добавит в Windows ИИ-агентов с доступом к локальным файлам3DNews · 8 октября
- ▪Cloudflare обновил правила доступа ИИ-ботов к сайтамХабр ИИ · 8 октября
- ▪ICANN получила 1615 заявок на новые домены верхнего уровня от 481 заявителя3DNews · 7 октября