Два ИИ-ревьюера нашли шесть P1 и 25 P2 в коде skillmem за 40 раундов

Разработчики проекта skillmem пропустили код через двойное ревью моделей Claude и GPT: модели проверяли друг друга в общей сложности 40 раундов, каждая находка подтверждалась воспроизведением. Нашли шесть ошибок уровня P1 и около 25 уровня P2 в коде, который до этого прошёл два независимых ревью. Часть исправлений приводила к регрессиям, которые выявлялись только на следующем раунде.
Код проекта skillmem прошёл два независимых ревью и считался чистым. Затем его враждебно проверяли две модели с разных сторон — Claude и GPT — в течение 40 раундов подряд. Условием было воспроизведение каждой находки командой.
Итог: шесть ошибок уровня P1 и около 25 уровня P2 в коде, который «уже был отревьюен». Ключевое наблюдение — каждый второй фикс порождал регрессию, которую выявлял только следующий раунд проверки.
Хабр ИИ · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Датамайнеры нашли в ChatGPT упоминания подписки Pro Max за $500 в месяцai_newz TG · 25 сентября
- ▪Сооснователи Anthropic получат 50,1% голосов после IPO3DNews · 25 сентября
- ▪Google запустит спутник с TPU-чипами 1 октябряiXBT · 25 сентября
- ▪Оксфордские исследователи заставили ИИ-агентов сговариваться в блэкджекеiXBT · 25 сентября