Ни одна из 3 ИИ-моделей не восстановила 9 из 20 базовых алгоритмов без подсказок

Исследователи проверили 3 больших языковых модели с открытыми весами на 20 классических алгоритмах информатики, применив к ним «машинное забывание». Без подсказок ни одной системе не удалось воспроизвести 9 алгоритмов. Это указывает на разрыв между умением решать задачи знакомыми методами и способностью восстановить сам метод.
Большие языковые модели (LLM) испытывают сложности с самостоятельным восстановлением фундаментальных алгоритмов информатики, если ограничить доступ к известным им решениям. В работе «Can Large Language Models Reinvent Foundational Algorithms?» авторы протестировали 3 модели с открытыми весами на 20 алгоритмах.
В режиме без подсказок 9 из 20 алгоритмов не удалось восстановить ни одной из трёх систем. Результат показывает разрыв между использованием усвоенных знаний и возможностью самостоятельно находить базовые алгоритмические решения.
Как проходил эксперимент
Авторы применили метод «машинного забывания» — настройку, подавляющую воспроизведение конкретных знаний без полного переобучения модели с нуля. Затем моделям давали программные задачи, требовавшие конкретного алгоритма, разрешали писать код на Python, запускать его и исправлять ошибки по результатам проверки. Среди примеров — алгоритм Дейкстры для поиска кратчайших путей в графе и алгоритм Евклида для нахождения наибольшего общего делителя.
Ограничение эксперимента: «машинное забывание» не гарантирует полного стирания знаний, поэтому результаты авторы считают приблизительной верхней границей способности моделей восстанавливать алгоритмы в заданных условиях.
Опора на названия и подсказки
Зависимость от знакомых формулировок проявилась и без изменения параметров модели: когда при генерации подавляли токены, связанные с названием целевого алгоритма, успешность восстановления падала на 19–39%. Алгоритмы с простой структурой или интуитивно понятной идеей восстанавливались легче, чем решения, требовавшие менее очевидных подходов.
Подсказки заметно улучшали результат. Проверили 3 режима: без подсказок, с общим указанием на подход и с пошаговым объяснением логики алгоритма. Общие рекомендации позволяли восстановить дополнительные алгоритмы, а подробные инструкции в отдельных случаях помогали моделям превзойти исходные версии, которые были в них до «забывания».
Обратная связь и пределы метода
Отдельно изучили исправление неудачных попыток. Проверяющий модуль анализировал ошибки и выдавал подсказки для следующего шага. Без такой обратной связи модели постепенно сокращали рассуждения, прекращая полноценный поиск решения, — авторы назвали это «схлопыванием рассуждений». Проверяющий модуль поддерживал процесс поиска и повышал успешность восстановления, но в проведённых экспериментах не позволил расширить набор алгоритмов, которые модели смогли восстановить.
Авторы подчёркивают, что работа охватывает ограниченное число моделей и алгоритмов, а «машинное забывание» не эквивалентно обучению без исходных знаний. Поэтому результаты не доказывают неспособность языковых моделей к фундаментальным открытиям вообще. Они показывают более конкретную проблему: успешное решение задачи ещё не означает, что модель способна самостоятельно восстановить лежащий в его основе алгоритм без опоры на знакомые знания и подсказки.
iXBT · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪В Кремниевой долине обострилась борьба за вычислительные мощности3DNews · 10 октября
- ▪Synopsys обсуждает с китайскими разработчиками ИИ совместное проектирование чипов3DNews · 10 октября
- ▪Anthropic вырвалась вперёд в корпоративном ИИ, OpenAI сокращает отставание3DNews · 10 октября
- ▪OpenAI, Anthropic и AMD вложат более $1 млрд в научную программу ТрампаiXBT · 10 октября