DeepSeek запустила V4.1-Flash в API и выводит из эксплуатации V4-Pro

DeepSeek запустила V4.1-Flash в API: 552 млрд параметров, текст и изображения, контекст до 1 млн токенов, кэш около 890 байт на токен — в 4 раза меньше, чем у DeepSeek-V4-Flash. С 14 сентября запросы к V4-Pro перенаправят на новую модель. По расчётам разработчиков, рост контекста в 256 раз увеличивает вычисления на один генерируемый токен лишь на четверть.
Китайская лаборатория DeepSeek представила архитектуру DeepSeek-V4.1-Flash. Новая модель рассчитана на длинные контексты и работу ИИ-агентов, которые в ходе решения объёмной задачи постоянно обрабатывают большие массивы входных данных.
Модель уже запущена в API, и с 14 сентября запросы к V4-Pro будут перенаправлять на неё: прежнюю версию DeepSeek выводит из эксплуатации. Дата названа прямо, условия переноса для сторонних интеграций компания не раскрыла.
У V4.1-Flash 552 млрд параметров. Модель принимает текст и изображения, поддерживает контекст до 1 млн токенов. Кэш занимает около 890 байт на токен — вчетверо меньше, чем у DeepSeek-V4-Flash, а объём постоянно сохраняемых данных удалось уменьшить в 8 раз.
Зачем понадобилась новая архитектура
Сложность возникает из-за того, как работают модели с большим контекстом. KV-кэш хранит промежуточные результаты обработки токенов, чтобы не пересчитывать их заново. Когда контекст разрастается, кэш начинает занимать заметную долю быстрой памяти HBM, а его сохранение для повторного использования требует SSD или оперативной памяти и высокой пропускной способности при пересылке. Поэтому снижение вычислительной нагрузки не всегда пропорционально уменьшает стоимость обслуживания длинноконтекстных агентов.
В V4.1-Flash переработали сразу несколько уровней. Архитектура Causal Encoder-Decoder при первичной обработке запроса задействует около 8 млрд параметров на токен против 16 млрд при последующей генерации. Механизм Compressed Sparse Attention 2 повторно использует часть KV-кэша между слоями, а его данные дополнительно хранятся в формате FP4. Для постоянно сохраняемого кэша применяется механизм SWA Bounded Replay: система не держит все нужные промежуточные состояния, а восстанавливает их повторным вычислением небольшого фрагмента контекста.
На чём обучали и что получилось
Предварительное обучение шло на мультимодальном массиве объёмом 45 трлн токенов, затем модель дообучали под задачи рассуждения, программирования и работы агентом. DeepSeek заявляет, что базовая версия V4.1-Flash при трети общего числа параметров и четверти активируемых показывает результаты на уровне DeepSeek-V4-Pro-Base и превосходит её на 5–10% на части отложенных тестов. На агентских тестах модель сопоставима с рядом закрытых передовых моделей, хотя разработчики признают сохраняющийся разрыв на научных задачах, где нужны экспертные знания.
Ключевой результат — рост длины контекста перестаёт так сильно удорожать его обслуживание. По расчётам авторов, увеличение контекста в 256 раз, с 4 тыс. до 1 млн токенов, повышает вычисления на один генерируемый токен лишь на четверть. Вместе с сокращённым KV-кэшем это должно удешевить развёртывание длительных агентских сценариев и расширить круг задач, где их можно применять.
iXBT · права на исходный материал принадлежат автору.
Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».
Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.
Читать в Telegram →По теме
- ▪Датамайнеры нашли в ChatGPT упоминания подписки Pro Max за $500 в месяцai_newz TG · 25 сентября
- ▪Сооснователи Anthropic получат 50,1% голосов после IPO3DNews · 25 сентября
- ▪Google запустит спутник с TPU-чипами 1 октябряiXBT · 25 сентября
- ▪Оксфордские исследователи заставили ИИ-агентов сговариваться в блэкджекеiXBT · 25 сентября