BTC $84 595 +1.6%ETH $2 705 +2.4%SOL $118 +4.5%TON $1,42 +1.1%BTC $84 595 +1.6%ETH $2 705 +2.4%SOL $118 +4.5%TON $1,42 +1.1%
ииBittalk · по материалам iXBT

DeepSeek запустила V4.1-Flash в API и выводит из эксплуатации V4-Pro

DeepSeek запустила V4.1-Flash в API и выводит из эксплуатации V4-Pro

DeepSeek запустила V4.1-Flash в API: 552 млрд параметров, текст и изображения, контекст до 1 млн токенов, кэш около 890 байт на токен — в 4 раза меньше, чем у DeepSeek-V4-Flash. С 14 сентября запросы к V4-Pro перенаправят на новую модель. По расчётам разработчиков, рост контекста в 256 раз увеличивает вычисления на один генерируемый токен лишь на четверть.

Китайская лаборатория DeepSeek представила архитектуру DeepSeek-V4.1-Flash. Новая модель рассчитана на длинные контексты и работу ИИ-агентов, которые в ходе решения объёмной задачи постоянно обрабатывают большие массивы входных данных.

Модель уже запущена в API, и с 14 сентября запросы к V4-Pro будут перенаправлять на неё: прежнюю версию DeepSeek выводит из эксплуатации. Дата названа прямо, условия переноса для сторонних интеграций компания не раскрыла.

У V4.1-Flash 552 млрд параметров. Модель принимает текст и изображения, поддерживает контекст до 1 млн токенов. Кэш занимает около 890 байт на токен — вчетверо меньше, чем у DeepSeek-V4-Flash, а объём постоянно сохраняемых данных удалось уменьшить в 8 раз.

Зачем понадобилась новая архитектура

Сложность возникает из-за того, как работают модели с большим контекстом. KV-кэш хранит промежуточные результаты обработки токенов, чтобы не пересчитывать их заново. Когда контекст разрастается, кэш начинает занимать заметную долю быстрой памяти HBM, а его сохранение для повторного использования требует SSD или оперативной памяти и высокой пропускной способности при пересылке. Поэтому снижение вычислительной нагрузки не всегда пропорционально уменьшает стоимость обслуживания длинноконтекстных агентов.

В V4.1-Flash переработали сразу несколько уровней. Архитектура Causal Encoder-Decoder при первичной обработке запроса задействует около 8 млрд параметров на токен против 16 млрд при последующей генерации. Механизм Compressed Sparse Attention 2 повторно использует часть KV-кэша между слоями, а его данные дополнительно хранятся в формате FP4. Для постоянно сохраняемого кэша применяется механизм SWA Bounded Replay: система не держит все нужные промежуточные состояния, а восстанавливает их повторным вычислением небольшого фрагмента контекста.

На чём обучали и что получилось

Предварительное обучение шло на мультимодальном массиве объёмом 45 трлн токенов, затем модель дообучали под задачи рассуждения, программирования и работы агентом. DeepSeek заявляет, что базовая версия V4.1-Flash при трети общего числа параметров и четверти активируемых показывает результаты на уровне DeepSeek-V4-Pro-Base и превосходит её на 5–10% на части отложенных тестов. На агентских тестах модель сопоставима с рядом закрытых передовых моделей, хотя разработчики признают сохраняющийся разрыв на научных задачах, где нужны экспертные знания.

Ключевой результат — рост длины контекста перестаёт так сильно удорожать его обслуживание. По расчётам авторов, увеличение контекста в 256 раз, с 4 тыс. до 1 млн токенов, повышает вычисления на один генерируемый токен лишь на четверть. Вместе с сокращённым KV-кэшем это должно удешевить развёртывание длительных агентских сценариев и расширить круг задач, где их можно применять.

Источник

iXBT · права на исходный материал принадлежат автору.

Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском полной потери вложенных средств. Подробнее — «Отказ от ответственности».

Bittalk в Telegram

Разборы событий, итоги дня и то, что двигает рынок. Без сигналов и обещаний — только факты и что они значат.

Читать в Telegram →

По теме