DeepSeek V4.1 Flash: 763B параметров, 196B N-gram — какConditional Memory Module меняет правила

Технический разбор DeepSeek V4.1 Flash: N-gram conditional memory module, KV-cache сокращение до 13-25%, causal encoder-decoder. 4-8x больше пользователей при том же footprint. Что это значит для open-weight моделей.

Источник: The Register


A giant brain made of bookshelves towers over a small engineer studying two charts.

Точечный релиз, который больше предыдущей модели в 2.5 раза

DeepSeek выпустила V4.1 Flash — модель, которую называют «point release» (обновление с точкой), но которая по размеру превосходит V3 и R1, поставившие DeepSeek на карту в начале 2025 года. 763 миллиарда параметров. Для сравнения: предыдущая версия V4 Flash была меньше в 2.5 раза.

Но главное — не размер. Главное — то, что модель стала умнее и одновременно требует заметно меньше ресурсов для обслуживания.

N-gram: энциклопедия, а не мозг

Из 763 миллиарда параметров 196 миллиардов — это N-gram weights, которые DeepSeek называет «conditional memory module». Концепция: отделить память от вычислений.

Работает это примерно как заученное знание. Вместо того чтобы каждый раз вычислять, какая комбинация токенов с наибольшей вероятностью отвечает на вопрос, модель дополняет вычисления быстрым поиском по таблице. Это не lookup в буквальном смысле — модель ищет серии хешей, а содержимое lookup-таблицы — не сырые ответы, а математические представления (векторы), которые встраиваются в инференс-пайплайн.

Конечный результат одинаков: модель выдаёт более точные и нюансированные ответы без penalty, обычно связанного с дополнительными параметрами.

Почему это дёшево. Современные LLM авторегрессивны при декодировании: для каждого сгенерированного токена нужно прочитать из памяти все активные веса модели. Пропускная способность — узкое место. N-gram weights работают иначе: они представляют собой огромные lookup-таблицы (LUT). Они быстры и дёшевы для запроса — не нужно читать всю таблицу целиком для каждого токена, достаточно нескольких десятков обращений.

GPU-память: 567 гигабайт вместо 763

В практических терминах: модель с 763B параметров в FP8 потребовала бы минимум 763 GB GPU-памяти. Но поскольку N-gram weights можно выгрузить в system RAM, достаточно около 567 GB GPU-памяти. В production цифры выше — нужно учитывать KV-cache, масштабирующийся с длиной контекста и числом одновременных пользователей — но экономия реальна.

Во время инференса N-gram weights дополняют восемь миллиардов активных параметров, которые DeepSeek использует для обработки промпта. N-gram weights не увеличивают активный счёт параметров. Они работают как «oddly specific encyclopedia, которая почти мгновенно открывает нужные страницы, пока модель обрабатывает промпты» — цитата из The Register.

KV-cache: от 13% до 25% предыдущего requirements

Второе ключевое изменение — работа с KV-cache, трекающим состояние модели между сессиями. Обновления механизмов внимания и введение causal encoder-decoder (CED) позволили сократить потребление KV-cache до 13-25% от требований DeepSeek V4 Flash.

Практический результат: V4.1 может обслужить 4-8x больше пользователей в том же KV-cache footprint. Для high-throughput приложений — чатботов, агентов — это не оптимизация, а смена экономики.

Это не только DeepSeek

Google уже применяет аналогичный подход через Per-Layer Embedding (PLE), разработанный командой Gemma, — чтобы выгружать менее bandwidth-sensitive weights на локальное хранилище. Пока это применялось только к маленьким моделям (по крайней мере, публично).

Alibaba в конце августа показала Qwen 3.8-Flash-Next — 180B параметров, из которых 51B — N-gram weights, с использованием техник из того же исследования DeepSeek, опубликованного в январе. По словам Alibaba, архитектурные основы Qwen 3.8-Flash-Next лягут в основу следующего поколения Qwen 4.

The Register резюмирует: «like it or not, this probably won’t be the last time you hear about N-grams».

Почему это важно

Гонка моделей последние два года определялась одним принципом: больше параметров = умнее модель. DeepSeek V4.1 Flash показывает, что этот принцип исчерпан. Модель с 763B параметров может быть умнее, дешевле в обслуживании и эффективнее при масштабировании, чем её предшественник с меньшим числом параметров, — если правильно разделить вычисления и память.

Для open-weight экосистемы это значит: можно строить более крупные модели без пропорционального роста требований к GPU. Для закрытых лабораторий — что их экономическое преимущество, основанное на огромных inference-бюджетах, может оказаться менее устойчивым.

FAQ

Что такое N-gram в контексте DeepSeek V4.1 Flash?

N-gram — группа токенов. В архитектуре DeepSeek N-gram parameters формируют conditional memory module — lookup-таблицы, которые позволяют модели быстро находить релевантную информацию без полного вычисления для каждого токена.

Сколько GPU-памяти нужно для DeepSeek V4.1 Flash?

Минимум 763 GB для всех весов в FP8. Но поскольку N-gram weights можно выгрузить в system RAM, достаточно около 567 GB GPU-памяти.

Что такое Conditional Memory Module?

Это архитектура, разделяющая память и вычисления. 196B N-gram parameters хранят информацию в lookup-таблицах, которые дополняют 8B активных параметров при обработке промпта. Модель становится умнее без пропорционального роста вычислительных затрат.

Что такое KV-cache и почему его сокращение важно?

KV-cache хранит состояние модели между сессиями. Он масштабируется с длиной контекста и числом одновременных пользователей. Сокращение до 13-25% от требований V4 Flash означает, что модель может обслужить 4-8x больше пользователей при том же footprint.

Это только DeepSeek использует N-gram?

Нет. Google применяет аналогичный подход Per-Layer Embedding (PLE) в Gemma. Alibaba показала Qwen 3.8-Flash-Next (180B параметров, 51B N-gram) на основе техник из исследования DeepSeek.

Краткий ответ

DeepSeek V4.1 Flash — 763B параметров (2.5x предшественника), из которых 196B — N-gram conditional memory module. KV-cache сокращён до 13-25% от V4 Flash, что позволяет обслуживать 4-8x больше пользователей при том же footprint. GPU-память: ~567 GB вместо 763 GB. Архитектуру уже применяют Google (PLE в Gemma) и Alibaba (Qwen 3.8-Flash-Next, 51B N-gram).

← Все новости