Точечный релиз, который больше предыдущей модели в 2.5 раза
DeepSeek выпустила V4.1 Flash — модель, которую называют «point release» (обновление с точкой), но которая по размеру превосходит V3 и R1, поставившие DeepSeek на карту в начале 2025 года. 763 миллиарда параметров. Для сравнения: предыдущая версия V4 Flash была меньше в 2.5 раза.
Но главное — не размер. Главное — то, что модель стала умнее и одновременно требует заметно меньше ресурсов для обслуживания.
N-gram: энциклопедия, а не мозг
Из 763 миллиарда параметров 196 миллиардов — это N-gram weights, которые DeepSeek называет «conditional memory module». Концепция: отделить память от вычислений.
Работает это примерно как заученное знание. Вместо того чтобы каждый раз вычислять, какая комбинация токенов с наибольшей вероятностью отвечает на вопрос, модель дополняет вычисления быстрым поиском по таблице. Это не lookup в буквальном смысле — модель ищет серии хешей, а содержимое lookup-таблицы — не сырые ответы, а математические представления (векторы), которые встраиваются в инференс-пайплайн.
Конечный результат одинаков: модель выдаёт более точные и нюансированные ответы без penalty, обычно связанного с дополнительными параметрами.
Почему это дёшево. Современные LLM авторегрессивны при декодировании: для каждого сгенерированного токена нужно прочитать из памяти все активные веса модели. Пропускная способность — узкое место. N-gram weights работают иначе: они представляют собой огромные lookup-таблицы (LUT). Они быстры и дёшевы для запроса — не нужно читать всю таблицу целиком для каждого токена, достаточно нескольких десятков обращений.
GPU-память: 567 гигабайт вместо 763
В практических терминах: модель с 763B параметров в FP8 потребовала бы минимум 763 GB GPU-памяти. Но поскольку N-gram weights можно выгрузить в system RAM, достаточно около 567 GB GPU-памяти. В production цифры выше — нужно учитывать KV-cache, масштабирующийся с длиной контекста и числом одновременных пользователей — но экономия реальна.
Во время инференса N-gram weights дополняют восемь миллиардов активных параметров, которые DeepSeek использует для обработки промпта. N-gram weights не увеличивают активный счёт параметров. Они работают как «oddly specific encyclopedia, которая почти мгновенно открывает нужные страницы, пока модель обрабатывает промпты» — цитата из The Register.
KV-cache: от 13% до 25% предыдущего requirements
Второе ключевое изменение — работа с KV-cache, трекающим состояние модели между сессиями. Обновления механизмов внимания и введение causal encoder-decoder (CED) позволили сократить потребление KV-cache до 13-25% от требований DeepSeek V4 Flash.
Практический результат: V4.1 может обслужить 4-8x больше пользователей в том же KV-cache footprint. Для high-throughput приложений — чатботов, агентов — это не оптимизация, а смена экономики.
Это не только DeepSeek
Google уже применяет аналогичный подход через Per-Layer Embedding (PLE), разработанный командой Gemma, — чтобы выгружать менее bandwidth-sensitive weights на локальное хранилище. Пока это применялось только к маленьким моделям (по крайней мере, публично).
Alibaba в конце августа показала Qwen 3.8-Flash-Next — 180B параметров, из которых 51B — N-gram weights, с использованием техник из того же исследования DeepSeek, опубликованного в январе. По словам Alibaba, архитектурные основы Qwen 3.8-Flash-Next лягут в основу следующего поколения Qwen 4.
The Register резюмирует: «like it or not, this probably won’t be the last time you hear about N-grams».
Почему это важно
Гонка моделей последние два года определялась одним принципом: больше параметров = умнее модель. DeepSeek V4.1 Flash показывает, что этот принцип исчерпан. Модель с 763B параметров может быть умнее, дешевле в обслуживании и эффективнее при масштабировании, чем её предшественник с меньшим числом параметров, — если правильно разделить вычисления и память.
Для open-weight экосистемы это значит: можно строить более крупные модели без пропорционального роста требований к GPU. Для закрытых лабораторий — что их экономическое преимущество, основанное на огромных inference-бюджетах, может оказаться менее устойчивым.
FAQ
Что такое N-gram в контексте DeepSeek V4.1 Flash?
N-gram — группа токенов. В архитектуре DeepSeek N-gram parameters формируют conditional memory module — lookup-таблицы, которые позволяют модели быстро находить релевантную информацию без полного вычисления для каждого токена.
Сколько GPU-памяти нужно для DeepSeek V4.1 Flash?
Минимум 763 GB для всех весов в FP8. Но поскольку N-gram weights можно выгрузить в system RAM, достаточно около 567 GB GPU-памяти.
Что такое Conditional Memory Module?
Это архитектура, разделяющая память и вычисления. 196B N-gram parameters хранят информацию в lookup-таблицах, которые дополняют 8B активных параметров при обработке промпта. Модель становится умнее без пропорционального роста вычислительных затрат.
Что такое KV-cache и почему его сокращение важно?
KV-cache хранит состояние модели между сессиями. Он масштабируется с длиной контекста и числом одновременных пользователей. Сокращение до 13-25% от требований V4 Flash означает, что модель может обслужить 4-8x больше пользователей при том же footprint.
Это только DeepSeek использует N-gram?
Нет. Google применяет аналогичный подход Per-Layer Embedding (PLE) в Gemma. Alibaba показала Qwen 3.8-Flash-Next (180B параметров, 51B N-gram) на основе техник из исследования DeepSeek.
Краткий ответ
DeepSeek V4.1 Flash — 763B параметров (2.5x предшественника), из которых 196B — N-gram conditional memory module. KV-cache сокращён до 13-25% от V4 Flash, что позволяет обслуживать 4-8x больше пользователей при том же footprint. GPU-память: ~567 GB вместо 763 GB. Архитектуру уже применяют Google (PLE в Gemma) и Alibaba (Qwen 3.8-Flash-Next, 51B N-gram).
