10.09.2026
DeepSeek представила открытую модель V4.1-Flash для ИИ-агентов и обработки длинного контекста. Новая архитектура сокращает объём глобального KV-кэша примерно в четыре раза по сравнению с V4-Flash и активирует до 16 млрд параметров из 552 млрд.
DeepSeek опубликовала мультимодальную модель DeepSeek-V4.1-Flash с поддержкой текстовых и графических данных, а также контекстного окна объёмом до 1 млн токенов. Весовые коэффициенты распространяются по лицензии MIT.
Модель построена по схеме Causal Encoder-Decoder: 20 слоёв кодировщика обрабатывают входные данные, а следующие 20 слоёв формируют ответ. Во время загрузки контекста активируются 8 млрд параметров на токен, при генерации — 16 млрд из 552 млрд параметров основной модели.
Основное изменение связано с KV-кэшем, в котором сохраняются промежуточные данные уже обработанного контекста. Сочетание разреженного внимания, повторного использования состояний и хранения основной части кэша в формате FP4 позволило уменьшить его объём до 890 байт на токен — примерно до четверти показателя DeepSeek-V4-Flash. Постоянная часть кэша, размещаемая в оперативной памяти или на SSD, сократилась примерно в восемь раз.
Оптимизации рассчитаны прежде всего на агентов, которые многократно обрабатывают длинную историю и результаты вызова внешних инструментов. В опубликованных DeepSeek тестах модель получила 74,2% на программном бенчмарке DeepSWE v1.1, однако эти результаты пока являются оценками самого разработчика.
Источник: huggingface.co