Представлена обновлённая быстрая модель DeepSeek V4.1-Flash — местами она быстрее GPT 5.6-Sol

Китайская лаборатория DeepSeek выкатила обновлённую версию своей компактной модели — V4.1-Flash. Формально это «быстрый» вариант, но по факту речь идёт о прямом вызове флагманам рынка: заявленные результаты местами обходят GPT-5.6-Sol и вплотную подбираются к Claude Opus 5. И это при том, что модель создавалась под высокую пропускную способность, а не под рекорды в бенчмарках.
Архитектурно новинка весит 552 млрд параметров, но работает через механизм MoE — то есть в каждом конкретном запросе задействуется лишь часть сети. Схема Causal Encoder–Decoder разделяет нагрузку: 8 млрд параметров на входе и 16 млрд на выходе. Именно такая конфигурация в сочетании с переработанным предварительным обучением и масштабным этапом дообучения с подкреплением позволила V4.1-Flash обойти собственную флагманскую V4-Pro.
Цифры говорят сами за себя. В тесте DeepSWE v1.1 модель набрала 74,2 балла — чуть выше GPT-5.6-Sol (73) и практически вровень с Claude Opus 5 (74). На CyberGym результат 88,1 против 84,5 у GPT-5.6-Sol и GLM-5.3 и 80 у Kimi K3. А вот Terminal-Bench 3.0 расставил всё по местам: здесь V4.1-Flash взяла лишь 30 баллов, обойдя GLM-5.3 (28,3) и Kimi K3 (17,7), но уступив GPT-5.6-Sol (34,4) и Claude Opus 5 (43,3). То есть в задачах, требующих работы с терминалом и сложных многошаговых операций, разрыв всё ещё ощутим.
Куда интереснее другое — экономика. Разработчик радикально сократил использование KV-кеша: модель потребляет вчетверо меньше памяти HBM и в восемь раз меньше места на SSD. Расходы на обработку запросов с попаданием в кеш часто составляют значительную часть стоимости работы ИИ-агентов, так что сжатие кеша — это не абстрактная оптимизация, а прямое сокращение затрат для тех, кто гоняет модели в продакшене.
Тарификация гибкая, с разделением на пиковые и непиковые часы. В непиковое время обработка входных данных с попаданием в кеш стоит $0,003 за 1 млн токенов, без попадания — $0,15, выходные данные — $0,60. В пиковые часы эти цифры удваиваются: $0,006, $0,30 и $1,20 соответственно. Разница в 50% между режимами — явный стимул переносить тяжёлые задачи на ночь.
С выходом V4.1-Flash поддержка V4-Flash и V4-Flash-Vision-Exp прекращается — все обращения временно перенаправляются на новую модель. Дальше больше: поскольку V4.1-Flash превосходит V4-Pro по производительности, скорости и общему времени выполнения задач, флагман тоже отправляют на пенсию. С 14 сентября включается полная переадресация запросов с V4-Pro на V4.1-Flash по тарифам последнего. Партнёры WorkBuddy, CodeBuddy и OpenCode уже заявили о поддержке.
Модель доступна через API DeepSeek с нативной поддержкой мультимодальности — для использования нужно выбрать deepseek-flash. Получается, что DeepSeek не просто выпустила очередное обновление, а переписала собственную линейку: компактная и быстрая модель становится основной, а флагманская уходит в историю. Вопрос лишь в том, насколько реальные нагрузки подтвердят бенчмарки — особенно там, где V4.1-Flash пока проигрывает конкурентам.














