Новости ИИ

DeepSeek V4.1 Flash: один режим вместо трёх и что произойдёт с V4 Pro

Heli
Автор
Heli
Опубликовано 10.09.2026
0,0
Views 1

DeepSeek выложила V4.1 Flash. В приложении и на сайте у неё больше нет переключателя между быстрым, экспертным и визуальным режимами, остался один диалог, который справляется и с разговором, и с картинкой, и с длинным рассуждением.

Звучит как правка интерфейса, а на деле поменялась модель целиком. И у этого есть продолжение, которое касается всех, кто платит за API: 14 сентября версию V4 Pro отключают, а запросы к ней начнут уходить в Flash. Давайте разберемся, что там внутри и к чему готовиться.

Почему режимов было три

Раньше под разные задачи работали разные модели. Одна отвечала на обычные вопросы, другая думала дольше и решала сложное, а картинки разбирала deepseek-v4-flash-vision-exp, у которой в названии не зря стоит exp, экспериментальная. Зрение к такой модели приделывают сбоку, отдельным блоком поверх готовой языковой части.

Представьте ванную со старыми кранами: горячий отдельно, холодный отдельно, и нужную температуру вы ловите руками каждый раз. Смеситель с одним рычагом делает то же самое, но решение принимает не человек.

V4.1 Flash, это смеситель. Зрительный кодировщик у неё встроен и учился вместе с текстом с самого начала, а не был приделан потом. Поэтому картинка для неё не отдельный режим, а обычная часть разговора.

Что внутри

По карточке модели на Hugging Face:

1) 552 миллиарда параметров всего, архитектура со смесью экспертов. На чтение вашего запроса работают 8 миллиардов, на генерацию ответа 16
2) контекст до 1 миллиона токенов, максимум вывода 384 тысячи
3) усилие на рассуждение задаётся числом от 1 до 100, то есть выбор между "ответь сразу" и "подумай подольше" стал в API плавной ручкой вместо двух кнопок
4) лицензия MIT, веса выложены и их можно скачать

Смесь экспертов, это как большая поликлиника. Врачей в штате пятьсот, но на приём к вам выходят двое, и платите вы за приём, а не за весь штат. Отсюда и цена: модель размером с флагман, а считает как небольшая.

Ещё одно число, которое обычно пропускают, хотя оно объясняет всё остальное: 890 байт на токен в кэше KV, примерно вчетверо меньше, чем у прошлого Flash. Кэш KV, это записная книжка, в которой модель держит уже прочитанное. Чем компактнее записи, тем больше диалогов помещается на одной видеокарте, и тем дешевле обходится миллионный контекст. Именно из этого растут новые цены, а не из щедрости.

Цифры и честное "но"

Сравнение с прошлыми версиями из карточки модели:

Бенчмарк V4 Pro V4 Flash V4.1 Flash
Terminal-Bench 2.1 87,9 82,7 90,6
DeepSWE v1.1 62,7 54,4 74,2
MathArena Apex 65,3 58,6 65,6

Заметный рост на задачах с кодом и работой в терминале, на математике паритет с Pro.

Но как всегда есть НО. На базовой модели по знаниевым тестам V4.1 Flash идёт чуть ниже Pro, MMLU-Pro 73,5 против 74,1. Разница небольшая, и всё же направление обратное остальным цифрам. Модель сильнее там, где надо рассуждать и работать инструментами, и не сильнее там, где надо помнить факты. Если ваши сценарии, это справочные вопросы, а не агенты и код, выигрыш вы получите в счёте, а не в качестве ответов.

14 сентября: что произойдёт с V4 Pro

С 12:00 по Пекину, это 07:00 по Москве, все запросы к deepseek-v4-pro будут перенаправляться на V4.1 Flash и считаться по её ценам. Так продлится до выхода V4.1 Pro. Старые имена deepseek-v4-flash и deepseek-v4-flash-vision-exp уже сейчас ведут на новую модель, а актуальное имя, это deepseek-flash.

Цены за миллион токенов в долларах, слева непиковая, справа пиковая:

Что считается V4.1 Flash V4 Pro
Вход, попадания в кэш нет 0,15 / 0,3 0,66 / 1,32
Вход, попадание в кэш 0,003 / 0,006 0,022 / 0,044
Выход 0,6 / 1,2 1,98 / 3,96

По выходу дешевле в 3,3 раза, по входу без кэша в 4,4. Поверх этого работает деление по времени суток: по прайсу на 10 сентября пиковые часы, это 01:00-04:00 и 06:00-10:00 UTC с понедельника по пятницу, по Москве 04:00-07:00 и 09:00-13:00. Всё остальное время идёт по непиковой цене, вдвое ниже. Один и тот же пакетный прогон стоит по-разному в зависимости от того, в котором часу вы его запустили.

Подводный камень тут не в ценах, а в подмене. Если у вас в проде стоит deepseek-v4-pro, в понедельник утром на том же имени вам начнёт отвечать другая модель, с другим характером и другими краевыми случаями. Промпты, которые вы подгоняли под Pro, никто не переносил.

Что можно с этим делать

1) до понедельника прогнать свои типовые запросы через deepseek-flash и сравнить ответы с Pro руками. Тридцати примеров хватит, чтобы увидеть расхождение
2) отдельно проверить то, что завязано на факты и справочные ответы, там просадка вероятнее всего
3) посмотреть на строку "попадание в кэш" в прайсе. Разница между 0,15 и 0,003 стократная, и она достаётся тем, кто держит начало промпта неизменным, а меняет только хвост
4) не считать deepseek-flash закреплённой версией. Это указатель на последнюю, и он уже один раз
переехал под теми, кто звал старые имена. Для стабильности нужен конкретный номер версии
5) если данные чувствительные, отдельно посмотреть, где они обрабатываются. К качеству модели вопрос отношения не имеет, а к внутренним правилам компании имеет прямое 6) тому, кто пользуется приложением, делать не надо ничего, кроме одного: переключ ателя режимов больше нет, и заставить модель думать дольше кнопкой не выйдет. Просите это словами в самом запросе

Что в итоге

Исчезнувший переключатель, это не удобство ради удобства. Три режима существовали потому, что за ними стояли три разные модели, и выбирать между ними приходилось человеку. Теперь модель одна, а решение, сколько думать и куда смотреть, принимает она сама.

Цена этого решения видна в календаре: 14 сентября V4 Pro уходит, и вместе со счётом втрое ниже вы получаете другие ответы на те же промпты. Проверить это стоит до понедельника, а не в понедельник.

Авторизуйтесь, чтобы оставить комментарий.

Комментариев: 0

Нет комментариев.

Тут может быть ваша реклама

Пишите info@aisferaic.ru

Похожие новости