DeepSeek V4.1 Flash: один режим вместо трёх и что произойдёт с V4 Pro
DeepSeek выложила V4.1 Flash. В приложении и на сайте у неё больше нет переключателя между быстрым, экспертным и визуальным режимами, остался один диалог, который справляется и с разговором, и с картинкой, и с длинным рассуждением.
Звучит как правка интерфейса, а на деле поменялась модель целиком. И у этого есть продолжение, которое касается всех, кто платит за API: 14 сентября версию V4 Pro отключают, а запросы к ней начнут уходить в Flash. Давайте разберемся, что там внутри и к чему готовиться.
Почему режимов было три
Раньше под разные задачи работали разные модели. Одна отвечала на обычные вопросы, другая думала дольше и решала сложное, а картинки разбирала deepseek-v4-flash-vision-exp, у которой в названии не зря стоит exp, экспериментальная. Зрение к такой модели приделывают сбоку, отдельным блоком поверх готовой языковой части.
Представьте ванную со старыми кранами: горячий отдельно, холодный отдельно, и нужную температуру вы ловите руками каждый раз. Смеситель с одним рычагом делает то же самое, но решение принимает не человек.
V4.1 Flash, это смеситель. Зрительный кодировщик у неё встроен и учился вместе с текстом с самого начала, а не был приделан потом. Поэтому картинка для неё не отдельный режим, а обычная часть разговора.
Что внутри
По карточке модели на Hugging Face:
1) 552 миллиарда параметров всего, архитектура со смесью экспертов. На чтение вашего запроса
работают 8 миллиардов, на генерацию ответа 16
2) контекст до 1 миллиона токенов, максимум вывода 384 тысячи
3) усилие на рассуждение задаётся числом от 1 до 100, то есть выбор между "ответь сразу" и
"подумай подольше" стал в API плавной ручкой вместо двух кнопок
4) лицензия MIT, веса выложены и их можно скачать
Смесь экспертов, это как большая поликлиника. Врачей в штате пятьсот, но на приём к вам выходят двое, и платите вы за приём, а не за весь штат. Отсюда и цена: модель размером с флагман, а считает как небольшая.
Ещё одно число, которое обычно пропускают, хотя оно объясняет всё остальное: 890 байт на токен в кэше KV, примерно вчетверо меньше, чем у прошлого Flash. Кэш KV, это записная книжка, в которой модель держит уже прочитанное. Чем компактнее записи, тем больше диалогов помещается на одной видеокарте, и тем дешевле обходится миллионный контекст. Именно из этого растут новые цены, а не из щедрости.
Цифры и честное "но"
Сравнение с прошлыми версиями из карточки модели:
| Бенчмарк | V4 Pro | V4 Flash | V4.1 Flash |
|---|---|---|---|
| Terminal-Bench 2.1 | 87,9 | 82,7 | 90,6 |
| DeepSWE v1.1 | 62,7 | 54,4 | 74,2 |
| MathArena Apex | 65,3 | 58,6 | 65,6 |
Заметный рост на задачах с кодом и работой в терминале, на математике паритет с Pro.
Но как всегда есть НО. На базовой модели по знаниевым тестам V4.1 Flash идёт чуть ниже Pro, MMLU-Pro 73,5 против 74,1. Разница небольшая, и всё же направление обратное остальным цифрам. Модель сильнее там, где надо рассуждать и работать инструментами, и не сильнее там, где надо помнить факты. Если ваши сценарии, это справочные вопросы, а не агенты и код, выигрыш вы получите в счёте, а не в качестве ответов.
14 сентября: что произойдёт с V4 Pro
С 12:00 по Пекину, это 07:00 по Москве, все запросы к deepseek-v4-pro будут перенаправляться на V4.1 Flash и считаться по её ценам. Так продлится до выхода V4.1 Pro. Старые имена deepseek-v4-flash и deepseek-v4-flash-vision-exp уже сейчас ведут на новую модель, а актуальное имя, это deepseek-flash.
Цены за миллион токенов в долларах, слева непиковая, справа пиковая:
| Что считается | V4.1 Flash | V4 Pro |
|---|---|---|
| Вход, попадания в кэш нет | 0,15 / 0,3 | 0,66 / 1,32 |
| Вход, попадание в кэш | 0,003 / 0,006 | 0,022 / 0,044 |
| Выход | 0,6 / 1,2 | 1,98 / 3,96 |
По выходу дешевле в 3,3 раза, по входу без кэша в 4,4. Поверх этого работает деление по времени суток: по прайсу на 10 сентября пиковые часы, это 01:00-04:00 и 06:00-10:00 UTC с понедельника по пятницу, по Москве 04:00-07:00 и 09:00-13:00. Всё остальное время идёт по непиковой цене, вдвое ниже. Один и тот же пакетный прогон стоит по-разному в зависимости от того, в котором часу вы его запустили.
Подводный камень тут не в ценах, а в подмене. Если у вас в проде стоит deepseek-v4-pro, в понедельник утром на том же имени вам начнёт отвечать другая модель, с другим характером и другими краевыми случаями. Промпты, которые вы подгоняли под Pro, никто не переносил.
Что можно с этим делать
1) до понедельника прогнать свои типовые запросы через deepseek-flash и сравнить ответы с Pro
руками. Тридцати примеров хватит, чтобы увидеть расхождение
2) отдельно проверить то, что завязано на факты и справочные ответы, там просадка вероятнее
всего
3) посмотреть на строку "попадание в кэш" в прайсе. Разница между 0,15 и 0,003 стократная, и она достаётся тем, кто держит начало промпта неизменным, а меняет только хвост
4) не считать deepseek-flash закреплённой версией. Это указатель на последнюю, и он уже один раз
переехал под теми, кто звал старые имена. Для стабильности нужен конкретный номер версии
5) если данные чувствительные, отдельно посмотреть, где они обрабатываются. К качеству модели
вопрос отношения не имеет, а к внутренним правилам компании имеет прямое
6) тому, кто пользуется приложением, делать не надо ничего, кроме одного: переключ ателя режимов
больше нет, и заставить модель думать дольше кнопкой не выйдет. Просите это словами в самом
запросе
Что в итоге
Исчезнувший переключатель, это не удобство ради удобства. Три режима существовали потому, что за ними стояли три разные модели, и выбирать между ними приходилось человеку. Теперь модель одна, а решение, сколько думать и куда смотреть, принимает она сама.
Цена этого решения видна в календаре: 14 сентября V4 Pro уходит, и вместе со счётом втрое ниже вы получаете другие ответы на те же промпты. Проверить это стоит до понедельника, а не в понедельник.
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru