Claude Fable 5.1 и Mythos 5.1: чтение кэша дешевле на 75% и три ломающих изменен
1 сентября Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1. По бенчмаркам прирост заметный, но интереснее две другие вещи: цена чтения кэша упала на 75 процентов, а в API появились три изменения, из-за которых рабочий код может перестать работать после смены одной строки с названием модели.
Разберём по порядку, что здесь важно для счёта и что для кода.
Что именно вышло
Моделей две, и это одна и та же модель с разными защитами.
Claude Fable 5.1 доступен всем, идентификатор в API claude-fable-5-1. Claude Mythos 5.1 с
ослабленными ограничениями по кибербезопасности и биологии, идентификатор claude-mythos-5-1,
доступ только через две программы проверки: Cyber Verification Program для оборонительной
безопасности и Life Sciences Verification Program для специалистов по наукам о жизни, вторая
делается в партнёрстве с правительством США. Пока доступ открыт ограниченному набору американских
организаций.
Обе модели держат контекст в миллион токенов и до 128 тысяч токенов на выходе.
Бенчмарки
| Бенчмарк | Fable 5.1 | Fable 5 | Opus 5 | Mythos 5.1 |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6% | 24,7% | 29,0% | нет данных |
| Terminal-Bench 4.0 | 55,8% | 42,0% | 52,3% | 60,9% |
| Humanity's Last Exam, без инструментов | 60,9% | 57,8% | 56,6% | нет данных |
| Humanity's Last Exam, с инструментами | 65,0% | 63,8% | 63,6% | нет данных |
| OSWorld 2.0, частичный зачёт | 77,9% | 72,9% | 75,4% | нет данных |
| OSWorld 2.0, строгий зачёт | 41,7% | 36,1% | 39,6% | нет данных |
| AutomationBench | 31,4% | 17,1% | 26,9% | нет данных |
| CursorBench 3.2.0 | 73,4% | 70,5% | 70,0% | нет данных |
Здесь стоит сделать два замечания.
Первое, про OSWorld. Цифра 77,9 процента, которая разошлась по новостям, относится к частичному зачёту, где засчитываются частично выполненные задачи. В строгом режиме, где задача либо сделана, либо нет, результат 41,7 процента. Обе цифры настоящие, но означают они разное, и при сравнении инструментов между собой брать надо одну и ту же.
Второе, про Terminal-Bench-Science: рост с 24,7 до 52,6 процента, это больше чем удвоение, и он сильно выбивается из остальных. Такие скачки обычно означают, что модель специально дотягивали под этот класс задач, поэтому на своей работе ждать двукратного улучшения не стоит. Прирост на CursorBench скромнее и ближе к тому, что вы почувствуете руками: с 70,5 до 73,4 процента.
Что с ценой
Цена за токены не изменилась: 10 долларов за миллион входных и 50 за миллион выходных.
Изменилось чтение кэша. Было 1 доллар за миллион кэшированных токенов, стало 0,25. Это нестандартно низко даже по меркам самой Anthropic: у Fable 5.1 чтение кэша стоит 0,025 от базовой цены входа, тогда как у всех остальных актуальных моделей Claude это 0,1. По оценке компании, одна эта правка снижает счёт примерно на 25 процентов на обычных нагрузках и до 45 процентов на агентных, где одна и та же история контекста перечитывается десятки раз.
Тут нужны две оговорки, без которых обещанные проценты не появятся.
Первая: экономия наступает, только если кэш у вас реально работает. Проверяется это полем
cache_read_input_tokens в ответе. Если оно нулевое от запроса к запросу, значит префикс
что-то ломает: метка времени в системном промпте, несортированный JSON, меняющийся набор
инструментов. Кэш работает по совпадению префикса, и любое изменение байта в начале обесценивает
всё, что идёт после.
Вторая: снижение объявлено для Fable 5.1. Разделяет ли эту ставку Mythos 5.1, на момент запуска не закреплено.
Уровни усилия и где они по умолчанию
У модели пять уровней усилия: low, medium, high, xhigh и max. По умолчанию в Claude Code стоит high, в Cowork и на claude.ai medium.
Практический смысл в том, что нижние уровни на новой модели часто дают результат уровня прошлой модели на высоких. То есть первый шаг к экономии, это не переход на модель попроще, а понижение усилия на рутинных маршрутах внутри той же модели. Одна модель, это ещё и одно пространство кэша, а каскад из нескольких моделей кэш между ними не переиспользует.
Есть нюанс для тех, кто меняет усилие по ходу диалога. Смена значения на верхнем уровне запроса сбрасывает кэш сообщений, но в Fable 5.1 появился способ менять усилие отдельным системным сообщением в середине разговора, без сброса.
Три изменения, которые ломают код
Это то, чего в новостных пересказах нет, а именно с этим вы столкнётесь при переезде с Fable 5.
1) принудительный вызов инструмента убран. Параметр tool_choice со значением any или
конкретным инструментом возвращает ошибку 400. Вместо него берите auto плюс явную инструкцию
в промпте, strict: true на инструменте, если важна схема аргументов, или структурированный
вывод, если вызов существовал только ради JSON на выходе
2) блоки размышления привязаны к породившей их модели. Другие модели их молча отбрасывают, и
тарификации за это нет. Mythos 5.1, наоборот, их читает
3) правка ранних ходов диалога обесценивает блоки размышления. Для аккаунтов, созданных 31 августа
2026 года и позже, изменённая история возвращает ошибку 400, а в дальнейших моделях правило
станет общим. Вывод простой: обвязка должна дописывать историю, а не переписывать её
Сюда же несколько вещей, которые стоит знать заранее: размышление у модели всегда включено, и
старый параметр budget_tokens возвращает ошибку; предзаполнение ответа ассистента не
поддерживается; Priority Tier для Fable 5.1 и Mythos 5.1 недоступен; модель требует тридцатидневного
хранения данных, и организации с нулевым хранением получат ошибку 400, если Anthropic не разрешила
им доступ отдельно.
Кибербезопасность
По заявлению компании, защитные фильтры срабатывают примерно на 60 процентов реже за сессию в Claude Code, то есть ложных отказов стало меньше.
Разрешено: поиск уязвимостей в программах и работа над защищённостью систем. Не разрешено: пентест, генерация эксплойтов и поиск уязвимостей на уровне бинарного кода.
Деталь, которой нет в кратких пересказах: такие запросы не просто отклоняются. Модель может завершить ответ со специальной причиной остановки и категорией отказа, а на стороне API есть механизм подмены, который уводит запрос на Opus. То есть для приложения это не глухая стена, а ветка, которую надо обработать в коде: проверяйте причину остановки до того, как читать содержимое ответа.
Что с этим делать
1) если вы пользуетесь Claude Code на подписке, делать нечего. Уровень high стоит по умолчанию,
кэш работает под капотом, разницу вы увидите в счетах и в скорости работы над длинными задачами
2) если вы строите на API, не меняйте строку с названием модели в проде до того, как пройдёте по
трём пунктам выше. Принудительный вызов инструмента, это самая частая находка в старом коде
3) прежде чем закладывать экономию в 25 процентов, посмотрите свой процент попаданий в кэш.
Скидка на чтение кэша ничего не даёт тому, у кого кэш не читается
4) прогоните типовые маршруты на low и medium. Это единственный способ узнать, где у вас
переплата за усилие, которое задаче не нужно
Вывод
Главное в этом релизе не бенчмарки, а изменение экономики агентных сценариев. Когда чтение кэша стоит в четыре раза дешевле, длинные многошаговые прогоны, где модель раз за разом перечитывает один и тот же контекст, перестают быть тем, что считаешь с калькулятором. Всё остальное, это проценты в таблицах.
Ближайший шаг: найдите в своём коде cache_read_input_tokens и посмотрите на реальные числа за
последнюю неделю. Если кэш читается, новая цена уже работает на вас. Если нет, сначала чините
префикс, а модель меняйте потом.
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru