Новости ИИ

Claude Fable 5.1 и Mythos 5.1: чтение кэша дешевле на 75% и три ломающих изменен

Heli
Автор
Heli
Опубликовано 02.09.2026
0,0
Views 1

1 сентября Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1. По бенчмаркам прирост заметный, но интереснее две другие вещи: цена чтения кэша упала на 75 процентов, а в API появились три изменения, из-за которых рабочий код может перестать работать после смены одной строки с названием модели.

Разберём по порядку, что здесь важно для счёта и что для кода.

Что именно вышло

Моделей две, и это одна и та же модель с разными защитами.

Claude Fable 5.1 доступен всем, идентификатор в API claude-fable-5-1. Claude Mythos 5.1 с ослабленными ограничениями по кибербезопасности и биологии, идентификатор claude-mythos-5-1, доступ только через две программы проверки: Cyber Verification Program для оборонительной безопасности и Life Sciences Verification Program для специалистов по наукам о жизни, вторая делается в партнёрстве с правительством США. Пока доступ открыт ограниченному набору американских организаций.

Обе модели держат контекст в миллион токенов и до 128 тысяч токенов на выходе.

Бенчмарки

Бенчмарк Fable 5.1 Fable 5 Opus 5 Mythos 5.1
Terminal-Bench-Science 0.1 52,6% 24,7% 29,0% нет данных
Terminal-Bench 4.0 55,8% 42,0% 52,3% 60,9%
Humanity's Last Exam, без инструментов 60,9% 57,8% 56,6% нет данных
Humanity's Last Exam, с инструментами 65,0% 63,8% 63,6% нет данных
OSWorld 2.0, частичный зачёт 77,9% 72,9% 75,4% нет данных
OSWorld 2.0, строгий зачёт 41,7% 36,1% 39,6% нет данных
AutomationBench 31,4% 17,1% 26,9% нет данных
CursorBench 3.2.0 73,4% 70,5% 70,0% нет данных

Здесь стоит сделать два замечания.

Первое, про OSWorld. Цифра 77,9 процента, которая разошлась по новостям, относится к частичному зачёту, где засчитываются частично выполненные задачи. В строгом режиме, где задача либо сделана, либо нет, результат 41,7 процента. Обе цифры настоящие, но означают они разное, и при сравнении инструментов между собой брать надо одну и ту же.

Второе, про Terminal-Bench-Science: рост с 24,7 до 52,6 процента, это больше чем удвоение, и он сильно выбивается из остальных. Такие скачки обычно означают, что модель специально дотягивали под этот класс задач, поэтому на своей работе ждать двукратного улучшения не стоит. Прирост на CursorBench скромнее и ближе к тому, что вы почувствуете руками: с 70,5 до 73,4 процента.

Что с ценой

Цена за токены не изменилась: 10 долларов за миллион входных и 50 за миллион выходных.

Изменилось чтение кэша. Было 1 доллар за миллион кэшированных токенов, стало 0,25. Это нестандартно низко даже по меркам самой Anthropic: у Fable 5.1 чтение кэша стоит 0,025 от базовой цены входа, тогда как у всех остальных актуальных моделей Claude это 0,1. По оценке компании, одна эта правка снижает счёт примерно на 25 процентов на обычных нагрузках и до 45 процентов на агентных, где одна и та же история контекста перечитывается десятки раз.

Тут нужны две оговорки, без которых обещанные проценты не появятся.

Первая: экономия наступает, только если кэш у вас реально работает. Проверяется это полем cache_read_input_tokens в ответе. Если оно нулевое от запроса к запросу, значит префикс что-то ломает: метка времени в системном промпте, несортированный JSON, меняющийся набор инструментов. Кэш работает по совпадению префикса, и любое изменение байта в начале обесценивает всё, что идёт после.

Вторая: снижение объявлено для Fable 5.1. Разделяет ли эту ставку Mythos 5.1, на момент запуска не закреплено.

Уровни усилия и где они по умолчанию

У модели пять уровней усилия: low, medium, high, xhigh и max. По умолчанию в Claude Code стоит high, в Cowork и на claude.ai medium.

Практический смысл в том, что нижние уровни на новой модели часто дают результат уровня прошлой модели на высоких. То есть первый шаг к экономии, это не переход на модель попроще, а понижение усилия на рутинных маршрутах внутри той же модели. Одна модель, это ещё и одно пространство кэша, а каскад из нескольких моделей кэш между ними не переиспользует.

Есть нюанс для тех, кто меняет усилие по ходу диалога. Смена значения на верхнем уровне запроса сбрасывает кэш сообщений, но в Fable 5.1 появился способ менять усилие отдельным системным сообщением в середине разговора, без сброса.

Три изменения, которые ломают код

Это то, чего в новостных пересказах нет, а именно с этим вы столкнётесь при переезде с Fable 5.

1) принудительный вызов инструмента убран. Параметр tool_choice со значением any или конкретным инструментом возвращает ошибку 400. Вместо него берите auto плюс явную инструкцию
в промпте, strict: true на инструменте, если важна схема аргументов, или структурированный вывод, если вызов существовал только ради JSON на выходе
2) блоки размышления привязаны к породившей их модели. Другие модели их молча отбрасывают, и тарификации за это нет. Mythos 5.1, наоборот, их читает
3) правка ранних ходов диалога обесценивает блоки размышления. Для аккаунтов, созданных 31 августа 2026 года и позже, изменённая история возвращает ошибку 400, а в дальнейших моделях правило станет общим. Вывод простой: обвязка должна дописывать историю, а не переписывать её

Сюда же несколько вещей, которые стоит знать заранее: размышление у модели всегда включено, и старый параметр budget_tokens возвращает ошибку; предзаполнение ответа ассистента не поддерживается; Priority Tier для Fable 5.1 и Mythos 5.1 недоступен; модель требует тридцатидневного хранения данных, и организации с нулевым хранением получат ошибку 400, если Anthropic не разрешила им доступ отдельно.

Кибербезопасность

По заявлению компании, защитные фильтры срабатывают примерно на 60 процентов реже за сессию в Claude Code, то есть ложных отказов стало меньше.

Разрешено: поиск уязвимостей в программах и работа над защищённостью систем. Не разрешено: пентест, генерация эксплойтов и поиск уязвимостей на уровне бинарного кода.

Деталь, которой нет в кратких пересказах: такие запросы не просто отклоняются. Модель может завершить ответ со специальной причиной остановки и категорией отказа, а на стороне API есть механизм подмены, который уводит запрос на Opus. То есть для приложения это не глухая стена, а ветка, которую надо обработать в коде: проверяйте причину остановки до того, как читать содержимое ответа.

Что с этим делать

1) если вы пользуетесь Claude Code на подписке, делать нечего. Уровень high стоит по умолчанию, кэш работает под капотом, разницу вы увидите в счетах и в скорости работы над длинными задачами
2) если вы строите на API, не меняйте строку с названием модели в проде до того, как пройдёте по трём пунктам выше. Принудительный вызов инструмента, это самая частая находка в старом коде
3) прежде чем закладывать экономию в 25 процентов, посмотрите свой процент попаданий в кэш. Скидка на чтение кэша ничего не даёт тому, у кого кэш не читается
4) прогоните типовые маршруты на low и medium. Это единственный способ узнать, где у вас переплата за усилие, которое задаче не нужно

Вывод

Главное в этом релизе не бенчмарки, а изменение экономики агентных сценариев. Когда чтение кэша стоит в четыре раза дешевле, длинные многошаговые прогоны, где модель раз за разом перечитывает один и тот же контекст, перестают быть тем, что считаешь с калькулятором. Всё остальное, это проценты в таблицах.

Ближайший шаг: найдите в своём коде cache_read_input_tokens и посмотрите на реальные числа за последнюю неделю. Если кэш читается, новая цена уже работает на вас. Если нет, сначала чините префикс, а модель меняйте потом.

Авторизуйтесь, чтобы оставить комментарий.

Комментариев: 0

Нет комментариев.

Тут может быть ваша реклама

Пишите info@aisferaic.ru

Похожие новости