Mac Studio M5 Ultra против десяти RTX 5090: арифметика локального запуска модели
По каналам ходит эффектное сравнение: Mac Studio с 512 гигабайтами памяти держит модель на 320 миллиардов параметров и выдаёт около 60 токенов в секунду, а на видеокартах для того же нужны десять RTX 5090 и отдельная электростанция. По сути сравнение верное. В цифрах там две ошибки, а главное объяснение пропущено, и без него результат выглядит невозможным.
Разберём по числам, потому что тема как раз про числа.
Что такое единая память и почему она здесь решает
В обычном компьютере память разделена. Есть оперативная память, есть видеопамять на карте, и данные между ними ездят по шине PCIe. Для игр это не проблема, для модели это узкое место: веса должны лежать там, где считает ускоритель, а видеопамяти всегда меньше.
В Apple Silicon память общая. Процессор, графическое ядро и нейродвижок работают с одним пулом, и перекладывать данные между ними не нужно. Разница как между общим рабочим столом и десятью отдельными столами в разных комнатах: во втором случае вы больше времени носите бумаги, чем работаете с ними.
Для запуска моделей это даёт одно свойство, которого у потребительских видеокарт нет. Вы можете взять столько памяти, сколько купили, и отдать её целиком под модель.
Цифры Mac Studio M5 Ultra
Apple представила новый Mac Studio 25 августа 2026 года. У M5 Ultra 36 ядер процессора, 80 ядер графики, 32 ядра нейродвижка, память конфигурируется до 512 гигабайт, а пропускная способность памяти составляет до 1,2 терабайта в секунду, это на 50 процентов больше прошлого поколения.
Здесь первая поправка к исходному посту: терабайта, а не гигабайта. Разница в тысячу раз, и она принципиальна. Память со скоростью 1,2 гигабайта в секунду выдавала бы вам один токен в несколько минут, примерно как если бы модель читалась с флешки.
Про доступность стоит сказать сразу, чтобы никто не бежал за кошельком. Mac Studio с M5 Ultra стартует с 5499 долларов за версию с 96 гигабайтами. Конфигурация на 256 гигабайт стоит от 9499 до 10 799 долларов. А вот вариант на 512 гигабайт, тот самый, о котором идёт речь, выходит только в конце октября, и цену Apple пока не объявила.
Откуда берутся 60 токенов в секунду
Это место в исходном посте пропущено, а оно объясняет всё остальное.
GLM-5.3-Flash, это модель с архитектурой MoE, то есть со смесью экспертов. Всего в ней около 321 миллиарда параметров, но на каждый токен работают только 18 миллиардов. Внутри 288 маршрутизируемых экспертов, из которых на токен выбираются 8, плюс один общий, который работает всегда. Веса в FP8 занимают около 306 GiB (на диске это порядка 328 гигабайт), контекст до миллиона токенов, лицензия MIT.
Важная деталь: в памяти должны лежать все 320 миллиардов. Маршрутизатор выбирает экспертов на каждый токен заново, поэтому подгрузить только нужных нельзя, они должны быть под рукой все. Библиотека тут хорошая аналогия: все 288 томов обязаны стоять на полке, но на каждый вопрос вы снимаете восемь.
Дальше считается потолок скорости. Генерация упирается в пропускную способность памяти: чтобы выдать один токен, надо прочитать активные веса. Восемнадцать миллиардов параметров в FP8, это примерно 18 гигабайт. Делим 1200 гигабайт в секунду на 18 и получаем около 66 токенов в секунду как теоретический потолок. Заявленные 60 ложатся ровно в эту арифметику с поправкой на накладные расходы.
Проверим ту же формулу на плотной модели того же размера. Если бы все 306 гигабайт участвовали в каждом токене, вышло бы 1200 делить на 306, то есть около 4 токенов в секунду. Тот же компьютер, та же память, разница в 15 раз. Так что впечатляющие 60 токенов, это заслуга архитектуры модели не в меньшей степени, чем заслуга железа.
Сколько на самом деле стоит альтернатива на видеокартах
Счёт из поста выглядит так: 306 гигабайт весов, 32 гигабайта видеопамяти у RTX 5090, значит нужно минимум десять карт, и это больше 20 тысяч долларов.
Арифметика по количеству верная, по деньгам устарела. Двадцать тысяч, это счёт по рекомендованной цене в 1999 долларов, по которой карту не купить с начала продаж. Медианная цена RTX 5090 в августе 2026 года держится около 4700 долларов, потому что память GDDR7 в дефиците и уходит в серверный сегмент. Десять карт по этой цене, это уже около 47 тысяч долларов, и это только карты.
Дальше начинается то, что в сравнении обычно не считают:
1) платформа под десять карт. Нужны линии PCIe, корпус или стойка, райзеры, охлаждение
2) питание. Десять карт по 575 ватт, это 5750 ватт только на видеокартах. Обычная бытовая розетка на 16 ампер отдаёт около 3,5 киловатта, то есть одной розеткой вы не обойдётесь
3) память впритык. Десять карт дают 320 гигабайт, веса занимают 306. Оставшиеся 14 гигабайт должны вместить кэш KV, активации и служебные буферы, причём распределённые по картам. На длинном контексте этого не хватит, реальная сборка начинается с двенадцати карт
4) обмен между картами. Модель придётся резать между устройствами, и трафик пойдёт по шине, которая на порядок медленнее локальной памяти
Mac Studio закрывает всё это одним пулом памяти и потреблением в пределах обычной розетки. Вот в чём настоящий выигрыш, а не в скорости как таковой.
Где Mac проигрывает
Как всегда есть "но", и здесь оно существенное. У локального запуска две разные скорости, и их постоянно путают.
Первая, это генерация: сколько токенов в секунду модель выдаёт в ответе. Она упирается в пропускную способность памяти, и тут Apple сильна.
Вторая, это обработка запроса, то есть время до первого токена. Она упирается в вычислительную мощность, и тут дискретные видеокарты по-прежнему впереди. Apple заявляет, что M5 Ultra обрабатывает запрос до четырёх раз быстрее, чем M3 Ultra, и это честный прогресс, но сравнения с дискретной картой он не отменяет: в мартовских тестах 2026 года RTX Pro 6000 Blackwell на 96 гигабайтах обрабатывала запрос примерно в 3,5 раза быстрее на контексте в 4 тысячи токенов и выдавала на 50-65 процентов больше токенов в секунду.
Отсюда практическое следствие. Заявленный контекст в миллион токенов на Mac существует, но заполнять его целиком вы будете долго, и кэш KV под него съест память сверх тех самых 306 гигабайт. Сценарий "загрузим весь репозиторий и спросим" на такой машине упирается не в объём памяти, а в терпение.
И ещё одно ограничение, о котором забывают: это настольная машина для одного человека. Обслужить команду из десяти разработчиков параллельными запросами она не сможет, там нужна другая экономика.
Кому это подходит
Сценарии, где такая машина оправдана:
1) работа с данными, которые нельзя отправлять наружу. Медицина, юридические документы, внутренний код закрытого контура
2) постоянная фоновая нагрузка, где оплата за токены набегает быстрее, чем амортизация железа
3) стабильность модели. Локальные веса не поменяются под вами в четверг, не подорожают и не отключатся из-за смены владельца сервиса
Сценарии, где не оправдана: обслуживание многих пользователей, задачи, где важно время до первого токена на длинном контексте, и разовые эксперименты, для которых аренда часа на облачной карте стоит несопоставимо дешевле.
Что стоит забрать из этой истории
Настоящая новость не в том, что Mac обогнал видеокарты. Он их не обогнал. Новость в том, что модель такого класса вообще помещается в настольный компьютер целиком, и веса к ней лежат под лицензией MIT. Три года назад для этого требовалась стойка.
И полезная формула, которая работает без всяких обзоров: потолок генерации равен пропускной способности памяти, делённой на размер активных весов. Возьмите свою машину, свою модель и посчитайте. Для MoE берите активные параметры, для плотной модели весь объём. Это одно деление даст вам более честный прогноз, чем любое сравнение в интернете, включая это.
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru