Сжатие весов GLM-5.2 на 423 ГБ без изменения самой модели
Энтузиаст представил метод, который позволил уменьшить объем модели с 1 403 ГБ до 980 ГБ. При этом нейросеть остается бит в бит идентичной оригиналу никакой квантизации или дообучения.
В чем секрет технологии: • Метод не трогает содержимое данных, поэтому точность ответов не меняется ни на долю процента. • Умное хранение в VRAM: Вместо того чтобы разворачивать веса в полный объем перед вычислениями, они хранятся в сжатом виде прямо в видеопамяти. • Система работает с «упакованными» весами, избавляя от необходимости тратить ресурсы на их восстановление.
Этот подход открывает путь к запуску гигантских моделей на железе, которое раньше физически не могло их вместить из-за ограничений памяти.
Комментарии
Комментариев пока нет. Будьте первым!