DeepSeek выложила в открытый доступ библиотеку DeepGEMM, которая значительно ускоряет GPU-вычисления, лежащие в основе современных ИИ-моделей.
Инструмент оптимизирует матричные операции и позволяет выжать максимум из видеокарт NVIDIA архитектур Hopper и Blackwell. Библиотека поддерживает форматы FP8, FP4 и BF16, а также включает специальные оптимизации для моделей с архитектурой Mixture-of-Experts (MoE). Главные фишки — умение совмещать обмен данными между GPU с вычислениями и компиляция ядер прямо во время работы, что избавляет от необходимости отдельной сборки CUDA при установке.
По результатам тестов DeepSeek, на определенных размерах матриц DeepGEMM показывает производительность на уровне или даже выше библиотек, которые эксперты годами оптимизировали вручную.
Подробности и код доступны здесь: https://github.com/deepseek-ai/DeepGEMM#interfaces