Блог AST-SoftPro
Модели REAP: обзор технологии сжатия MoE-моделей от Cerebras
Что такое REAP и почему это прорыв в сжатии LLM
REAP (Router-weighted Expert Activation Pruning) — это метод одношагового сжатия Mixture-of-Experts (MoE) моделей, разработанный командой Cerebras. Технология позволяет удалять до 50% экспертов из моделей объёмом до 1 триллиона параметров, сохраняя при этом практически полную производительность оригинальной модели.
Простыми словами: REAP находит «лишние» эксперты в MoE-архитектуре и аккуратно их удаляет, делая модель в два раза легче без заметной потери качества. Это открывает путь к развёртыванию элитных моделей на потребительском оборудовании.
История создания
История REAP начинается в октябре 2025 года, когда Cerebras опубликовала статью «REAP the Experts: Why Pruning Prevails for One-Shot MoE compression» на arXiv (arXiv:2510.13999). Ключевые авторы: Mike Lasby, Ivan Lazarevich, Nish Sinnadurai, Sean Lie, Yani Ioannou, Vithursan Thangarasa.
1 марта 2026 года статья была принята на ICLR 2026 — одну из ведущих конференций по машинному обучению. Это подтвердило научную значимость работы.
Параллельно Cerebras выпустила открытый код на GitHub и серию REAP-версий популярных моделей на HuggingFace: Qwen3-Coder-REAP-246B-A35B-FP8, Qwen3-Coder-REAP-363B-A35B-FP8, GLM-4.7-REAP-268B-A32B-FP8 и другие.
Как работает REAP
MoE-модели состоят из множества «экспертов» — специализированных подмоделей, каждый из которых активируется для определённых токенов. Роутер (маршрутизатор) решает, каких экспертов задействовать для каждого токена.
REAP использует новый критерий значимости (saliency), который учитывает оба фактора:
-
Значения роутера (router gate-values) — насколько часто эксперт выбирается роутером
-
Нормы активации эксперта (expert activation norms) — насколько сильно эксперт влияет на выходной сигнал слоя
Формула REAP: S_i = (router_weight_i) × ||activation_i||²
Эксперты с наименьшим значением S_i вносят минимальный вклад в выход модели и удаляются первыми. После удаления веса роутера перенормируются, чтобы сумма вероятностей оставалась равной 1.
Ключевое открытие: pruning лучше merging
До REAP основным подходом к сжатию MoE было объединение (merging) экспертов — кластеризация похожих экспертов и их слияние в один. Методы вроде EAN (Expert Activation Norm) и M-SMoE merging были стандартом.
REAP доказал, что для генеративных задач (код, текст, инструменты) обрезка (pruning) значительно превосходит объединение:
-
При сжатии 25%: REAP теряет в среднем 1.9% точности, merging — значительно больше
-
При сжатии 50%: REAP теряет 6.9%, merging — 15-20%+
-
REAP сохраняет равномерное качество по всем задачам, merging показывает нестабильность
Почему? Объединение лишает роутер динамической независимости выбора — два разных эксперта становятся одним с одним гейтом. Обрезка же сохраняет оставшихся экспертов нетронутыми.
Результаты на реальных моделях
REAP был протестирован на широком спектре моделей:
-
Qwen3-480B-Coder-FP8 — при 50% сжатии сохранил 96%+ возможностей оригинала
-
GLM-4.7-FP8 — при 25% сжатии HumanEval вырос с 95.7 до 97.0%
-
Mixtral-8x7B-Instruct-v0.1 — стабильное качество при 25-50% сжатии
-
ERNIE-4.5-21B-A3B-PT — минимальная потеря на coding-бенчмарках
-
Llama-4-Scout-17B-16E-Instruct — подтверждение на архитектуре Meta
Особенно впечатляет результат на Qwen3-480B-Coder: REAP-версия (246B) практически неотличима от оригинала по генерации кода, но требует вдвое меньше памяти.
Сравнение с аналогами
| Метод | Подход | Потеря при 50% | Генеративные задачи |
|---|---|---|---|
| REAP | Pruning (обрезка) | 6.9% | Отлично |
| EAN | Pruning (только норма активации) | ~10-12% | Средне |
| M-SMoE Merging | Merging (объединение) | 15-20%+ | Плохо |
| HC-SMoE | Merging (иерархическое) | 12-15% | Средне |
| Distillation | Переобучение | Зависит от данных | Хорошо, но дорого |
Главное преимущество REAP — one-shot: не нужно переобучать модель. Достаточно прогнать калибровочный датасет, вычислить значимость экспертов, удалить лишние — и готово. Это занимает часы, а не дни.
Практическое значение
REAP решает реальную проблему: MoE-модели растут до триллионов параметров, и развёртывание таких моделей требует огромных вычислительных ресурсов. REAP позволяет:
-
Запускать модели на потребительском оборудовании (RTX 5060 Ti и аналоги)
-
Сократить стоимость инференса вдвое
-
Уменьшить задержку (latency) за счёт меньшего числа экспертов
-
Развёртывать модели в on-premise инфраструктуре без облака
Сообщество активно использует REAP: на HuggingFace появляются REAP-версии новых моделей каждую неделю. NVIDIA обсуждает REAP в контексте DGX Spark, сообщество vLLM экспериментирует с live-pruning.
Как это может быть полезно вашему бизнесу
Если ваша компания использует LLM для генерации кода, обработки документов или работы с клиентами — REAP-модели позволяют существенно снизить затраты на инфраструктуру. Вместо аренды мощных GPU-кластеров можно развёртывать сжатые модели на собственном оборудовании.
Команда ast-softpro.ru помогает бизнесу внедрять AI-решения: подбор оптимальных моделей (включая REAP-сжатые), настройка инфраструктуры, разработка чат-ботов и автоматизация бизнес-процессов. Если вы хотите обсудить, какие модели и подходы лучше всего подойдут для ваших задач — свяжитесь с нами, и мы поможем подобрать решение под ваш бюджет и требования.