Подписывайтесь:

Блог AST-SoftPro

Модели REAP: обзор технологии сжатия MoE-моделей от Cerebras

31.07.2026 7 мин чтения
Модели REAP: обзор технологии сжатия MoE-моделей от Cerebras

Что такое REAP и почему это прорыв в сжатии LLM

REAP (Router-weighted Expert Activation Pruning) — это метод одношагового сжатия Mixture-of-Experts (MoE) моделей, разработанный командой Cerebras. Технология позволяет удалять до 50% экспертов из моделей объёмом до 1 триллиона параметров, сохраняя при этом практически полную производительность оригинальной модели.

Простыми словами: REAP находит «лишние» эксперты в MoE-архитектуре и аккуратно их удаляет, делая модель в два раза легче без заметной потери качества. Это открывает путь к развёртыванию элитных моделей на потребительском оборудовании.

История создания

История REAP начинается в октябре 2025 года, когда Cerebras опубликовала статью «REAP the Experts: Why Pruning Prevails for One-Shot MoE compression» на arXiv (arXiv:2510.13999). Ключевые авторы: Mike Lasby, Ivan Lazarevich, Nish Sinnadurai, Sean Lie, Yani Ioannou, Vithursan Thangarasa.

1 марта 2026 года статья была принята на ICLR 2026 — одну из ведущих конференций по машинному обучению. Это подтвердило научную значимость работы.

Параллельно Cerebras выпустила открытый код на GitHub и серию REAP-версий популярных моделей на HuggingFace: Qwen3-Coder-REAP-246B-A35B-FP8, Qwen3-Coder-REAP-363B-A35B-FP8, GLM-4.7-REAP-268B-A32B-FP8 и другие.

Как работает REAP

MoE-модели состоят из множества «экспертов» — специализированных подмоделей, каждый из которых активируется для определённых токенов. Роутер (маршрутизатор) решает, каких экспертов задействовать для каждого токена.

REAP использует новый критерий значимости (saliency), который учитывает оба фактора:

  1. Значения роутера (router gate-values) — насколько часто эксперт выбирается роутером

  2. Нормы активации эксперта (expert activation norms) — насколько сильно эксперт влияет на выходной сигнал слоя

Формула REAP: S_i = (router_weight_i) × ||activation_i||²

Эксперты с наименьшим значением S_i вносят минимальный вклад в выход модели и удаляются первыми. После удаления веса роутера перенормируются, чтобы сумма вероятностей оставалась равной 1.

Ключевое открытие: pruning лучше merging

До REAP основным подходом к сжатию MoE было объединение (merging) экспертов — кластеризация похожих экспертов и их слияние в один. Методы вроде EAN (Expert Activation Norm) и M-SMoE merging были стандартом.

REAP доказал, что для генеративных задач (код, текст, инструменты) обрезка (pruning) значительно превосходит объединение:

  • При сжатии 25%: REAP теряет в среднем 1.9% точности, merging — значительно больше

  • При сжатии 50%: REAP теряет 6.9%, merging — 15-20%+

  • REAP сохраняет равномерное качество по всем задачам, merging показывает нестабильность

Почему? Объединение лишает роутер динамической независимости выбора — два разных эксперта становятся одним с одним гейтом. Обрезка же сохраняет оставшихся экспертов нетронутыми.

Результаты на реальных моделях

REAP был протестирован на широком спектре моделей:

  • Qwen3-480B-Coder-FP8 — при 50% сжатии сохранил 96%+ возможностей оригинала

  • GLM-4.7-FP8 — при 25% сжатии HumanEval вырос с 95.7 до 97.0%

  • Mixtral-8x7B-Instruct-v0.1 — стабильное качество при 25-50% сжатии

  • ERNIE-4.5-21B-A3B-PT — минимальная потеря на coding-бенчмарках

  • Llama-4-Scout-17B-16E-Instruct — подтверждение на архитектуре Meta

Особенно впечатляет результат на Qwen3-480B-Coder: REAP-версия (246B) практически неотличима от оригинала по генерации кода, но требует вдвое меньше памяти.

Сравнение с аналогами

Метод Подход Потеря при 50% Генеративные задачи
REAP Pruning (обрезка) 6.9% Отлично
EAN Pruning (только норма активации) ~10-12% Средне
M-SMoE Merging Merging (объединение) 15-20%+ Плохо
HC-SMoE Merging (иерархическое) 12-15% Средне
Distillation Переобучение Зависит от данных Хорошо, но дорого

Главное преимущество REAP — one-shot: не нужно переобучать модель. Достаточно прогнать калибровочный датасет, вычислить значимость экспертов, удалить лишние — и готово. Это занимает часы, а не дни.

Практическое значение

REAP решает реальную проблему: MoE-модели растут до триллионов параметров, и развёртывание таких моделей требует огромных вычислительных ресурсов. REAP позволяет:

  • Запускать модели на потребительском оборудовании (RTX 5060 Ti и аналоги)

  • Сократить стоимость инференса вдвое

  • Уменьшить задержку (latency) за счёт меньшего числа экспертов

  • Развёртывать модели в on-premise инфраструктуре без облака

Сообщество активно использует REAP: на HuggingFace появляются REAP-версии новых моделей каждую неделю. NVIDIA обсуждает REAP в контексте DGX Spark, сообщество vLLM экспериментирует с live-pruning.

Как это может быть полезно вашему бизнесу

Если ваша компания использует LLM для генерации кода, обработки документов или работы с клиентами — REAP-модели позволяют существенно снизить затраты на инфраструктуру. Вместо аренды мощных GPU-кластеров можно развёртывать сжатые модели на собственном оборудовании.

Команда ast-softpro.ru помогает бизнесу внедрять AI-решения: подбор оптимальных моделей (включая REAP-сжатые), настройка инфраструктуры, разработка чат-ботов и автоматизация бизнес-процессов. Если вы хотите обсудить, какие модели и подходы лучше всего подойдут для ваших задач — свяжитесь с нами, и мы поможем подобрать решение под ваш бюджет и требования.

Источники

AI-Помощник