Блог AST-SoftPro
Step 3.5 Flash: обзор модели, которая меняет правила игры в локальных LLM
В январе 2026 года китайская компания StepFun выпустила Step 3.5 Flash — открытую модель с архитектурой Mixture of Experts, которая активирует лишь 11 из 196 миллиардов параметров на каждый токен. Результат: производительность, сопоставимая с проприетарными флагманами, при скорости генерации до 350 токенов в секунду на потребительском железе. В этой статье мы разберём архитектуру, бенчмарки, сравнение с конкурентами и практические сценарии использования.
Что такое StepFun и как дошли до Step 3.5 Flash
StepFun (Shanghai Jieyue Xingchen Intelligent Technology Co., Ltd) — одна из шести китайских «AI-тигров», основанная в апреле 2023 года бывшими сотрудниками Baidu: Яо Чжао, И Ли и Юцзе Чжоу. Компания с самого начала сделала ставку на открытые модели и мультимодальность.
Ключевые вехи развития:
-
2023 — основание компании, старт разработки больших моделей
-
2024 — релиз Step-1 и Step-2, включая модель с триллионом параметров (первая китайская компания, выпустившая модель такого масштаба)
-
2025 — стратегический сдвиг: переход от зависимости от инфраструктуры ByteDance (Volcano Engine) к собственной вычислительной базе; релиз Step-1V и Step-1-Image
-
Январь 2026 — релиз Step 3.5 Flash с открытым исходным кодом и лицензией Apache 2.0
Step 3.5 Flash — не просто очередная итерация. Это модель, спроектированная с нуля под агентные задачи: быстрое рассуждение, генерация кода, работа с длинным контекстом и локальное развёртывание. Компания также открыла тренировочный код SteptronOss, что позволяет сообществу дообучать модель под собственные задачи.
Архитектура: почему MoE и почему это работает
Step 3.5 Flash построена на разреженной архитектуре Mixture of Experts (MoE). Из 196 миллиардов параметров на каждый токен активируется лишь 11 миллиардов — это примерно 5.6% от общего объёма модели. Такой подход даёт два ключевых преимущества:
-
Скорость — меньше активных параметров означают меньшую вычислительную нагрузку на каждый шаг генерации
-
Масштаб — модель может хранить больше знаний (больше параметров), не увеличивая стоимость инференса
Технические характеристики
| Параметр | Значение |
|---|---|
| Всего параметров | 196B |
| Активных параметров (на токен) | 11B |
| Архитектура | Sparse MoE |
| Контекстное окно | 256K токенов |
| Скорость генерации | 100–300 tok/s (до 350 tok/s для single-stream) |
| Лицензия | Apache 2.0 |
| Дата релиза | 29 января 2026 |
| Формат весов | GGUF, Safetensors |
Multi-Token Prediction (MTP-3)
Одна из ключевых архитектурных особенностей — 3-way Multi-Token Prediction. Вместо предсказания одного токена за шаг, модель предсказывает три токена параллельно. Это существенно ускоряет генерацию без потери качества — модель учится предсказывать не только следующий токен, но и два последующих, что позволяет «пропускать» шаги при инференсе.
💡 Практическая выгода: MTP-3 означает, что агент на базе Step 3.5 Flash может обрабатывать запросы в реальном времени — критично для интерактивных сценариев, где задержка в секунды влияет на пользовательский опыт.
Sliding Window Attention (SWA)
Для поддержки контекстного окна в 256K токенов модель использует гибридный подход: соотношение 3:1 между слоями Sliding Window Attention и слоями полного внимания. Три слоя SWA на каждый слой полного внимания обеспечивают стабильную работу с длинными контекстами при значительно меньших вычислительных затратах.
⚠️ Важно: При работе с контекстами более 128K токенов рекомендуется использовать квантованные версии (INT4) для снижения потребления памяти. На 80 ГБ VRAM (например, A100) модель работает стабильно, но на потребительском железе (24–48 ГБ) без квантования запуск невозможен.
Бенчмарки: где Step 3.5 Flash показывает себя
Модель ориентирована на агентные задачи, и бенчмарки это подтверждают:
| Бенчмарк | Результат | Что измеряет |
|---|---|---|
| SWE-bench Verified | 74.4% | Способность решать реальные задачи из GitHub-репозиториев |
| Terminal-Bench 2.0 | 51.0% | Работа в терминале: навигация, отладка, скрипты |
| AIME 2026 | 82.6% | Математические олимпиадные задачи |
| LiveCodeBench | 68.3% | Генерация кода по реальным задачам |
Результат на SWE-bench Verified в 74.4% — один из лучших среди открытых моделей. Для сравнения, проприетарные модели уровня GPT-4o и Claude Opus показывают 70–75% на этом же бенчмарке. Это означает, что Step 3.5 Flash способна автономно решать задачи по исправлению багов, написанию фич и рефакторингу кода — без участия человека.
💡 Для бизнеса: SWE-bench — не просто академический бенчмарк. Он измеряет реальную способность модели работать с кодовой базой, понимать контекст проекта и вносить корректные изменения. 74.4% означает, что модель может самостоятельно закрыть почти три из четырёх задач по исправлению кода.
Сравнение с аналогами
Step 3.5 Flash конкурирует в сегменте открытых моделей с несколькими серьёзными игроками. Давайте сравним:
Step 3.5 Flash vs Qwen3-235B-A22B
Обе модели используют MoE-архитектуру. Qwen3 от Alibaba Cloud имеет 235B параметров (22B активных), что немного больше. Однако Step 3.5 Flash превосходит Qwen3 по агентным бенчмаркам (SWE-bench, Terminal-Bench) и значительно выигрывает по скорости генерации благодаря MTP-3. Qwen3, в свою очередь, имеет более широкую экосистему инструментов и лучшую поддержку мультиязычности.
Step 3.5 Flash vs DeepSeek-R1-671B
DeepSeek-R1 — модель с 671B параметрами (dense, без MoE). Она превосходит Step 3.5 Flash по глубине рассуждений (reasoning) и математике, но требует значительно больше ресурсов для развёртывания. Step 3.5 Flash — более практичный выбор для локального использования: она помещается на 80 ГБ VRAM в INT4-квантовании, тогда как DeepSeek-R1 требует 4× A100 даже в квантованном виде.
Step 3.5 Flash vs Gemini 2.5 Pro
Gemini 2.5 Pro от Google — проприетарная модель с контекстным окном 1M токенов. Она превосходит Step 3.5 Flash по мультимодальности (видео, аудио, изображение) и длине контекста. Однако Step 3.5 Flash — открытая модель, которую можно развёртывать локально с полным контролем над данными. Для организаций, где конфиденциальность данных критична, это решающее преимущество.
Сводная таблица
| Модель | Параметры | Активных | Контекст | SWE-bench | Локально | Лицензия |
|---|---|---|---|---|---|---|
| Step 3.5 Flash | 196B | 11B | 256K | 74.4% | Да (INT4) | Apache 2.0 |
| Qwen3-235B-A22B | 235B | 22B | 128K | ~65% | Да (INT4) | Apache 2.0 |
| DeepSeek-R1-671B | 671B | 671B | 128K | ~70% | Сложно | MIT |
| Gemini 2.5 Pro | — | — | 1M | — | Нет | Проприетарная |
⚠️ Типичная ошибка при выборе модели: ориентация только на количество параметров. 671B параметров звучат впечатляюще, но если модель не помещается на ваше железо или генерирует ответ за 30 секунд — это непрактично для продакшена. Step 3.5 Flash демонстрирует, что 11B активных параметров при правильной архитектуре могут дать результат, сопоставимый с dense-моделями в 50 раз большего размера.
Локальное развёртывание: как запустить модель
Step 3.5 Flash доступна в нескольких форматах, что упрощает развёртывание:
Через vLLM (рекомендуемый способ)
pip install vllm
vllm serve "stepfun-ai/Step-3.5-Flash"
Сервер запустится с OpenAI-совместимым API на порту 8000. Для квантованной версии:
vllm serve "stepfun-ai/Step-3.5-Flash" --quantization awq
Через Ollama (для быстрого старта)
ollama run step-3.5-flash
Минимальные требования к железу
| Версия | VRAM | Пример конфигурации |
|---|---|---|
| Full precision (FP16) | 160+ ГБ | 2× A100 80GB |
| INT4 квантование | 80 ГБ | 1× A100 80GB |
| INT4 квантование | 48 ГБ | Mac Studio M4 Max |
| GGUF Q4_K_M | 24 ГБ | RTX 4090 |
💡 Для команд без GPU-кластера: Step 3.5 Flash доступна бесплатно через OpenRouter (stepfun/step-3.5-flash:free). Это позволяет протестировать модель без собственного железа, прежде чем инвестировать в инфраструктуру.
Практические сценарии использования
1. Агент для разработки ПО
С результатом 74.4% на SWE-bench Verified, Step 3.5 Flash — один из лучших открытых вариантов для агентов, которые работают с кодом. Модель способна:
-
Анализировать баг-репорты и предлагать исправления
-
Генерировать unit-тесты для существующего кода
-
Рефакторить код с сохранением функциональности
-
Работать с контекстами до 256K токенов (целые репозитории)
2. Локальный AI-ассистент
Благодаря открытой лицензии и возможности локального развёртывания, Step 3.5 Flash подходит для создания корпоративных AI-ассистентов, где данные не должны покидать периметр организации. Это критично для:
-
Финансовых учреждений (конфиденциальность клиентских данных)
-
Медицинских организаций (HIPAA/GDPR compliance)
-
Государственных структур (требования к локализации данных)
3. Дообучение под специфические задачи
Открытый тренировочный код SteptronOss позволяет дообучать модель на собственных данных. Это особенно ценно для нишевых доменов, где общие модели показывают слабые результаты:
-
Юридический анализ документов
-
Медицинская диагностика
-
Техническая поддержка специфического ПО
⚠️ Важно понимать: дообучение модели — это не тривиальная задача. Неправильно подобранные данные, гиперпараметры или стратегия обучения могут ухудшить качество модели вместо улучшения. Для продакшн-решений рекомендуется привлечение специалистов с опытом работы с большими языковыми моделями — это снижает риски ошибок и экономит ресурсы на переобучение.
Риски и ограничения
Несмотря на впечатляющие результаты, Step 3.5 Flash имеет ряд ограничений, которые стоит учитывать при принятии решений:
1. Отсутствие мультимодальности
Модель работает только с текстом. Для задач, требующих обработки изображений, аудио или видео, Step 3.5 Flash не подходит. StepFun работает над мультимодальными версиями, но на момент написания статьи они не доступны.
2. Англоцентричность
Модель оптимизирована для английского языка. Работа с русским, китайским и другими языками возможна, но качество заметно ниже. Для русскоязычных задач это означает, что модель может быть хороша для генерации кода (код на английском), но слаба для генерации текстового контента на русском.
3. Зависимость от инфраструктуры
Полноценное развёртывание требует серьёзного GPU-оборудования. Даже квантованная версия на 24 ГБ VRAM работает с ограничениями по контексту и скорости. Для организаций без GPU-инфраструктуры это может быть барьером.
💡 Альтернатива: если собственное развёртывание невозможно, рассмотрите использование модели через API (OpenRouter, SiliconFlow). Это не даёт полного контроля над данными, но позволяет оценить качество модели до принятия решения о покупке оборудования.
Почему это важно для бизнеса
Step 3.5 Flash демонстрирует важный тренд: открытые модели достигли уровня, когда они могут заменить проприетарные решения в большинстве сценариев. Это меняет экономику AI-проектов:
-
Стоимость владения — модель бесплатна (Apache 2.0), вы платите только за инфраструктуру
-
Контроль данных — данные не покидают ваш периметр
-
Независимость от вендора — нет риска изменения условий API или цен
-
Возможность кастомизации — дообучение под ваши задачи
Однако важно понимать: выбор модели — лишь половина задачи. Вторая половина — корректная реализация с учётом edge-кейсов, безопасности и производительности. Поверхностное копирование решений из интернета может привести к скрытым уязвимостям — стоит проверить реализацию на соответствие OWASP Top 10. Команды, которые доверяют критичные задачи опытным разработчикам, экономят время и деньги на исправлении ошибок, которые могли быть предотвращены на этапе проектирования.
Заключение
Step 3.5 Flash — значимый релиз в мире открытых LLM. Модель сочетает передовую архитектуру (MoE + MTP-3 + SWA), впечатляющие результаты на агентных бенчмарках и практическую применимость благодаря локальному развёртыванию. Для организаций, которым нужен мощный AI-инструмент с контролем над данными, это один из лучших вариантов на начало 2026 года.
Если ваш проект требует глубокой экспертизы — от архитектуры до безопасности — стоит рассмотреть профессиональную помощь. Это инвестиция, которая окупается снижением рисков и ускорением выхода на рынок. Разработка ПО — это не только код. Это проектирование архитектуры, тестирование, мониторинг и поддержка. Комплексный подход с привлечением специалистов обеспечивает качество на всех этапах.
Источники
-
GitHub — stepfun-ai/Step-3.5-Flash — официальный репозиторий модели
-
Hugging Face — stepfun-ai/Step-3.5-Flash-Base — карточка модели с техническими деталями
-
StepFun — Wikipedia — история компании
-
StepFun Blog — Step 3.5 Flash — официальный блог-пост о релизе
-
arXiv: 2602.10604 — Technical Report — технический отчёт о модели
-
arXiv: 2601.05593 — Architecture Paper — статья об архитектуре
-
StepFun на OpenRouter — бесплатный доступ к модели
-
Step-3.5-Flash-int4 — новый король локальных LLM на 128 ГБ — обзор квантованной версии
-
StepFun выпустил открытый исходный код модели Step-3.5-Flash — обзор на VC.ru
-
SteptronOss — тренировочный код — открытый код для дообучения