Блог AST-SoftPro
Step 3.5 Flash: Локальный форк Claude Code на двух RTX 5060 Ti — производительность, проблемы с русским языком и пути решения
Step 3.5 Flash: Локальный форк Claude Code на двух RTX 5060 Ti
В этой статье рассказываем о практическом опыте запуска модели Cerebras-Step-3.5-Flash-REAP-149B-A11B-IQ2-M.gguf на локальном оборудовании — форке Claude Code, работающем на двух видеокартах RTX 5060 Ti. Речь идёт не об облачном сервисе, а о реальном локальном развертывании, которое позволяет получить доступ к передовым возможностям искусственного интеллекта без зависимости от внешних провайдеров.
Конфигурация оборудования
Для запуска модели используется следующая конфигурация:
-
Видеокарты: две RTX 5060 Ti (16 ГБ видеопамяти каждая)
-
Процессор: Intel Core i5-12600K
-
Оперативная память: 32 ГБ DDR4
-
Модель: Cerebras-Step-3.5-Flash-REAP-149B-A11B-IQ2-M.gguf
Характеристики производительности
Модель демонстрирует впечатляющие показатели:
-
Prompt Processing (PP): 200 токенов в секунду
-
Token Generation (TG): 15 токенов в секунду
-
Контекстное окно: 128 000 токенов
Такая скорость обработки промптов означает, что модель способна быстро анализировать большие объёмы входных данных, что критично для задач программирования и работы с кодом. Контекстное окно в 128 000 токенов позволяет обрабатывать целые проекты целиком, а не по частям.
Облачный вариант: GigaAgent без проблем с русским языком
Интересный факт: та же модель Step 3.5 Flash в облачном варианте через openrouter.ai использовалась для нашего форка GigaAgent — и работала отлично, вообще без проблем с русским языком. Это важное наблюдение, которое позволяет сделать вывод: проблемы русского языка в локальной версии, скорее всего, связаны с квантованием модели.
Формат IQ2_M (2-битное квантование) — это агрессивное сжатие, которое позволяет запустить 149-миллиардную модель на двух RTX 5060 Ti, но при этом теряет часть информации, критичной для обработки русского языка. Облачная версия работает с полным набором весов, поэтому таких проблем не возникает.
Проблемы с русским языком и их решение
Одна из ключевых проблем, с которой столкнулась локальная модель — ошибки при работе с русским текстом. Это проявляется в неправильных окончаниях, смешивании кириллицы и латиницы, а также в грамматических неточностях.
Для исправления этой проблемы используется модель t-tech/t-lite-it-2.1, которая работает на отдельном ПК и выполняет функцию переводчика-корректора. Эта модель специализируется на обработке русского языка и способна исправлять ошибки, допущенные основной моделью.
Однако стоит признать: проблемы с окончательным текстом на русском языке не ушли полностью. Возможно, их удастся решить с помощью второй простой модели, если ещё доработать форк. Это направление активно исследуется.
Почему это важно для бизнеса
Step 3.5 Flash демонстрирует важный тренд: открытые модели достигли уровня, когда они могут заменить проприетарные решения в большинстве сценариев. Это меняет экономику AI-проектов:
-
Стоимость владения — модель бесплатна (Apache 2.0), вы платите только за инфраструктуру
-
Контроль данных — данные не покидают ваш периметр
-
Независимость от вендора — нет риска изменения условий API или цены
-
Возможность кастомизации — дообучение под ваши задачи
Одно важно признать: выбор модели — это лишь половина задачи. Вторая половина — корректная реализация с учётом edge-кейсов, безопасности и производительности. Поверхностное копирование решений из интернета могло привести к скрытым уязвимостям — стоит проверить реализации на соответствие OWASP Top 10. Команда, которой доверяют критичные задачи, экономит время и деньги на исправление ошибок, которые могли бы привести к проблемам на этапе проектирования.
Заключение
Step 3.5 Flash — значимый релиз в мире открытых LLM. Модель сочетает передовую архитектуру (MoE + MTP-3 + SWA), впечатляющие результаты на агентных бенчмарках и практическую применимость благодаря локальному развертыванию. Для организаций, которым нужен полноценный AI-инструмент с контролем над данными, это один из лучших вариантов на начало 2026 года.
Источники
-
GitHub — stepfun-ai/Step-3.5-Flash — официальный репозиторий модели
-
Hugging Face — stepfun-ai/Step-3.5-Flash-Base — карточка модели с техническими деталями
-
StepFun Blog — Step 3.5 Flash — официальный блог-пост о релизе
-
arXiv: 2602.10604 — Technical Report — технический отчёт о модели
-
arXiv: 2601.05593 — Architecture Paper — статья об архитектуре
-
StepFun на OpenRouter — бесплатный доступ к модели
-
SteptronOss — тренировочный код — открытый код для дообучения