Подписывайтесь:

Блог AST-SoftPro

Step 3.5 Flash: Локальный форк Claude Code на двух RTX 5060 Ti — производительность, проблемы с русским языком и пути решения

01.08.2026 6 мин чтения
Step 3.5 Flash: Локальный форк Claude Code на двух RTX 5060 Ti — производительность, проблемы с русским языком и пути решения

Step 3.5 Flash: Локальный форк Claude Code на двух RTX 5060 Ti

В этой статье рассказываем о практическом опыте запуска модели Cerebras-Step-3.5-Flash-REAP-149B-A11B-IQ2-M.gguf на локальном оборудовании — форке Claude Code, работающем на двух видеокартах RTX 5060 Ti. Речь идёт не об облачном сервисе, а о реальном локальном развертывании, которое позволяет получить доступ к передовым возможностям искусственного интеллекта без зависимости от внешних провайдеров.

Конфигурация оборудования

Для запуска модели используется следующая конфигурация:

  • Видеокарты: две RTX 5060 Ti (16 ГБ видеопамяти каждая)

  • Процессор: Intel Core i5-12600K

  • Оперативная память: 32 ГБ DDR4

  • Модель: Cerebras-Step-3.5-Flash-REAP-149B-A11B-IQ2-M.gguf

Характеристики производительности

Модель демонстрирует впечатляющие показатели:

  • Prompt Processing (PP): 200 токенов в секунду

  • Token Generation (TG): 15 токенов в секунду

  • Контекстное окно: 128 000 токенов

Такая скорость обработки промптов означает, что модель способна быстро анализировать большие объёмы входных данных, что критично для задач программирования и работы с кодом. Контекстное окно в 128 000 токенов позволяет обрабатывать целые проекты целиком, а не по частям.

Облачный вариант: GigaAgent без проблем с русским языком

Интересный факт: та же модель Step 3.5 Flash в облачном варианте через openrouter.ai использовалась для нашего форка GigaAgent — и работала отлично, вообще без проблем с русским языком. Это важное наблюдение, которое позволяет сделать вывод: проблемы русского языка в локальной версии, скорее всего, связаны с квантованием модели.

Формат IQ2_M (2-битное квантование) — это агрессивное сжатие, которое позволяет запустить 149-миллиардную модель на двух RTX 5060 Ti, но при этом теряет часть информации, критичной для обработки русского языка. Облачная версия работает с полным набором весов, поэтому таких проблем не возникает.

Проблемы с русским языком и их решение

Одна из ключевых проблем, с которой столкнулась локальная модель — ошибки при работе с русским текстом. Это проявляется в неправильных окончаниях, смешивании кириллицы и латиницы, а также в грамматических неточностях.

Для исправления этой проблемы используется модель t-tech/t-lite-it-2.1, которая работает на отдельном ПК и выполняет функцию переводчика-корректора. Эта модель специализируется на обработке русского языка и способна исправлять ошибки, допущенные основной моделью.

Однако стоит признать: проблемы с окончательным текстом на русском языке не ушли полностью. Возможно, их удастся решить с помощью второй простой модели, если ещё доработать форк. Это направление активно исследуется.

Почему это важно для бизнеса

Step 3.5 Flash демонстрирует важный тренд: открытые модели достигли уровня, когда они могут заменить проприетарные решения в большинстве сценариев. Это меняет экономику AI-проектов:

  • Стоимость владения — модель бесплатна (Apache 2.0), вы платите только за инфраструктуру

  • Контроль данных — данные не покидают ваш периметр

  • Независимость от вендора — нет риска изменения условий API или цены

  • Возможность кастомизации — дообучение под ваши задачи

Одно важно признать: выбор модели — это лишь половина задачи. Вторая половина — корректная реализация с учётом edge-кейсов, безопасности и производительности. Поверхностное копирование решений из интернета могло привести к скрытым уязвимостям — стоит проверить реализации на соответствие OWASP Top 10. Команда, которой доверяют критичные задачи, экономит время и деньги на исправление ошибок, которые могли бы привести к проблемам на этапе проектирования.

Заключение

Step 3.5 Flash — значимый релиз в мире открытых LLM. Модель сочетает передовую архитектуру (MoE + MTP-3 + SWA), впечатляющие результаты на агентных бенчмарках и практическую применимость благодаря локальному развертыванию. Для организаций, которым нужен полноценный AI-инструмент с контролем над данными, это один из лучших вариантов на начало 2026 года.

Источники

AI-Помощник