Подписывайтесь:

AST-SoftPro

Блог о разработке и проектах

Опыт внедрения Python, телеграм-ботов и AI-решений, заметки команды и кейсы заказчиков

Квантование больших языковых моделей: полное руководство по методам, потере точности и практическим рекомендациям
01.08.2026 19 мин чтения

Квантование больших языковых моделей: полное руководство по методам, потере точности и практическим рекомендациям

Введение Запуск больших языковых моделей (LLM) в продакшене — это не просто вопрос выбора модели. Это вопрос того, сколько VRAM она займёт, сколько токенов в секунду выдаст, и скол…

Почему у разных LLM при одинаковых параметрах разная память для контекста: Mamba, KV-кэш и архитектура
29.07.2026 21 мин чтения

Почему у разных LLM при одинаковых параметрах разная память для контекста: Mamba, KV-кэш и архитектура

Введение Если запустить Llama 3.1 8B и Granite 4.1 8B на одном GPU с контекстом в 128 000 токенов, вы заметите неожиданную вещь: при практически одинаковом количестве параметров тр…

AI-Помощник