Блог AST-SoftPro
Radeon XTX и локальные LLM: где AMD сильна, а NVIDIA всё ещё быстрее
Введение
Выбор видеокарты под локальные LLM в 2026 году — это не вопрос «купить самое дорогое». Рынок изменился: дефицит GDDR-памяти поднял цены на все карты, а экосистема ROCm наконец стала пригодной для повседневной работы. В этой статье разбираем линейку Radeon XTX (RX 7900 XTX и её наследников) с точки зрения запуска LLM: где AMD реально сильна, где NVIDIA всё ещё быстрее, можно ли использовать эти карты как рабочую станцию кодера и что в итоге выгоднее по цене за токен.
Практический вывод для читателя: если вы собираете машину под локальный инференс и бюджет ограничен, RX 7900 XTX — одна из самых рациональных покупок на рынке. Но есть нюансы: Windows-поддержка ROCm, отсутствие FP8 и более узкая экосистема кастомных нодов. Разберём каждый пункт по фактам.
Что такое линейка XTX и почему она важна для LLM
Radeon RX 7900 XTX построена на архитектуре RDNA 3 (чип gfx1100) и имеет 24 ГБ GDDR6 с пропускной способностью 960 ГБ/с. Именно объём и ширина шины памяти определяют скорость инференса LLM: генерация токенов — это операция, ограниченная полосой пропускания памяти (memory-bandwidth bound), а не вычислительной мощностью в TFLOPS. Поэтому карта с 24 ГБ и высокой шиной часто обгоняет более «мощную» по гейминг-бенчмаркам видеокарту с меньшим объёмом VRAM.
Для локальных моделей это означает:
-
Модели до ~14B параметров (Gemma 4 12B, Qwen3.5-9B, Llama 3.1 8B) полностью помещаются в 24 ГБ с запасом на контекст и работают на полной скорости карты.
-
Модели класса 32B (Gemma 4 31B Q4_K_M, Qwen3.5-27B Q4_K_M, ~16–20 ГБ) тоже влезают целиком — это уже уровень, близкий к качеству больших облачных моделей для большинства задач.
-
Модели 70B на одной карте не помещаются: нужен частичный оффлоад в RAM (медленно, ~7–10 ток/с) или вторая видеокарта с tensor split (~22 ток/с).
💡 Если ваша задача — запускать модели до 32B параметров целиком на GPU, 24 ГБ VRAM — это «золотой стандарт» потребительского сегмента. Именно поэтому XTX конкурирует не только с RTX 4090 (также 24 ГБ), но и с подержанной RTX 3090 (24 ГБ).
Бенчмарки RX 7900 XTX: реальные цифры
По данным независимых замеров (llama.cpp, квантование Q4_K_M):
| Модель | RX 7900 XTX | Примечание |
|---|---|---|
| Llama 3.1 8B (Q4_K_M) | ~96–105 ток/с | полная генерация на GPU |
| Qwen3.5-9B (Q4_K_M) | ~80–100 ток/с | малая модель, быстро и комфортно |
| Qwen3.5-27B (Q4_K_M, dense) | ~28–35 ток/с | модель целиком в VRAM, актуальная модель 2026 |
| Gemma 4 26B-A4B (MoE, активные ~4B) | значительно выше — малые активные параметры, decode упирается не во всю модель | 256K-контекст, качество кода LiveCodeBench ~80% |
| Gemma 4 31B (dense) | ~25–30 ток/с | прорыв по качеству кода (LiveCodeBench ~80% vs ~29% у Gemma 3 27B) |
| Llama 7B (Q4_0), prompt processing | до ~2800 ток/с | обработка промпта, не генерация |
Для сравнения: RTX 4090 выдаёт на Llama 3.1 8B порядка 127–162 ток/с в зависимости от квантования и настроек. То есть XTX закрывает примерно 75–80% скорости RTX 4090 — при заметно меньшей цене.
Сильные стороны AMD для LLM
Цена за гигабайт VRAM
Главный аргумент в пользу XTX — стоимость. В середине 2026 года новая RX 7900 XTX стоит примерно $1100–1400 (подержанная $750–850), тогда как RTX 4090, снятая с производства ещё в октябре 2024-го, продаётся за $1800–2700 и выше. Разница в ~$700–1300 при разнице в скорости инференса всего 25% — это математика, которая говорит сама за себя: цена за токен на XTX заметно ниже.
Зрелость ROCm
ROCm 7.x (производственная версия 7.2.x) официально поддерживает gfx1100 без всяких HSA_OVERRIDE_GFX_VERSION. На Linux настройка занимает около 30 минут: скрипт amdgpu-install --usecase=rocm,hiplibsdk, добавление в группы render/video, перезагрузка, проверка через rocminfo. Ollama, llama.cpp (HIP-бэкенд), vLLM и PyTorch работают «из коробки». FlashAttention-2 поддерживается ROCm-форком — на длинном контексте это даёт существенный прирост: Llama 3.1 8B при 16K контекста ускоряется примерно втрое (с ~22 до ~67 ток/с).
Поддержка новых карт RDNA 4
RX 9070 / 9070 XT (gfx1201) уже официально поддерживаются ROCm 7.2: Ollama, vLLM и llama.cpp работают. Но у них всего 16 ГБ VRAM — для больших моделей это ограничение серьёзнее, чем выигрыш в архитектуре. XTX с её 24 ГБ остаётся более универсальной покупкой под LLM.
⚠️ Если вы рассматриваете RX 9070 XT «потому что новее», имейте в виду: 16 ГБ VRAM не хватит даже для Gemma 4 31B или Qwen3.5-27B с нормальным контекстом. Под LLM объём памяти важнее поколения архитектуры.
Слабые стороны и реальные проблемы
Windows: поддержка хуже, чем на Linux
ROCm — это в первую очередь Linux-экосистема. На Windows AMD выпускает ROCm для потребительских RDNA-карт, но опыт «хрупок»: обновления драйверов Adrenalin иногда ломают работу HIP-бэкендов, а часть инструментов (vLLM, кастомные сборки llama.cpp) на Windows поддерживается хуже или требует ручной настройки переменных окружения (HIP_VISIBLE_DEVICES, пути к библиотекам). На практике сообщество r/ROCm регулярно обсуждает ситуации, когда Vulkan-бэкенд llama.cpp оказывается быстрее ROCm-сборки на той же XTX.
Практический вывод: если у вас Windows и вы не готовы копать в настройках — закладывайте время на отладку или рассматривайте WSL2 с Linux. Если у вас уже есть Ubuntu-машина — AMD просто работает.
Нет FP8/FP4
У Ada (RTX 40xx) и Blackwell (RTX 50xx) есть аппаратное FP8. Это позволяет запускать модели в FP8-квантовании с лучшим соотношением качества/скорости, чем INT8/INT4 GGUF. На RDNA 3 такой поддержки нет: вы ограничены GGUF-квантованиями (Q4_K_M, Q5_K_M и т.д.) или BF16/FP16. Для большинства задач это не критично — квантованные модели работают отлично, — но если вы хотите максимум качества при фиксированном объёме VRAM, NVIDIA имеет преимущество.
Экосистема уже и уже
-
ComfyUI / Stable Diffusion: основные пайплайны работают (SDXL ~6–8 сек/изображение, Flux Schnell 3–5 сек), но часть кастомных нодов, завязанных на xformers-аттеншн или CUDA-ядрах, не работает.
-
Fine-tuning / LoRA: backward-pass в Composable Kernel для RDNA 3 не реализован — обучение откатывается на Triton или более медленные ядра. Для серьёзного дообучения AMD пока проигрывает.
-
vLLM / TensorRT-LLM: vLLM работает через ROCm, но «продакшн-зрелость» CUDA-стека (TensorRT-LLM, ExLlamaV2) всё ещё выше. ExLlamaV2, например, только NVIDIA.
Мульти-GPU без NVLink
Две XTX в одной системе работают через PCIe pipeline/tensor parallelism — без Infinity Fabric между потребительскими картами. На моделях класса 70B это даёт примерно 1.5x от одной карты, а не 2x. У NVIDIA NVLink (на старых флагманах) и более зрелый мульти-GPU стек.
Можно ли использовать XTX для кодинга?
Короткий ответ: да, и для многих сценариев это лучшее соотношение цены и возможностей. Но давайте разберём по задачам.
Локальный AI-ассистент (главный сценарий)
Если ваш «кодинг с ИИ» — это локальная модель через Ollama/llama.cpp, которая помогает писать код, объяснять баги, рефакторить: XTX отлично подходит. Gemma 4 31B на ~25–30 ток/с — это интерактивный темп: вы успеваете читать ответ, пока он генерируется. Gemma 4 (апрель/май 2026) — прорыв по качеству кода: LiveCodeBench ~80% против ~29% у Gemma 3 27B, AIME ~89%. Альтернативы: Qwen3.6-27B (dense, апрель 2026) и Qwen3.8-27B (dense, август 2026) — актуальные dense-модели для кода с 256K+ контекстом; а также Qwen3.5-35B-A3B / Qwen3.6-35B-A3B (MoE, активные ~3B) — быстрый decode за счёт малых активных параметров. Для повседневных задач (написание функций, отладка, объяснение чужого кода) модели 26–31B в квантовании Q4_K_M часто достаточны.
Что XTX НЕ заменит
-
Облачные фронтир-модели — на сложных архитектурных задачах, многофайловом рефакторинге и тонком отладывании 32B-локалка всё ещё уступает большим облачным моделям. Это вопрос качества модели, а не железа: та же модель на RTX 4090 будет лишь быстрее, но не умнее.
-
Серьёзный fine-tuning — из-за отсутствия backward-pass в CK-бэкенде дообучение на AMD пока медленное и неудобное.
⚠️ Важно понимать: видеокарта определяет скорость, а не качество ответов. «Вайб-кодинг» с локальной моделью — отличный старт для экспериментов и частных проектов, но в продакшене выбор модели, промптов и архитектуры подсистем решает больше, чем ток/с на конкретной карте. Команды, которые доверяют критичные задачи (безопасность, N+1-запросы, масштабируемость) опытным разработчикам, экономят недели на исправлении ошибок, которые могли быть предотвращены на этапе проектирования.
Практическая конфигурация под кодинг
Для рабочей станции «кодинг + локальная LLM» разумный минимум:
| Компонент | Рекомендация | Почему |
|---|---|---|
| GPU | RX 7900 XTX (24 ГБ) | модели до 32B целиком в VRAM |
| RAM | 64 ГБ DDR5 | оффлоад больших моделей + IDE + браузеры |
| CPU | любой современный 8+ ядер | prompt processing частично на CPU при смешанном режиме |
| ОС | Ubuntu 22.04/24.04 (или WSL2) | зрелая поддержка ROCm |
Сравнение с аналогичными по цене решениями NVIDIA
Сопоставим XTX не только с RTX 4090 (дороже), но и с тем, что можно купить за те же деньги у NVIDIA:
| Карта | VRAM | Цена (середина 2026) | LLM-скорость (Llama 3.1 8B) | Комментарий |
|---|---|---|---|---|
| RX 7900 XTX | 24 ГБ | $1100–1400 (новая), $750–850 (б/у) | ~96–105 ток/с | лучшее $/GB VRAM в сегменте |
| RTX 4090 | 24 ГБ | $1800–2700+ | ~127–162 ток/с | максимум скорости, FP8, зрелый CUDA-стек |
| RTX 3090 (б/у) | 24 ГБ | $800–1000 | ~95 ток/с | NVIDIA-only инструменты (ExLlamaV2, TensorRT), но старое железо |
| RTX 5090 | 32 ГБ | $3000+ | значительно выше | другой ценовой класс, FP8/FP4 |
Ключевые наблюдения:
-
Против RTX 4090: XTX на ~40–50% дешевле при разнице в скорости инференса ~25%. Если вам не нужен FP8 и продакшн-vLLM — это рациональный выбор.
-
Против б/у RTX 3090: по цене они сопоставимы, по скорости почти равны (~95–96 ток/с). XTX выигрывает тем, что её можно купить новой с гарантией, а ROCm на RDNA 3 в 2026 году зрелее, чем репутация «старой» карты. Но если вам критичны NVIDIA-only инструменты (ExLlamaV2, TensorRT-LLM) — б/у 3090 всё ещё живая опция.
-
Против RTX 5090: не конкуренты по цене ($3000+), но 32 ГБ VRAM на 5090 позволяют держать модели с большим контекстом или более высокие квантования.
💡 Правило выбора: берите XTX, если приоритет — цена за гигабайт и «достаточно быстро». Берите NVIDIA, если нужен FP8, продакшн-инференс (vLLM/TensorRT), fine-tuning или вы уже построили пайплайн под CUDA.
Рекомендации и бест-практисы
-
Linux — основной выбор. Если есть возможность работать в Ubuntu (нативно или WSL2) — делайте это: ROCm на Linux стабилен, на Windows хрупок.
-
Включайте FlashAttention (
-faв llama.cpp). На длинном контексте разница до 3x. -
Квантуйте под VRAM с запасом. Для 24 ГБ: Gemma 4 31B или Qwen3.5-27B берите Q4_K_M (~16–20 ГБ) — останется место на контекст. Не пытайтесь втиснуть Q8 «на грани».
-
Ограничьте мощность до 290–310 Вт (LACT/CoreCtrl или Adrenalin). Потеря 3–5% скорости, минус ~10°C — для 24/7-инференса это продлевает жизнь карте.
-
Не смешивайте вендоры в одном пайплайне. XTX + RTX в одной системе работают только как отдельные workload'ы (через
HIP_VISIBLE_DEVICES/CUDA_VISIBLE_DEVICES). Для маршрутизации между картами разных вендоров смотрите GPUStack. -
Для 70B+ моделей планируйте две карты или рассматривайте профессиональные варианты (Radeon PRO W7900, 48 ГБ).
⚠️ Типичная ошибка: покупать XTX «на вырост» под обучение моделей. Для инференса карта отличная, но для fine-tuning AMD пока проигрывает — если дообучение в планах, сначала оцените, какие именно ядра вам нужны и протестируйте на конкретной модели.
Заключение
Radeon XTX в 2026 году — это рациональный выбор под локальные LLM для тех, кто ценит объём VRAM и цену больше, чем последние проценты скорости. RX 7900 XTX даёт ~75–80% производительности RTX 4090 на инференсе при цене на 40–50% ниже, а ROCm наконец созрел до уровня «поставил — работает». Для кодинга с локальным AI-ассистентом (модели до 32B) это одна из лучших покупок на рынке.
Ограничения реальные: Windows-поддержка слабее Linux, нет FP8, fine-tuning и часть кастомных инструментов экосистемы — прерогатива CUDA. Если ваш сценарий — продакшн-инференс с vLLM/TensorRT или дообучение моделей, NVIDIA всё ещё впереди. Но для повседневной работы кодера с локальной моделью XTX закрывает задачу и экономит сотни долларов.
И помните: железо ускоряет ответы, но качество результата зависит от выбора модели, промптов и инженерных решений вокруг них. Для продакшн-систем — от архитектуры до безопасности — стоит привлекать специалистов: это инвестиция, которая окупается снижением рисков на всех этапах.
Источники
-
Radeon RX 7900 XTX for Local AI (2026): The Best Value 24GB GPU — localaimaster.com
-
Local LLM Benchmarks — Tokens/sec by Hardware (Mac M-series, NVIDIA, AMD)
-
Performance of llama.cpp on AMD ROCm (HIP) — ggml-org/llama.cpp Discussion #15021