Подписывайтесь:

Блог AST-SoftPro

Radeon XTX и локальные LLM: где AMD сильна, а NVIDIA всё ещё быстрее

16.08.2026 16 мин чтения
Radeon XTX и локальные LLM: где AMD сильна, а NVIDIA всё ещё быстрее

Введение

Выбор видеокарты под локальные LLM в 2026 году — это не вопрос «купить самое дорогое». Рынок изменился: дефицит GDDR-памяти поднял цены на все карты, а экосистема ROCm наконец стала пригодной для повседневной работы. В этой статье разбираем линейку Radeon XTX (RX 7900 XTX и её наследников) с точки зрения запуска LLM: где AMD реально сильна, где NVIDIA всё ещё быстрее, можно ли использовать эти карты как рабочую станцию кодера и что в итоге выгоднее по цене за токен.

Практический вывод для читателя: если вы собираете машину под локальный инференс и бюджет ограничен, RX 7900 XTX — одна из самых рациональных покупок на рынке. Но есть нюансы: Windows-поддержка ROCm, отсутствие FP8 и более узкая экосистема кастомных нодов. Разберём каждый пункт по фактам.

Что такое линейка XTX и почему она важна для LLM

Radeon RX 7900 XTX построена на архитектуре RDNA 3 (чип gfx1100) и имеет 24 ГБ GDDR6 с пропускной способностью 960 ГБ/с. Именно объём и ширина шины памяти определяют скорость инференса LLM: генерация токенов — это операция, ограниченная полосой пропускания памяти (memory-bandwidth bound), а не вычислительной мощностью в TFLOPS. Поэтому карта с 24 ГБ и высокой шиной часто обгоняет более «мощную» по гейминг-бенчмаркам видеокарту с меньшим объёмом VRAM.

Для локальных моделей это означает:

  • Модели до ~14B параметров (Gemma 4 12B, Qwen3.5-9B, Llama 3.1 8B) полностью помещаются в 24 ГБ с запасом на контекст и работают на полной скорости карты.

  • Модели класса 32B (Gemma 4 31B Q4_K_M, Qwen3.5-27B Q4_K_M, ~16–20 ГБ) тоже влезают целиком — это уже уровень, близкий к качеству больших облачных моделей для большинства задач.

  • Модели 70B на одной карте не помещаются: нужен частичный оффлоад в RAM (медленно, ~7–10 ток/с) или вторая видеокарта с tensor split (~22 ток/с).

💡 Если ваша задача — запускать модели до 32B параметров целиком на GPU, 24 ГБ VRAM — это «золотой стандарт» потребительского сегмента. Именно поэтому XTX конкурирует не только с RTX 4090 (также 24 ГБ), но и с подержанной RTX 3090 (24 ГБ).

Бенчмарки RX 7900 XTX: реальные цифры

По данным независимых замеров (llama.cpp, квантование Q4_K_M):

Модель RX 7900 XTX Примечание
Llama 3.1 8B (Q4_K_M) ~96–105 ток/с полная генерация на GPU
Qwen3.5-9B (Q4_K_M) ~80–100 ток/с малая модель, быстро и комфортно
Qwen3.5-27B (Q4_K_M, dense) ~28–35 ток/с модель целиком в VRAM, актуальная модель 2026
Gemma 4 26B-A4B (MoE, активные ~4B) значительно выше — малые активные параметры, decode упирается не во всю модель 256K-контекст, качество кода LiveCodeBench ~80%
Gemma 4 31B (dense) ~25–30 ток/с прорыв по качеству кода (LiveCodeBench ~80% vs ~29% у Gemma 3 27B)
Llama 7B (Q4_0), prompt processing до ~2800 ток/с обработка промпта, не генерация

Для сравнения: RTX 4090 выдаёт на Llama 3.1 8B порядка 127–162 ток/с в зависимости от квантования и настроек. То есть XTX закрывает примерно 75–80% скорости RTX 4090 — при заметно меньшей цене.

Сильные стороны AMD для LLM

Цена за гигабайт VRAM

Главный аргумент в пользу XTX — стоимость. В середине 2026 года новая RX 7900 XTX стоит примерно $1100–1400 (подержанная $750–850), тогда как RTX 4090, снятая с производства ещё в октябре 2024-го, продаётся за $1800–2700 и выше. Разница в ~$700–1300 при разнице в скорости инференса всего 25% — это математика, которая говорит сама за себя: цена за токен на XTX заметно ниже.

Зрелость ROCm

ROCm 7.x (производственная версия 7.2.x) официально поддерживает gfx1100 без всяких HSA_OVERRIDE_GFX_VERSION. На Linux настройка занимает около 30 минут: скрипт amdgpu-install --usecase=rocm,hiplibsdk, добавление в группы render/video, перезагрузка, проверка через rocminfo. Ollama, llama.cpp (HIP-бэкенд), vLLM и PyTorch работают «из коробки». FlashAttention-2 поддерживается ROCm-форком — на длинном контексте это даёт существенный прирост: Llama 3.1 8B при 16K контекста ускоряется примерно втрое (с ~22 до ~67 ток/с).

Поддержка новых карт RDNA 4

RX 9070 / 9070 XT (gfx1201) уже официально поддерживаются ROCm 7.2: Ollama, vLLM и llama.cpp работают. Но у них всего 16 ГБ VRAM — для больших моделей это ограничение серьёзнее, чем выигрыш в архитектуре. XTX с её 24 ГБ остаётся более универсальной покупкой под LLM.

⚠️ Если вы рассматриваете RX 9070 XT «потому что новее», имейте в виду: 16 ГБ VRAM не хватит даже для Gemma 4 31B или Qwen3.5-27B с нормальным контекстом. Под LLM объём памяти важнее поколения архитектуры.

Слабые стороны и реальные проблемы

Windows: поддержка хуже, чем на Linux

ROCm — это в первую очередь Linux-экосистема. На Windows AMD выпускает ROCm для потребительских RDNA-карт, но опыт «хрупок»: обновления драйверов Adrenalin иногда ломают работу HIP-бэкендов, а часть инструментов (vLLM, кастомные сборки llama.cpp) на Windows поддерживается хуже или требует ручной настройки переменных окружения (HIP_VISIBLE_DEVICES, пути к библиотекам). На практике сообщество r/ROCm регулярно обсуждает ситуации, когда Vulkan-бэкенд llama.cpp оказывается быстрее ROCm-сборки на той же XTX.

Практический вывод: если у вас Windows и вы не готовы копать в настройках — закладывайте время на отладку или рассматривайте WSL2 с Linux. Если у вас уже есть Ubuntu-машина — AMD просто работает.

Нет FP8/FP4

У Ada (RTX 40xx) и Blackwell (RTX 50xx) есть аппаратное FP8. Это позволяет запускать модели в FP8-квантовании с лучшим соотношением качества/скорости, чем INT8/INT4 GGUF. На RDNA 3 такой поддержки нет: вы ограничены GGUF-квантованиями (Q4_K_M, Q5_K_M и т.д.) или BF16/FP16. Для большинства задач это не критично — квантованные модели работают отлично, — но если вы хотите максимум качества при фиксированном объёме VRAM, NVIDIA имеет преимущество.

Экосистема уже и уже

  • ComfyUI / Stable Diffusion: основные пайплайны работают (SDXL ~6–8 сек/изображение, Flux Schnell 3–5 сек), но часть кастомных нодов, завязанных на xformers-аттеншн или CUDA-ядрах, не работает.

  • Fine-tuning / LoRA: backward-pass в Composable Kernel для RDNA 3 не реализован — обучение откатывается на Triton или более медленные ядра. Для серьёзного дообучения AMD пока проигрывает.

  • vLLM / TensorRT-LLM: vLLM работает через ROCm, но «продакшн-зрелость» CUDA-стека (TensorRT-LLM, ExLlamaV2) всё ещё выше. ExLlamaV2, например, только NVIDIA.

Две XTX в одной системе работают через PCIe pipeline/tensor parallelism — без Infinity Fabric между потребительскими картами. На моделях класса 70B это даёт примерно 1.5x от одной карты, а не 2x. У NVIDIA NVLink (на старых флагманах) и более зрелый мульти-GPU стек.

Можно ли использовать XTX для кодинга?

Короткий ответ: да, и для многих сценариев это лучшее соотношение цены и возможностей. Но давайте разберём по задачам.

Локальный AI-ассистент (главный сценарий)

Если ваш «кодинг с ИИ» — это локальная модель через Ollama/llama.cpp, которая помогает писать код, объяснять баги, рефакторить: XTX отлично подходит. Gemma 4 31B на ~25–30 ток/с — это интерактивный темп: вы успеваете читать ответ, пока он генерируется. Gemma 4 (апрель/май 2026) — прорыв по качеству кода: LiveCodeBench ~80% против ~29% у Gemma 3 27B, AIME ~89%. Альтернативы: Qwen3.6-27B (dense, апрель 2026) и Qwen3.8-27B (dense, август 2026) — актуальные dense-модели для кода с 256K+ контекстом; а также Qwen3.5-35B-A3B / Qwen3.6-35B-A3B (MoE, активные ~3B) — быстрый decode за счёт малых активных параметров. Для повседневных задач (написание функций, отладка, объяснение чужого кода) модели 26–31B в квантовании Q4_K_M часто достаточны.

Что XTX НЕ заменит

  • Облачные фронтир-модели — на сложных архитектурных задачах, многофайловом рефакторинге и тонком отладывании 32B-локалка всё ещё уступает большим облачным моделям. Это вопрос качества модели, а не железа: та же модель на RTX 4090 будет лишь быстрее, но не умнее.

  • Серьёзный fine-tuning — из-за отсутствия backward-pass в CK-бэкенде дообучение на AMD пока медленное и неудобное.

⚠️ Важно понимать: видеокарта определяет скорость, а не качество ответов. «Вайб-кодинг» с локальной моделью — отличный старт для экспериментов и частных проектов, но в продакшене выбор модели, промптов и архитектуры подсистем решает больше, чем ток/с на конкретной карте. Команды, которые доверяют критичные задачи (безопасность, N+1-запросы, масштабируемость) опытным разработчикам, экономят недели на исправлении ошибок, которые могли быть предотвращены на этапе проектирования.

Практическая конфигурация под кодинг

Для рабочей станции «кодинг + локальная LLM» разумный минимум:

Компонент Рекомендация Почему
GPU RX 7900 XTX (24 ГБ) модели до 32B целиком в VRAM
RAM 64 ГБ DDR5 оффлоад больших моделей + IDE + браузеры
CPU любой современный 8+ ядер prompt processing частично на CPU при смешанном режиме
ОС Ubuntu 22.04/24.04 (или WSL2) зрелая поддержка ROCm

Сравнение с аналогичными по цене решениями NVIDIA

Сопоставим XTX не только с RTX 4090 (дороже), но и с тем, что можно купить за те же деньги у NVIDIA:

Карта VRAM Цена (середина 2026) LLM-скорость (Llama 3.1 8B) Комментарий
RX 7900 XTX 24 ГБ $1100–1400 (новая), $750–850 (б/у) ~96–105 ток/с лучшее $/GB VRAM в сегменте
RTX 4090 24 ГБ $1800–2700+ ~127–162 ток/с максимум скорости, FP8, зрелый CUDA-стек
RTX 3090 (б/у) 24 ГБ $800–1000 ~95 ток/с NVIDIA-only инструменты (ExLlamaV2, TensorRT), но старое железо
RTX 5090 32 ГБ $3000+ значительно выше другой ценовой класс, FP8/FP4

Ключевые наблюдения:

  1. Против RTX 4090: XTX на ~40–50% дешевле при разнице в скорости инференса ~25%. Если вам не нужен FP8 и продакшн-vLLM — это рациональный выбор.

  2. Против б/у RTX 3090: по цене они сопоставимы, по скорости почти равны (~95–96 ток/с). XTX выигрывает тем, что её можно купить новой с гарантией, а ROCm на RDNA 3 в 2026 году зрелее, чем репутация «старой» карты. Но если вам критичны NVIDIA-only инструменты (ExLlamaV2, TensorRT-LLM) — б/у 3090 всё ещё живая опция.

  3. Против RTX 5090: не конкуренты по цене ($3000+), но 32 ГБ VRAM на 5090 позволяют держать модели с большим контекстом или более высокие квантования.

💡 Правило выбора: берите XTX, если приоритет — цена за гигабайт и «достаточно быстро». Берите NVIDIA, если нужен FP8, продакшн-инференс (vLLM/TensorRT), fine-tuning или вы уже построили пайплайн под CUDA.

Рекомендации и бест-практисы

  1. Linux — основной выбор. Если есть возможность работать в Ubuntu (нативно или WSL2) — делайте это: ROCm на Linux стабилен, на Windows хрупок.

  2. Включайте FlashAttention (-fa в llama.cpp). На длинном контексте разница до 3x.

  3. Квантуйте под VRAM с запасом. Для 24 ГБ: Gemma 4 31B или Qwen3.5-27B берите Q4_K_M (~16–20 ГБ) — останется место на контекст. Не пытайтесь втиснуть Q8 «на грани».

  4. Ограничьте мощность до 290–310 Вт (LACT/CoreCtrl или Adrenalin). Потеря 3–5% скорости, минус ~10°C — для 24/7-инференса это продлевает жизнь карте.

  5. Не смешивайте вендоры в одном пайплайне. XTX + RTX в одной системе работают только как отдельные workload'ы (через HIP_VISIBLE_DEVICES / CUDA_VISIBLE_DEVICES). Для маршрутизации между картами разных вендоров смотрите GPUStack.

  6. Для 70B+ моделей планируйте две карты или рассматривайте профессиональные варианты (Radeon PRO W7900, 48 ГБ).

⚠️ Типичная ошибка: покупать XTX «на вырост» под обучение моделей. Для инференса карта отличная, но для fine-tuning AMD пока проигрывает — если дообучение в планах, сначала оцените, какие именно ядра вам нужны и протестируйте на конкретной модели.

Заключение

Radeon XTX в 2026 году — это рациональный выбор под локальные LLM для тех, кто ценит объём VRAM и цену больше, чем последние проценты скорости. RX 7900 XTX даёт ~75–80% производительности RTX 4090 на инференсе при цене на 40–50% ниже, а ROCm наконец созрел до уровня «поставил — работает». Для кодинга с локальным AI-ассистентом (модели до 32B) это одна из лучших покупок на рынке.

Ограничения реальные: Windows-поддержка слабее Linux, нет FP8, fine-tuning и часть кастомных инструментов экосистемы — прерогатива CUDA. Если ваш сценарий — продакшн-инференс с vLLM/TensorRT или дообучение моделей, NVIDIA всё ещё впереди. Но для повседневной работы кодера с локальной моделью XTX закрывает задачу и экономит сотни долларов.

И помните: железо ускоряет ответы, но качество результата зависит от выбора модели, промптов и инженерных решений вокруг них. Для продакшн-систем — от архитектуры до безопасности — стоит привлекать специалистов: это инвестиция, которая окупается снижением рисков на всех этапах.

Источники

Полезные ссылки на другие статьи блога

AI-Помощник