Подписывайтесь:

Блог AST-SoftPro

Qwythos-9B: 9B модель с 1M контекстом и нативным вызовом инструментов

28.06.2026 7 мин чтения
Qwythos-9B: 9B модель с 1M контекстом и нативным вызовом инструментов

Qwythos-9B: 9B модель с 1M контекстом и нативным вызовом инструментов

Недавно компания Empero AI выпустила новую открытую модель Qwythos-9B-Claude-Mythos-5-1M, которая привлекает внимание благодаря своей способности работать с контекстом длиной до 1 048 576 токенов и поддержкой нативного вызова инструментов (tool calling). В этой статье мы рассмотрим детали этой модели, её возможности и способы развертывания.

Основные характеристики модели

Qwythos-9B — это полнопараметрическая модель рассуждений, созданная на основе глубоко нецензурированной базы Qwen3.5-9B и дообученная на более чем 500 миллионах токенов высококачественных трасс Claude Mythos и Claude Fable с цепочками рассуждений, сгенерированными внутренним инструментом Empero AI под названием rethink.

Ключевые возможности модели:

  • 🔭 1 048 576-токенный контекст — Qwythos поставляется с включенным по умолчанию масштабированием YaRN rope для полного контекстного окна в 1M токенов. Одно из самых длинных контекстных окон среди открытых моделей класса 9B, подходящее для анализа целых кодовых баз, многодокументальных исследований и длинных агентных траекторий.

  • 📈 Превосходство над базовой моделью — при сопоставимой оценке: +34 балла MMLU, +30 баллов gsm8k-strict, +19 баллов gsm8k-flex.

  • 🛠 Нативный вызов функций по спецификации Qwen3.5 — без дополнительных обёрток, без необходимости в специфичном для инструментов дообучении.

  • 🎯 Самокоррекция с инструментами — при наличии Python-исполнителя и инструмента веб-поиска Qwythos выдавал цитируемые, фактологически правильные ответы на 7 из 7 тестовых запросов, охватывающих математику, кибербезопасность, клиническую фармакологию и биохимию.

Область применения

Qwythos-9B предназначена не для обычного чат-общения. Она более подходит для:

  • Анализа длинных документов;

  • Чтения многофайловых кодовых баз;

  • Длинных агентных рабочих процессов;

  • Ответов на вопросы с использованием инструментов;

  • Задач, требующих Python-исполнителя или поискового инструмента для проверки;

  • Исследований, рассуждений, математики, кода и обработки технических документов;

  • Тестирования 1M контекста в локальных или частных развертываниях.

Модель намеренно нецензурирована. Она разработана для серьезного взаимодействия с технически сложными вопросами в области кибербезопасности, методологии red-teaming, биологии, фармакологии и клинической медицины — областях, где чрезмерно выровненные модели склонны отказываться, уходить в бесполезные оговорки или выдавать шаблонные предупреждения вместо содержательного ответа.

Развертывание с vLLM

Если вы привыкли к API, совместимым с OpenAI, vLLM — один из самых прямых вариантов.

Установка:

pip install vllm

Запуск модели:

vllm serve "empero-ai/Qwythos-9B-Claude-Mythos-5-1M"

Для явного запроса контекста, близкого к 1M, следуйте инструкции из карточки модели:

vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000

Вызов API:

curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "empero-ai/Qwythos-9B-Claude-Mythos-5-1M",
    "messages": [
      {
        "role": "user",
        "content": "What is the capital of France?"
      }
    ]
  }'

Если запуск не удался из-за недостатка VRAM, не начинайте с 1M. Сначала протестируйте меньшие значения --max-model-len, такие как 32k, 64k или 128k, а затем постепенно увеличивайте.

Развертывание с SGLang

SGLang также поддерживается в карточке модели.

Установка:

pip install sglang

Запуск:

python3 -m sglang.launch_server \
  --model-path "empero-ai/Qwythos-9B-Claude-Mythos-5-1M" \
  --host 0.0.0.0 \
  --port 30000

Для попытки длинного контекста:

SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server \
  --model-path empero-ai/Qwythos-9B-Claude-Mythos-5-1M \
  --context-length 1010000

Вызов:

curl -X POST "http://localhost:30000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "empero-ai/Qwythos-9B-Claude-Mythos-5-1M",
    "messages": [
      {
        "role": "user",
        "content": "What is the capital of France?"
      }
    ]
  }'

Использование с Transformers

Карточка модели также предоставляет примеры для Transformers:

import torch
from transformers import AutoModelForImageTextToText, AutoTokenizer

model_id = "empero-ai/Qwythos-9B-Claude-Mythos-5-1M"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
    model_id, dtype="bfloat16", device_map="auto"
)

messages = [
    {
        "role": "user",
        "content": "Explain how tool calling helps a reasoning model verify exact facts."
    }
]

text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt").to(model.device)

outputs = model.generate(**inputs, max_new_tokens=40)
print(tok.decode(outputs[0][inputs["input_ids"].shape[-1]:]))

Рекомендации по параметрам выборки

Модель карточки предоставляет параметры выборки: temperature=0.6, top_p=0.95, top_k=20.

Ограничения и границы безопасности

Qwythos-9B — это не обычная чат-модель. Это модель рассуждений. Её ответы сначала включают блок рассуждений <think></think>, а затем окончательный ответ. Если вы подключаете её к продукту, ориентированному на пользователя, вам нужно обработать или скрыть эту часть самостоятельно.

Полное контекстное окно в 1M токенов лучше подходит для настроек с тензорной параллельностью на нескольких GPU или агрессивного отключения KV-cache. Один высокопроизводительный GPU может быть более практичным при 256k до 512k, в зависимости от бэкенда, квантования, KV cache и VRAM.

Заключение

Qwythos-9B-Claude-Mythos-5-1M — это 9B модель рассуждений, выпущенная Empero AI, основанная на Qwen3.5-9B, которая фокусируется на 1M контексте, нативном вызове инструментов, длинных текстовых рассуждениях и лицензии Apache-2.0. Если вы ищете относительно небольшую открытую модель с длинным контекстом и вызовом инструментов, Qwythos-9B стоит рассмотреть.

AI-Помощник