Блог AST-SoftPro
Qwythos-9B: 9B модель с 1M контекстом и нативным вызовом инструментов
Qwythos-9B: 9B модель с 1M контекстом и нативным вызовом инструментов
Недавно компания Empero AI выпустила новую открытую модель Qwythos-9B-Claude-Mythos-5-1M, которая привлекает внимание благодаря своей способности работать с контекстом длиной до 1 048 576 токенов и поддержкой нативного вызова инструментов (tool calling). В этой статье мы рассмотрим детали этой модели, её возможности и способы развертывания.
Основные характеристики модели
Qwythos-9B — это полнопараметрическая модель рассуждений, созданная на основе глубоко нецензурированной базы Qwen3.5-9B и дообученная на более чем 500 миллионах токенов высококачественных трасс Claude Mythos и Claude Fable с цепочками рассуждений, сгенерированными внутренним инструментом Empero AI под названием rethink.
Ключевые возможности модели:
-
🔭 1 048 576-токенный контекст — Qwythos поставляется с включенным по умолчанию масштабированием YaRN rope для полного контекстного окна в 1M токенов. Одно из самых длинных контекстных окон среди открытых моделей класса 9B, подходящее для анализа целых кодовых баз, многодокументальных исследований и длинных агентных траекторий.
-
📈 Превосходство над базовой моделью — при сопоставимой оценке: +34 балла MMLU, +30 баллов gsm8k-strict, +19 баллов gsm8k-flex.
-
🛠 Нативный вызов функций по спецификации Qwen3.5 — без дополнительных обёрток, без необходимости в специфичном для инструментов дообучении.
-
🎯 Самокоррекция с инструментами — при наличии Python-исполнителя и инструмента веб-поиска Qwythos выдавал цитируемые, фактологически правильные ответы на 7 из 7 тестовых запросов, охватывающих математику, кибербезопасность, клиническую фармакологию и биохимию.
Область применения
Qwythos-9B предназначена не для обычного чат-общения. Она более подходит для:
-
Анализа длинных документов;
-
Чтения многофайловых кодовых баз;
-
Длинных агентных рабочих процессов;
-
Ответов на вопросы с использованием инструментов;
-
Задач, требующих Python-исполнителя или поискового инструмента для проверки;
-
Исследований, рассуждений, математики, кода и обработки технических документов;
-
Тестирования 1M контекста в локальных или частных развертываниях.
Модель намеренно нецензурирована. Она разработана для серьезного взаимодействия с технически сложными вопросами в области кибербезопасности, методологии red-teaming, биологии, фармакологии и клинической медицины — областях, где чрезмерно выровненные модели склонны отказываться, уходить в бесполезные оговорки или выдавать шаблонные предупреждения вместо содержательного ответа.
Развертывание с vLLM
Если вы привыкли к API, совместимым с OpenAI, vLLM — один из самых прямых вариантов.
Установка:
pip install vllm
Запуск модели:
vllm serve "empero-ai/Qwythos-9B-Claude-Mythos-5-1M"
Для явного запроса контекста, близкого к 1M, следуйте инструкции из карточки модели:
vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000
Вызов API:
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "empero-ai/Qwythos-9B-Claude-Mythos-5-1M",
"messages": [
{
"role": "user",
"content": "What is the capital of France?"
}
]
}'
Если запуск не удался из-за недостатка VRAM, не начинайте с 1M. Сначала протестируйте меньшие значения --max-model-len, такие как 32k, 64k или 128k, а затем постепенно увеличивайте.
Развертывание с SGLang
SGLang также поддерживается в карточке модели.
Установка:
pip install sglang
Запуск:
python3 -m sglang.launch_server \
--model-path "empero-ai/Qwythos-9B-Claude-Mythos-5-1M" \
--host 0.0.0.0 \
--port 30000
Для попытки длинного контекста:
SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server \
--model-path empero-ai/Qwythos-9B-Claude-Mythos-5-1M \
--context-length 1010000
Вызов:
curl -X POST "http://localhost:30000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "empero-ai/Qwythos-9B-Claude-Mythos-5-1M",
"messages": [
{
"role": "user",
"content": "What is the capital of France?"
}
]
}'
Использование с Transformers
Карточка модели также предоставляет примеры для Transformers:
import torch
from transformers import AutoModelForImageTextToText, AutoTokenizer
model_id = "empero-ai/Qwythos-9B-Claude-Mythos-5-1M"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
model_id, dtype="bfloat16", device_map="auto"
)
messages = [
{
"role": "user",
"content": "Explain how tool calling helps a reasoning model verify exact facts."
}
]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=40)
print(tok.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
Рекомендации по параметрам выборки
Модель карточки предоставляет параметры выборки: temperature=0.6, top_p=0.95, top_k=20.
Ограничения и границы безопасности
Qwythos-9B — это не обычная чат-модель. Это модель рассуждений. Её ответы сначала включают блок рассуждений <think></think>, а затем окончательный ответ. Если вы подключаете её к продукту, ориентированному на пользователя, вам нужно обработать или скрыть эту часть самостоятельно.
Полное контекстное окно в 1M токенов лучше подходит для настроек с тензорной параллельностью на нескольких GPU или агрессивного отключения KV-cache. Один высокопроизводительный GPU может быть более практичным при 256k до 512k, в зависимости от бэкенда, квантования, KV cache и VRAM.
Заключение
Qwythos-9B-Claude-Mythos-5-1M — это 9B модель рассуждений, выпущенная Empero AI, основанная на Qwen3.5-9B, которая фокусируется на 1M контексте, нативном вызове инструментов, длинных текстовых рассуждениях и лицензии Apache-2.0. Если вы ищете относительно небольшую открытую модель с длинным контекстом и вызовом инструментов, Qwythos-9B стоит рассмотреть.