Блог AST-SoftPro
Sakana AI Fugu: мультиагентная оркестрация LLM как одна модель
22 июня 2026 года токийская лаборатория Sakana AI представила Sakana Fugu — систему, которая объединяет лучшие модели мира в один оркестр и выдаёт результат через единственный API-ёндпоинт.
Это не новая модель в традиционном смысле. Fugu — это обученный оркестратор, который динамически управляет пулом фронтенд-моделей (GPT 5.5, Claude Opus 4.8, Gemini 3.1 Pro и другими), распределяя задачи между ними и синтезируя ответы. Для разработчика это выглядит как вызов обычной LLM, но под капотом работает сложный многоагентный пайплайн.
Как работает Fugu
Архитектура Fugu основана на двух научных работах, принятых на конференцию ICLR 2026:
TRINITY — Evolved LLM Coordinator
TRINITY — это лёгкий координатор, который назначает роли моделям из доступного пула. Вместо ручного написания правил маршрутизации, координатор обучается эволюционной оптимизацией и находит эффективные стратегии координации. На момент публикации TRINITY установил новый рекорд на LiveCodeBench — 86.2% pass@1.
RL Conductor — оркестратор на 7 миллиардов параметров
Вторая работа представляет Conductor — модель на базе Qwen2.5-7B, обученную reinforcement learning (метод GRPO, 200 итераций). Conductor динамически:
- Разбивает сложные задачи на подзадачи
- Делегирует каждую подзадачу подходящей модели
- Проектирует коммуникационные топологии между агентами
- Генерирует кастомные инструкции для каждой модели в пуле
- Определяет, какой контекст передать каждому агенту
Ключевое отличие от ручных мультиагентных систем — оркестрация обучается, а не программируется. Conductor находит неочевидные, но эффективные паттерны сотрудничества между моделями.
Две модели — один API
Sakana Fugu доступен в двух вариантах:
| Модель | Назначение |
|---|---|
| Fugu | Баланс качества и низкой задержки для повседневных задач |
| Fugu Ultra | Максимальное качество для сложных многошаговых проблем |
Оба варианта доступны через один OpenAI-совместимый API на https://api.sakana.ai.
Результаты на бенчмарках
Fugu Ultra показывает результаты на уровне лучших单体 моделей:
- SWE-Bench Pro — 73.7 (на уровне Fable 5)
- LiveCodeBench — 93.2 (выше Fable 5 — 89.8)
- GPQA-Diamond — 95.5 (выше Mythos Preview — 94.6)
Это значит, что оркестратор превосходит отдельные модели, которые он координирует. Эффект синергии — главный инсайт Sakana AI.
Цена вопроса
Тарификация Fugu Ultra:
- $5.00 за 1 миллион input-токенов
- $30.00 за 1 миллион output-токенов
Важный нюанс: внутренние токены оркестрации (вызовы между моделями) также тарифицируются. Это значит, что реальная стоимость запроса может быть выше ожидаемой, особенно для сложных задач, где Fugu задействует несколько моделей.
С другой стороны, prompt caching снижает стоимость до 90% на повторяющихся контекстах.
Для кого Fugu
Подходит, если:
- Нужна фронтенд-качество без привязки к одному вендору
- Важна устойчивость к экспортным ограничениям (актуально после ограничений на Fable/Mythos)
- Сложные задачи, где одна модель не даёт оптимального результата
- Хотите упростить архитектуру — один API вместо рутины с роутингом
Не подходит, если:
- Бюджет ограничен — цена выше, чем прямые вызовы моделей
- Нужна предсказуемая задержка — оркестрация добавляет latency
- Простые задачи, где одна модель справляется отлично
- Требуется полная локальная обработка данных (GDPR-ограничения)
Как использовать
# Через Codex CLI
SAKANA_API_KEY=ваш_ключ codex -p fugu
# Через OpenAI-compatible API
curl https://api.sakana.ai/v1/chat/completions \
-H "Authorization: Bearer ваш_ключ" \
-H "Content-Type: application/json" \
-d '{
"model": "fugu-ultra",
"messages": [{"role": "user", "content": "ваш запрос"}]
}'API-ключ создаётся в Sakana Console. При создании ключа можно настроить custom model pool — выбрать, какие модели участвуют в оркестрации.
Локальные альтернативы
Прямого локального клона Fugu нет — это облачный сервис. Однако можно собрать подобную архитектуру самостоятельно:
| Инструмент | Роль | Локально? |
|---|---|---|
| LangGraph | Графовая оркестрация агентов | Да |
| Qwen2.5-7B/14B | Worker-модели через Ollama | Да |
| LiteLLM | Роутинг между провайдерами | Да |
| DSPy | Оптимизация промптов | Да |
| CrewAI | Мультиагентные фреймворки | Да |
Комбинация LangGraph + Qwen + Ollama — ближайший open-source аналог по архитектуре. Разница в том, что Fugu использует обученную через RL оркестрацию и доступ к пулу фронтенд-моделей.
Что дальше
Fugu — важный шаг в эволюции LLM-архитектур. Идея «мультиагентная система как одна модель» может стать новым стандартом, особенно если:
- Sakana AI откроет код Conductor (базовая модель Qwen2.5-7B уже open source)
- Появятся self-hosted версии оркестратора
- Сообщество обучит собственных conductor на локальных моделях
Пока же Fugu — это proof-of-concept того, что оркестрация может быть таким же valuable активом, как и доступ к мощным моделям. И это меняет правила игры.
Статья написана на основе официальных материалов Sakana AI, научных работ TRINITY и RL Conductor (ICLR 2026), а также обзоров сообщества.