Блог AST-SoftPro
T-Search от T-Tech: agentic retriever для многошагового поиска — обзор, архитектура, бенчмарки
T-Search — open-source agentic retriever от T-Tech (AI-подразделение Т-Банка), построенный на Qwen3.6-35B-A3B для сложного многошагового поиска на русском и английском. Работает на одной GPU, лицензия Apache 2.0.
Что такое T-Search?
T-Search — это не поисковик для конечных пользователей и не SaaS-сервис. Это agentic retriever — специализированная ML-модель, которая планирует и выполняет поиск по корпусу документов в несколько шагов (multi-step search), собирает доказательства и возвращает ранжированный набор чанков для downstream-генератора.
Ключевые факты:
- База: Qwen3.6-35B-A3B (Mixture-of-Experts, 35B параметров, 3B активных)
- Языки: русский и английский
- Лицензия: Apache 2.0 (полностью open-source)
- Инференс: одна GPU (ранее требовался кластер из 16 GPU)
- Тренировка: синтетические search-траектории + RL с recall-based rewards
- Официальный harness: github.com/turbo-llm/t-search-harness
Модель доступна на HuggingFace:
- Основная: t-tech/T-Search
- Квантованная FP8: t-tech/T-Search-FP8
- Квантованная NVFP4: t-tech/T-Search-NVFP4
- Коллекция: huggingface.co/collections/t-tech/t-search
T-Tech: кто стоит за моделью
T-Tech (t-tech.dev) — AI/ML-подразделение Т-Банка (Т-Технологии), которое создаёт собственные ML-технологии, интегрирует их в продукты и делится с рынком.
Это не «дизайн-студия» — это команда ML-инженеров, работающих с полным спектром NLP-технологий: от регулярных выражений до собственных LLM. Среди их проектов:
- Семантический поиск с биллионами документов
- Автоматический контроль качества клиентского сервиса
- Voice-аналитика (распознавание эмоций, возраста, интонации)
- Инструменты для автоматического контроля качества
Пресс-релиз о T-Search опубликован 17 июля 2026 года на tbank.ru.
Архитектура: как работает agentic retriever
T-Search — не простой pipeline «embedding + reranker». Это настоящий агент, который планирует, выполняет и рефлексирует в нескольких раундах через ReAct loop.
Раундовый цикл
Модель работает в раундах с конфигурируемым search budget:
Запрос пользователя
│
▼
┌──────────────────────────────┐
│ Round 1: ReAct Loop │
│ ~32K token context budget │
│ 3 tool calls per step │
│ │
│ search_corpus() │
│ save_and_advance() │
│ finalize_ranking() │
└──────────┬───────────────────┘
│
▼
┌──────────────────────────────┐
│ Compact Memory Transfer │
│ (только существенные чанки, │
│ coverage state, next steps)│
└──────────┬───────────────────┘
│
▼
┌──────────────────────────────┐
│ Round 2: ReAct Loop │
│ (повторяется до budget) │
└──────────┬───────────────────┘
│
▼
┌──────────────────────────────┐
│ Ranked Evidence Set │
│ (для downstream генератора) │
└──────────────────────────────┘
Ключевые инструменты агента
| Инструмент | Назначение |
|---|---|
| search_corpus() | Формулирует запрос, ищет по корпусу |
| save_and_advance() | Сохраняет существенные доказательства, переходит к следующему шагу |
| finalize_ranking() | Возвращает финальный ранжированный набор чанков |
Compact memory transfer
Между раундами передаётся только компактная память: существенные чанки доказательств, состояние покрытия и следующие шаги. Полная история инструментов и шум отбрасываются. Это держит контекстное окно в пределах ~32K токенов на раунд (до 65K поддерживается в serving).
Масштабирование rollouts
Процесс можно настроить от «быстро и дёшево» (single rollout) до «максимальное качество» (multiple parallel rollouts + Reciprocal Rank Fusion):
- Single rollout: базовый режим, один проход
- 3 parallel rollouts + RRF: результат с 55.96 → 61.33 (по данным T-Tech)
Обучение: от синтетических данных к RL
T-Search обучался в два этапа на полностью синтетических search-траекториях, сгенерированных тем же harness, который используется при инференсе.
Этап 1: Supervised Fine-Tuning (SFT)
- Синтетическая фабрика задач генерирует search-траектории
- Модель обучается на этих траекториях через supervised fine-tuning
- Закрытый цикл: тренировочный harness = инференс-харнесс
Этап 2: Reinforcement Learning
- GSPO (Generalized Step-wise Preference Optimization)
- Recall-based rewards — награда за качество recalled evidence
- Это позволяет модели учиться не просто «следовать траектории», а максимизировать качество поиска
Синтетическая фабрика задач
Ключевая особенность: все обучающие данные — синтетические. Это решает проблему нехватки реальных search-траекторий с ground truth и позволяет масштабировать тренировку без ручного аннотирования.
Бенчмарки и результаты
T-Search оценивался на официальном T-Search harness по следующим датасетам:
| Датасет | Язык | Описание |
|---|---|---|
| TRuST | EN | Truthful Search — проверка честности поиска |
| SynthComp | EN/RU | Синтетические составные задачи |
| BrowseComp | EN | Адаптированная версия бенчмарка |
| SealQA | EN | Адаптированная версия бенчмарка |
Ключевые результаты
- Single rollout T-Search уже превосходит несколько значительно более крупных моделей
- 3 parallel rollouts + RRF: качество растёт с 55.96 → 61.33
- Модель демонстрирует strong robustness при смене retriever-бэкендов (разные embedding-модели + опциональный LLM-reranker)
- На общих бенчмарках (general-purpose) T-Tech не фиксирует заметных улучшений — специализация сфокусирована именно на retrieval agentics
Важно: T-Tech честно указывает, что на общих бенчмарках (общее понимание, код, математика) модель не показывает заметных улучнений относительно базовой Qwen3.6-35B-A3B. Это узкоспециализированная модель.
Экономика: почему это прорыв
Главное преимущество T-Search — соотношение цена/качество.
| Параметр | До T-Search | С T-Search |
|---|---|---|
| GPU для инференса | Кластер из 16 GPU | 1 GPU |
| Активные параметры | Все параметры модели | ~3B из 35B (MoE) |
| Стоимость | Высокая | ~10x дешевле |
| Качество | Базовое | СOTA для open моделей |
Архитектура Mixture-of-Experts (MoE) позволяет активировать только ~3 миллиарда параметров на токен, несмотря на 35 миллиардов общих. Это делает инференс сопоставимым по стоимости с 3B-моделью, но с качеством, близким к значительно более крупным моделям.
Практическое применение в RAG-системах
T-Search — это ретривер, а не генератор ответов. Он занимает место в RAG-пайплайне до генерации:
Query → T-Search (agentic retriever) → Ranked Evidence → LLM Generator → Answer
Кто может использовать
1. Разработчики RAG-систем
- Замена простого embedding-based retriever на agentic retriever
- Особенно эффективно для сложных вопросов, требующих multi-hop reasoning
- Поддержка русского языка — редкое преимущество
2. Компании с русскоязычными данными
- Большинство open-source retriever-ов оптимизированы под английский
- T-Search обучен на EN + RU траекториях
- Семантический поиск по русскоязычным корпусам
3. Исследователи
- Open-source под Apache 2.0 — можно модифицировать
- Синтетическая фабрика задач — воспроизводимая методология
- Harness для оценки — готовый фреймворк
4. Стартапы с ограниченным бюджетом
- Одна GPU вместо кластера
- Квантованные версии (FP8, NVFP4) для ещё более дешёвого инференса
Конкретные use-кейсы
- Юридический поиск — multi-step поиск по контрактам, нормативам
- Медицинские базы знаний — составные запросы по симптомам и исследованиям
- Корпоративная документация — поиск по внутренним базам с亿лионами документов
- Финансовый анализ — составные запросы по отчётам и нормативам
- Научные исследования — поиск по arXiv, PubMed с multi-hop reasoning
Как начать использовать
Установка harness
git clone https://github.com/turbo-llm/t-search-harness.git cd t-search-harness pip install -e .
Быстрый старт с Transformers
from transformers import pipeline
pipe = pipeline("text-generation", model="t-tech/T-Search")
messages = [
{
"role": "user",
"content": "Как снизить операционные расходы на логистику?"
}
]
result = pipe(messages)
Запуск через vLLM (OpenAI-compatible API)
# Установка
pip install vllm
# Запуск сервера
vllm serve "t-tech/T-Search"
# Запрос через curl
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
-d '{
"model": "t-tech/T-Search",
"messages": [
{"role": "user", "content": "Как снизить операционные расходы?"}
]
}'
Запуск через SGLang (для production)
python3 -m sglang.launch_server \
--model-path "t-tech/T-Search" \
--host 0.0.0.0 \
--port 30000
Docker
docker model run hf.co/t-tech/T-Search
Использование в T-Search Harness
from t_search_harness import AgentConfig config = AgentConfig(model="t-tech/T-Search") # Запуск agentic search с корпусом документов
Сравнение с аналогами
| Критерий | T-Search | OpenAI DeepResearch | Gemini DeepResearch | Step-DeepResearch |
|---|---|---|---|---|
| Тип | Agentic retriever | End-to-end agent | End-to-end agent | End-to-end agent |
| Open-source | Да (Apache 2.0) | Нет | Нет | Да |
| Языки | EN + RU | EN | EN | EN |
| GPU | 1 GPU | Cloud API | Cloud API | ~32B dense |
| Стоимость | Низкая | Подписка | Подписка | Средняя |
| Специализация | Retrieval только | Полный цикл | Полный цикл | Полный цикл |
| Базовая модель | Qwen3.6-35B-A3B (MoE) | Proprietary | Proprietary | 32B dense |
Важно: T-Search — это retriever, а не end-to-end agent. Он собирает доказательства, но не генерирует финальный ответ. Для генерации нужен downstream LLM. Это делает его модульным компонентом, а не самостоятельным продуктом.
Что НЕ делает T-Search
Чтобы избежать путаницы (как в предыдущей версии этой статьи):
- Не является поисковиком для конечных пользователей
- Не имеет API для интеграции с CRM/ERP
- Не генерирует ответы — только собирает доказательства
- Не является SaaS-сервисом — это ML-модель, которую нужно запускать самостоятельно
- Не превосходит базовую модель на общих задачах (код, математика, общие знания)
Заключение
T-Search от T-Tech — это open-source agentic retriever, который доказывает: специализированное обучение + умный выбор архитектуры (MoE) дают лучшие результаты, чем простое масштабирование модели.
Ключевые выводы:
- Качество retrieval на уровне SOTA для open моделей
- Стоимость в ~10 раз ниже (одна GPU вместо кластера)
- Русский язык — редкое преимущество среди open retriever-ов
- Модульность — компонент для RAG-пайплайнов, не самостоятельный продукт
- Полная открытость — Apache 2.0, harness, датасеты, модель
Для разработчиков RAG-систем, особенно работающих с русскоязычными данными, T-Search — один из самых значимых open-source релизов 2026 года.
Источники
- Пресс-релиз T-Search на tbank.ru — официальное объявление от 17 июля 2026
- t-tech/T-Search на HuggingFace — модельная карточка с деталями архитектуры и обучения
- T-Search Collection на HuggingFace — коллекция всех версий модели
- T-Search Harness на GitHub — официальный inference framework
- t-tech.dev/technologies — страница технологий T-Tech
- Quasa: T-Tech Open-Sources T-Search — обзор с деталями бенчмарков
- Qwen3.6-35B-A3B на qwen.ai — базовая модель
Статья подготовлена на основе открытых источников: пресс-релиза T-Tech, модельной карточки на HuggingFace, официального T-Search Harness на GitHub и публикации на quasa.io. Все технические детали проверены по первоисточникам.