Подписывайтесь:

Блог AST-SoftPro

T-Search от T-Tech: agentic retriever для многошагового поиска — обзор, архитектура, бенчмарки

19.07.2026 12 мин чтения
T-Search от T-Tech: agentic retriever для многошагового поиска — обзор, архитектура, бенчмарки

T-Search — open-source agentic retriever от T-Tech (AI-подразделение Т-Банка), построенный на Qwen3.6-35B-A3B для сложного многошагового поиска на русском и английском. Работает на одной GPU, лицензия Apache 2.0.


Что такое T-Search?

T-Search — это не поисковик для конечных пользователей и не SaaS-сервис. Это agentic retriever — специализированная ML-модель, которая планирует и выполняет поиск по корпусу документов в несколько шагов (multi-step search), собирает доказательства и возвращает ранжированный набор чанков для downstream-генератора.

Ключевые факты:

  • База: Qwen3.6-35B-A3B (Mixture-of-Experts, 35B параметров, 3B активных)
  • Языки: русский и английский
  • Лицензия: Apache 2.0 (полностью open-source)
  • Инференс: одна GPU (ранее требовался кластер из 16 GPU)
  • Тренировка: синтетические search-траектории + RL с recall-based rewards
  • Официальный harness: github.com/turbo-llm/t-search-harness

Модель доступна на HuggingFace:
- Основная: t-tech/T-Search
- Квантованная FP8: t-tech/T-Search-FP8
- Квантованная NVFP4: t-tech/T-Search-NVFP4
- Коллекция: huggingface.co/collections/t-tech/t-search


T-Tech: кто стоит за моделью

T-Tech (t-tech.dev) — AI/ML-подразделение Т-Банка (Т-Технологии), которое создаёт собственные ML-технологии, интегрирует их в продукты и делится с рынком.

Это не «дизайн-студия» — это команда ML-инженеров, работающих с полным спектром NLP-технологий: от регулярных выражений до собственных LLM. Среди их проектов:

  • Семантический поиск с биллионами документов
  • Автоматический контроль качества клиентского сервиса
  • Voice-аналитика (распознавание эмоций, возраста, интонации)
  • Инструменты для автоматического контроля качества

Пресс-релиз о T-Search опубликован 17 июля 2026 года на tbank.ru.


Архитектура: как работает agentic retriever

T-Search — не простой pipeline «embedding + reranker». Это настоящий агент, который планирует, выполняет и рефлексирует в нескольких раундах через ReAct loop.

Раундовый цикл

Модель работает в раундах с конфигурируемым search budget:

Запрос пользователя
       │
       ▼
┌──────────────────────────────┐
│  Round 1: ReAct Loop         │
│  ~32K token context budget   │
│  3 tool calls per step       │
│                              │
│  search_corpus()             │
│  save_and_advance()          │
│  finalize_ranking()          │
└──────────┬───────────────────┘
           │
           ▼
┌──────────────────────────────┐
│  Compact Memory Transfer     │
│  (только существенные чанки, │
│   coverage state, next steps)│
└──────────┬───────────────────┘
           │
           ▼
┌──────────────────────────────┐
│  Round 2: ReAct Loop         │
│  (повторяется до budget)     │
└──────────┬───────────────────┘
           │
           ▼
┌──────────────────────────────┐
│  Ranked Evidence Set         │
│  (для downstream генератора) │
└──────────────────────────────┘

Ключевые инструменты агента

Инструмент Назначение
search_corpus() Формулирует запрос, ищет по корпусу
save_and_advance() Сохраняет существенные доказательства, переходит к следующему шагу
finalize_ranking() Возвращает финальный ранжированный набор чанков

Compact memory transfer

Между раундами передаётся только компактная память: существенные чанки доказательств, состояние покрытия и следующие шаги. Полная история инструментов и шум отбрасываются. Это держит контекстное окно в пределах ~32K токенов на раунд (до 65K поддерживается в serving).

Масштабирование rollouts

Процесс можно настроить от «быстро и дёшево» (single rollout) до «максимальное качество» (multiple parallel rollouts + Reciprocal Rank Fusion):

  • Single rollout: базовый режим, один проход
  • 3 parallel rollouts + RRF: результат с 55.96 → 61.33 (по данным T-Tech)

Обучение: от синтетических данных к RL

T-Search обучался в два этапа на полностью синтетических search-траекториях, сгенерированных тем же harness, который используется при инференсе.

Этап 1: Supervised Fine-Tuning (SFT)

  • Синтетическая фабрика задач генерирует search-траектории
  • Модель обучается на этих траекториях через supervised fine-tuning
  • Закрытый цикл: тренировочный harness = инференс-харнесс

Этап 2: Reinforcement Learning

  • GSPO (Generalized Step-wise Preference Optimization)
  • Recall-based rewards — награда за качество recalled evidence
  • Это позволяет модели учиться не просто «следовать траектории», а максимизировать качество поиска

Синтетическая фабрика задач

Ключевая особенность: все обучающие данные — синтетические. Это решает проблему нехватки реальных search-траекторий с ground truth и позволяет масштабировать тренировку без ручного аннотирования.


Бенчмарки и результаты

T-Search оценивался на официальном T-Search harness по следующим датасетам:

Датасет Язык Описание
TRuST EN Truthful Search — проверка честности поиска
SynthComp EN/RU Синтетические составные задачи
BrowseComp EN Адаптированная версия бенчмарка
SealQA EN Адаптированная версия бенчмарка

Ключевые результаты

  • Single rollout T-Search уже превосходит несколько значительно более крупных моделей
  • 3 parallel rollouts + RRF: качество растёт с 55.96 → 61.33
  • Модель демонстрирует strong robustness при смене retriever-бэкендов (разные embedding-модели + опциональный LLM-reranker)
  • На общих бенчмарках (general-purpose) T-Tech не фиксирует заметных улучшений — специализация сфокусирована именно на retrieval agentics

Важно: T-Tech честно указывает, что на общих бенчмарках (общее понимание, код, математика) модель не показывает заметных улучнений относительно базовой Qwen3.6-35B-A3B. Это узкоспециализированная модель.


Экономика: почему это прорыв

Главное преимущество T-Search — соотношение цена/качество.

Параметр До T-Search С T-Search
GPU для инференса Кластер из 16 GPU 1 GPU
Активные параметры Все параметры модели ~3B из 35B (MoE)
Стоимость Высокая ~10x дешевле
Качество Базовое СOTA для open моделей

Архитектура Mixture-of-Experts (MoE) позволяет активировать только ~3 миллиарда параметров на токен, несмотря на 35 миллиардов общих. Это делает инференс сопоставимым по стоимости с 3B-моделью, но с качеством, близким к значительно более крупным моделям.


Практическое применение в RAG-системах

T-Search — это ретривер, а не генератор ответов. Он занимает место в RAG-пайплайне до генерации:

Query → T-Search (agentic retriever) → Ranked Evidence → LLM Generator → Answer

Кто может использовать

1. Разработчики RAG-систем

  • Замена простого embedding-based retriever на agentic retriever
  • Особенно эффективно для сложных вопросов, требующих multi-hop reasoning
  • Поддержка русского языка — редкое преимущество

2. Компании с русскоязычными данными

  • Большинство open-source retriever-ов оптимизированы под английский
  • T-Search обучен на EN + RU траекториях
  • Семантический поиск по русскоязычным корпусам

3. Исследователи

  • Open-source под Apache 2.0 — можно модифицировать
  • Синтетическая фабрика задач — воспроизводимая методология
  • Harness для оценки — готовый фреймворк

4. Стартапы с ограниченным бюджетом

  • Одна GPU вместо кластера
  • Квантованные версии (FP8, NVFP4) для ещё более дешёвого инференса

Конкретные use-кейсы

  • Юридический поиск — multi-step поиск по контрактам, нормативам
  • Медицинские базы знаний — составные запросы по симптомам и исследованиям
  • Корпоративная документация — поиск по внутренним базам с亿лионами документов
  • Финансовый анализ — составные запросы по отчётам и нормативам
  • Научные исследования — поиск по arXiv, PubMed с multi-hop reasoning

Как начать использовать

Установка harness

git clone https://github.com/turbo-llm/t-search-harness.git
cd t-search-harness
pip install -e .

Быстрый старт с Transformers

from transformers import pipeline

pipe = pipeline("text-generation", model="t-tech/T-Search")
messages = [
    {
        "role": "user",
        "content": "Как снизить операционные расходы на логистику?"
    }
]
result = pipe(messages)

Запуск через vLLM (OpenAI-compatible API)

# Установка
pip install vllm

# Запуск сервера
vllm serve "t-tech/T-Search"

# Запрос через curl
curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "t-tech/T-Search",
    "messages": [
      {"role": "user", "content": "Как снизить операционные расходы?"}
    ]
  }'

Запуск через SGLang (для production)

python3 -m sglang.launch_server \
    --model-path "t-tech/T-Search" \
    --host 0.0.0.0 \
    --port 30000

Docker

docker model run hf.co/t-tech/T-Search

Использование в T-Search Harness

from t_search_harness import AgentConfig

config = AgentConfig(model="t-tech/T-Search")
# Запуск agentic search с корпусом документов

Сравнение с аналогами

Критерий T-Search OpenAI DeepResearch Gemini DeepResearch Step-DeepResearch
Тип Agentic retriever End-to-end agent End-to-end agent End-to-end agent
Open-source Да (Apache 2.0) Нет Нет Да
Языки EN + RU EN EN EN
GPU 1 GPU Cloud API Cloud API ~32B dense
Стоимость Низкая Подписка Подписка Средняя
Специализация Retrieval только Полный цикл Полный цикл Полный цикл
Базовая модель Qwen3.6-35B-A3B (MoE) Proprietary Proprietary 32B dense

Важно: T-Search — это retriever, а не end-to-end agent. Он собирает доказательства, но не генерирует финальный ответ. Для генерации нужен downstream LLM. Это делает его модульным компонентом, а не самостоятельным продуктом.


Что НЕ делает T-Search

Чтобы избежать путаницы (как в предыдущей версии этой статьи):

  • Не является поисковиком для конечных пользователей
  • Не имеет API для интеграции с CRM/ERP
  • Не генерирует ответы — только собирает доказательства
  • Не является SaaS-сервисом — это ML-модель, которую нужно запускать самостоятельно
  • Не превосходит базовую модель на общих задачах (код, математика, общие знания)

Заключение

T-Search от T-Tech — это open-source agentic retriever, который доказывает: специализированное обучение + умный выбор архитектуры (MoE) дают лучшие результаты, чем простое масштабирование модели.

Ключевые выводы:

  1. Качество retrieval на уровне SOTA для open моделей
  2. Стоимость в ~10 раз ниже (одна GPU вместо кластера)
  3. Русский язык — редкое преимущество среди open retriever-ов
  4. Модульность — компонент для RAG-пайплайнов, не самостоятельный продукт
  5. Полная открытость — Apache 2.0, harness, датасеты, модель

Для разработчиков RAG-систем, особенно работающих с русскоязычными данными, T-Search — один из самых значимых open-source релизов 2026 года.


Источники


Статья подготовлена на основе открытых источников: пресс-релиза T-Tech, модельной карточки на HuggingFace, официального T-Search Harness на GitHub и публикации на quasa.io. Все технические детали проверены по первоисточникам.

AI-Помощник