Блог AST-SoftPro
TrueForge: открытый агентный рантайм от TrueFoundry — обзор, история и сравнение с аналогами
Введение
В августе 2026 года рынок ИИ-агентов пережил настоящую гонку агентных рантаймов. Сначала DeepSeek выпустила свой «всё-плагин» рантайм dsh, который за два дня собрал 95 000 звёзд на GitHub. Через шесть дней после этого, 19 августа, калифорнийская инфраструктурная компания TrueFoundry открыла исходный код TrueForge: агентного harness (рантайм-слоя), который превращает любую LLM в работающего агента. Проект распространяется под MIT-лицензией, работает с моделями любого провайдера и позиционируется как «drop-in» альтернатива закрытому Claude Managed Agents от Anthropic — но на вашей собственной инфраструктуре и при существенно меньших затратах.
Почему это важно для практикующего разработчика? Потому что стоимость запуска агента в продакшене давно определяется не ценой модели, а тем, сколько токенов сжигает сам цикл выполнения: каждый вызов инструмента возвращает растущий контекст обратно в модель. TrueForge заявляет, что при той же точности тратит на 30% меньше денег, чем Claude Managed Agents на Opus 4.8, и примерно в 2,5 раза меньше, чем open-source deepagents от LangChain. Разберём, что это за проект, как он устроен, что умеет, где его слабые места — и как он соотносится с другими агентными рантаймами: Claude Managed Agents, DeepSeek Harness (dsh), OpenClaw и deepagents.
Что такое agent harness и зачем он нужен
Агентный harness (обвязка) — это слой между моделью и внешним миром, который управляет всем, что происходит вокруг самого вызова LLM: циклом tool-calling, состоянием сессии, контекстом, песочницей для выполнения кода, правами на инструменты и интерфейсом. Модель сама по себе умеет только генерировать текст; чтобы она стала агентом — читала файлы, запускала команды, ходила в CRM и Jira, — нужен именно этот runtime.
Проблема в том, что «построить агента» и «запустить его хорошо» — разные вещи. Первый рабочий прототип собирается за вечер: модель + несколько инструментов + цикл вызовов. Но для продакшена нужны стриминг ответов, персистентность сессий, авторизация к инструментам (MCP-серверы часто требуют OAuth), изоляция выполнения кода, точки человеческого одобрения опасных действий, управление контекстом на длинных задачах и UI. Каждый из этих компонентов — недели работы, а ошибки в них стоят денег: раздутый контекст умножает стоимость каждого шага, а пропущенная проверка прав — потенциальная утечка данных.
TrueForge берёт этот слой на себя и отдаёт его тремя способами: готовый чат-интерфейс (Chat UI), HTTP API с TypeScript SDK (@truefoundry/trueforge-sdk) для автоматизации и встраиваемый UI SDK (@truefoundry/trueforge-ui), если агент нужно встроить в собственный продукт.
История проекта: от внутреннего рантайма к open source
TrueFoundry — стартап из Сан-Франциско, основанный в 2021 году инженерами, пришедшими из Meta[^1] и Google; компания строит enterprise-платформу для инфраструктуры ИИ (AI Gateway, MCP Gateway, управление моделями). TrueForge — это тот самый агентный рантайм, который команда TrueFoundry сама использовала для построения и запуска собственных агентов общего назначения. 19 августа 2026 года проект был открыт: код опубликован на GitHub под MIT-лицензией, пакеты выложены в npm (@truefoundry/trueforge, @truefoundry/trueforge-sdk, @truefoundry/trueforge-ui, @truefoundry/trueforge-core), документация живёт на trueforge.dev.
Мотивация открытий сформулирована прямо: «агентный harness должен быть открытым». Аргумент компании — привязка к провайдеру модели должна заканчиваться: модель должна оставаться заменяемой, а рантайм, который управляет её поведением, не должен становиться новым вендорским заложником. Для enterprise-команд это означает возможность self-host'ить рантайм в своём облаке или on-prem, подключить любую модель через OpenAI-совместимый endpoint и при этом не терять управление (governance) над инструментами.
К моменту публикации (конец августа 2026) репозиторий набрал порядка 1,6 тысячи звёзд GitHub и 77 форков — скромно по сравнению с dsh от DeepSeek (95 тысяч звёзд за два дня), но проект только стартует: TrueFoundry анонсировала хакатон «The Agent Harness Hackathon» на 24–30 августа 2026 года, что говорит о планах активно растить комьюнити.
⚠️ Важно понимать: звёзды GitHub — не единственный показатель зрелости. TrueForge — ранний проект (менее месяца с момента релиза), и API ещё может меняться. Для критичных задач стоит оценивать его как перспективную альтернативу, а не как устоявшуюся платформу.
Архитектура: что внутри TrueForge
TrueForge выполняет агентный цикл за вас: вызовы модели, MCP-инструменты, скиллы, песочница, одобрения, управление контекстом и состояние сессий. Ключевые компоненты:
Каталоги ресурсов (initial setup from catalogs). Модели, MCP-серверы, скиллы и песочницу конфигурируют один раз — через поставляемые YAML-каталоги, которые можно кастомизировать. Агенты затем выбирают из подключённого пула: вы не описываете инструменты заново для каждого агента.
Модели любого провайдера. OpenAI, Anthropic, Google Gemini и другие каталожные провайдеры — или любой OpenAI-совместимый endpoint. Это и есть суть «vendor-neutral»: тот же агентный код работает с Opus 4.8, GLM-5.2 или вашей локальной моделью через Ollama/vLLM.
MCP-инструменты. Подключение удалённых MCP-серверов с header-авторизацией или OAuth, включая авторизацию прямо в чате (in-chat authorization) — пользователь одобряет доступ к инструменту не выходя из диалога.
Скиллы (skills registry). Версионируемые пакеты инструкций SKILL.md на базе git, загружаемые в песочницу по требованию. Это тот же паттерн, что и в Claude Code: знания о том, как выполнять класс задач, отделяются от модели и обновляются без переобучения.
Песочница как инструмент (sandbox as a tool). Изолированное выполнение кода и файловых операций — сегодня на базе Daytona, планируется больше провайдеров. Песочница provision-ится только когда нужна, а секреты остаются в harness — модель их не видит.
Человеческие контрольные точки. Одобрение вызова инструментов (tool approval), запросы вопросов у пользователя и Generative UI прямо в чате. Для enterprise это ключевая фича: агент может действовать автономно, но опасные операции проходят через человека.
Инженерия контекста. Субагенты, отложенная загрузка инструментов (deferred tool loading), Code Mode, выгрузка больших результатов (large-result offloading) и компакция истории — набор техник, которые напрямую влияют на стоимость запуска (о них ниже в разделе про бенчмарки).
Два режима работы:
| Режим | Для кого | Хранилище | Дополнительная инфраструктура | Запуск |
|---|---|---|---|---|
| Local | Личное использование, знакомство с проектом | SQLite (один процесс) | Нет | npx @truefoundry/trueforge |
| Hosted | Команды, несколько реплик | Postgres + Redis | Postgres + Redis | Docker Compose или Helm |
Разработчики прямо предупреждают: local mode — только для localhost. По умолчанию там нет логина, данные лежат в локальном SQLite-файле; выставлять его в интернет нельзя. Для совместной или продакшен-развёртывания — hosted mode с опциональным OIDC-логингом.
Возможности: от quickstart до production
Быстрый старт выглядит так: запустить TrueForge (локально, через Docker Compose или Kubernetes), подключить модель и инструменты, собрать первого переиспользуемого агента — всё описано в Quickstart на trueforge.dev. Для автоматизации доступен TypeScript SDK: сессии, ходы (turns) и события — стандартный событийный интерфейс, позволяющий строить свои оркестрации поверх рантайма.
Для enterprise-сценариев TrueForge интегрируется с AI Gateway от TrueFoundry: централизованный доступ к моделям, MCP-governance, бюджеты, учётные данные и observability по всему стеку. То есть open-source ядро можно обернуть в коммерческий контур управления — типичная open-core модель.
💡 Практический совет: если вы оцениваете TrueForge для команды, начните с local mode на одной машине (
npx @truefoundry/trueforge) и воспроизведите бенчмарк из папкиbenchmark/в репозитории — он открыт вместе с датасетом. Это самый честный способ проверить цифры «30% дешевле» на ваших собственных задачах, а не на маркетинговых слайдах.
Бенчмарки: 30–75% дешевле при той же точности
TrueFoundry опубликовала сравнение TrueForge с двумя альтернативами — закрытым Claude Managed Agents и open-source deepagents (на LangGraph) — на одних и тех же задачах, инструментах и модели. Методология: 14 enterprise-задач уровня L1–L2 из Enterprise-Bench от DevRev — кросс-системные операции, похожие на реальную B2B работу (инженерия, продажи, поддержка), где агент должен стыковать данные трёх MCP-серверов: CRM в стиле Salesforce, трекер задач в стиле Jira и документохранилище в стиле Drive.
Каждый harness запускался с одной моделью, одними тремя MCP-серверами и одним системным промптом; каждая задача — в свежей сессии, n = 3 повторения, отчёт по среднему. Ответы оценивал независимый LLM-judge, который видел только критерии задачи и ответ — но не знал, какой harness его сгенерировал; задача засчитывается только если выполнены все критерии.
| Конфигурация | Решено из 14 | $ за запуск | Токенов за запуск |
|---|---|---|---|
| Claude Managed Agents · Opus 4.8 | 10,7 | $11,8 | 10,0M |
| TrueForge · Opus 4.8 | 10,7 | $8,6 | 3,7M |
| TrueForge · GLM-5.2 | 11,7 | $3,0 | 3,8M |
| deepagents · Opus 4.8 | 10,0 | $21,2 | 16,5M |
| deepagents · GLM-5.2 | 12,0 | $9,1 | 11,9M |
Итог: при той же модели (Opus 4.8) TrueForge решает столько же задач, что и Claude Managed Agents (10,7 из 14), но стоит на ~30% дешевле ($8,6 против $11,8). На открытой модели GLM-5.2 от Z.ai TrueForge даже чуть точнее (11,7) при цене в ~$3 — это и есть заявленные «до 75% дешевле». deepagents на той же задаче сжигает втрое больше токенов (16,5M против 3,7M у TrueForge).
Почему разница такая? Основная стоимость агентного запуска — не финальный ответ, а сам цикл: каждый round-trip инструмента отправляет растущий контекст обратно в модель. TrueForge держит цикл компактным:
-
Компактный контекст на каждом ходу. Цикл управляется короткой инструкцией, а не тяжёлым scaffolding'ом; deepagents при этом тащит планирование, виртуальную файловую систему и механизм субагентов на каждом шаге.
-
Меньше вызовов инструментов. TrueForge спланировал минимум вызовов из трёх участников — 19 на задачу против 32 и 40.
-
Компакция вместо реплея. История обрезается, большие ответы инструментов выгружаются наружу; deepagents же перечитывает накопленный контекст шаг за шагом — так он доходит до тройного-четверного объёма токенов на той же задаче.
⚠️ Критически важно: это бенчмарк, проведённый самим производителем TrueForge. Методология прозрачная (датасет Enterprise-Bench открыт, kit для воспроизведения лежит в
benchmark/), но выбор задач — тоже его выбор. Перед принятием решения о внедрении стоит прогнать свой собственный набор задач: если ваши агенты делают не кросс-системные B2B-операции, а, скажем, рефакторинг кода или работу с базой данных, расклад по стоимости может отличаться.
Сравнение с аналогами
Август 2026 года стал «месяцем агентного harness»: за две недели вышло сразу несколько заметных рантаймов. Разберём главное отличие каждого — и когда какой инструмент имеет смысл выбирать.
| Критерий | TrueForge | Claude Managed Agents | DeepSeek Harness (dsh) | OpenClaw | deepagents (LangChain) |
|---|---|---|---|---|---|
| Тип | Open-source harness, MIT | Закрытый managed-сервис Anthropic | Open-source harness, «всё — плагин» | Open-source личный агент-ассистент | Open-source фреймворк (LangGraph) |
| Модельная привязка | Нет: любой провайдер / OpenAI-compatible endpoint | Только Claude | Гибкая (плагинная модель) | Любая (GPT, Claude, Gemini, локальные через Ollama) | Любая, но в экосистеме LangChain |
| Инфраструктура | Своя: SQLite (local) или Postgres+Redis (hosted), Docker/Helm | Облако Anthropic (public beta) | Своя | Своя (локальная машина) | Своя |
| Governance / enterprise | Централизованный auth, OAuth в чате, логирование и policy-check каждого вызова инструмента; интеграция с AI Gateway TrueFoundry | Встроенный managed-контур Anthropic | Плагинная система из 9 категорий | Ориентация на личного ассистента (мессенджеры: Telegram, WhatsApp и др.) | Библиотечный уровень — governance строите сами |
| UI | Чат-UI + embeddable UI SDK + TS SDK | API /v1/agents (beta) |
Свой интерфейс | Мессенджерные интерфейсы | Нет «из коробки» — свой фронтенд |
| Ключевое преимущество | Vendor-neutral, self-host, заявленная экономия 30–75% по стоимости за запуска | Минимум усилий: инфраструктуру держит Anthropic | Экстремальная расширяемость (9 категорий плагинов), взрывной рост комьюнити (95k звёзд за 2 дня) | Личный автономный ассистент с доступом к мессенджерам и устройствам | Гибкость LangGraph для сложных графов агентов |
| Ключевой риск | Молодой проект (~1 месяц), API может меняться | Привязка к Anthropic, стоимость managed-сервиса | Очень быстрый темп изменений, сложность экосистемы плагинов | Безопасность: агент с доступом к вашим устройствам и мессенджерам требует строгого контроля | Сложность настройки, высокий расход токенов (по бенчмаркам выше) |
Claude Managed Agents — это managed-инфраструктура Anthropic для продакшен-агентов на базе Claude: sandboxing, управление состоянием и выполнение инструментов держит сам провайдер. Запущена в апреле 2026 года (public beta, endpoint /v1/agents). Сильная сторона — «ничего не строить»: слабая — привязка к моделям Anthropic и стоимость. TrueForge целится именно сюда: тот же класс задач, но на вашей инфраструктуре и с любой моделью.
DeepSeek Harness (dsh) — ближайший по духу конкурент: open-source рантайм, где буквально всё является плагином (9 категорий), 4 режима работы и append-only лог. Мы уже разбирали его в статье «DeepSeek Harness: обзор агентного рантайма, где всё — плагин». Разница с TrueForge: dsh делает ставку на экстремальную расширяемость и собрал огромное комьюнити за считанные дни; TrueForge — на enterprise-governance (policy-check каждого вызова инструмента, централизованный auth) и измеримую экономию токенов.
OpenClaw — другой класс: не рантайм для построения собственных агентов, а готовый личный автономный ассистент, который живёт на вашей машине и работает через мессенджеры (Telegram, WhatsApp, Slack). Подробнее — в статьях «OpenClaw: обзор и типовые сценарии использования AI-агента в 2026 году» и «AI-Агенты для работы: Claude Code, Hermes Agent, OpenClaw, GigaAgent». TrueForge и OpenClaw решают разные задачи: первый — платформа для вашей команды, второй — персональный ассистент.
deepagents от LangChain — библиотечный фреймворк для многошаговых агентных задач (разбирали в статье «DeepAgents от LangChain: обзор фреймворка для сложных многошаговых задач»). По бенчмаркам TrueForge deepagents прямо «обгоняет по деньгам»: на той же модели и задаче — в 2,5 раза дешевле. Если вы уже в экосистеме LangChain, deepagents остаётся осмысленным выбором; но если цель — минимизировать стоимость цикла агента, цифры говорят сами за себя (при условии воспроизведения бенчмарка на ваших задачах).
Для тех, кто выбирает между терминальными кодинг-агентами (другой класс инструментов), полезны наши обзоры: «Grok Build (Grok agent harness): обзор, история и сравнение с аналогами» и «Google Antigravity: история, обзор и сравнение с Claude Code и Cursor».
Практические соображения при внедрении
Когда TrueForge имеет смысл. У вас есть команда, которая строит ИИ-агентов как часть продукта или внутренних процессов; важна независимость от провайдера модели (модель должна быть заменяемой без переписывания агента); нужен self-host в собственном облаке или on-prem; критично governance: логирование и проверка политики на каждом вызове инструмента, одобрения опасных действий человеком.
Когда лучше другие варианты. Если вы хотите «просто запустить агента» без собственной инфраструктуры — Claude Managed Agents требует меньше усилий. Если нужен личный ассистент в мессенджерах — OpenClaw. Если вы глубоко в экосистеме LangChain и строите сложные графы агентов — deepagents. Если важна максимальная расширяемость плагинами и большое комьюнити — dsh от DeepSeek.
⚠️ Риски раннего проекта. TrueForge вышел 19 августа 2026 года — ему меньше месяца. API, SDK и схемы могут меняться; для продакшена фиксируйте версии пакетов npm и Helm-чарта и держите план отката. Кроме того, как и с любым агентным рантаймом, ключевые риски — не в рантайме, а в том, что вы в него подключаете: MCP-серверы с широкими правами, песочница без изоляции, отсутствие policy-check на опасных инструментах. Поверхностная настройка «поднял и поехало» может привести к утечкам данных или неконтролируемым действиям агента — это классическая зона, где экономия на экспертизе оборачивается дороже.
💡 Проверка перед внедрением. Три шага: (1) запустите local mode и прогоните свой пилотный сценарий; (2) воспроизведите бенчмарк из
benchmark/на своих задачах — сравните токены и стоимость за запуск с вашим текущим решением; (3) оцените governance-требования вашей компании: логирование вызовов, одобрения, OIDC. Если по всем трём пунктам цифры работают в вашу пользу — переходите к hosted mode на staging.
Стоимость эксплуатации. Поскольку harness открыт и self-host'ится, лицензионных платежей нет; вы платите за свою инфраструктуру (Postgres + Redis в hosted mode) и за токены модели. Заявленная экономия 30–75% по стоимости запуска — это именно про токены: компактный цикл TrueForge тратит 3,7M токенов на задачу против 10M у Claude Managed Agents и 16,5M у deepagents. На масштабе сотен запусков в день разница между $8,6 и $21,2 за задачу становится основной статьёй экономии — больше, чем стоимость самой инфраструктуры.
Заключение
TrueForge — заметное событие августа 2026: первый серьёзный open-source агентный рантайм от enterprise-инфраструктурной компании с прозрачной методологией бенчмарков и измеримой экономией (30% против Claude Managed Agents, до 75% при замене модели на открытую GLM-5.2). Его ставка — vendor-neutral: модель заменяема, инфраструктура ваша, governance встроен в рантайм.
Три ключевых вывода:
-
Стоимость агента определяется циклом, а не моделью. Компактный контекст, меньше вызовов инструментов и компакция истории дают 2–3 раза экономии токенов при той же точности. Это главный инженерный урок бенчмарков TrueForge — и он применим к любому агентному рантайму.
-
Open-source harness меняет баланс сил. До августа альтернатива «managed-сервис провайдера» была только «собрать самому на LangChain». Теперь есть зрелый self-host вариант с enterprise-governance — это давление на цены managed-сервисов в обе стороны.
-
Ранний проект требует осторожности. Менее месяца с момента релиза, API меняется. Пилотите на своих задачах, фиксируйте версии и не выставляйте local mode в интернет.
Выбор между TrueForge, Claude Managed Agents, dsh и deepagents — это выбор между стоимостью, контролем и зрелостью. Инструмент здесь лишь половина задачи: вторая половина — корректная настройка песочницы, прав на инструменты и policy-правил с учётом того, что агент будет делать автономно. Для критичных enterprise-задач такая настройка требует опыта в архитектуре агентных систем — это инвестиция, которая окупается тем, что ваш агент не станет источником инцидента.
Источники
-
GitHub: truefoundry/trueforge — The open-source agent harness
-
TrueForge: Benchmarking — сравнение с Claude Managed Agents и deepagents на Enterprise-Bench
-
TrueFoundry: TrueForge — Open-Source Agent Harness (официальная страница продукта)
-
Flowtivity: TrueForge vs DeepSeek Harness vs Claude Managed Agents — 2026 Comparison
[^1]: Meta Platforms признана экстремистской организацией в Российской Федерации.