Подписывайтесь:

Блог AST-SoftPro

TrueForge: открытый агентный рантайм от TrueFoundry — обзор, история и сравнение с аналогами

20.08.2026 26 мин чтения
TrueForge: открытый агентный рантайм от TrueFoundry — обзор, история и сравнение с аналогами

Введение

В августе 2026 года рынок ИИ-агентов пережил настоящую гонку агентных рантаймов. Сначала DeepSeek выпустила свой «всё-плагин» рантайм dsh, который за два дня собрал 95 000 звёзд на GitHub. Через шесть дней после этого, 19 августа, калифорнийская инфраструктурная компания TrueFoundry открыла исходный код TrueForge: агентного harness (рантайм-слоя), который превращает любую LLM в работающего агента. Проект распространяется под MIT-лицензией, работает с моделями любого провайдера и позиционируется как «drop-in» альтернатива закрытому Claude Managed Agents от Anthropic — но на вашей собственной инфраструктуре и при существенно меньших затратах.

Почему это важно для практикующего разработчика? Потому что стоимость запуска агента в продакшене давно определяется не ценой модели, а тем, сколько токенов сжигает сам цикл выполнения: каждый вызов инструмента возвращает растущий контекст обратно в модель. TrueForge заявляет, что при той же точности тратит на 30% меньше денег, чем Claude Managed Agents на Opus 4.8, и примерно в 2,5 раза меньше, чем open-source deepagents от LangChain. Разберём, что это за проект, как он устроен, что умеет, где его слабые места — и как он соотносится с другими агентными рантаймами: Claude Managed Agents, DeepSeek Harness (dsh), OpenClaw и deepagents.

Что такое agent harness и зачем он нужен

Агентный harness (обвязка) — это слой между моделью и внешним миром, который управляет всем, что происходит вокруг самого вызова LLM: циклом tool-calling, состоянием сессии, контекстом, песочницей для выполнения кода, правами на инструменты и интерфейсом. Модель сама по себе умеет только генерировать текст; чтобы она стала агентом — читала файлы, запускала команды, ходила в CRM и Jira, — нужен именно этот runtime.

Проблема в том, что «построить агента» и «запустить его хорошо» — разные вещи. Первый рабочий прототип собирается за вечер: модель + несколько инструментов + цикл вызовов. Но для продакшена нужны стриминг ответов, персистентность сессий, авторизация к инструментам (MCP-серверы часто требуют OAuth), изоляция выполнения кода, точки человеческого одобрения опасных действий, управление контекстом на длинных задачах и UI. Каждый из этих компонентов — недели работы, а ошибки в них стоят денег: раздутый контекст умножает стоимость каждого шага, а пропущенная проверка прав — потенциальная утечка данных.

TrueForge берёт этот слой на себя и отдаёт его тремя способами: готовый чат-интерфейс (Chat UI), HTTP API с TypeScript SDK (@truefoundry/trueforge-sdk) для автоматизации и встраиваемый UI SDK (@truefoundry/trueforge-ui), если агент нужно встроить в собственный продукт.

История проекта: от внутреннего рантайма к open source

TrueFoundry — стартап из Сан-Франциско, основанный в 2021 году инженерами, пришедшими из Meta[^1] и Google; компания строит enterprise-платформу для инфраструктуры ИИ (AI Gateway, MCP Gateway, управление моделями). TrueForge — это тот самый агентный рантайм, который команда TrueFoundry сама использовала для построения и запуска собственных агентов общего назначения. 19 августа 2026 года проект был открыт: код опубликован на GitHub под MIT-лицензией, пакеты выложены в npm (@truefoundry/trueforge, @truefoundry/trueforge-sdk, @truefoundry/trueforge-ui, @truefoundry/trueforge-core), документация живёт на trueforge.dev.

Мотивация открытий сформулирована прямо: «агентный harness должен быть открытым». Аргумент компании — привязка к провайдеру модели должна заканчиваться: модель должна оставаться заменяемой, а рантайм, который управляет её поведением, не должен становиться новым вендорским заложником. Для enterprise-команд это означает возможность self-host'ить рантайм в своём облаке или on-prem, подключить любую модель через OpenAI-совместимый endpoint и при этом не терять управление (governance) над инструментами.

К моменту публикации (конец августа 2026) репозиторий набрал порядка 1,6 тысячи звёзд GitHub и 77 форков — скромно по сравнению с dsh от DeepSeek (95 тысяч звёзд за два дня), но проект только стартует: TrueFoundry анонсировала хакатон «The Agent Harness Hackathon» на 24–30 августа 2026 года, что говорит о планах активно растить комьюнити.

⚠️ Важно понимать: звёзды GitHub — не единственный показатель зрелости. TrueForge — ранний проект (менее месяца с момента релиза), и API ещё может меняться. Для критичных задач стоит оценивать его как перспективную альтернативу, а не как устоявшуюся платформу.

Архитектура: что внутри TrueForge

TrueForge выполняет агентный цикл за вас: вызовы модели, MCP-инструменты, скиллы, песочница, одобрения, управление контекстом и состояние сессий. Ключевые компоненты:

Каталоги ресурсов (initial setup from catalogs). Модели, MCP-серверы, скиллы и песочницу конфигурируют один раз — через поставляемые YAML-каталоги, которые можно кастомизировать. Агенты затем выбирают из подключённого пула: вы не описываете инструменты заново для каждого агента.

Модели любого провайдера. OpenAI, Anthropic, Google Gemini и другие каталожные провайдеры — или любой OpenAI-совместимый endpoint. Это и есть суть «vendor-neutral»: тот же агентный код работает с Opus 4.8, GLM-5.2 или вашей локальной моделью через Ollama/vLLM.

MCP-инструменты. Подключение удалённых MCP-серверов с header-авторизацией или OAuth, включая авторизацию прямо в чате (in-chat authorization) — пользователь одобряет доступ к инструменту не выходя из диалога.

Скиллы (skills registry). Версионируемые пакеты инструкций SKILL.md на базе git, загружаемые в песочницу по требованию. Это тот же паттерн, что и в Claude Code: знания о том, как выполнять класс задач, отделяются от модели и обновляются без переобучения.

Песочница как инструмент (sandbox as a tool). Изолированное выполнение кода и файловых операций — сегодня на базе Daytona, планируется больше провайдеров. Песочница provision-ится только когда нужна, а секреты остаются в harness — модель их не видит.

Человеческие контрольные точки. Одобрение вызова инструментов (tool approval), запросы вопросов у пользователя и Generative UI прямо в чате. Для enterprise это ключевая фича: агент может действовать автономно, но опасные операции проходят через человека.

Инженерия контекста. Субагенты, отложенная загрузка инструментов (deferred tool loading), Code Mode, выгрузка больших результатов (large-result offloading) и компакция истории — набор техник, которые напрямую влияют на стоимость запуска (о них ниже в разделе про бенчмарки).

Два режима работы:

Режим Для кого Хранилище Дополнительная инфраструктура Запуск
Local Личное использование, знакомство с проектом SQLite (один процесс) Нет npx @truefoundry/trueforge
Hosted Команды, несколько реплик Postgres + Redis Postgres + Redis Docker Compose или Helm

Разработчики прямо предупреждают: local mode — только для localhost. По умолчанию там нет логина, данные лежат в локальном SQLite-файле; выставлять его в интернет нельзя. Для совместной или продакшен-развёртывания — hosted mode с опциональным OIDC-логингом.

Возможности: от quickstart до production

Быстрый старт выглядит так: запустить TrueForge (локально, через Docker Compose или Kubernetes), подключить модель и инструменты, собрать первого переиспользуемого агента — всё описано в Quickstart на trueforge.dev. Для автоматизации доступен TypeScript SDK: сессии, ходы (turns) и события — стандартный событийный интерфейс, позволяющий строить свои оркестрации поверх рантайма.

Для enterprise-сценариев TrueForge интегрируется с AI Gateway от TrueFoundry: централизованный доступ к моделям, MCP-governance, бюджеты, учётные данные и observability по всему стеку. То есть open-source ядро можно обернуть в коммерческий контур управления — типичная open-core модель.

💡 Практический совет: если вы оцениваете TrueForge для команды, начните с local mode на одной машине (npx @truefoundry/trueforge) и воспроизведите бенчмарк из папки benchmark/ в репозитории — он открыт вместе с датасетом. Это самый честный способ проверить цифры «30% дешевле» на ваших собственных задачах, а не на маркетинговых слайдах.

Бенчмарки: 30–75% дешевле при той же точности

TrueFoundry опубликовала сравнение TrueForge с двумя альтернативами — закрытым Claude Managed Agents и open-source deepagents (на LangGraph) — на одних и тех же задачах, инструментах и модели. Методология: 14 enterprise-задач уровня L1–L2 из Enterprise-Bench от DevRev — кросс-системные операции, похожие на реальную B2B работу (инженерия, продажи, поддержка), где агент должен стыковать данные трёх MCP-серверов: CRM в стиле Salesforce, трекер задач в стиле Jira и документохранилище в стиле Drive.

Каждый harness запускался с одной моделью, одними тремя MCP-серверами и одним системным промптом; каждая задача — в свежей сессии, n = 3 повторения, отчёт по среднему. Ответы оценивал независимый LLM-judge, который видел только критерии задачи и ответ — но не знал, какой harness его сгенерировал; задача засчитывается только если выполнены все критерии.

Конфигурация Решено из 14 $ за запуск Токенов за запуск
Claude Managed Agents · Opus 4.8 10,7 $11,8 10,0M
TrueForge · Opus 4.8 10,7 $8,6 3,7M
TrueForge · GLM-5.2 11,7 $3,0 3,8M
deepagents · Opus 4.8 10,0 $21,2 16,5M
deepagents · GLM-5.2 12,0 $9,1 11,9M

Итог: при той же модели (Opus 4.8) TrueForge решает столько же задач, что и Claude Managed Agents (10,7 из 14), но стоит на ~30% дешевле ($8,6 против $11,8). На открытой модели GLM-5.2 от Z.ai TrueForge даже чуть точнее (11,7) при цене в ~$3 — это и есть заявленные «до 75% дешевле». deepagents на той же задаче сжигает втрое больше токенов (16,5M против 3,7M у TrueForge).

Почему разница такая? Основная стоимость агентного запуска — не финальный ответ, а сам цикл: каждый round-trip инструмента отправляет растущий контекст обратно в модель. TrueForge держит цикл компактным:

  • Компактный контекст на каждом ходу. Цикл управляется короткой инструкцией, а не тяжёлым scaffolding'ом; deepagents при этом тащит планирование, виртуальную файловую систему и механизм субагентов на каждом шаге.

  • Меньше вызовов инструментов. TrueForge спланировал минимум вызовов из трёх участников — 19 на задачу против 32 и 40.

  • Компакция вместо реплея. История обрезается, большие ответы инструментов выгружаются наружу; deepagents же перечитывает накопленный контекст шаг за шагом — так он доходит до тройного-четверного объёма токенов на той же задаче.

⚠️ Критически важно: это бенчмарк, проведённый самим производителем TrueForge. Методология прозрачная (датасет Enterprise-Bench открыт, kit для воспроизведения лежит в benchmark/), но выбор задач — тоже его выбор. Перед принятием решения о внедрении стоит прогнать свой собственный набор задач: если ваши агенты делают не кросс-системные B2B-операции, а, скажем, рефакторинг кода или работу с базой данных, расклад по стоимости может отличаться.

Сравнение с аналогами

Август 2026 года стал «месяцем агентного harness»: за две недели вышло сразу несколько заметных рантаймов. Разберём главное отличие каждого — и когда какой инструмент имеет смысл выбирать.

Критерий TrueForge Claude Managed Agents DeepSeek Harness (dsh) OpenClaw deepagents (LangChain)
Тип Open-source harness, MIT Закрытый managed-сервис Anthropic Open-source harness, «всё — плагин» Open-source личный агент-ассистент Open-source фреймворк (LangGraph)
Модельная привязка Нет: любой провайдер / OpenAI-compatible endpoint Только Claude Гибкая (плагинная модель) Любая (GPT, Claude, Gemini, локальные через Ollama) Любая, но в экосистеме LangChain
Инфраструктура Своя: SQLite (local) или Postgres+Redis (hosted), Docker/Helm Облако Anthropic (public beta) Своя Своя (локальная машина) Своя
Governance / enterprise Централизованный auth, OAuth в чате, логирование и policy-check каждого вызова инструмента; интеграция с AI Gateway TrueFoundry Встроенный managed-контур Anthropic Плагинная система из 9 категорий Ориентация на личного ассистента (мессенджеры: Telegram, WhatsApp и др.) Библиотечный уровень — governance строите сами
UI Чат-UI + embeddable UI SDK + TS SDK API /v1/agents (beta) Свой интерфейс Мессенджерные интерфейсы Нет «из коробки» — свой фронтенд
Ключевое преимущество Vendor-neutral, self-host, заявленная экономия 30–75% по стоимости за запуска Минимум усилий: инфраструктуру держит Anthropic Экстремальная расширяемость (9 категорий плагинов), взрывной рост комьюнити (95k звёзд за 2 дня) Личный автономный ассистент с доступом к мессенджерам и устройствам Гибкость LangGraph для сложных графов агентов
Ключевой риск Молодой проект (~1 месяц), API может меняться Привязка к Anthropic, стоимость managed-сервиса Очень быстрый темп изменений, сложность экосистемы плагинов Безопасность: агент с доступом к вашим устройствам и мессенджерам требует строгого контроля Сложность настройки, высокий расход токенов (по бенчмаркам выше)

Claude Managed Agents — это managed-инфраструктура Anthropic для продакшен-агентов на базе Claude: sandboxing, управление состоянием и выполнение инструментов держит сам провайдер. Запущена в апреле 2026 года (public beta, endpoint /v1/agents). Сильная сторона — «ничего не строить»: слабая — привязка к моделям Anthropic и стоимость. TrueForge целится именно сюда: тот же класс задач, но на вашей инфраструктуре и с любой моделью.

DeepSeek Harness (dsh) — ближайший по духу конкурент: open-source рантайм, где буквально всё является плагином (9 категорий), 4 режима работы и append-only лог. Мы уже разбирали его в статье «DeepSeek Harness: обзор агентного рантайма, где всё — плагин». Разница с TrueForge: dsh делает ставку на экстремальную расширяемость и собрал огромное комьюнити за считанные дни; TrueForge — на enterprise-governance (policy-check каждого вызова инструмента, централизованный auth) и измеримую экономию токенов.

OpenClaw — другой класс: не рантайм для построения собственных агентов, а готовый личный автономный ассистент, который живёт на вашей машине и работает через мессенджеры (Telegram, WhatsApp, Slack). Подробнее — в статьях «OpenClaw: обзор и типовые сценарии использования AI-агента в 2026 году» и «AI-Агенты для работы: Claude Code, Hermes Agent, OpenClaw, GigaAgent». TrueForge и OpenClaw решают разные задачи: первый — платформа для вашей команды, второй — персональный ассистент.

deepagents от LangChain — библиотечный фреймворк для многошаговых агентных задач (разбирали в статье «DeepAgents от LangChain: обзор фреймворка для сложных многошаговых задач»). По бенчмаркам TrueForge deepagents прямо «обгоняет по деньгам»: на той же модели и задаче — в 2,5 раза дешевле. Если вы уже в экосистеме LangChain, deepagents остаётся осмысленным выбором; но если цель — минимизировать стоимость цикла агента, цифры говорят сами за себя (при условии воспроизведения бенчмарка на ваших задачах).

Для тех, кто выбирает между терминальными кодинг-агентами (другой класс инструментов), полезны наши обзоры: «Grok Build (Grok agent harness): обзор, история и сравнение с аналогами» и «Google Antigravity: история, обзор и сравнение с Claude Code и Cursor».

Практические соображения при внедрении

Когда TrueForge имеет смысл. У вас есть команда, которая строит ИИ-агентов как часть продукта или внутренних процессов; важна независимость от провайдера модели (модель должна быть заменяемой без переписывания агента); нужен self-host в собственном облаке или on-prem; критично governance: логирование и проверка политики на каждом вызове инструмента, одобрения опасных действий человеком.

Когда лучше другие варианты. Если вы хотите «просто запустить агента» без собственной инфраструктуры — Claude Managed Agents требует меньше усилий. Если нужен личный ассистент в мессенджерах — OpenClaw. Если вы глубоко в экосистеме LangChain и строите сложные графы агентов — deepagents. Если важна максимальная расширяемость плагинами и большое комьюнити — dsh от DeepSeek.

⚠️ Риски раннего проекта. TrueForge вышел 19 августа 2026 года — ему меньше месяца. API, SDK и схемы могут меняться; для продакшена фиксируйте версии пакетов npm и Helm-чарта и держите план отката. Кроме того, как и с любым агентным рантаймом, ключевые риски — не в рантайме, а в том, что вы в него подключаете: MCP-серверы с широкими правами, песочница без изоляции, отсутствие policy-check на опасных инструментах. Поверхностная настройка «поднял и поехало» может привести к утечкам данных или неконтролируемым действиям агента — это классическая зона, где экономия на экспертизе оборачивается дороже.

💡 Проверка перед внедрением. Три шага: (1) запустите local mode и прогоните свой пилотный сценарий; (2) воспроизведите бенчмарк из benchmark/ на своих задачах — сравните токены и стоимость за запуск с вашим текущим решением; (3) оцените governance-требования вашей компании: логирование вызовов, одобрения, OIDC. Если по всем трём пунктам цифры работают в вашу пользу — переходите к hosted mode на staging.

Стоимость эксплуатации. Поскольку harness открыт и self-host'ится, лицензионных платежей нет; вы платите за свою инфраструктуру (Postgres + Redis в hosted mode) и за токены модели. Заявленная экономия 30–75% по стоимости запуска — это именно про токены: компактный цикл TrueForge тратит 3,7M токенов на задачу против 10M у Claude Managed Agents и 16,5M у deepagents. На масштабе сотен запусков в день разница между $8,6 и $21,2 за задачу становится основной статьёй экономии — больше, чем стоимость самой инфраструктуры.

Заключение

TrueForge — заметное событие августа 2026: первый серьёзный open-source агентный рантайм от enterprise-инфраструктурной компании с прозрачной методологией бенчмарков и измеримой экономией (30% против Claude Managed Agents, до 75% при замене модели на открытую GLM-5.2). Его ставка — vendor-neutral: модель заменяема, инфраструктура ваша, governance встроен в рантайм.

Три ключевых вывода:

  1. Стоимость агента определяется циклом, а не моделью. Компактный контекст, меньше вызовов инструментов и компакция истории дают 2–3 раза экономии токенов при той же точности. Это главный инженерный урок бенчмарков TrueForge — и он применим к любому агентному рантайму.

  2. Open-source harness меняет баланс сил. До августа альтернатива «managed-сервис провайдера» была только «собрать самому на LangChain». Теперь есть зрелый self-host вариант с enterprise-governance — это давление на цены managed-сервисов в обе стороны.

  3. Ранний проект требует осторожности. Менее месяца с момента релиза, API меняется. Пилотите на своих задачах, фиксируйте версии и не выставляйте local mode в интернет.

Выбор между TrueForge, Claude Managed Agents, dsh и deepagents — это выбор между стоимостью, контролем и зрелостью. Инструмент здесь лишь половина задачи: вторая половина — корректная настройка песочницы, прав на инструменты и policy-правил с учётом того, что агент будет делать автономно. Для критичных enterprise-задач такая настройка требует опыта в архитектуре агентных систем — это инвестиция, которая окупается тем, что ваш агент не станет источником инцидента.

Источники

[^1]: Meta Platforms признана экстремистской организацией в Российской Федерации.

AI-Помощник