149-страничный обзор «К агентам с долгосрочным горизонтом: обзор», опубликованный Исследовательским центром GAIR Университета Жэньминь в сотрудничестве с Пекинским университетом, Университетом Цинхуа, Университетом Сунь Ятсена, Гонконгским университетом науки и технологий и Национальным университетом Сингапура, представляет первую систематическую основу для понимания emerging-области AI-агентов с долгосрочным горизонтом. Обзор организует область вокруг двух параллельных линий эволюции: внешней инженерии оснастки (Harness Engineering) для повышения производительности во время выполнения и внутренней оптимизации модели (Model Optimization), которая постепенно записывает способность к выполнению обратно в модель через обучение.
Обзор определяет ключевую характеристику как способность организовывать взаимозависимые решения в связные траектории.
Основной вклад — трехуровневая иерархия сложности задач и соответствующих возможностей. Задачи уровня H1 (Window-Level), выполняемые в рамках одного контекстного окна, требуют устойчивых циклов «план-действие-обратная связь-коррекция», что соответствует способности C1 (Интерактивное рассуждение). Задачи уровня H2 (Cross-Window), охватывающие часы или дни, требуют сжатия истории, сохранения прогресса и передачи между сессиями, что выходит за рамки возможностей расширенных контекстных окон; при этом смена контекста (Context Rot) определена как фундаментальное узкое место, что соответствует способности C2 (Состояние и память). Задачи уровня H3 (Cross-Task-Flow), где задачи поступают непрерывно с изменяющейся средой, инструментами и целями, требуют накопления опыта в повторно используемые навыки и постоянного улучшения, что соответствует способности C3 (Накопление опыта), распространяющейся на непрерывное обучение и самоэволюцию.
Обзор предоставляет количественные доказательства прогресса в возможностях, используя публичные данные METR. Временной интервал выполнения задачи с 50% успешностью, измеряющий эквивалентное время работы эксперта-человека для задач, которые агент выполняет с вероятностью успеха около 50%, удваивается каждые 196,5 дней (примерно 7 месяцев) по всему набору данных, ускоряясь до примерно 130,8 дней (4 месяца) при фокусе на период после 2023 года. GPT-3 достиг примерно 9 секунд временного интервала задачи, GPT-4 — примерно 4 минут, o3 — примерно 2 часов, а Claude Opus 4.6 — примерно 12 часов по состоянию на 2026 год. Прогресс от минут к часам и десяткам часов демонстрирует эскалацию возможностей от H1 к H2 и H3.
Обзор описывает три эры разработки AI-агентов: эра инженерии подсказок (Prompt Engineering, 2020-2023), опирающаяся на цепочки рассуждений и декомпозицию задач в рамках одного вызова модели; эра инженерии контекста (Context Engineering, 2023-2025), расширяющая контроль до того, что модель может видеть через RAG, вызов функций и память; и emerging-эра инженерии оснастки (Harness Engineering), где системная архитектура, окружающая модель, определяет границы возможностей. Авторы утверждают, что ключевая идея заключается в том, что сфера инженерного контроля прогрессивно расширяется наружу, а способность к долгосрочному горизонту меньше зависит от улучшений интеллекта модели и больше — от сложности окружающей системной архитектуры. 149-страничный обзор устанавливает единый словарь и концептуальную основу для области, которая быстро росла, но не имела систематической организации, предоставляя как исследователям, так и практикам дорожную карту для следующего этапа развития возможностей агентов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




