25 сентября 2026
Самоулучшение харнесса работает, но с оговорками: главное за неделю в ИИ
Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 21 по 25 сентября
Google Cloud AI Research, UNC Chapel Hill, Stanford и Washington University in St. Louis представили RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), который автоматически улучшает харнесс ИИ-агента. RRSI по кругу предлагает правки, проверяет их и сохраняет лучшие. Со временем правки становятся мельче, система учитывает историю удачных и неудачных попыток, а когда поиск буксует, переключается на части харнесса, которые ещё не трогала. Каждую правку сначала проверяет отдельный фильтр: не заточена ли она под конкретный бенчмарк. Затем RRSI сравнивает прирост качества с дополнительным расходом токенов и удаляет компоненты, которые перестали приносить пользу. Так харнесс становится лучше и при этом не обрастает лишней сложностью.
Авторы проверили RRSI на восьми бенчмарках, связанных с программированием, офисным задачам и инженерным проектированием. Улучшения переносились даже на задачи, которых система не видела при настройке. На Terminal-Bench прирост достиг 14,1 п.п., а на незнакомых JobBench и SWE-bench Verified результат вырос на 4,7 и 2,2 п.п. В офисных задачах RRSI набрала в среднем 43,6 балла на трёх внешних бенчмарках против 39,7 у исходного харнесса. Токенов на попытку ушло около 2,42 млн, тогда как эволюция без регуляризации тратила 3,8 млн.
Почему это важно: если ИИ-агент сам переписывает свой харнесс, бенчмарк становится частью среды, на которой он учится, и система может начать подгоняться под тест. RRSI показывает, что цикла «сгенерировать, проверить, отобрать» для надёжного самоулучшения мало. Поверх него нужен отдельный контур, который следит за утечками, сложностью, стоимостью и переносимостью правок. Метод пока проверяли только на замороженных моделях, и как он поведёт себя в долгих циклах самоулучшения и на других архитектурах, ещё предстоит выяснить.
NVIDIA предлагает SoL-Pi — ещё один подход для оптимизации харнесса. Обычно инженеры вручную настраивают отдельные механизмы под конкретную среду. SoL-Pi сама генерирует улучшения, тестирует и отбирает их, причём каждое проверяет сразу на множестве окружений. За цикл оптимизации система нашла четыре изменения с устойчивым эффектом. Action Fusion меняет способ выполнения действий, Online Context Compact сжимает контекст прямо во время работы над задачей, ObservationPack оптимизирует обработку наблюдений, а Evidence-Preserving Reducer сокращает объём информации при делегированном чтении, сохраняя нужные доказательства.
С SoL-Pi агент передаёт почти вдвое меньше токенов, а качество на GPT-5.6 Sol и Opus 5 остаётся сопоставимым с базовым харнессом. На 51 задаче EdgeBench это снижает API-затраты примерно на 33% и экономит $8,75–13,50 в час по сравнению с нативными харнессами Codex и Claude Code и $4,36–5,71 в час по сравнению с базовым вариантом. Качество при этом не страдает, потому что экономию даёт более эффективная организация рабочего цикла агента.
Почему это важно: кроме экономии токенов, интересен сам подход: система исследует харнесс как объект, ищет механизмы, проверяет их и оставляет только устойчивые. SoL-Pi проверяет каждое улучшение сразу на многих средах, и поэтому риск подогнать оптимизацию под один бенчмарк ниже. Агентный инжиниринг так приближается к замкнутому циклу, в котором система сама находит улучшения, отбирает их и передаёт следующим версиям.
