25 сентября 2026

Самоулучшение харнесса работает, но с оговорками: главное за неделю в ИИ

Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 21 по 25 сентября
4.png
Google Cloud AI Research, UNC Chapel Hill, Stanford и Washington University in St. Louis представили RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), который автоматически улучшает харнесс ИИ-агента. RRSI по кругу предлагает правки, проверяет их и сохраняет лучшие. Со временем правки становятся мельче, система учитывает историю удачных и неудачных попыток, а когда поиск буксует, переключается на части харнесса, которые ещё не трогала. Каждую правку сначала проверяет отдельный фильтр: не заточена ли она под конкретный бенчмарк. Затем RRSI сравнивает прирост качества с дополнительным расходом токенов и удаляет компоненты, которые перестали приносить пользу. Так харнесс становится лучше и при этом не обрастает лишней сложностью. Авторы проверили RRSI на восьми бенчмарках, связанных с программированием, офисным задачам и инженерным проектированием. Улучшения переносились даже на задачи, которых система не видела при настройке. На Terminal-Bench прирост достиг 14,1 п.п., а на незнакомых JobBench и SWE-bench Verified результат вырос на 4,7 и 2,2 п.п. В офисных задачах RRSI набрала в среднем 43,6 балла на трёх внешних бенчмарках против 39,7 у исходного харнесса. Токенов на попытку ушло около 2,42 млн, тогда как эволюция без регуляризации тратила 3,8 млн. Почему это важно: если ИИ-агент сам переписывает свой харнесс, бенчмарк становится частью среды, на которой он учится, и система может начать подгоняться под тест. RRSI показывает, что цикла «сгенерировать, проверить, отобрать» для надёжного самоулучшения мало. Поверх него нужен отдельный контур, который следит за утечками, сложностью, стоимостью и переносимостью правок. Метод пока проверяли только на замороженных моделях, и как он поведёт себя в долгих циклах самоулучшения и на других архитектурах, ещё предстоит выяснить. NVIDIA предлагает SoL-Pi — ещё один подход для оптимизации харнесса. Обычно инженеры вручную настраивают отдельные механизмы под конкретную среду. SoL-Pi сама генерирует улучшения, тестирует и отбирает их, причём каждое проверяет сразу на множестве окружений. За цикл оптимизации система нашла четыре изменения с устойчивым эффектом. Action Fusion меняет способ выполнения действий, Online Context Compact сжимает контекст прямо во время работы над задачей, ObservationPack оптимизирует обработку наблюдений, а Evidence-Preserving Reducer сокращает объём информации при делегированном чтении, сохраняя нужные доказательства. С SoL-Pi агент передаёт почти вдвое меньше токенов, а качество на GPT-5.6 Sol и Opus 5 остаётся сопоставимым с базовым харнессом. На 51 задаче EdgeBench это снижает API-затраты примерно на 33% и экономит $8,75–13,50 в час по сравнению с нативными харнессами Codex и Claude Code и $4,36–5,71 в час по сравнению с базовым вариантом. Качество при этом не страдает, потому что экономию даёт более эффективная организация рабочего цикла агента. Почему это важно: кроме экономии токенов, интересен сам подход: система исследует харнесс как объект, ищет механизмы, проверяет их и оставляет только устойчивые. SoL-Pi проверяет каждое улучшение сразу на многих средах, и поэтому риск подогнать оптимизацию под один бенчмарк ниже. Агентный инжиниринг так приближается к замкнутому циклу, в котором система сама находит улучшения, отбирает их и передаёт следующим версиям.

Также на неделе:

Anthropic выпустила Claude Opus 5.5. Компания заявляет, что модель лидирует в агентном программировании, работе с компьютером и офисных задачах, а на многих тестах догоняет или обходит более крупную Fable. По данным Anthropic, по сравнению с Opus 5 новинка работает более чем на 30% быстрее, расходует меньше токенов и в типичных задачах обходится примерно на 40% дешевле. OpenAI ответила GPT-6 Sol и Luna. GPT-6 Sol рассчитана на сложные задачи и код, а Luna берёт на себя рутину вроде пересказа документов. Обе стоят вдвое меньше серии 5.6, и за Sol просят $2 за 1 млн входных токенов и $10 за 1 млн выходных. OpenAI утверждает, что Sol ошибается вдвое реже предшественницы и обходит модели конкурентов. Независимых проверок этих цифр пока нет. SpaceXAI выпустила Grok 4.7. По словам разработчика, модель лучше справляется со сложными рассуждениями, строже перепроверяет свои ответы и получила обновлённые защитные механизмы. Grok 4.7 доступна через Grok API и в средах разработки вроде Cursor. Xiaomi открыла MiMo-V2.6, семейство мультимодальных моделей для пространственного 3D-мышления, дизайна и автономной работы с компьютером. Кроме весов компания выложила фреймворк для обучения с подкреплением, наборы для оценки и более 7000 RL-сред с задачами от поиска новых материалов до процедурной 3D-генерации. Meta (запрещена в РФ) строит стратегию вокруг ИИ-агента Muse и очков. На конференции Connect компания представила Muse как центр связки «устройство плюс агент». Агент теперь поддерживает голос и видео в реальном времени, ведёт длинный разговор и одновременно выполняет задачи в фоне. Скоро Meta добавит видеочат с настраиваемым голосом, а на всех очках компании Muse будет включаться по голосовой команде. Ещё Meta показала исследовательскую модель Muse Realtime Avatar. Она анимирует агента синхронно с голосом, отвечает быстрее чем за секунду и не ограничивает длину сессии. Из устройств компания представила Ray-Ban Meta третьего поколения, которые дольше работают от батареи, получили улучшенные микрофоны и новые формы, в том числе авиаторы. Кроме того, очки Meta получили одобрение FDA как слуховой аппарат. В декабре выйдет Muse Charm — брелок для разговора с агентом.