04 сентября 2026

Агентов научили не тащить лишнее и не спрашивать лишний раз: главное за неделю в ИИ

Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 31 августа по 4 сентября
4.png
Google и Университет Пердью представили SKILL.state — подход, который помогает ИИ-агентам эффективнее справляться с длинными задачами. На таких задачах агенты замедляются и путаются: тащат с собой всю историю — каждое наблюдение, каждый шаг, каждое рассуждение — и на каждом новом шаге перечитывают её заново, включая уже ненужные детали. SKILL.state решает проблему: вместо разрастающейся истории агент хранит только актуальное состояние задачи — краткое резюме, инструкции и последний результат. Промежуточные рассуждения стираются сразу после проверенного шага, поэтому объём текста для модели не растёт вместе с длиной задачи. Подход не привязан к конкретной архитектуре и легко встраивается в существующие системы агентов. Почему это важно: чем длиннее задача, тем дороже она обходится в токенах, а значит, и в деньгах. SKILL.state снижает эти расходы: на задаче из 200 шагов Gemini 3.0 Flash обычно тратит 6,17 млн токенов, а с SKILL.state — 122 тысячи, а точность растёт с 84 до 94%. На задаче из 100 шагов расход упал с 1,85 млн до 90 тысяч токенов — примерно в 20 раз. Для компаний, которые запускают агентов на масштабе, это прямая экономия на инфраструктуре без потери качества. Microsoft, Amazon, Rutgers University, University of Toronto и The Hong Kong Polytechnic University разработали SPACE — метод учит ИИ-агента выполнять сразу несколько действий подряд, а не обращаться к языковой модели после каждого шага, как это устроено в схеме ReAct. Просто научить модель длинным цепочкам действий не получается: она либо всё равно скатывается к одному шагу за раз, либо строит слишком длинные и неточные цепочки, не понимая, где серии действий пора закончиться. SPACE решает это иначе: система анализирует успешные попытки агента и находит в них повторяющиеся блоки действий с чёткими границами. На них агент и учится сам определять, когда достаточно одного шага, а когда можно сразу выполнить целый блок без обращения к модели. Почему это важно: каждое обращение к LLM — это время и деньги. SPACE поднял успешность задач на 7–31,3% по сравнению с лучшими существующими методами и одновременно сократил число обращений к модели до 78,9%. Для агентов, которые работают с большим объёмом задач, это ниже стоимость и выше скорость — без потери качества результата.

Также на неделе:

• Prime Intellect выпустил харнесс Prime Agent для long-horizon задач, и его главное отличие — то, что сохраняется между запусками • Tencent AI анонсировала предварительную версию Hy4 — MoE-модель с открытыми весами: 770 млрд параметров, из них 49 млрд активных. Модель рассчитана на сложные задачи: кодинг, техническую документацию и научные исследования • Z.ai выпустила open-source мультимодальную модель GLM-5.3-Flash на 320B-A18B. Она показывает конкурентные результаты по кодинг-бенчмаркам и высокую эффективность по стоимости относительно других топовых моделей • OpenAI представил GPT-6 Astra — модель для автономной работы над сложными многошаговыми задачами: кодом, исследованиями, инструментами. Она сама проходит длинную цепочку действий вместо того, чтобы просто отвечать на запрос • Google DeepMind перевёл Co-Scientist из симуляций в физические эксперименты — в материаловедении, биологии и информатике • Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 — две версии одной базовой модели с разными защитными механизмами. Fable доступна широко, Mythos пока доступна только проверенным пользователям в кибербезопасности и науках о жизни (life sciences)
Агентов научили не тащить лишнее и не спрашивать лишний раз: главное за неделю в ИИ