11 сентября 2026

ИИ-агентам дали год, чтобы вести бизнес: главное за неделю в ИИ

Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 7 по 11 сентября.
image.png
Команда Qwen (Alibaba) собрала бенчмарк E-Commerce Bench. Он проверяет, способны ли ИИ-агенты вести онлайн-магазин весь симулированный год, а не только справляться с короткой цепочкой задач. Агент управляет четырьмя магазинами одновременно: исследует товары и рынки, ведёт переговоры с поставщиками, выбирает ассортимент и цены, выполняет заказы, организует доставку и возвраты, реагирует на промоакции, катастрофы и сбои в цепочке поставок, управляет денежным потоком и репутацией магазина. Среда содержит 6 886 товаров, 576 поставщиков, 12 типов магазинов, 10 рыночных событий и восемь промоакций. Данные о товарах и поставщиках взяты с реальной площадки, а скрытые параметры спроса и себестоимости заставляют агента учиться. Основная метрика — суммарные активы на конец года при старте с ¥100k. Бенчмарк также фиксирует шесть способностей агента: качество переговоров, устойчивость к мошенничеству, управление денежным потоком, операционную эффективность, исполнение операций и обучение со временем. Это важно: одна цифра прибыли может скрыть слабости — например, беспечность к мошенникам или неумение договариваться. Авторы протестировали 18 передовых моделей по пять прогонов на каждую. Единого лидера нет:
  • GPT-5.6 Sol зарабатывает больше всех — превращает ¥100k в ¥1,4 млн, но по устойчивости к мошенничеству занимает лишь 16-е место из 18;
  • Claude Opus 4.7 лучше всех торгуется и держит удар от мошенников, но по итоговому капиталу — в середине рейтинга;
  • Qwen3.8-Max-Preview — сильнейшая модель с открытыми весами, x4,2 от стартового капитала;
  • 4 модели банкротятся хотя бы в части прогонов;
  • 6 моделей из 18 не снижают цены при повторных закупках у одного поставщика, то есть плохо учатся на в долгосрочной перспективе.
Похожие бенчмарки для интернет-торговли:
  • CoffeeBench — бенчмарк от Sakana AI и KPMG Japan Azsa, принятый на воркшопе ICML 2026 «Failure Modes in Agentic AI» — симулирует цепочку поставок кофе от фермы до прилавка: шесть компаний — по два фермера, обжарщика и магазина, каждую ведёт отдельный агент, так что внутри слоя конкуренция, а между слоями — зависимость. Горизонт — 90 дней, цель — максимальная чистая прибыль.
  • MerchantBench — это ещё один бенчмарк от Alibaba — симулятор магазина на 365 дней с 99 тысячами товарных записей и более 36 тысячами поставщиков с площадки 1688.
Почему это важно: такие бенчмарки дают более реалистичный стресс-тест ИИ-систем в условиях, близких к бизнесу. Детерминированная среда отделяет качество стратегии модели от случайности взаимодействия с симулированными контрагентами — это делает результаты сопоставимыми и полезными для сравнения ИИ-провайдеров и оценки рисков перед масштабированием ИИ в бизнес-процессах. Вопрос смещается с «насколько хорошо модель рассуждает» на «насколько устойчиво агент управляет ресурсами и рисками на длинном горизонте». Именно эта устойчивость становится критерием готовности ИИ к реальной эксплуатации. Также на неделе:
  • DeepSeek выпустила DeepSeek-V4.1-Flash — самая маленькая модель семейства, но на многих бенчмарках выходит на уровень Opus 5 и Sol.
  • OpenAI представила ChatGPT Images 2.5 — новое поколение модели генерации изображений, который работает на 50% быстрее версии 2.0, лучше прорабатывает текстуры, естественнее ставит свет и точнее сохраняет ключевые черты объектов.
  • Meta (запрещена в РФ) запустила Muse — персональный ИИ-агент для покупок, планирования и других задач, который опирается на сервисы компании и подключённые аккаунты.
  • Google вместе с Georgia Tech и Пекинским университетом презентовала Procedural Graph. Граф знаний, который раскладывает факты на триплеты «сущность — связь — сущность» (отвечает на вопрос «что это») и процедурное знание на триплеты «процедура — связь — процедура» (отвечает на вопрос «что делать»). Граф подсказывает агенту следующий шаг и сам переписывается на основе разницы между неудачными и успешными траекториями.
  • Anthropic опубликовала исследование, в котором проверяет, может ли ИИ-модель отвечать на проверяемые вопросы о собственном поведении. Авторы пытаются натренировать эту способность.
  • Shanghai AI Lab и SJTU продемонстрировали Harness-of-Harness — цикл поверх существующих харнессов ИИ-агентов для программирования, который превращает многодневную автономную разработку в повторяющиеся итерации планирования, кода и тестов с версионированной историей.