Этот текст — фактологическое продолжение выпуска подкаста 2ТОК о том, как ИИ меняет разные индустрии и повседневную жизнь в России. В первом выпуске мы поговорили с художником Покрасом Лампасом и создателем нейросетей Kandinsky Денисом Димитровым. Пока в эфире мы обсуждали смыслы и личный опыт, аналитический центр red_mad_robot зафиксировал рыночную реальность вокруг этой темы: технологии, деньги и то, как меняются стандарты креативных индустрий.
За четыре года генеративные модели прошли путь от лабораторного эксперимента до инфраструктуры, на которую опирается значительная часть медиапроизводства.
Midjourney v2, 2022
Midjourney v6, 2024
Ещё несколько лет назад нейросети выдавали себя очевидными ошибками: лишними пальцами, деформированной анатомией. К 2024 году эту проблему в основном устранили — за счёт более качественных обучающих данных, роста разрешения и новых архитектур. Подсчёт пальцев как метод верификации подлинности изображения перестал работать.
Ошибки не исчезли, а сместились в область, которую сложнее заметить непрофессионалу. Модели по-прежнему систематически ошибаются в трёх областях: физика света и жидкостей (тени, отражения, преломление в стекле, движение воды), читаемый текст мелким кеглем на длинных строках и сложные многоплановые сцены с перекрывающимися объектами.
Пример рейтинга моделей для генерации изображений на LMArena (10 июля 2026 года)
Автоматические метрики (FID, CLIP-score и каскады моделей-оценщиков) масштабируемы и малозатратны, но плохо коррелируют с эстетической оценкой и точностью соответствия запросу. Оценка людьми точнее, но требует больше времени и ресурсов — и остаётся золотым стандартом отрасли.
Промежуточное решение — арены, где респондентам вслепую показывают две генерации и просят выбрать более удачную. На основе сотен тысяч таких сравнений строится рейтинг с доверительными интервалами и фильтрацией автоматических голосов. Так работает LMArena и аналогичные площадки.
Летом 2022 года text-to-image вышел к широкой публике — DALL-E 2, Midjourney и Stable Diffusion, тогда же Google обучила модель Imagen.
В 2021 году OpenAI показала, что диффузионные модели впервые превзошли GAN по качеству генерации. Второй ключевой компонент — CLIP — компания разработала для классификации изображений и опубликовала в январе 2021 года; именно эта разработка определила дальнейшее направление отрасли.
Тогда же появились первые публичные системы генерации изображений по текстовому описанию: оригинальный DALL-E от OpenAI (начало 2021 года) с его знаменитым «креслом в форме авокадо».
Летом 2022 года генерация изображений по тексту вышла к широкой аудитории — DALL-E 2, Midjourney и Stable Diffusion; в то же время Google обучила модель Imagen.
Схема Image RAG (источник: Хабр)
↓ Промпт: Граффити яркий зеленый жук на серой кирпичной стене
Сравнение результатов YandexART 2.0 с YandexART 2.5 и 2.5 Pro
Второй российский центр компетенций — Яндекс, который развивает линейку YandexART с 2023 года; актуальная версия — YandexART 2.5. Модель точнее обрабатывает сложные запросы: учитывает заданное количество объектов, их форму, цвет и размер, реже добавляет избыточные детали. YandexART 2.5 также на 30% точнее воспроизводит надписи на латинице по сравнению с предыдущей версией, что расширяет применимость модели для логотипов, постеров и сувенирной продукции.
Линейка включает базовую версию и YandexART 2.5 Pro — она создаёт более детализированные изображения, максимально приближенные к фотографическому качеству, и реже допускает артефакты в изображении лиц. Обе модели используются в приложении Шедеврум для генерации изображений, видео и музыкальных клипов.
Вопрос «заменит ли ИИ человека» уступил место более практичному: как встроить эту технологию в производственные процессы с максимальной отдачей.В этом документе мы разберём три уровня: технологическую базу моделей, экономику генеративного медиа и то, как это отражается на рынке труда творческих специалистов в России.
- Технологический прорыв: как ИИ-модели стали доступными, мощными и универсальными
- Экономика: кто зарабатывает на генеративном медиа и почему бизнес перестраивает процессы вокруг него
- Трансформация рынка труда в России: как меняется роль творческих специалистов в эпоху ИИ
Технология: рост качества и падение цены
Артефакты не исчезли, а сместились в детали↓ Промпт: The mother tree with glowing fruit in jungle



Оценка качества генерации

В первом выпуске подкаста Покрас и Денис провели похожий эксперимент на себе: оценивали фотографии и видео, пытаясь определить происхождение — человек или LLM. Результат подтвердил общий тренд: различить оригинал и генерацию становится всё сложнее даже специалистам, которые работают с этой технологией ежедневно.Позиция модели в таком рейтинге не статична: расстановка меняется еженедельно. Поэтому ссылаться на «N-е место» корректно только с указанием даты и названия конкретного рейтинга.
От DALL-E до Sora: краткая история развития моделей

После 2025 года центр тяжести индустрии смещался в двух направлениях.Первое — расширение линейки моделей для генерации изображений:
- **Qwen Image ** — флагманская модель Alibaba, ориентированная на точное выполнение сложных инструкций.
- FLUX 3 — модель линейки Black Forest Labs с сильными сторонами в детализации, сложных композициях и генерации текста внутри изображений.
- GPT Image 2 — модель OpenAI, встроенная в экосистему ChatGPT; сочетает генерацию и редактирование изображений и интерпретирует запросы на естественном языке без необходимости тщательной проработки запроса.
- Grok Imagine — модель компании xAI, в которой приоритет отдан качеству итогового изображения за счёт скорости генерации.
- Muse — агентная система Meta (запрещена в РФ) для генерации изображений: в отличие от классических моделей, создающих картинку по одному запросу, Muse разбивает задачу на последовательность этапов.одному запросу, Muse разбивает задачу на несколько этапов.
Развитие этого направления в России с самого начала обеспечивают Сбер и Яндекс.В конце 2021 года команда Сбера выпустила первую модель для генерации изображений — ruDALL-E Malevich, одну из первых открытых нейросетей такого класса в мире. Модель генерировала изображения размером 256×256 пикселей, а результаты по качеству соответствовали черновым эскизам.


От DALL-E до Sora: краткая история развития моделей
Что представляют собой модели мира? Одной из первых значимых работ в этой области стала статья World Models Дэвида Ха и Юргена Шмидхубера (2018). Авторы показали, что ИИ-система способна сначала сформировать внутреннюю модель среды и только затем обучаться действовать в ней — вместо метода проб и ошибок непосредственно в реальных условиях. Ключевой результат этой работы: агент научился действовать внутри собственной внутренней симуляции среды, после чего полученная стратегия успешно переносилась в реальную игровую среду.Сегодня модели мира — это генеративные модели, обучающиеся строить внутреннее представление физики среды, пространственных связей и причинно-следственных закономерностей.Одну из наиболее продвинутых моделей мира в 2026 году представил Google DeepMind — Genie 3, первую универсальную интерактивную модель мира, генерирующую управляемые 3D-среды в реальном времени. Ян Лекун, один из ключевых исследователей в области ИИ и последовательный критик архитектуры больших языковых моделей, покинул Meta (запрещена в РФ), чтобы основать собственную лабораторию AMI Labs и развивать ИИ-системы, ориентированные на моделирование физики реального мира. Часть 2
Ценность: где генеративное медиа приносит деньги
Объём инвестиций в генеративные медиа коррелирует с ростом спроса на технологии ИИ. За период с 2023 по 2026 год рынок прошёл путь от экспериментальной стадии до многомиллиардных оценок компаний.- 2023 год. Рынок находился на стадии формирования. Runway представила модель Gen-2, фактически запустив конкуренцию в сегменте ИИ-видео; в апреле была основана Pika Labs. Несмотря на высокий интерес к технологии, сегмент оставался нишевым.
- 2024 год. Инвестиционная активность резко выросла. Pika Labs закрыла раунд Series B на $80 млн при оценке $470 млн. Black Forest Labs, основанная бывшими исследователями Stable Diffusion, получила $31 млн от Andreessen Horowitz. Luma AI представила модель Dream Machine — один из наиболее заметных релизов года в сегменте генерации видео.
- 2025 год. Рост продолжился. Runway привлекла $308 млн в раунде Series D при оценке около $3 млрд. Suno закрыла раунд Series C на $250 млн с оценкой $2,45 млрд. Luma AI получила $900 млн в Series C при оценке $4 млрд. В декабре Black Forest Labs привлекла ещё $300 млн при оценке $3,25 млрд.
- Февраль 2026. Runway объявила о привлечении $315 млн в раунде Series E, увеличив оценку до $5,3 млрд.