В эпоху нейросетей выигрывают люди со вкусом, средний уровень даже не рядом, Олег Коновалов, Сантэнс
Олег Коновалов, креативный директор, ГК Сантэнс. Форум Cnews "Технологии искусственного интеллекта 2026".
Олег Коновалов рассказывает о том, как нейросети изменили работу с визуальным контентом, и делает акцент на том, что редко обсуждают: как быть, если ниша узкая, а подходящих картинок, видео и музыки в открытом доступе просто нет. О компании Коновалов говорит с иронией: это «широко известная в узких кругах» группа, через сервисы которой проходит «каждая третья таблетка и прочие медицинские вещи в нашей стране». Сам он называет себя человеком-оркестром, который фотографирует, рисует, снимает видео и пишет тексты, а главным своим интересом считает «сделать что-то визуальное из того, что сделать как бы нельзя».
Как всё начиналось: от корявых картинок до безумной красоты
Первые доступные генераторы изображений появились в 2022 году. Stable Diffusion выдавал картинки в 512 пикселей с качеством цифровой «мыльницы» нулевых, а при попытке увеличить размер получались странные, но эффектные уродцы. Следующим шагом стал Midjourney, который тогда жил только в Discord. Картинки у него были причудливые, похожие на работы слегка сумасшедшего импрессиониста. Главное, что он дал человеку без дизайнерских навыков: за несколько минут методом проб и подбора получить иллюстрацию, которая годится для рабочей задачи.
Почему узкие ниши остались без визуала
Стоки заполнены успешными бизнесменами и улыбчивыми девушками. Если же нужна буровая вышка за полярным кругом или сотрудник склада со сканером QR-кодов, выбор почти нулевой. Остальные варианты тоже болезненны: фотограф с командировкой и допуском на режимный объект, самостоятельная работа в Photoshop, которой владеют немногие, или художник, который может пропасть на месяц. Материалы при этом всегда нужны «вчера».
Нейросеть решает задачу просто: описываешь сцену словами, делаешь несколько итераций и получаешь результат, который выглядит «на 150% как настоящий». Коновалов называет это парадоксом: картинки прошли через нейросеть, но при этом кажутся более достоверными, чем реальные.
Различить нейросеть и человека уже нельзя
Люди, которые были уверены в своём чутье, в экспериментах угадывали «на уровне вероятности подбрасывания монетки». Год назад на московской биеннале цифрового искусства Коновалов сам не смог отличить фотографии от сгенерированных, а с тех пор модели улучшились ещё на порядок. С текстами то же самое: на встрече копирайтеров профессионалы признали, что различить текст нейросети и человека сложно. Однообразие текстов чаще объясняется тем, что пользователи не умеют «выжимать» из модели живой язык.
Мода на «испорченное»
Волна аккуратных картинок выше среднего дизайнерского уровня быстро надоела. Дальше повторилась история цифровой фотографии: когда цифра стала чище плёнки, люди принялись добавлять зерно и кривые цвета. Так и сейчас: изображениям намеренно придают вид неумелого снимка, а в видео вносят тряску камеры, чтобы всё выглядело «живым». Коновалов уверен, что среди океана массового контента обязательно появятся и настоящие шедевры, просто оценить их можно будет лишь спустя время, как это случилось с Босхом.
Видео: главный прорыв последнего года
Для узких ниш видео было вдвойне сложным: найти подходящий ролик на стоке почти невозможно, а монтаж и ротоскопия отнимают уйму сил. Главной болезнью генерации была консистентность: лицо героя менялось, одежда «плыла», кадр разваливался за пять секунд. По словам Коновалова, «проблема консистентности сейчас решена». Новые модели принимают до 50 референсов сразу: одежду героя, аксессуары, город, транспорт, фон. Плюс выросли разрешение и длина роликов. Даже одной неудачной фотографии буровой вышки с телефона достаточно, чтобы получить целый фильм, а если есть снимки с разных сторон, результат будет очень хорошим.
Музыка без страха блокировок
Раньше у авторов контента была особая боль: известную музыку блокируют сразу, а купленная на стоке лицензионная композиция может «выстрелить» через пару месяцев из-за Content ID. Коновалов не раз переписывался с поддержкой платформ и пришёл к выводу, что это бесполезно: любую музыку, которая занесена в базы авторских прав, использовать нельзя. Генерация музыки снимает эту проблему.
Агенты и рабочий процесс: пока без полной автоматизации
Автономные агенты для картинок и видео пока не очень функциональны, хотя их наверняка допилят. Рабочая схема сегодня такая: описать идею голосом, пусть даже мычанием и ассоциациями, передать текст языковой модели вместе с инструкцией, как писать запросы под конкретную нейросеть, получить готовый промт, проверить и поправить. Для видео это особенно важно: сценарий, раскадровка, ракурсы, переходы, реплики и музыка складываются в огромное полотно текста, которое специалист писал бы очень долго, а языковая модель делает быстро. «Без этого сейчас вообще уже как бы никак».
Главное ограничение: без человека нейросеть даёт только среднее
Нейросеть не приходит с идеей, её должен принести человек. Если попросить «сделай красивую картинку», результат будет средним, и Коновалов формулирует жёстко: «Вы никогда не прыгнете выше среднего. А средний, которого много, становится ничтожным, ценность теряется абсолютно». Чтобы получить по-настоящему хорошую работу, нужно видеть, что свет не тот, ракурс не тот, композиция хромает, ритм не держится.
Что будет с командами и профессиями
Вопрос, распустил ли креативный директор ГК Сантэнс команду, Коновалов обходит с юмором: сам он всегда работал «в одни руки», так что себя уволить не мог. По его оценке, кого-то, возможно, и сократят, но в целом люди, которые умели делать работу раньше, теперь делают то же самое «гораздо больше и быстрее». Старые добрые фотографы, художники и дизайнеры по-прежнему нужны, просто «много их больных мест закрылось».
Реплики из зала и истории из практики
Один из слушателей рассказал, что сэкономил около 300 тысяч рублей на обложках для музыкальных релизов, и сравнил нынешний ажиотаж вокруг нейросетей с появлением синтезаторов: со временем и они станут привычным фоном, как искусственный интеллект в приложении такси.
Коновалов добавил две истории. Автор детской сказки, которому художник назвал цену в несколько тысяч долларов и потом пропал, сам сделал все иллюстрации в Midjourney за два дня. А участницы вокальной группы, которую он знает, с помощью нейросетей сами пишут стихи и музыку, набирают миллионные просмотры в соцсетях и получают приглашения на концерты.
Вывод Коновалова: пострадают в первую очередь те, с кем трудно договариваться, а выиграют те, кто давно хотел что-то создать сам.
Резюме
Выступление Олега Коновалова, креативного директора ГК Сантэнс, показывает генеративные нейросети как практический инструмент для компаний в узких отраслях, где готового визуального контента нет. Картинки, видео и музыка, на которые раньше уходили недели и бюджеты, теперь создаются за часы. Прорыв последнего года — стабильные персонажи и объекты в видео благодаря загрузке десятков референсов. Различить работу нейросети и человека практически невозможно, а тексты и запросы для генерации всё чаще пишет сама языковая модель.
Главный вывод Коновалова: технологии не отменяют профессионалов, а ускоряют их. Без идеи, вкуса и понимания композиции нейросеть даёт лишь средний результат, а средний результат в массовом потоке ничего не стоит. Выигрывают те, у кого есть что сказать, и те, кто умеет управлять инструментом.

