ИИ фото: как получить фотореалистичный результат

13 мин чтения

Запрос «ИИ фото» ведёт на десяток сайтов с кнопкой «сгенерировать», и почти нигде не написано, почему у одного человека выходит кадр, похожий на съёмку, а у другого получается пластиковая картинка с шестью пальцами. Разница почти всегда упирается в формулировку запроса, и сервис тут играет вторую роль.

Разберём, как устроено описание фотографии, что нейросети даётся легко, а что до сих пор нет, и как отличить сгенерированный снимок от настоящего. Подбором сервиса займёмся отдельно: сравнение генераторов у нас лежит в самостоятельной подборке, а самый известный из них разобран брендовой статьёй.

Масштаб явления к делу отношение имеет. Вклад ИИ в валовой продукт России к 2030 году оценивают примерно в 5,5% [1], и визуальный контент занимает в этой цифре заметную долю.

Что называют ИИ-фото

За этим словосочетанием стоят три разные задачи, и путать их дорого.

Генерация с нуля. Опишите сцену словами, и модель нарисует несуществующий кадр. Этим и занимается ИИ генератор фото, о нём дальше пойдёт речь.

Обработка своего снимка. Замена фона, удаление лишнего, ретушь. Здесь исходник ваш, а нейросеть работает поверх него, и разбирали мы это отдельно.

Улучшение качества. Мелкий или мутный кадр вытягивается до пригодного размера, детали дорисовываются. Задача соседняя и решается другими сервисами.

Дальше речь про первую задачу. Слово «фото» здесь описывает результат, который выглядит снятым на камеру, хотя никакой съёмки за ним не стояло.

Что получается хорошо, а что до сих пор нет

Сначала хорошая часть. Предметная съёмка на однотонном фоне, интерьеры, пейзажи, еда, абстрактные фоны и текстуры выходят убедительно почти с первой попытки. Свет модель строит грамотно, материалы различает, глубину резкости имитирует.

Дальше начинается список, который генераторы у себя на сайтах не пишут.

Руки и пальцы. Классическая беда стала реже, хотя никуда не делась: крупный план кисти с предметом до сих пор ломается.

Текст в кадре. Вывеска, этикетка, обложка книги и номер на двери проверяют модель на прочность: латиницу новые поколения держат сносно, а кириллица разваливается почти всегда.

Повторяемость человека. Один и тот же персонаж в двух разных сценах получается похожим, хотя и не тем же самым, и для серии постов это критично.

Мелкая механика. Отражения в зеркале, тени от нескольких источников, украшения, шнурки, зубы. Модель рисует правдоподобно, а при увеличении собирается ерунда.

Известные люди и узнаваемые бренды. Часть сервисов такие запросы блокирует, часть выдаёт карикатуру. Юридическая сторона тут отдельная, и мы к ней вернёмся.

Как написать запрос на фотографию

Фотозапрос отличается от обычного одной вещью: в нём есть камера. Модель училась на настоящих снимках вместе с их подписями, поэтому слова из языка фотографов работают в нём как рычаги.

Оптика и план

Начните с того, что вы снимаете и с какого расстояния. Крупный план, средний и общий задают композицию раньше всего остального.

Дальше добавьте оптику. Портретный объектив даёт размытый фон и мягкие черты, широкоугольный растягивает пространство, макро вытаскивает фактуру. Слова вроде «85mm», «широкоугольный», «макросъёмка» модель понимает буквально.

Третьим рычагом работает тип носителя: просьба про плёночную съёмку добавит зерно и характерный цвет, а упоминание студийной съёмки уберёт случайности.

Попробуйте

Средний план: кружка чёрного чая на деревянном столе у окна, портретный объектив, размытый фон, мягкий боковой свет, плёночная фотография

Содержание

Ракурс и композиция

Точка съёмки меняет кадр сильнее, чем набор предметов в нём. Вид сверху годится для раскладки на столе, съёмка с уровня глаз даёт нейтральный репортажный кадр, нижняя точка добавляет объекту весомости.

Скажите модели и про кадрирование: вертикаль для сторис, горизонталь для обложки, квадрат для карточки товара. Формат лучше задать словами и параметром сразу, иначе сервис отдаст свой стандартный.

Ещё один приём, о котором почти не пишут: назовите, где в кадре пустое место. Просьба оставить свободное поле слева выручает, когда поверх картинки ляжет текст.

Свет

Свет делает кадр правдоподобным сильнее, чем что угодно ещё. Опишите его двумя параметрами: откуда падает и какой он.

Боковой свет из окна, контровой на закате, рассеянный пасмурный, жёсткий полуденный, тёплый ламповый вечером. Каждая формулировка меняет картинку целиком, и подбирать её быстрее, чем переписывать всё описание.

Отдельно упомяните время суток. «Раннее утро» и «синий час» дают модели готовую палитру, поэтому цвет не приходится описывать словами.

Что убрать из кадра

Половина неудачных генераций получается из-за того, что в запросе не сказано, чего быть не должно.

Напишите прямо: без текста и надписей, без логотипов, без людей на заднем плане, без лишних предметов на столе. Часть моделей понимает отдельный параметр для исключений, часть достаточно попросить словами.

И держите описание коротким. Запрос на пятнадцать существительных модель разбирает хуже, чем на пять: лишние детали конкурируют друг с другом, и побеждают случайные.

Попробуйте

Общий план: пустая переговорная комната небольшого офиса, дневной свет из окна слева, минимализм, без людей, без надписей на стенах, без логотипов

Остаётся вопрос, что делать с почти удачным результатом. Дешевле доработать такой кадр, чем гнаться за идеалом с нуля: почти все сервисы перерисовывают выделенный участок и расширяют границы кадра. Приведите композицию в порядок за две-три генерации, а мелочи чините точечно.

Не знаете, с чего начать в AI?
Пройдите короткий опрос, и promptyka составит под вас индивидуальный план погружения в AI
Пройти опрос

Своё лицо и свои товары

Три сценария, где генерация встречается с вашим материалом.

Портрет по своей фотографии. Загрузите снимок, и сервис сделает из него стилизованный образ. Сходство при этом плавает, а добиваться его приходится отдельными приёмами, и разбирали мы их подробно.

Карточка товара. Предмет ставится в сгенерированную обстановку, фон меняется, добавляется свет. Для маркетплейсов это самый частый сценарий, и требования площадок к таким изображениям мы разбирали пошагово.

Фон и обстановка под свою съёмку. Самый недооценённый вариант: снимаете предмет сами, а окружение генерируете. Реальный объект остаётся настоящим, поэтому и доверия к кадру больше.

Общее правило для всех трёх: чем меньше вы просите модель дорисовать поверх настоящего, тем достовернее результат.

ИИ фото бесплатно: чем платит бесплатный уровень

Бесплатные генерации есть почти везде, и цена у них тоже есть почти везде. Просто она не написана на витрине.

Водяной знак. Скачанный файл несёт логотип сервиса, а снятие знака открывает подписка.

Разрешение. Бесплатный кадр обычно выходит мелким, и для печати или для большого экрана его не хватит.

Права на результат. Самый неочевидный пункт. У части сервисов изображения, созданные на бесплатном уровне, остаются за сервисом, и коммерческое использование открывает только платный тариф. Проверяйте это в пользовательском соглашении конкретного сервиса до того, как поставите картинку в рекламу.

Очередь и лимиты. Бесплатные генерации идут общим потоком, а число попыток в сутки конечно.

Как устроены бесплатные уровни у разных сервисов и где проходит граница, мы разбирали отдельно.

Как отличить ИИ-фото от настоящего

Навык полезен в обе стороны: и чтобы не поверить подделке, и чтобы понять, что выдаёт ваш собственный результат.

Смотрите на периферию кадра. Центр модель прорабатывает, а по краям начинается каша: слипшиеся пальцы у второстепенных людей, кривая геометрия зданий, повторяющийся узор на плитке.

Проверьте текст и мелкие детали: ошибки чаще всего собираются в буквах на вывесках, цифрах на часах, украшениях и узорах на ткани.

Оцените свет и тени. Тень от предмета должна совпадать по направлению с источником, а в сгенерированном кадре она нередко идёт сама по себе.

Обратите внимание на кожу и глаза. Слишком ровная кожа, симметричные блики в зрачках и стеклянный взгляд выдают генерацию быстрее прочего.

Технические способы проверки и юридическая сторона подделок разобраны в отдельном материале. Отдельно держите в голове маркировку: российское регулирование движется в сторону обязательной пометки сгенерированного контента.

Промпты для ИИ-фото

Пять заготовок под задачи, с которыми к генератору приходят чаще всего: меняйте в них предмет, а каркас оставляйте как есть.

Предметная съёмка для маркетплейса. «Крупный план: стеклянная банка мёда на светлом деревянном столе, однотонный светлый фон, рассеянный дневной свет, студийная предметная съёмка, высокая детализация, без текста и логотипов».

Фон для поста в Telegram-канал. «Общий план: рабочий стол с ноутбуком и чашкой кофе, вид сверху, мягкий утренний свет, спокойные бежевые тона, без людей, вертикальный кадр».

Интерьер для сайта услуг. «Средний план: небольшая парикмахерская, два кресла и зеркала, тёплый ламповый свет вечером, широкоугольный объектив, без людей, без надписей».

Еда для меню кафе. «Крупный план: тарелка сырников со сметаной и ягодами, деревянный стол, боковой свет из окна, портретный объектив, размытый фон, естественные цвета».

Атмосферный кадр для обложки. «Общий план: заснеженная улица маленького русского города вечером, тёплый свет в окнах домов, синий час, плёночная фотография, лёгкое зерно».

Каркас у всех пяти одинаковый: план, объект, обстановка, свет, техника, исключения. Разберитесь с этой схемой один раз, и переписывать запрос придётся заметно реже.

Частые вопросы

Изображение, которое нейросеть создала по текстовому описанию и которое выглядит как снятое на камеру. Настоящей съёмки за таким кадром нет.

Коротко: с чего начать

Фотореализм собирается из трёх вещей: правильно названного плана, описанного света и списка того, чего в кадре быть не должно. Сервис на результат влияет меньше, чем эти три слоя.

Начните с одного кадра, который вам действительно нужен: фон для поста, снимок товара, иллюстрация к статье. Напишите запрос по схеме выше, получите четыре варианта и доработайте лучший вместо того, чтобы переписывать описание с нуля.

Отдача от навыка неравномерна по отраслям. По расчётам PwC, премия к зарплате за ИИ-навыки доходит до 118% в потребительском секторе и падает до 16% в госсекторе [2]. Работа с визуалом как раз ближе к первому полюсу, потому что результат видно сразу и он измеряется продажами. Возьмите одну задачу этой недели и доведите её до готовой картинки.

Ссылки на источники

Попробуйте миниуроки по AI бесплатно

Открыть доступ