Заметки

Промпт для генерации изображения: как добиться фотореализма

M
Markabus
·31 августа 2026 г.
Рабочий стол ретушёра в полутёмной студии: крупный монитор с фотореалистичным снимком и панелями цветокоррекции, рядом фотоаппарат со светосильным объективом, калибровочная карта и тестовые отпечатки

Промпт для генерации изображения — это текстовое описание кадра, по которому нейросеть рисует картинку. Написать его умеет каждый, а вот получить на выходе снимок, который не отличить от фотографии, выходит далеко не всегда: модель выдаёт то восковую кожу, то пластиковый глянец, то «слишком красивый» свет, какого в реальности не бывает. Разберём, из чего складывается фотореализм и как собрать промпт, который стабильно даёт правдоподобный результат — на примерах для Gemini, GPT Image, Midjourney и FLUX.

Почему картинка выглядит ненастоящей

Главная причина — не «слабая модель», а слишком короткий запрос. Когда вы пишете «красивая девушка в кафе», модель достраивает всё остальное сама и достраивает по усреднённому идеалу: безупречная кожа, симметричное лицо, ровный студийный свет, чистая посуда, никакого мусора в кадре. Такой кадр читается как реклама или 3D-рендер, потому что в реальной фотографии всегда есть шум, пыль, случайные отражения и неидеальная композиция.

Отсюда простое правило: фотореализм задаётся не словом «photorealistic», а описанием физики съёмки. Модель обучалась на реальных фотографиях вместе с их метаданными и подписями, поэтому слова про объектив, диафрагму, характер света и материалы буквально сдвигают результат в сторону фотобанка, а не иллюстрации.

Формула промпта: шесть смысловых слотов

Официальное руководство Google по генерации изображений предлагает почти дословный шаблон: «фотореалистичный [тип кадра] объекта [описание] в [обстановка]. [Описание света]. Снято [ракурс] на [тип объектива]». Этот же каркас работает и в других моделях. Удобно держать в голове шесть слотов.

1. Герой кадра

Что именно в фокусе и чем оно занято. Не «мужчина», а «седой мужчина лет шестидесяти в потёртой джинсовой куртке, чинит велосипедную цепь». Конкретика уменьшает пространство для домысливания — а домысливание и есть источник «пластика».

2. Тип кадра и ракурс

Общий план, средний, крупный, макро; съёмка с уровня глаз, снизу, сверху, из-за плеча. Ракурс сильнее всего влияет на ощущение «это снимал человек»: кадры строго по центру с уровня груди выглядят синтетически.

3. Оптика и параметры съёмки

Здесь работают привычные фотографические термины: 35mm — репортажный широкий кадр, 50mm — естественная перспектива, 85mm f/1.8 — портрет с мягким размытием фона (боке), macro lens — предметная съёмка с микродеталями. Полезны и уточнения вроде «shallow depth of field» (малая глубина резкости), «shot on a DSLR», «subtle sensor noise» (лёгкий шум матрицы).

4. Свет

Самый недооценённый слот. Опишите источник и его характер: «мягкий свет из окна слева, пасмурный день», «тёплый контровой свет заката, лёгкая дымка», «одна лампа над столом, глубокие тени». Абстрактное «хорошее освещение» модель трактует как студийную трёхточечную схему — и кадр моментально уезжает в рекламный глянец.

5. Среда и второстепенные детали

Реальная сцена всегда захламлена: провода, следы от чашки, отклеившийся стикер, неровно сложенные бумаги. Два-три таких предмета в описании дают больше правдоподобия, чем десять эпитетов о красоте.

6. Материалы и несовершенства

Прямо просите текстуры: «поры кожи и лёгкие морщинки», «матовый пластик с царапинами», «пыль на металле», «отпечатки пальцев на стекле», «естественные изгибы кабеля». Это самый быстрый способ убрать эффект восковой фигуры.

Отдельно — стоп-лист

В конец промпта стоит добавлять явные запреты: «no 3D render look, no CGI product-render aesthetic, no glossy toy-like objects, no plastic skin, no watermark, no logos». Одни модели поддерживают отдельное поле negative prompt (отрицательный промпт), другие — например, семейства Gemini и GPT Image — лучше понимают запреты, встроенные в основной текст обычной фразой.

Готовый шаблон

Каркас, который можно копировать и подставлять своё:

«Фотореалистичный [план] снимок [герой + что делает] в [обстановка]. [Источник и характер света]. Снято [ракурс] на [объектив], малая глубина резкости. Видимые текстуры: [материалы и несовершенства]. На заднем плане в расфокусе: [2–3 бытовых предмета]. Строго фотореалистично: без 3D-рендера, без глянцевых игрушечных объектов, без крупного текста и логотипов.»

Пример заполнения: «Фотореалистичный средний план: пекарь в испачканном мукой фартуке вынимает противень из печи в маленькой городской пекарне ранним утром. Тёплый свет от печи снизу и холодный синеватый свет из витрины за спиной. Снято чуть сбоку с уровня груди на 35 мм, малая глубина резкости. Видимые текстуры: мука на предплечьях, поры кожи, подпалины на металле противня, потёртая плитка. На заднем плане в расфокусе: стеллаж с формами, мятая коробка, настенные часы. Строго фотореалистично: без 3D-рендера, без глянца, без текста и логотипов».

Чем генерировать в 2026 году

Gemini (семейство Nano Banana). В Gemini API сейчас три актуальные модели изображений: gemini-3.1-flash-lite-image (только 1K, дешёвая), gemini-3.1-flash-image (0.5K–4K) и gemini-3-pro-image — она же Nano Banana Pro, вышедшая 20 ноября 2025 года и заточенная под сложные сцены, разрешение до 4K, аккуратный текст на изображении и удержание внешности до пяти человек при смешивании до 14 входных картинок. Цены на момент подготовки материала: Pro — $0,134 за кадр в 1K/2K и $0,24 в 4K, Flash — от $0,045 (0,5K) до $0,151 (4K), Lite — $0,0336 за 1K; в батч-режиме вдвое дешевле. Поддерживаются соотношения сторон от 1:1 до 21:9. Попробовать без кода можно в Google AI Studio, а подключиться программно — по инструкции по ключу Gemini API; если сервис не открывается, смотрите разбор гео-ограничений Gemini.

OpenAI. В каталоге моделей текущей является gpt-image-2, описанная как флагманская модель генерации и редактирования; предыдущая gpt-image-1 помечена как устаревшая и поддерживает размеры 1024×1024, 1024×1536 и 1536×1024 с тремя уровнями качества. Сильная сторона семейства — послушное следование длинным структурированным инструкциям, поэтому подробный шаблон выше здесь особенно хорошо окупается.

Midjourney. С 24 июля 2026 года версия по умолчанию — V8.2 (до неё V8.1 с апреля 2026-го); нужная версия задаётся параметром --v 8.2 в конце промпта. Модель традиционно даёт наиболее «киношную» картинку, но сильнее остальных навязывает собственную эстетику — фотореализма приходится добиваться более сухими, техническими формулировками.

FLUX.2 от Black Forest Labs (анонс 25 ноября 2025 года) — вариант для тех, кому нужны открытые веса: версия [dev] на 32 млрд параметров выложена на Hugging Face и запускается на потребительских видеокартах, есть проприетарные [pro] и [flex]. Поддерживается редактирование до 4 мегапикселей и до 10 референсных изображений для единого стиля. Логика та же, что и с текстовыми моделями: своя генерация на своём железе — это отсутствие лимитов и полный контроль над данными, подробнее в заметке про локальные модели на своём сервере.

Типичные ошибки

  • Гора эпитетов вместо описания. «Потрясающий, невероятно детализированный, шедевральный» не добавляют информации о кадре — их место занимает описание света и материалов.
  • Слишком много героев. Чем больше объектов претендуют на главный план, тем выше шанс получить кашу. Один герой в резкости, остальное — фон.
  • Выдуманные объекты в «фотореалистичной» сцене. Парящие голограммы и светящиеся абстрактные фигуры невозможно сфотографировать, поэтому модель вынуждена их рендерить — и весь кадр уезжает в CGI, сколько бы раз вы ни написали «photorealistic».
  • Ставка на текст внутри картинки. Даже у лучших моделей 2026 года длинные надписи выходят нестабильно. Надёжнее генерировать фон и накладывать текст в редакторе.
  • Одна попытка. Генерация — итеративный процесс: меняйте по одному параметру за раз (сначала свет, потом объектив, потом детали фона), иначе непонятно, что именно сработало.

Что делать с результатом

Практически все современные модели умеют не только генерировать с нуля, но и редактировать по тексту: «убери предмет со стола», «сделай свет холоднее», «поменяй ракурс». Это дешевле и предсказуемее, чем перегенерировать сцену целиком. Если картинка идёт на сайт, не забудьте про alt-текст и сжатие в WebP — тяжёлые 4K-кадры бьют по скорости загрузки сильнее, чем любой плагин.

И про честность. Все изображения Gemini получают невидимую метку SynthID, по которой генерацию можно распознать автоматически; в приложении Gemini на бесплатном тарифе и на части платных добавляется ещё и видимый знак. Если снимок изображает конкретный реальный продукт, место, событие или человека, подпись «изображение сгенерировано ИИ» — не формальность, а способ не подвести читателя.

Вывод

Фотореализм — вопрос дисциплины, а не удачи. Опишите героя, план и ракурс, назовите объектив, отдельно проговорите свет, добавьте материалы с их несовершенствами и завершите промпт явными запретами. Дальше — итерации по одному параметру. Тот же подход, что и в работе с текстовыми моделями: чем точнее вы объясняете задачу, тем меньше модель домысливает за вас — об этом же практические приёмы промпт-инжиниринга.

Частые вопросы

Q.Помогает ли слово «photorealistic» в начале промпта?

Помогает, но само по себе решает мало. Гораздо сильнее работает описание физики съёмки: тип кадра, объектив (35mm, 50mm, 85mm f/1.8), источник и характер света, а также материалы с их несовершенствами — пыль, царапины, поры кожи. Слово «фотореалистичный» лишь задаёт направление, детали задают результат.

Q.Почему у людей на генерациях «восковая» кожа?

Модель по умолчанию рисует усреднённый идеал: ровный тон, отсутствие пор и морщин, мягкий студийный свет. Лечится явным описанием текстуры кожи, направленным светом с выраженными тенями и запретом на глянец в конце промпта. Помогает и уход от фронтального ракурса.

Q.Какая модель лучше для фотореализма в 2026 году?

Универсального лидера нет. Gemini 3 Pro Image (Nano Banana Pro) хорош для сложных сцен и разрешения до 4K, gpt-image-2 — для точного следования длинным инструкциям, Midjourney V8.2 даёт самую «киношную» картинку, но навязывает свою эстетику, а FLUX.2 [dev] с открытыми весами подойдёт тем, кому нужна генерация на своём железе.

Q.Нужно ли помечать сгенерированные изображения?

Изображения Gemini уже несут невидимую метку SynthID, а в приложении на ряде тарифов — и видимый знак. Явную подпись «изображение сгенерировано ИИ» стоит ставить, когда кадр можно принять за фотографию реального продукта, места, события или человека.

Источники

Предыдущая
Не работает Gemini в России: почему и что делать
Следующая
Few-shot и примеры в промпте: как получить нужный ответ

Читайте также

Вид сверху на рабочий стол: ряд бумажных карточек с короткими парами «вход — выход», рядом ручка, механическая клавиатура и край экрана с кодомЗаметки
1 сентября 2026 г.

Few-shot и примеры в промпте: как получить нужный ответ

Иногда нужный результат проще показать, чем описать. Разбираем few-shot: сколько примеров давать, как их размечать, почему важны порядок и баланс классов, где приём не нужен и во сколько токенов обходится.

Читать →
Рабочий стол разработчика в тёмной комнате: на экране ноутбука терминал с красной ошибкой неудавшегося запроса, рядом второй монитор с кодом, роутер с индикаторами и моток сетевого кабеляЗаметки
28 августа 2026 г.

Не работает Gemini в России: почему и что делать

Gemini API отвечает 400 FAILED_PRECONDITION, а AI Studio не даёт выпустить ключ. Разбираем, как Google определяет регион, почему VPN на компьютере не спасает боевой сервер и как за вечер поднять свой обратный прокси на nginx — с проверкой IP, конфигом и типичными граблями.

Читать →
Открытый серверный блок на тёмном рабочем столе: материнская плата, планки памяти и NVMe-накопитель крупным планом, за ним монитор с тёмной панелью управления и синим облаком точек — визуализацией векторов.Заметки
27 августа 2026 г.

Qdrant: разворачиваем векторную базу на своём сервере

Практический гайд по самостоятельному хостингу Qdrant: сколько нужно памяти, запуск в Docker и docker compose, API-ключ и TLS, первая коллекция, фильтры по метаданным, квантизация и бэкапы.

Читать →