Промпт для генерации изображения — это текстовое описание кадра, по которому нейросеть рисует картинку. Написать его умеет каждый, а вот получить на выходе снимок, который не отличить от фотографии, выходит далеко не всегда: модель выдаёт то восковую кожу, то пластиковый глянец, то «слишком красивый» свет, какого в реальности не бывает. Разберём, из чего складывается фотореализм и как собрать промпт, который стабильно даёт правдоподобный результат — на примерах для Gemini, GPT Image, Midjourney и FLUX.
Почему картинка выглядит ненастоящей
Главная причина — не «слабая модель», а слишком короткий запрос. Когда вы пишете «красивая девушка в кафе», модель достраивает всё остальное сама и достраивает по усреднённому идеалу: безупречная кожа, симметричное лицо, ровный студийный свет, чистая посуда, никакого мусора в кадре. Такой кадр читается как реклама или 3D-рендер, потому что в реальной фотографии всегда есть шум, пыль, случайные отражения и неидеальная композиция.
Отсюда простое правило: фотореализм задаётся не словом «photorealistic», а описанием физики съёмки. Модель обучалась на реальных фотографиях вместе с их метаданными и подписями, поэтому слова про объектив, диафрагму, характер света и материалы буквально сдвигают результат в сторону фотобанка, а не иллюстрации.
Формула промпта: шесть смысловых слотов
Официальное руководство Google по генерации изображений предлагает почти дословный шаблон: «фотореалистичный [тип кадра] объекта [описание] в [обстановка]. [Описание света]. Снято [ракурс] на [тип объектива]». Этот же каркас работает и в других моделях. Удобно держать в голове шесть слотов.
1. Герой кадра
Что именно в фокусе и чем оно занято. Не «мужчина», а «седой мужчина лет шестидесяти в потёртой джинсовой куртке, чинит велосипедную цепь». Конкретика уменьшает пространство для домысливания — а домысливание и есть источник «пластика».
2. Тип кадра и ракурс
Общий план, средний, крупный, макро; съёмка с уровня глаз, снизу, сверху, из-за плеча. Ракурс сильнее всего влияет на ощущение «это снимал человек»: кадры строго по центру с уровня груди выглядят синтетически.
3. Оптика и параметры съёмки
Здесь работают привычные фотографические термины: 35mm — репортажный широкий кадр, 50mm — естественная перспектива, 85mm f/1.8 — портрет с мягким размытием фона (боке), macro lens — предметная съёмка с микродеталями. Полезны и уточнения вроде «shallow depth of field» (малая глубина резкости), «shot on a DSLR», «subtle sensor noise» (лёгкий шум матрицы).
4. Свет
Самый недооценённый слот. Опишите источник и его характер: «мягкий свет из окна слева, пасмурный день», «тёплый контровой свет заката, лёгкая дымка», «одна лампа над столом, глубокие тени». Абстрактное «хорошее освещение» модель трактует как студийную трёхточечную схему — и кадр моментально уезжает в рекламный глянец.
5. Среда и второстепенные детали
Реальная сцена всегда захламлена: провода, следы от чашки, отклеившийся стикер, неровно сложенные бумаги. Два-три таких предмета в описании дают больше правдоподобия, чем десять эпитетов о красоте.
6. Материалы и несовершенства
Прямо просите текстуры: «поры кожи и лёгкие морщинки», «матовый пластик с царапинами», «пыль на металле», «отпечатки пальцев на стекле», «естественные изгибы кабеля». Это самый быстрый способ убрать эффект восковой фигуры.
Отдельно — стоп-лист
В конец промпта стоит добавлять явные запреты: «no 3D render look, no CGI product-render aesthetic, no glossy toy-like objects, no plastic skin, no watermark, no logos». Одни модели поддерживают отдельное поле negative prompt (отрицательный промпт), другие — например, семейства Gemini и GPT Image — лучше понимают запреты, встроенные в основной текст обычной фразой.
Готовый шаблон
Каркас, который можно копировать и подставлять своё:
«Фотореалистичный [план] снимок [герой + что делает] в [обстановка]. [Источник и характер света]. Снято [ракурс] на [объектив], малая глубина резкости. Видимые текстуры: [материалы и несовершенства]. На заднем плане в расфокусе: [2–3 бытовых предмета]. Строго фотореалистично: без 3D-рендера, без глянцевых игрушечных объектов, без крупного текста и логотипов.»
Пример заполнения: «Фотореалистичный средний план: пекарь в испачканном мукой фартуке вынимает противень из печи в маленькой городской пекарне ранним утром. Тёплый свет от печи снизу и холодный синеватый свет из витрины за спиной. Снято чуть сбоку с уровня груди на 35 мм, малая глубина резкости. Видимые текстуры: мука на предплечьях, поры кожи, подпалины на металле противня, потёртая плитка. На заднем плане в расфокусе: стеллаж с формами, мятая коробка, настенные часы. Строго фотореалистично: без 3D-рендера, без глянца, без текста и логотипов».
Чем генерировать в 2026 году
Gemini (семейство Nano Banana). В Gemini API сейчас три актуальные модели изображений: gemini-3.1-flash-lite-image (только 1K, дешёвая), gemini-3.1-flash-image (0.5K–4K) и gemini-3-pro-image — она же Nano Banana Pro, вышедшая 20 ноября 2025 года и заточенная под сложные сцены, разрешение до 4K, аккуратный текст на изображении и удержание внешности до пяти человек при смешивании до 14 входных картинок. Цены на момент подготовки материала: Pro — $0,134 за кадр в 1K/2K и $0,24 в 4K, Flash — от $0,045 (0,5K) до $0,151 (4K), Lite — $0,0336 за 1K; в батч-режиме вдвое дешевле. Поддерживаются соотношения сторон от 1:1 до 21:9. Попробовать без кода можно в Google AI Studio, а подключиться программно — по инструкции по ключу Gemini API; если сервис не открывается, смотрите разбор гео-ограничений Gemini.
OpenAI. В каталоге моделей текущей является gpt-image-2, описанная как флагманская модель генерации и редактирования; предыдущая gpt-image-1 помечена как устаревшая и поддерживает размеры 1024×1024, 1024×1536 и 1536×1024 с тремя уровнями качества. Сильная сторона семейства — послушное следование длинным структурированным инструкциям, поэтому подробный шаблон выше здесь особенно хорошо окупается.
Midjourney. С 24 июля 2026 года версия по умолчанию — V8.2 (до неё V8.1 с апреля 2026-го); нужная версия задаётся параметром --v 8.2 в конце промпта. Модель традиционно даёт наиболее «киношную» картинку, но сильнее остальных навязывает собственную эстетику — фотореализма приходится добиваться более сухими, техническими формулировками.
FLUX.2 от Black Forest Labs (анонс 25 ноября 2025 года) — вариант для тех, кому нужны открытые веса: версия [dev] на 32 млрд параметров выложена на Hugging Face и запускается на потребительских видеокартах, есть проприетарные [pro] и [flex]. Поддерживается редактирование до 4 мегапикселей и до 10 референсных изображений для единого стиля. Логика та же, что и с текстовыми моделями: своя генерация на своём железе — это отсутствие лимитов и полный контроль над данными, подробнее в заметке про локальные модели на своём сервере.
Типичные ошибки
- Гора эпитетов вместо описания. «Потрясающий, невероятно детализированный, шедевральный» не добавляют информации о кадре — их место занимает описание света и материалов.
- Слишком много героев. Чем больше объектов претендуют на главный план, тем выше шанс получить кашу. Один герой в резкости, остальное — фон.
- Выдуманные объекты в «фотореалистичной» сцене. Парящие голограммы и светящиеся абстрактные фигуры невозможно сфотографировать, поэтому модель вынуждена их рендерить — и весь кадр уезжает в CGI, сколько бы раз вы ни написали «photorealistic».
- Ставка на текст внутри картинки. Даже у лучших моделей 2026 года длинные надписи выходят нестабильно. Надёжнее генерировать фон и накладывать текст в редакторе.
- Одна попытка. Генерация — итеративный процесс: меняйте по одному параметру за раз (сначала свет, потом объектив, потом детали фона), иначе непонятно, что именно сработало.
Что делать с результатом
Практически все современные модели умеют не только генерировать с нуля, но и редактировать по тексту: «убери предмет со стола», «сделай свет холоднее», «поменяй ракурс». Это дешевле и предсказуемее, чем перегенерировать сцену целиком. Если картинка идёт на сайт, не забудьте про alt-текст и сжатие в WebP — тяжёлые 4K-кадры бьют по скорости загрузки сильнее, чем любой плагин.
И про честность. Все изображения Gemini получают невидимую метку SynthID, по которой генерацию можно распознать автоматически; в приложении Gemini на бесплатном тарифе и на части платных добавляется ещё и видимый знак. Если снимок изображает конкретный реальный продукт, место, событие или человека, подпись «изображение сгенерировано ИИ» — не формальность, а способ не подвести читателя.
Вывод
Фотореализм — вопрос дисциплины, а не удачи. Опишите героя, план и ракурс, назовите объектив, отдельно проговорите свет, добавьте материалы с их несовершенствами и завершите промпт явными запретами. Дальше — итерации по одному параметру. Тот же подход, что и в работе с текстовыми моделями: чем точнее вы объясняете задачу, тем меньше модель домысливает за вас — об этом же практические приёмы промпт-инжиниринга.
Частые вопросы
Помогает, но само по себе решает мало. Гораздо сильнее работает описание физики съёмки: тип кадра, объектив (35mm, 50mm, 85mm f/1.8), источник и характер света, а также материалы с их несовершенствами — пыль, царапины, поры кожи. Слово «фотореалистичный» лишь задаёт направление, детали задают результат.
Модель по умолчанию рисует усреднённый идеал: ровный тон, отсутствие пор и морщин, мягкий студийный свет. Лечится явным описанием текстуры кожи, направленным светом с выраженными тенями и запретом на глянец в конце промпта. Помогает и уход от фронтального ракурса.
Универсального лидера нет. Gemini 3 Pro Image (Nano Banana Pro) хорош для сложных сцен и разрешения до 4K, gpt-image-2 — для точного следования длинным инструкциям, Midjourney V8.2 даёт самую «киношную» картинку, но навязывает свою эстетику, а FLUX.2 [dev] с открытыми весами подойдёт тем, кому нужна генерация на своём железе.
Изображения Gemini уже несут невидимую метку SynthID, а в приложении на ряде тарифов — и видимый знак. Явную подпись «изображение сгенерировано ИИ» стоит ставить, когда кадр можно принять за фотографию реального продукта, места, события или человека.
Источники
- 1.Image generation with Gemini — Gemini API docshttps://ai.google.dev/gemini-api/docs/image-generation
- 2.Gemini API pricinghttps://ai.google.dev/gemini-api/docs/pricing
- 3.Nano Banana Pro: Gemini 3 Pro Image — Google Bloghttps://blog.google/innovation-and-ai/products/nano-banana-pro/
- 4.OpenAI API — Modelshttps://developers.openai.com/api/docs/models
- 5.Midjourney — Versionhttps://docs.midjourney.com/hc/en-us/articles/32199405667853-Version
- 6.FLUX.2: Frontier Visual Intelligence — Black Forest Labshttps://bfl.ai/blog/flux-2



