Любая задача начинается с одной и той же развилки, и большая часть потраченных впустую кредитов уходит на неверную ветку. Описать картинку с нуля и изменить картинку, которая у вас уже есть, — это разные инструменты, и второй используют недостаточно.
Правило
Если хотя бы часть финального изображения уже существует — товар, логотип, комната, лицо, набросок, даже неудачный вчерашний рендер, — начинайте с генерации по изображению. Если ещё ничего нет, начинайте с генерации по тексту.
Записанное, это звучит очевидно. На практике люди словами описывают собственный товар модели, которая его никогда не видела, а потом тратят пятнадцать рендеров, уговаривая её выдать правильную форму.
Что на самом деле контролирует каждый режим
| По тексту | По изображению | |
|---|---|---|
| Вы даёте | Описание | Одно или несколько изображений плюс описание |
| Вы контролируете | Объект, стиль, кадрирование | Всё это плюс сам предмет |
| Попыток до попадания | Несколько, если объект конкретный | Обычно одна-две |
| Слоты референсов | Нет | От 1 до 16, в зависимости от модели |
| Лучше всего для | Концептов, сцен, настроений, фонов | Товаров, людей, фирменных материалов, правок |
На одной и той же модели оба режима стоят одинаково за рендер. Разница не в цене попытки, а в том, сколько попыток вам нужно.
Референсы — это и есть суть
Сколько референсов принимает модель — это реальная разница в возможностях, а не строчка в спецификации. Некоторые берут ровно один. GPT Image 2 и GPT Image 2.5 берут до шестнадцати. Nano Banana 2 берёт четырнадцать, Nano Banana Pro и Seedream — от восьми до десяти.
Один референс отвечает на «сделай похоже на это». Восемь референсов отвечают на «вот товар, вот эти ракурсы, вот такая отделка, и вот такой свет мне нужен». Именно второй вопрос и задаёт предметная съёмка.
Что класть в слоты
Рабочий набор такой: два-три ракурса объекта, одно изображение для света или настроения и одно — для поверхности или обстановки. Восемь вариантов одного и того же ракурса не помогут. Модель не усредняет — ей показывают, что важно.
Случаи, в которых чаще всего ошибаются
Логотипы и упаковка. Модель, которой велели нарисовать ваш логотип по описанию, выдаст нечто логотипообразное и неверное. Передайте его как референс — и та же модель разместит его правильно.
Один товар, двенадцать раз. Карточкам товара единообразие нужнее блеска. Генерация по тексту даст двенадцать правдоподобных бутылок; генерация по изображению с фиксированным набором референсов даст одну бутылку, снятую двенадцатью способами.
«Почти то, надо одно изменить». Это самая крупная статья расходов. Когда рендер готов на 90%, люди переписывают запрос и бросают кости заново, переслучайно задавая всё, включая то, что работало. Если вернуть удачный рендер как референс и описать только изменение, понравившееся сохранится.
Фон. Вырезать объект и поставить его в другое место — не задача генерации. Инструменты удаления фона, прозрачного фона и цвета фона делают это, вообще не трогая объект.
Когда генерация по тексту действительно уместна
Фоны и среды, в которые вы потом будете что-то вставлять. Концептуальная работа, где смысл в том, чтобы увидеть варианты. Иллюстрация и стилизованная графика без реального прототипа. Всё, где «удиви меня» — достоинство, а не риск.
Это ещё и более дешёвое место для поиска. Модели за 2 кредита существуют именно для этого: прогнать шесть кадрировок идеи, выбрать одну и только потом подключать референсы и модель получше для исполнения.
Гибридный процесс, который работает
Большинство готовых изображений на этой платформе рождаются из цикла, а не из одного запроса. Набросайте композицию по тексту на дешёвой модели. Выберите лучший кадр. Перейдите в режим по изображению, верните этот кадр как референс вместе с настоящим товаром и опишите только то, что должно измениться. Финал прогоните на модели, подходящей месту публикации.
Два-три таких прохода лучше двенадцати перебросов — и дешевле. Параметрическая сторона того же цикла — сиды, guidance и что стоит фиксировать между запусками — разобрана в статье повторяемые результаты.
Переключиться на полпути, не начиная заново
В рабочем пространстве поле запроса одинаково в обоих режимах; именно добавление референса и переводит вас из одного в другой. Ничего в запросе переписывать не нужно, список моделей тот же, так что уже сделанное сравнение остаётся в силе.
Девятнадцать моделей поддерживают оба режима с разными лимитами референсов. Список — в каталоге, а цена считается за рендер независимо от режима: единственное, что меняет ваш выбор, — сколько рендеров понадобится. А это обычно и есть весь бюджет.
Одна задача, пройденная двумя путями
Конкретное сравнение. У вас есть фотография керамической бутылки и нужны три изображения: кадр для карточки на белом фоне, кухонная сцена и широкий баннер.
| Подход | Шаги | Результат |
|---|---|---|
| Только по тексту | Каждый раз описывать бутылку; перебрасывать, пока форма не приблизится | Три разные бутылки, и ни одна не ваша |
| По изображению | Дать фото как референс; описывать только обстановку и кадр | Одна бутылка, три обстановки, единый стиль |
Второй маршрут ещё и заканчивается быстрее, потому что каждое изображение получается с одной-двух попыток вместо пяти. Кредиты за рендер одинаковы; итог — несопоставим.
Сбои, которые стоит узнавать
Плывущий объект. Ваш товар меняет форму от рендера к рендеру. Либо вы в текстовом режиме, когда не должны, либо strength выставлен так высоко, что модель вольна переосмыслить референс.
Коллаж. Слишком много несвязанных референсов дают изображение, которое их усредняет. Пять референсов, выбранных под разные задачи — ракурс, ракурс, свет, поверхность, настроение, — работают; двенадцать похожих — нет.
Затёртая удача. Рендер почти идеален, вы переписываете запрос — и хорошей версии больше нет. Верните удачный рендер как референс и опишите только изменение.
Запрос, который должен был быть инструментом. Просьба «то же изображение, но на белом фоне» стоит целого рендера, тогда как один инструмент делает это, не трогая объект.
Какие модели подходят какому режиму
Для генерации по тексту важнее всего дешёвые быстрые движки, потому что попытки накапливаются именно на стадии поиска. Для генерации по изображению возможное определяет лимит референсов: для переноса стиля хватит одного слота, а предметной работе с несколькими ракурсами нужно восемь и больше.
На страницах моделей указаны оба числа, а каталог показывает их рядом. Больше в вашем процессе между режимами менять нечего — тот же запрос, те же настройки соотношения сторон, то же чувство меры.
