GPT Image 2: как пользоваться и под какие задачи он реально сильнее
GPT Image 2 понимает длинные описания и держит текст на картинке. Разбираем, как формулировать запрос, где модель сильнее прочих и в чём проигрывает.
GPT Image 2 отличается от соседей по полке одной особенностью: он лучше остальных понимает сложные словесные инструкции. Не «красивая сцена с товаром», а абзац с деталями, где каждая фраза учитывается. Для человека, который умеет формулировать, это меняет всё.
Задача: текст внутри картинки
Сильная сторона. Надпись на упаковке, заголовок на баннере, ценник, слоган.
Кириллицу модель держит заметно аккуратнее большинства, хотя и не идеально: длинные фразы всё ещё могут поехать. Короткие слова получаются почти всегда. Мы это сравнивали на десятке моделей.
Практический приём: текст пишите в запросе в кавычках и отдельной фразой, буквально «на этикетке надпись "Крем для рук"». Так модель понимает, что это именно текст, а не описание.
Задача: точное следование описанию
Вторая сильная сторона и главная причина брать эту модель.
Если в сцене должно быть пять конкретных предметов в определённом порядке, модель это выполняет заметно чаще остальных. Другие модели на длинном описании начинают выборочно игнорировать детали.
Отсюда вывод: короткий промпт на эту модель тратить жалко, она раскрывается на подробных. Пишите абзацем, а не строкой.
Хотя тут я сама себе противоречу. Советую писать абзацем, а когда пишу абзацем, регулярно получаю перегруженный кадр: модель послушно ставит в сцену всё, что я перечислила.
Задача: предметное фото товара
Здесь ровно, но без превосходства. Фактура и свет получаются достоверными, однако Nano Banana и Seedream 5.0 на фактуре часто убедительнее.
Если товар простой и важен текст на упаковке, берите GPT Image. Если фактура решает, берите соседей.
Задача: скорость и объём
Слабое место. Модель думает дольше быстрых и стоит дороже.
Для сотни черновиков она не подходит: дешевле перебрать варианты на Z-Image, а финал добить здесь.
Как формулировать запрос, чтобы GPT Image 2 раскрылся
Порядок, который у меня работает лучше всего.
Сначала объект: что это, из чего, какого цвета, в каком состоянии.
Потом сцена: на чём стоит, что вокруг, что на заднем плане.
Потом свет: откуда, какой мягкости, какое время суток.
Потом камера: крупный план, средний, ракурс.
Потом текст, если он нужен, в кавычках.
И в конце запреты: чего в кадре быть не должно.
Такой порядок не обязателен, модель понимает и свободную речь. Но когда описание длинное, структура помогает не забыть половину. Общую структуру промпта разбирали отдельно.
Тут я сама себе противоречу. Советую писать абзацем, а когда пишу абзацем, регулярно получаю перегруженный кадр: модель послушно ставит в сцену всё, что я перечислила. Лучше десять точных фраз, чем тридцать приблизительных.
Где смотреть подробности
Технический разбор возможностей и цифры по бенчмаркам у нас лежат в обзоре GPT Image 2 и в разборе позиций модели в рейтингах. Сама модель доступна на странице GPT Image 2, там же видно текущую стоимость генерации.
Часто задаваемые вопросы
Что умеет GPT Image 2? Генерировать изображения по подробному текстовому описанию и по референсу, включая надписи внутри кадра. Сильнее всего модель в точном следовании длинным инструкциям и в работе с текстом на картинке.
Пишет ли GPT Image 2 по-русски? Кириллицу держит заметно лучше большинства моделей, особенно короткие слова. Длинные фразы всё ещё могут исказиться, поэтому надпись стоит указывать в кавычках отдельной фразой.
Чем GPT Image 2 отличается от других моделей? Пониманием сложных инструкций. На длинном описании с множеством деталей он выполняет больше пунктов, чем соседи, которые начинают игнорировать часть требований.
Подходит ли он для карточек маркетплейса? Да, особенно когда важен текст на упаковке или точное соблюдение состава сцены. Если решает фактура материала, стоит сравнить с Nano Banana и Seedream.
Источники
Об авторе
Марина Лебедева
Обозреватель Flami