Новы движок OpenAI: чаму GPT Image 2 — гэта не Midjourney

Вясной 2026 OpenAI паказала GPT Image 2 — новае пакаленне ўбудаванага графічнага движка для ChatGPT. Гэта не яшчэ адзін Midjourney з іншым назвіскам. Пад капотам — іншая архітэктура, і вынікі адпаведныя.

Як гэта ўладкавана

Midjourney, Stable Diffusion і большасць іншых генератараў — дыфузійныя мадэлі. Яны «чысцяць» шум, пакуль з яго не вылупіцца карцінка. Адсюль вядомыя праблемы: літары ператвараюцца ў абракадабру, рукі з шасцю пальцамі, аб’екты плывуць пры спробе паправіць адну дэталь.

GPT Image 2 ідзе іншым шляхам — аўтарэгрэсійная архітэктура. Тэкст і выявы апрацоўваюцца ў адным трансформеры, як словы ў моўнай мадэлі. Алгарытм разумее логіку сцэны, а не проста камбінуе тэкстуры.

Пасля генерацыі мадэль робіць структурны аналіз карцінкі. Можна прасіць шматлікія кропкавыя праўкі — кампазіцыя не разваліцца. У дыфузіі кожная спроба перамаляваць фрагмент цягне скажэнне ўсяго астатняга.

Што цяпер можна

Тэкст на карцінках працуе. Сапраўдны. Доўгія абзацы, дробныя шрыфты, шматмоўныя надпісы. Галаўны боль усёй галіны — вырашаны.

UI і макеты. Інтэрфейсы з чытабельнымі кнопкамі, формамі, падпісамі. Тое ж з тэхнічнымі дыяграмамі.

Фотарэалізм без жоўтага фільтра. Старыя версіі GPT Image мелі характэрную цёплую заліўку, якая выдавала ІІ з першага позірку. Цяпер — натуральнае святло, нармальныя адлюстраванні.

Структурная стабільнасць. Аб’екты трымаюць анатомію паміж генерацыямі. Значыць, можна рабіць серыйныя карцінкі, раскадроўкі, каталогі — без таго, каб кожны кадр жыў сваім жыццём.

Як паспрабаваць

Ніяк. Пакуль. Мадэль у скрытым A/B-тэсце ўнутры ChatGPT. Хтосьці з Pro- ці Plus-карыстальнікаў можа атрымаць доступ выпадкова, але ўключыць адмыслова няма як. OpenAI раскочваюць ціха.