Вясной 2026 OpenAI паказала GPT Image 2 — новае пакаленне ўбудаванага графічнага движка для ChatGPT. Гэта не яшчэ адзін Midjourney з іншым назвіскам. Пад капотам — іншая архітэктура, і вынікі адпаведныя.
Як гэта ўладкавана
Midjourney, Stable Diffusion і большасць іншых генератараў — дыфузійныя мадэлі. Яны «чысцяць» шум, пакуль з яго не вылупіцца карцінка. Адсюль вядомыя праблемы: літары ператвараюцца ў абракадабру, рукі з шасцю пальцамі, аб’екты плывуць пры спробе паправіць адну дэталь.
GPT Image 2 ідзе іншым шляхам — аўтарэгрэсійная архітэктура. Тэкст і выявы апрацоўваюцца ў адным трансформеры, як словы ў моўнай мадэлі. Алгарытм разумее логіку сцэны, а не проста камбінуе тэкстуры.
Пасля генерацыі мадэль робіць структурны аналіз карцінкі. Можна прасіць шматлікія кропкавыя праўкі — кампазіцыя не разваліцца. У дыфузіі кожная спроба перамаляваць фрагмент цягне скажэнне ўсяго астатняга.
Што цяпер можна
Тэкст на карцінках працуе. Сапраўдны. Доўгія абзацы, дробныя шрыфты, шматмоўныя надпісы. Галаўны боль усёй галіны — вырашаны.
UI і макеты. Інтэрфейсы з чытабельнымі кнопкамі, формамі, падпісамі. Тое ж з тэхнічнымі дыяграмамі.
Фотарэалізм без жоўтага фільтра. Старыя версіі GPT Image мелі характэрную цёплую заліўку, якая выдавала ІІ з першага позірку. Цяпер — натуральнае святло, нармальныя адлюстраванні.
Структурная стабільнасць. Аб’екты трымаюць анатомію паміж генерацыямі. Значыць, можна рабіць серыйныя карцінкі, раскадроўкі, каталогі — без таго, каб кожны кадр жыў сваім жыццём.
Як паспрабаваць
Ніяк. Пакуль. Мадэль у скрытым A/B-тэсце ўнутры ChatGPT. Хтосьці з Pro- ці Plus-карыстальнікаў можа атрымаць доступ выпадкова, але ўключыць адмыслова няма як. OpenAI раскочваюць ціха.