ChatGPT Images 1.5: Dette er OpenAIs store spring inden for billeder

  • ChatGPT Images lancerer GPT Image 1.5-modellen, op til fire gange hurtigere og med bedre instruktionssporing.
  • Det nye værktøj muliggør præcise redigeringer af uploadede fotos, samtidig med at belysning, komposition og ansigtstræk bevares.
  • Bemærkelsesværdig forbedring i tekstgenerering i billeder og i komplekse scener med mange ansigter eller smÃ¥ detaljer.
  • OpenAI lancerer sin egen billedsektion i ChatGPT, som nu er tilgængelig for de fleste brugere via API.

ChatGPT-billeder

AI-drevet billedgenerering er blevet et af de mest synlige udstillingsvinduer i kapløbet mellem tech-giganter. OpenAI har besluttet at tage skridtet med en større opdatering til ChatGPT Images , deres integrerede visuelle skabelsessystem, i en kontekst, hvor modeller som Googles Nano Banana Pro dominerede en stor del af samtalen.

Med denne lancering ønsker virksomheden bag ChatGPT, at deres værktøj skal gå ud over at være et simpelt chat-tilføjelsesprogram og fungere som et ægte integreret kreativt studie – hurtigere, mere præcist og med en brugerflade designet fra bunden til at arbejde med billeder i stedet for at være begrænset til tekst.

Ny GPT Image 1.5-model: hastighed og præcision som kendetegn

Kernen i opdateringen er GPT Image 1.5 , OpenAIs nye flagskibsmodel til billeder. Virksomheden hævder, at den kan generere visuelt indhold op til fire gange hurtigere end den tidligere version, en forskel der er særligt mærkbar i praksis i myldretiden og på mobile enheder, hvor det tidligere var almindeligt, at processen blev afbrudt eller trak ud i det uendelige, når man skiftede mellem apps.

Ud over ydeevnen ligger den vigtigste forbedring i instruktionssporing. Systemet fortolker komplekse prompter og præcise rumlige relationer med større nøjagtighed , så anmodninger som at ændre kun ét objekt, justere belysningen eller ændre en persons tøj ikke længere udløser uventede ændringer i resten af ​​scenen.

OpenAI forklarer, at GPT Image 1.5 er blevet trænet til at bevare vigtige billedelementer, såsom ansigtsidentitet, overordnet komposition og farvepalet , selv efter flere runder med kædet redigering. Dette er især relevant til professionel brug, hvor visuel konsistens ikke er en luksus, men et krav.

Spot- og kæderedigering: ændr kun det, der betyder noget

En af de største svagheder ved tidligere modeller var muligheden for at redigere specifikke områder . At skifte en hat, justere belysningen eller tilføje et element til baggrunden kunne ende med at remixe hele scenen. De nye ChatGPT Images adresserer direkte dette problem.

Modellen er i stand til at tilføje, fjerne, kombinere, blande og transponere elementer inden for det samme billede, samtidig med at de andre vigtige komponenter forbliver stabile. I praksis betyder det at kunne anmode om handlinger som at ændre farven på en skjorte, modificere en kasket, justere et trafikskilt eller omdanne en lastbil til en brandbil uden at forvrænge resten af ​​miljøet.

Kæderedigeringernes funktionsmåde er også blevet forbedret . Indtil nu har en tredje eller fjerde ændring ofte forårsaget, at modellen fuldstændigt "genopfinder" billedet. Med GPT Image 1.5 bevarer værktøjet stilen, posituren og scenen meget mere pålideligt, så du kan iterere på samme grundlag uden at skulle starte forfra med hver ændring.

Kreative transformationer: fra selfie til filmplakat

Ud over sin tekniske præcision skubber OpenAI ChatGPT Images ind i et udpræget kreativt territorium. Systemet giver brugerne mulighed for at uploade deres eget fotografi og, med en relativt simpel prompt, få troværdige transformerede versioner på få sekunder : fra en 90'er-reklame til en scene på Times Square midt om vinteren eller en cyberpunk-inspireret japansk by.

Modellen er også i stand til at genskabe specifikke kunstneriske stilarter , såsom klassiske filmplakater, illustrationer i anime-stil eller historisk udseende kompositioner, samtidig med at den respekterer den oprindelige persons centrale træk. Ideen er, at brugeren kan "se" sig selv i meget forskellige sammenhænge uden at miste følelsen af, at det er den samme person.

Denne tilgang minder om, hvad modeller som Nano Banana allerede har tilbudt, men OpenAI forsøger at differentiere sig ved at vælge mere kontrollerede konceptuelle transformationer , hvor systemet bevarer essensen af ​​basisfotoet, mens det ændrer tøj, miljø, belysning eller æra med betydelig visuel sammenhæng.

ChatGPT Images siger farvel til den gullige stil og forbedrer komplekse scener

I lang tid var det relativt let at identificere, om et billede var blevet oprettet med tidlige versioner af ChatGPT: varme toner, cremede overflader og et vist gult skær var dominerende , hvilket afslørede dets kunstige oprindelse. Imidlertid ser interne sammenligninger vist af OpenAI og i uafhængige tests, og sammenlignet med alternativer som Bing Image Creator , ud til at denne egenskab er forsvundet.

Den nye model tilbyder et mere neutralt og varieret farvespektrum , der minder mere om konventionelle fotografier, medmindre brugeren eksplicit anmoder om andet i meddelelsen. Dette er med til at gøre billederne mindre "brandede" og mere brugbare i sammenhænge, ​​hvor realisme eller integration med eksisterende fotografisk materiale ønskes.

Der er også foretaget forbedringer i gengivelsen af ​​scener med mange små elementer , såsom folkemængder eller baggrunde med mange detaljer. Ansigter i store grupper er nu mere tydelige med mere naturlige positurer og udtryk, og typiske fejl såsom håndfejl, små linjer og mærkelige gentagelser er blevet reduceret.

ChatGPT Images giver dig mulighed for at indsætte tekst i billeder: indsæt plakater, infografik og mockups

Generering af læsbar tekst i et billede har historisk set været en af ​​akilleshælene inden for generativ kunstig intelligens. OpenAI hævder, at GPT Image 1.5 tager et betydeligt skridt fremad på dette område med en langt mere ensartet typografisk gengivelse end i tidligere versioner.

Modellen kan håndtere tætte, små tekstblokke , hvilket åbner døren for at skabe plakater, infografik, avissidemockups eller designs med tabeller og markdown-lignende formater med et læsbarhedsniveau, der, selvom det ikke er perfekt, er tættere på noget, der kan bruges uden intensiv retouchering.

For dem, der arbejder inden for marketing, uddannelse, e-handel eller digitalt indhold, betyder denne forbedring mindre tid brugt på at rette misformede bogstaver eller ufuldstændige ord . I sammenhænge, ​​hvor der skal produceres visuelle materialer med klare, publikationsklare budskaber, bliver det faktum, at modellen i sig selv genererer rimelig ren tekst, en differentierende faktor.

En ny brugeroplevelse: en dedikeret billedsektion i ChatGPT

Opdateringen er ikke begrænset til modellen; den påvirker også, hvordan den bruges. OpenAI har tilføjet en dedikeret "Billeder"-sektion til ChatGPT-sidebjælken , både i mobilappen og webversionen. Målet er at adskille den visuelle oplevelse fra den traditionelle chat og gøre det nemmere for brugere, der ikke ønsker at kæmpe med komplekse prompts, at navigere.

Fra dette nye område kan brugerne finde foruddefinerede stilarter, trendforslag og skabeloner til hyppige opgaver såsom at lave hilsner, gendanne gamle fotos, skifte mellem forskellige kunstneriske stilarter eller generere variationer af det samme produkt. Denne tilgang sænker adgangsbarrieren for folk uden teknisk erfaring.

Et andet praktisk aspekt er, at billedsektionen fungerer som et centraliseret arkiv for alle brugerens visuelle kreationer. Derfra er det nemmere at gennemgå tidligere versioner, replikere en stil med nyt indhold eller fortsætte med at redigere et allerede genereret billede – noget, der er særligt nyttigt i kontinuerlige arbejdsgange.

Fra iøjnefaldende tilbehør til visuelt arbejdsværktøj

OpenAI anerkender selv, at billedgenerering i ChatGPT indtil nu har fungeret mere som et prangende ekstramateriale i en tekstbaseret brugerflade end som et robust visuelt arbejdsmiljø. Med denne opdatering sigter virksomheden mod at tage et kvalitativt spring: at gå fra "test"-billeder til sociale medier til et værktøj, der kan bruges i virkelige processer.

Forbedringen af ​​konsistens og iteration har en direkte indvirkning på sektorer som design, marketing, e-handel og branding . Virksomheder, der har brug for at tilpasse det samme kreative koncept til flere formater, teste produktvariationer eller opretholde konsistensen af ​​logoer og virksomhedselementer på tværs af hundredvis af elementer, finder en klar fordel i denne type kontrol.

Kreative platforme, der opererer i Europa, såsom webeditorer og cloudbaserede designværktøjer , integrerer allerede disse modeller i deres arbejdsgange. I denne sammenhæng kan OpenAIs engagement i et mere omfattende visuelt miljø være et godt valg for både SMV'er, der ønsker at accelerere produktionen af ​​grafisk materiale, og interne kommunikationsteams i store virksomheder.

Tilgængelighed af ChatGPT-billeder for brugere, virksomheder og udviklere

OpenAI er begyndt at udrulle den nye ChatGPT Images-funktion til de fleste brugere af platformen, inklusive dem på gratisversionen . Mange ser allerede en notifikation, når de åbner appen, der inviterer dem til at prøve billedfunktionen, og en ny dedikeret fane i sidemenuen for centraliseret adgang.

I erhvervssektoren har virksomheden bekræftet, at avanceret adgang til Business- og Enterprise-konti gradvist vil blive udrullet med fokus på integrationer i professionelle arbejdsgange . For europæiske organisationer, der allerede bruger ChatGPT til interne opgaver, betyder det at udvide brugen fra tekst til at omfatte grafisk indhold genereret under de samme loginoplysninger.

Parallelt hermed er GPT Image 1.5 tilgængelig via OpenAI API'en , hvilket giver udviklere mulighed for at integrere billedgenererings- og redigeringsfunktioner i deres egne applikationer. Virksomheden oplyser, at omkostningerne til billedinput og -output er cirka 20 % lavere end den tidligere model, hvilket er en betydelig fordel for store projekter eller tjenester, der opererer med snævre marginer.

Konkurrence med Nano Banana Pro og andre visuelle modeller

OpenAIs beslutning kommer i en tid med intens konkurrence. Google har promoveret Nano Banana Pro som en af ​​sine førende visuelle generative modeller, integreret den i sit økosystem af kreative værktøjer og knyttet den til sin Gemini-familie , hvilket har øget brugen globalt.

Denne situation har fået nogle konkurrerende tjenester til at indføre strenge begrænsninger for gratis brugere , for eksempel ved at reducere antallet af billeder, der kan genereres pr. dag, delvist på grund af stor efterspørgsel. I modsætning hertil synes OpenAI at fokusere på en kombination af bred rækkevidde, større hastighed og et mere raffineret redigeringsmiljø for at fastholde og tiltrække brugere.

I mellemtiden presser andre aktører som xAI med sin chatbot Grok, eller forskellige billedfokuserede modeller, på for at visuel generering bliver en central slagmark i kampen om brugeropmærksomhed. OpenAIs strategi involverer at konsolidere ChatGPT som en "alt-i-én-app", hvor søgning, tale, tekst, billeder og video sameksisterer i et enkelt indgangspunkt.

Med disse nye ChatGPT-billeder tager OpenAI et betydeligt skridt mod et mere modent visuelt værktøj : en hurtigere og mere præcis model, en distinkt brugerflade og redigeringsmuligheder, der er klart rettet mod brug i den virkelige verden, både i personlige og professionelle sammenhænge. Det er endnu uvist, i hvilket omfang disse forbedringer vil blive implementeret i brugernes og virksomhedernes dagligdag i Spanien og Europa, men budskabet er klart: billeder er ikke længere bare en sjov tilføjelse til chat, men er blevet en central del af ChatGPT-økosystemet.

ChatGPT skabe billeder
relateret artikel:
ChatGPT genererer nu billeder med GPT-4o: alt hvad du behøver at vide

Tilføj som foretrukken kilde i Google