O que é o ChatGPT Images 2.0? Recursos, prompts e casos de uso explicados

ChatGPT Images 2.0 on Morphic, an all-in-one creative studio

Guia completo do GPT Image 2 com recursos, dicas de prompt, o que fazer e o que evitar, especificações técnicas e casos de uso.

Como escrever prompts para o ChatGPT Images 2.0

A forma como você escreve o prompt molda o resultado diretamente. O GPT Image 2 processa a linguagem de forma sequencial, então as palavras no início do prompt carregam o maior peso visual. Aqui está um método de prompt para obter os melhores resultados.

1. Comece pelo estilo visual

As primeiras palavras definem a direção estética da imagem inteira. Nomeie um estilo específico antes de descrever qualquer outra coisa. Deixar o estilo para o final reduz sua influência no resultado.

Sem a orientaçãoCom a orientação
Um velho vendendo frutas em um mercado, deixe cinematográfico e sombrioUm plano aberto em estilo matte painting de um vendedor idoso arrumando romãs em uma barraca de mercado ao ar livre, céu nublado, luz cinza difusa, poças refletindo o toldo acima, tons terrosos suaves com toques de vermelho intenso

O primeiro prompt enterra o estilo em um adendo vago ("deixe cinematográfico e sombrio"). O segundo abre com "plano aberto em estilo matte painting", que fixa toda a estética antes de qualquer outra descrição.

Teste a versão melhorada:

Plano aberto em estilo matte painting de um vendedor idoso arrumando romãs em uma barraca de mercado
Prompt melhorado

Um plano aberto em estilo matte painting de um vendedor idoso arrumando romãs em uma barraca de mercado ao ar livre, céu nublado, luz cinza difusa, poças refletindo o toldo acima, tons terrosos suaves com toques de vermelho intenso

2. Siga uma ordem consistente no prompt

Escreva os prompts com uma estrutura fixa: primeiro o fundo ou a cena, depois o sujeito, depois os detalhes principais, depois as restrições. Para pedidos complexos, use segmentos curtos e identificados em vez de um único parágrafo longo.

Elemento do promptO que incluirExemplo
Cena / fundoCenário, ambiente, superfíciesUma bancada de mármore de banheiro ao lado de uma janela com vidro fosco
SujeitoO objeto ou a pessoa principalUm frasco de skincare com o rótulo 'Dew Drop Serum' e um logotipo minimalista de folha
DetalhesPosição, cores, materiais, textoPosicionado ligeiramente fora do centro, frasco de vidro fosco, líquido verde-claro visível dentro
RestriçõesIluminação, profundidade de campo, o que evitarLuz da manhã suave e difusa pela janela fosca, profundidade de campo rasa, nenhum outro produto na bancada
Sem a orientaçãoCom a orientação
Um frasco de skincare em uma bancada de banheiro, o rótulo diz Dew Drop Serum com uma folha, boa iluminação, visual cleanCena: Uma bancada de mármore de banheiro ao lado de uma janela com vidro fosco. Sujeito: Um frasco de skincare com o rótulo 'Dew Drop Serum' e um logotipo minimalista de folha, posicionado ligeiramente fora do centro. Detalhes: Frasco de vidro fosco, líquido verde-claro visível dentro, gotas de água na superfície de mármore. Restrições: Luz da manhã suave e difusa pela janela fosca, profundidade de campo rasa, nenhum outro produto na bancada.

O primeiro prompt salta entre os detalhes de forma aleatória. O segundo usa segmentos identificados, então o modelo processa cada elemento em ordem.

Teste a versão melhorada:

Frasco de skincare com o rótulo Dew Drop Serum em uma bancada de mármore de banheiro com janela de vidro fosco
Prompt melhorado

Cena: Uma bancada de mármore de banheiro ao lado de uma janela com vidro fosco. Sujeito: Um frasco de skincare com o rótulo 'Dew Drop Serum' e um logotipo minimalista de folha, posicionado ligeiramente fora do centro. Detalhes: Frasco de vidro fosco, líquido verde-claro visível dentro, gotas de água na superfície de mármore. Restrições: Luz da manhã suave e difusa pela janela fosca, profundidade de campo rasa, nenhum outro produto na bancada.

3. Coloque o texto exato entre aspas

Quando você quer texto renderizado dentro da imagem, coloque-o entre aspas duplas no prompt. Isso sinaliza ao modelo para reproduzir exatamente os caracteres que você especificou. Combine sempre o texto entre aspas com uma direção espacial precisa para melhorar a acurácia do posicionamento.

Sem a orientaçãoCom a orientação
Um letreiro de neon que diz open late acima de uma janela, brilhando em vermelhoUm letreiro de neon vermelho brilhante com os dizeres "OPEN LATE" centralizado no topo da janela, letra cursiva, brilho vermelho quente refletindo no vidro abaixo

O primeiro prompt deixa o texto sem aspas, o que significa que o modelo pode renderizar "Open Late", "OPEN late" ou algo totalmente diferente. O segundo coloca o texto exato entre aspas e especifica onde ele deve aparecer.

Teste a versão melhorada:

Letreiro de neon vermelho brilhante com os dizeres OPEN LATE em letra cursiva acima de uma janela
Prompt melhorado

Um letreiro de neon vermelho brilhante com os dizeres "OPEN LATE" centralizado no topo da janela, letra cursiva, brilho vermelho quente refletindo no vidro abaixo

4. Especifique a iluminação de forma explícita

Nomeie tanto o tipo de luz quanto a direção dela, em vez de usar termos vagos como "boa iluminação". Configurações de luz específicas dão ao GPT Image 2 uma referência baseada em física para seguir.

Sem a orientaçãoCom a orientação
Um retrato de uma mulher em um café, boa iluminação, clima aconcheganteUm retrato de uma mulher sentada perto da janela de um café, luz natural suave vindo da esquerda, preenchimento de tungstênio quente das luminárias pendentes acima, sombras leves no lado direito do rosto

O primeiro prompt não dá ao modelo nenhuma informação de luz para trabalhar. O segundo nomeia duas fontes de luz, suas direções e o comportamento das sombras resultante.

Teste a versão melhorada:

Retrato de uma mulher perto da janela de um café com luz natural suave e preenchimento de tungstênio quente
Prompt melhorado

Um retrato de uma mulher sentada perto da janela de um café, luz natural suave vindo da esquerda, preenchimento de tungstênio quente das luminárias pendentes acima, sombras leves no lado direito do rosto

5. Descreva a fotografia, não a fantasia

Para um resultado fotorrealista, descreva a lente, o enquadramento, a hora do dia, a fonte de luz, a textura, o desgaste das superfícies e os detalhes comuns de fundo. Uma única passagem de geração limpa pode produzir realismo convincente quando o prompt fixa o comportamento da câmera e o ambiente.

Sem a orientaçãoCom a orientação
Um chef cozinhando na cozinha de um restaurante, realista, atmosfera profissionalUma foto candid fotorrealista de uma chef com um jaleco branco manchado empratando um prato em uma passagem de aço, vapor subindo de uma panela atrás dela, luz fluorescente dura no teto misturada com o brilho quente de uma lâmpada de aquecimento sobre a passagem, profundidade de campo rasa, ladrilhos do piso arranhados e uma tira de comanda amassada presa ao trilho ao fundo

O primeiro prompt descreve um clima ("atmosfera profissional"). O segundo descreve o que uma câmera realmente veria: desgaste específico da roupa, imperfeições nas superfícies, várias fontes de luz e bagunça de fundo, que fazem a foto parecer real.

Teste a versão melhorada:

Foto candid fotorrealista de uma chef empratando um prato em uma passagem de aço na cozinha de um restaurante
Prompt melhorado

Uma foto candid fotorrealista de uma chef com um jaleco branco manchado empratando um prato em uma passagem de aço, vapor subindo de uma panela atrás dela, luz fluorescente dura no teto misturada com o brilho quente de uma lâmpada de aquecimento sobre a passagem, profundidade de campo rasa, ladrilhos do piso arranhados e uma tira de comanda amassada presa ao trilho ao fundo

6. Use a lógica de duas colunas para edições

Ao editar uma imagem existente, estruture o prompt com uma separação clara entre o que deve mudar e o que deve permanecer fixo. Use esta tabela como um modelo:

ElementoInstruçãoExemplo
MudarDescreva exatamente o que deve ser diferenteTrocar o fundo por uma praia tropical ao pôr do sol
PreservarListe o que precisa permanecer intocadoManter idênticos o rosto, a identidade, a pose, a roupa e a luz sobre o sujeito
RestriçõesEspecifique o que evitarNenhum objeto extra, nenhuma alteração no rótulo do produto, sem deriva do logotipo
Sem a orientaçãoCom a orientação
Mude o fundo para uma praiaMudar: Substituir o fundo de estúdio por uma praia tropical ao pôr do sol, luz dourada no horizonte. Preservar: Manter o rosto, a expressão, a pose, a roupa e as proporções do corpo da pessoa exatamente como estão. Manter a luz sobre o sujeito consistente. Restrições: Nenhuma pessoa ou objeto adicional na cena, nenhuma alteração no tom de pele ou na cor do cabelo.

O primeiro prompt dá ao modelo liberdade para reinterpretar tudo. O segundo fixa o que permanece igual, então só o fundo muda.

O que fazer e o que evitar no ChatGPT Images 2.0

FaçaEvite
Colocar o texto exato entre aspas no promptDeixar o texto sem aspas e esperar que o modelo adivinhe a grafia
Nomear um tipo e uma direção de luz específicos ("luz fluorescente natural", "luz de janela suave pela esquerda")Usar "boa iluminação" ou ignorar a iluminação por completo
Descrever lente, enquadramento, hora do dia e fonte de luz para resultado fotorrealistaConfiar em palavras de estilo vagas ("bonito", "alta qualidade", "profissional")
Combinar o texto entre aspas com direções espaciais precisas ("centralizado no topo da janela")Supor que o modelo vai posicionar o texto onde você quer
Começar o prompt pelo estilo visual antes do sujeitoEsconder o estilo no final de um prompt longo
Enviar imagens de referência ao editar e identificar cada uma pela funçãoDescrever uma imagem existente de memória em vez de enviá-la
Usar a lógica de duas colunas para edições: especificar o que muda e o que fica fixoDar instruções de edição abertas sem restrições de preservação
Seguir uma ordem consistente no prompt: cena, sujeito, detalhes, restriçõesEscrever um único parágrafo longo e sem estrutura para pedidos complexos

O que há de novo no ChatGPT Images 2.0

O GPT Image 2 não é apenas uma atualização incremental do antecessor. A maior mudança de arquitetura é a integração de capacidades de raciocínio no processo de geração de imagens. Nos modos thinking ou pro, o modelo consegue decompor pedidos visuais complexos, considerar relações espaciais e produzir composições mais precisas já na primeira tentativa.

O modelo também incorpora conhecimento de mundo até dezembro de 2025, o que significa que pode referenciar marcas, produtos, momentos culturais e tendências de design recentes sem que você precise descrevê-los do zero. Modelos de imagem anteriores não tinham consciência do mundo fora dos dados de treinamento, o que os tornava pouco confiáveis para qualquer coisa sensível ao tempo.

Comparado ao DALL-E 3, que foi acoplado ao ChatGPT como uma ferramenta separada, o GPT Image 2 é integrado de forma nativa à arquitetura do GPT-4o. Isso lhe dá uma compreensão de prompt mais apurada, um cumprimento de instruções melhor e a capacidade de lidar com prompts de várias partes que confundiriam modelos anteriores.

Recursos do ChatGPT Images 2.0

Renderização precisa de texto em vários idiomas

O GPT Image 2 renderiza texto com o que a OpenAI chama de "acurácia sem precedentes". O modelo lida com letras pequenas, parágrafos densos, texto em superfícies curvas e escritas não latinas, incluindo chinês, japonês, coreano, hindi e bengali. Rótulos de embalagem, placas de rua, botões de UI, anotações de infográfico e materiais de marketing multilíngues saem legíveis já na primeira geração. Modelos anteriores frequentemente distorciam ou erravam o texto dentro das imagens, tornando a correção manual uma parte padrão do fluxo. O GPT Image 2 elimina essa etapa na grande maioria dos casos de uso.

Edição de imagens a partir de referências enviadas

Envie uma imagem existente e descreva o que você quer alterar. O modelo pode trocar um fundo, atualizar o texto de um rótulo, ajustar as condições de luz ou colocar um produto em outro cenário, preservando os detalhes que você não mencionou. Você também pode enviar várias imagens de referência para guiar o resultado rumo a um visual, uma composição ou uma aparência de personagem específicos. Isso torna o GPT Image 2 útil não só para gerar do zero, mas para iterar sobre assets existentes.

Fotografia de produto com consistência de marca

Gere fotos de produto em que o nome da marca no rótulo, a lista de ingredientes no verso e o logotipo na tampa estejam todos escritos corretamente e visualmente consistentes. Rode o mesmo prompt com cenas ou ângulos diferentes e o modelo mantém a sua paleta de cores e a tipografia em todas as variações. Para times de e-commerce que precisam de um catálogo inteiro com aparência unificada sem refotografar, isso significa gerar várias imagens de produto em uma única sessão de prompt.

Geração de mockups de UI e de aplicativos

O GPT Image 2 consegue produzir imagens que parecem interfaces reais de software: janelas de navegador, telas de aplicativo mobile, painéis, menus de navegação e visualizações de dados com rótulos corretos. A acurácia da renderização de texto se estende a elementos de UI como botões, rótulos de aba e campos de formulário, o que torna o resultado útil para conceitos de wireframe, capturas de tela de documentação ou visualização de ideias de app antes de escrever qualquer linha de código.

Consistência de personagem em várias tomadas

Fixe um personagem, produto ou asset de marca e mantenha-o visualmente idêntico em várias gerações. Rostos, roupas, proporções e detalhes distintivos permanecem consistentes enquanto os fundos, as poses e as cenas mudam. Isso é útil para storyboards, variantes de campanha com um personagem recorrente e conteúdo de várias tomadas para redes sociais, em que a continuidade visual importa.

Vários formatos de saída e controle de compressão

A saída está disponível em PNG, JPEG ou WebP, com compressão ajustável de 0 a 100% para JPEG e WebP. Isso significa que os arquivos já saem no tamanho e no formato do seu caso de uso específico, seja um PNG de alta fidelidade para impressão ou um WebP comprimido para performance na web, sem passar por outra ferramenta de conversão.

Saída fotorrealista em até 2K de resolução

O modelo produz imagens com luz natural, texturas de material autênticas e tons de pele realistas em até 2K de resolução (2560x1440). O tom de cor quente e o aspecto liso e "plastificado" comum em modelos de imagem com IA anteriores dá lugar a um resultado que se aproxima da fotografia de estúdio. O suporte a proporções vai de 3:1 (ultra-larga) a 1:3 (ultra-alta), cobrindo formatos de banners e slides de apresentação a telas de celular e posts verticais para redes sociais. Resoluções maiores são tecnicamente possíveis, mas a OpenAI considera os resultados acima de 2K experimentais.

Especificações técnicas do ChatGPT Images 2.0

EspecificaçãoDetalhes
Renderização de textoAlta acurácia em escritas latina, CJK (chinês, japonês, coreano), hindi e bengali
Resolução máxima2K (2560x1440) confiável, resoluções maiores experimentais
Tamanhos predefinidos1024x1024, 1536x1024, 1024x1536 ou dimensões personalizadas (as duas bordas precisam ser múltiplas de 16)
Proporções3:1 a 1:3 (ultra-larga a ultra-alta)
Formatos de saídaPNG (padrão), JPEG, WebP
Níveis de qualidadeLow, medium, high, auto
Compressão0-100% ajustável (JPEG e WebP)
Imagens por solicitaçãoAté 10
Imagens de entradaSuporta referências enviadas para edição
Arquitetura do modeloIntegrada de forma nativa ao GPT-4o, com raciocínio visual

Casos de uso do ChatGPT Images 2.0

  1. Criadores e freelancers: Gere mockups de produto prontos para o cliente, artes para redes sociais e imagens de conceito em segundos. Refine com prompts de acompanhamento ou edições em imagens de referência, em vez de várias rodadas de revisão com um designer.

  2. Times de e-commerce e marketing: Crie fotos de produto com rótulos corretos, artes para redes sociais com texto promocional embutido e infográficos com anotações de dados. A renderização de texto e a consistência de marca em várias tomadas reduzem a pós-edição manual que os modelos anteriores exigiam.

  3. Designers e times de produto: Produza mockups de UI, conceitos de wireframe e visualizações de telas de app com conteúdo realista e tipografia correta. Útil para apresentações a stakeholders, design reviews e validação de ideias antes de partir para a produção.

  4. Times de conteúdo: Gere ilustrações de blog, visuais de newsletter, materiais de marketing multilíngues e infográficos educativos com texto e rótulos de dados precisos diretamente, reduzindo o vai e volta entre redatores e designers.

Perguntas frequentes

O que é o ChatGPT Images 2.0?

O ChatGPT Images 2.0, também chamado de GPT Image 2, é o modelo de geração e edição de imagens da OpenAI lançado em abril de 2026. Ele sucede o GPT Image 1.5 e é construído de forma nativa na arquitetura do GPT-4o. O modelo gera imagens a partir de prompts de texto, edita imagens existentes e renderiza texto dentro das imagens com alta acurácia em escritas latina, CJK, hindi e bengali.

O que há de novo no ChatGPT Images 2.0 em relação aos modelos anteriores?

O GPT Image 2 introduz capacidades de raciocínio na geração de imagens pela primeira vez, o que permite analisar prompts complexos com mais profundidade. Ele é integrado de forma nativa ao GPT-4o, em vez de ser uma ferramenta separada como o DALL-E 3. A renderização de texto melhorou muito, a edição de imagens a partir de referências enviadas é mais precisa e o modelo incorpora conhecimento de mundo até dezembro de 2025.

Qual a diferença entre o ChatGPT Images 2.0 e o GPT Image 1.5?

O GPT Image 1.5 equilibrava velocidade e qualidade, o que o tornava uma boa opção para iteração rápida. O GPT Image 2 adota uma abordagem que prioriza a qualidade, com foco em fotorrealismo, precisão de texto e fidelidade da saída. Ele também traz capacidades de raciocínio pela primeira vez, o que permite decompor prompts complexos com mais eficiência, e incorpora conhecimento de mundo até dezembro de 2025.

O ChatGPT Images 2.0 consegue editar imagens existentes?

Sim. Envie uma ou mais imagens de referência e descreva as mudanças que você quer. O modelo pode modificar fundos, texto, objetos, luz e composição, preservando as partes da imagem que você não mencionou no prompt.

Quais idiomas o ChatGPT Images 2.0 suporta para renderização de texto?

A OpenAI destaca uma renderização de texto forte em escritas latinas, além de chinês, japonês, coreano, hindi e bengali. O texto é renderizado corretamente em superfícies curvas, em tamanhos pequenos e em layouts densos, como materiais de marketing multilíngues e embalagens de produto.

Quais formatos de saída o ChatGPT Images 2.0 suporta?

O GPT Image 2 gera em PNG (padrão), JPEG ou WebP, com compressão ajustável de 0 a 100% para JPEG e WebP. O modelo suporta tamanhos de imagem flexíveis, com opções predefinidas (1024x1024, 1536x1024, 1024x1536) e dimensões personalizadas de até 2K de resolução.

O ChatGPT Images 2.0 consegue manter a consistência de personagem entre imagens?

Sim. O modelo pode fixar um personagem, produto ou asset de marca e mantê-lo visualmente idêntico em várias gerações. Rostos, roupas, proporções e detalhes permanecem consistentes enquanto os fundos e as cenas mudam, o que é útil para storyboards, campanhas e conteúdo de várias tomadas.