GLM-Image
Entrar
Peso do modelo GLM-Image está disponível no Hugging Face. Baixar

Editar Imagens · Fluxo Multi-referência

Compositor Multi-imagens AI com GLMImage

Combine de duas a quatro pessoas, produtos ou referências visuais em uma cena compartilhada crível — não uma colagem — dando a cada entrada uma função explícita e reconciliando escala, perspectiva, luz, cor e oclusão.

  • Duas referências obrigatórias, até quatro
  • Prompt opcional com ação útil padrão
  • Direção de identidade multi-sujeito
  • Primeiro composição paisagem
Duas imagens de origem fluindo para um resultado coerente em um compositor multi-imagens AI

Compositor Multi-imagens AI com GLMImage

Adicionar imagem
—

Composição significa integração, não colocar fotos lado a lado

Uma colagem preserva quadros separados. Uma composição coerente faz os sujeitos parecerem compartilhar uma câmera, um espaço e um momento. Isso requer mais do que remoção de fundo: os sujeitos precisam de escala compatível, perspectiva, direção de luz, temperatura de cor, profundidade, sombras de contato e sobreposição crível. Este compositor multi-imagens AI dá ao GLMImage um breve de integração explícito para que o resultado aponte para uma cena unificada em vez de um quadro de recortes não relacionados.

O fluxo é intencionalmente separado da edição genérica de imagem-para-imagem. Requer pelo menos duas referências porque o trabalho comercial é combinar fontes. Você pode enviar até quatro quando a cena final precisa de uma pessoa, produto, local ou dica de estilo adicional. Se deixar o prompt vazio, a ação incorporada combina os sujeitos primários em um ambiente natural equilibrado. Um prompt personalizado permite atribuir funções, escolher o ambiente e declarar quais identidades ou detalhes do produto devem permanecer estáveis.

Atribua uma função clara a cada referência

A ordem de envio fornece um plano simples. A imagem um é o sujeito primário e a imagem dois é o sujeito secundário. As imagens três e quatro são referências de suporte. Elas podem fornecer outro sujeito, um local, um arranjo de adereços ou estilo visual. No prompt, descreva o que tirar de cada imagem. Por exemplo: preserve a mulher da imagem um e a bicicleta da imagem dois; use a imagem três apenas para o ambiente à beira do rio e cor matinal.

Funções explícitas reduzem a mistura de identidade e a cópia acidental. Uma referência de estilo não deve doar suas pessoas ou objetos. Uma referência de local não deve substituir o guarda-roupa do sujeito principal. Uma referência de produto deve preservar forma, materiais e texto da embalagem em vez de meramente contribuir sua cor. Quanto mais diferentes forem as fontes, mais importante se torna essa linguagem de função. Pense como um compositor preparando uma lista de tomadas em vez de um usuário pedindo ao modelo para "misturar estes."

Planeje a cena compartilhada antes de descrever o estilo

Primeiro decida as relações físicas: quem fica onde, qual objeto é segurado, o que fica na frente, a que distância está a câmera e onde cai o horizonte. Depois descreva o local e a luz. Só depois que a cena for plausível você deve adicionar paleta ou estilo de renderização. Esta ordem ajuda o GLMImage a reconciliar geometria antes de aplicar estética. Se uma pessoa deve segurar um produto, declare qual mão, escala aproximada do produto e se o rótulo fica voltado para a câmera.

Escolha referências com pontos de vista compatíveis quando possível. Uma fotografia de produto frontal combina mais naturalmente com um retrato ao nível dos olhos do que com uma cena aérea. Resolução similar e limites de sujeito claros também ajudam. O compositor multi-imagens AI pode preencher diferenças significativas, mas não pode recuperar detalhes que não existem em uma fonte minúscula ou muito obscura. Use a imagem autorizada mais clara disponível para cada identidade ou produto que importa.

  • Função de cada imagem numerada
  • Posicionamento e interação do sujeito
  • Altura da câmera, enquadramento e horizonte
  • Escala relativa e ordem de primeiro plano
  • Direção e suavidade da luz compartilhada
  • Identidade, produto e detalhes de texto a preservar

Use a tela para suportar múltiplos sujeitos

O formato paisagem padrão 1216 × 832 dá espaço para múltiplos sujeitos respirarem e funciona para cenas de campanha, pares editoriais, pacotes de produto e retratos ambientais. Quadrado é útil para composições sociais compactas, enquanto retrato pode empilhar sujeitos ou colocar uma pessoa de corpo inteiro com um produto. A primeira referência também informa a proporção inicial ao ser enviada, e você pode escolher deliberadamente outro formato válido antes da geração.

Dimensões personalizadas devem permanecer entre 256 e 1536 pixels e ser divisíveis por 32. Ao mudar a proporção, descreva como a cena deve se expandir ou cortar. Peça espaço limpo para cópia se a imagem se tornará um anúncio, mas não sobrecarregue uma cena de quatro sujeitos com vários blocos de texto. Layouts complexos se beneficiam de uma relação focal clara. Texto de marketing adicional pode permanecer ao vivo e acessível no design final em vez de ser permanentemente incorporado à imagem gerada.

Composição multi-imagens para trabalho criativo prático

Equipes de campanha podem combinar um produto fotografado com um local de conceito antes de agendar uma produção completa. Equipes de varejo podem visualizar pacotes usando fotos de pacote separadas. Criadores podem colocar dois retratos autorizados em uma cena editorial compartilhada. Equipes de entretenimento podem testar interações de personagens e arte-chave. Equipes de interiores podem colocar uma referência de móveis em uma direção de ambiente. Equipes sociais podem remixar ativos de marca aprovados em uma composição fresca mantendo a verdade do produto reconhecível.

Este fluxo é especialmente útil durante pré-produção porque expõe problemas de composição cedo. Um diretor criativo pode comparar escala de sujeitos, equilíbrio visual e escolha de fundo antes que orçamentos sejam comprometidos. A saída comercial final ainda precisa de revisão. Garanta que cada fonte seja licenciada para o uso pretendido, verifique rostos e produtos contra suas referências, e evite usar a ferramenta para fabricar associações enganosas entre pessoas reais, eventos ou endossos.

Para o resultado mais forte, defina uma função clara para cada envio antes de gerar. Decida qual referência define a iluminação, qual fornece a identidade do sujeito, e qual apenas define uma paleta ou superfície — depois declare essas funções no prompt para que o modelo não precise adivinhar. Manter a atribuição de função consistente nas iterações torna a composição previsível e o loop de feedback rápido: quando algo deriva, você sabe exatamente qual referência ajustar em vez de redescrever a cena inteira.

Diagnostique falhas uma relação de cada vez

Se um sujeito desaparece, simplifique a cena e reafirme que ambos os sujeitos primário e secundário são obrigatórios. Se as identidades se misturam, descreva cada sujeito com uma posição e interação distintas, e remova referências de estilo até que as identidades estejam estáveis. Se a escala parece errada, forneça uma relação física concreta como "a garrafa tem 20 centímetros de altura na mesa ao lado da pessoa sentada." Se a iluminação conflita, escolha uma referência como autoridade de iluminação.

Inspecione oclusão e contato de perto. Mãos devem envolver objetos segurados, pés devem encontrar o chão e lançar sombras, e elementos de primeiro plano devem sobrepor em uma ordem fisicamente lógica. Compare logotipos, embalagens e características faciais com cada fonte. Uma composição quase bem-sucedida deve ser refinada com uma instrução curta e direcionada, não uma reescrita completa de prompt. Manter a ordem de envio e a estrutura de função estáveis torna a correção mais fácil tanto para o modelo quanto para sua equipe entender.

Pontos de partida práticos

Exemplos de prompts para compositor multi-imagens AI

Use como estruturas, não como frases mágicas. Substitua o sujeito, o propósito e as restrições com detalhes do seu próprio projeto.

Cena editorial de duas pessoas

Combine a mulher da imagem um e o homem da imagem dois em um retrato editorial casual em uma rua tranquila arborizada. Preserve o rosto, cabelo e roupa de cada pessoa. Coloque-os caminhando lado a lado na mesma distância da câmera, conversação natural, luz suave de fim de tarde à esquerda, perspectiva coerente, sombras realistas no chão e profundidade suave de fundo.

Define duas identidades estáveis, ação compartilhada, ambiente, relação de câmera e luz.

Composição de campanha de produto

Use os fones de ouvido da imagem um como o produto herói exato e o atleta da imagem dois como o sujeito da campanha. Coloque os fones naturalmente ao redor do pescoço do atleta, preserve a forma do produto e o logotipo, corredor de academia moderno enérgico, luz fria superior com um borda quente, corte paisagem cintura acima, deixe espaço limpo à esquerda para cópia de campanha.

Especifica interação, verdade do produto, iluminação e espaço de layout prático.

Conceito de interior com três referências

Coloque a poltrona da imagem um e a mesa lateral da imagem dois na sala mostrada na imagem três. Preserve ambos os designs e materiais dos móveis; use a imagem três apenas para arquitetura e direção de luz diurna. Combine escala, contato com o chão, reflexos de janela e sombras suaves, fotografia de interior editorial calma, nenhum móvel extra perto das peças herói.

Atribui funções separadas de objeto e ambiente a três referências.

Fluxo de trabalho focado

De imagem de entrada a imagem revisada em quatro etapas

1

Escolha Composição Multi-imagens

O editor muda para um fluxo que requer duas referências e aceita até quatro.

2

Envie sujeitos primário e secundário

Coloque a identidade mais importante primeiro e o próximo sujeito obrigatório em segundo.

3

Adicione suporte opcional e instruções de função

Use referências extras para ambiente ou estilo, e declare exatamente o que cada uma fornece.

4

Gere e compare cada fonte

Revise identidade, verdade do produto, escala, perspectiva, sobreposição, sombras e iluminação.

Perguntas frequentes

Quantas imagens de referência o compositor usa?

Duas imagens são obrigatórias e até quatro são suportadas. As duas primeiras são sujeitos primário e secundário; envios posteriores fornecem sujeitos adicionais ou suporte.

O prompt é opcional?

Sim. O padrão guiado combina os sujeitos primários em uma cena equilibrada. Um prompt é recomendado quando referências precisam de funções específicas, posicionamento ou restrições de preservação.

Cria uma colagem?

O fluxo pede uma nova cena coerente com perspectiva, escala, luz, cor, sombra e oclusão reconciliadas. Não pretende preservar quadros de imagem separados como um criador de colagens.

Posso combinar duas pessoas?

Sim, com retratos autorizados. Declare a posição e interação de cada pessoa e exija que ambas as identidades, rostos, cabelos e roupas permaneçam distintos.

Posso combinar um produto e uma pessoa?

Sim. Descreva a interação física e escala, preserve detalhes de embalagem ou logotipo e inspecione mãos, contato, reflexos e geometria do produto com cuidado.

Qual referência controla o fundo?

Você decide no prompt. Se uma imagem deve fornecer apenas o local, diga isso explicitamente e impeça que ela mude os sujeitos principais.

Qual tamanho de saída é recomendado?

1216 × 832 é o padrão paisagem porque dá espaço a vários sujeitos. Formatos quadrado e retrato também funcionam, e dimensões personalizadas devem ser alinhadas em 32.

As referências ficam visíveis quando publico o resultado?

Não. Os envios de referência permanecem privados. Apenas a imagem gerada e o prompt visível entram no fluxo de revisão da Galeria após você enviá-los explicitamente.