O problema que todo mundo que já gerou imagem conhece

Você escreve um parágrafo explicando a imagem que quer. Pede o produto no centro, o logo no canto, o título em cima. Manda. O modelo devolve algo bonito — só que o logo apareceu no meio do texto, a pessoa ficou cortada na borda e a frase saiu com uma letra trocada. Aí você reescreve o prompt, tenta de novo, e o resultado vem diferente de novo. Esse ciclo tem nome informal no mercado: a loteria do prompt.

Quem trabalha com design e publicidade conhece bem. Não é falta de qualidade do modelo — é que descrever em palavras onde cada coisa vai é um jeito ruim de dar instrução espacial. Palavra não tem coordenada. A Black Forest Labs (BFL) resolveu atacar exatamente esse ponto com o lançamento do FLUX 3 Image, no dia 1º de outubro de 2026.

A ideia em uma frase: você desenha a caixa, a IA pinta dentro dela

Em vez de descrever a cena inteira e torcer, você agora desenha um retângulo para cada elemento. Dentro de cada caixa, escreve o que deve aparecer ali. Depois junta tudo com uma frase única que amarra a cena — e o modelo renderiza cada elemento exatamente dentro da caixa dele.

O sistema de coordenadas é simples: a tela vira uma grade de 0 a 1000 nos dois eixos, independente da resolução final. Cada caixa é escrita como [top, left, bottom, right]. Isso significa que [0, 0, 500, 500] é sempre o quadrante superior esquerdo — seja numa imagem de 768 pixels ou numa de 16 megapixels. O layout não muda de forma quando você troca a resolução. Os detalhes estão na documentação oficial da BFL.

Silhueta de um corredor gerada pelo FLUX 3 a partir de um layout com duas caixas
Esta imagem foi gerada a partir de duas caixas: uma para o fundo (a grade inteira) e outra para a silhueta do corredor. Nada foi descrito "no meio" — o lugar estava definido antes de a imagem existir. (Imagem: Black Forest Labs)

O detalhe que interessa a quem programa: a instrução virou JSON

Aqui está a parte que fez essa novidade sair do mundo do design e entrar no mundo dos agentes de IA. O layout não é enviado como texto solto — é uma tabela de elementos em JSON. Cada linha tem três campos: um id (nome do elemento), um bbox (a caixa) e um desc (a descrição do que fica ali). A frase de cena cita cada elemento pelo seu id, algo como <dome_1>.

A BFL dá um exemplo real de layout para uma cena de festival: o título, a cidade, a cúpula, os banhistas e a multidão — cada um com sua caixa e sua descrição. O modelo recebe isso e monta a imagem respeitando a posição de cada peça.

E se você não quiser desenhar nada? A resposta oficial é direta: "dê ao agente uma linha e uma proporção de tela, e um modelo de linguagem planeja o layout para você" — escrevendo a legenda e a tabela de elementos sozinho. Traduzindo: a API foi desenhada para ser operada por outro modelo de IA, não só por uma pessoa com mouse. É por isso que a cobertura especializada classificou o lançamento como uma API de geração de imagem desenhada explicitamente para orquestração por LLM e pipelines agênticos.

Textos: cada linha ganha a sua própria caixa

Para quem sofre com IA escrevendo texto errado dentro de imagem, esse é o recurso mais promissor. A recomendação da BFL é literal: coloque cada linha de texto na sua própria linha da tabela e coloque as palavras exatas entre aspas na descrição — algo como texto escrito "Sauna". Assim o modelo não precisa "adivinhar" onde a frase termina e onde começa o resto da arte.

Pôster preto com o alfabeto em letras brancas, dividido em cinco caixas
Cada uma das cinco linhas do alfabeto tem sua própria caixa. É o oposto do que acontece quando você só pede "um pôster com o alfabeto" e recebe letras faltando ou trocadas. (Imagem: Black Forest Labs)

Editar sem estragar o resto — e o asterisco honesto

A segunda metade da proposta é a edição. Em vez de "refaça a imagem inteira com essa mudança", você edita caixa por caixa. A tabela de edição tem quatro tipos de linha: Keep (o elemento fica exatamente onde está), Move (ganha uma caixa nova), New (algo entra na cena) e Remove (a caixa de destino vira nula e o elemento desaparece). Dá para fazer várias edições na mesma chamada — trocar três objetos de uma vez, por exemplo.

Tigre e borboleta sobre um tronco na neve, antes da edição
Antes: um tigre e uma borboleta na neve. O pedido de edição é só "deixe os dois rosa" — mantendo o tronco, a neve e as árvores do fundo intactos. (Imagem: Black Forest Labs)
A mesma cena depois da edição, com tigre e borboleta rosa
Depois: só as duas caixas pedidas mudaram de cor. O resto da cena continua igual — é essa promessa que separa "editar" de "gerar outra imagem parecida". (Imagem: Black Forest Labs)

Agora o asterisco, que a própria BFL faz questão de escrever na documentação: "os pixels fora das caixas editadas normalmente permanecem idênticos" — mas "sombras, reflexos ou iluminação por perto ainda podem mudar". Ou seja, a garantia é de composição, não de bit a bit. Em uma cena com luz dramática, uma caixa nova pode derramar um pouco de claridade sobre o vizinho. A BFL publica inclusive um recurso de mapa de pixels alterados, que mostra em branco o que mudou e em preto o que ficou igual — e é justamente ali, na fronteira das caixas, que mora a dúvida que só produção real responde.

Os limites (e eles existem)

  • Caixa pequena demais falha. Nos testes da BFL, um elemento novo numa caixa de cerca de 40 × 25 pixels muitas vezes não aparecia. A orientação é dar espaço ao que é novo.
  • "4K" aqui não é o 4K do vídeo. O topo da linha entrega 5.456 × 3.072 pixels — cerca de 16,8 megapixels, o dobro em área de um quadro UHD comum (8,3 MP). São dois usos diferentes da palavra "4K".
  • O preço sobe muito rápido no fim. Por imagem: cerca de US$ 0,041 no formato 768×768, US$ 0,048 em 1K, US$ 0,100 em 2K e US$ 0,607 em 4K. O salto do 2K para o 4K é de mais de 6 vezes — e o 4K custa mais de 12 vezes uma imagem 1K. A conta sugere a estratégia óbvia: rascunhar e testar edições em 1K e só renderizar o final em 4K. A BFL está com 50% de desconto na API até 8 de outubro, o que ajuda a testar agora.
  • Ainda não é aberto. Pesos comerciais já podem ser licenciados por empresas, mas a versão de pesos abertos só foi prometida "nas próximas semanas", sem data.

Por que isso interessa diretamente a um pipeline como o nosso

Vale a transparência: na CheriffAI, o processo atual para fazer capas e carrosséis é uma gambiarra que funciona — o modelo de imagem gera um fundo sem texto nenhum, e o texto entra depois por cima, via HTML e CSS, renderizado no navegador. Isso garante acentuação perfeita em português e controle total de tipografia, mas exige duas etapas e bastante CSS para acertar o lugar de cada coisa.

O FLUX 3 Image propõe juntar as duas etapas: caixa para cada elemento, texto incluído, tudo numa passada só. Se a promessa se sustentar em produção, é o tipo de mudança que reduz uma classe inteira de retrabalho — porque o problema do "elemento fora de lugar" deixa de ser conserto e passa a ser entrada. E como a versão aberta vem aí, existe um caminho realista de rodar isso localmente, sem mandar arte de cliente para fora.

Mas não vamos vender o que ainda não foi testado. Nós ainda não rodamos esse teste A/B na nossa própria infraestrutura, e é exatamente isso que precisa acontecer antes de trocar o pipeline: colocar a mesma capa nas duas rotas e comparar controle, acentuação e custo. Até lá, a expectativa honesta é: promissor, bem documentado e com a verificação pendente.

O que isso muda para quem não é designer

O ponto que importa para o Brasil é mais simples do que parece. Hoje, quem tem uma loja pequena e tenta fazer arte com IA gasta tempo em tentativa e erro — e às vezes dinheiro pagando gerações que vão para o lixo. Quando a instrução vira coordenada, a conversa muda de "descreva e reze" para "monte e ajuste". Isso é menos mágica e mais ferramenta. Ferramenta é o que permite orçamento, contrato e prazo.

É também o sinal de uma mudança maior: em 2026, a corrida da geração de imagem saiu do "quem faz a foto mais bonita" e entrou na pergunta "quem consegue colocar cada peça exatamente onde o cliente pediu". Para um negócio, a segunda pergunta vale bem mais do que a primeira.

Fontes