O problema que todo mundo que já gerou imagem conhece
Você escreve um parágrafo explicando a imagem que quer. Pede o produto no centro, o logo no canto, o título em cima. Manda. O modelo devolve algo bonito — só que o logo apareceu no meio do texto, a pessoa ficou cortada na borda e a frase saiu com uma letra trocada. Aí você reescreve o prompt, tenta de novo, e o resultado vem diferente de novo. Esse ciclo tem nome informal no mercado: a loteria do prompt.
Quem trabalha com design e publicidade conhece bem. Não é falta de qualidade do modelo — é que descrever em palavras onde cada coisa vai é um jeito ruim de dar instrução espacial. Palavra não tem coordenada. A Black Forest Labs (BFL) resolveu atacar exatamente esse ponto com o lançamento do FLUX 3 Image, no dia 1º de outubro de 2026.
A ideia em uma frase: você desenha a caixa, a IA pinta dentro dela
Em vez de descrever a cena inteira e torcer, você agora desenha um retângulo para cada elemento. Dentro de cada caixa, escreve o que deve aparecer ali. Depois junta tudo com uma frase única que amarra a cena — e o modelo renderiza cada elemento exatamente dentro da caixa dele.
O sistema de coordenadas é simples: a tela vira uma grade de 0 a 1000 nos dois eixos, independente da resolução final. Cada caixa é escrita como [top, left, bottom, right]. Isso significa que [0, 0, 500, 500] é sempre o quadrante superior esquerdo — seja numa imagem de 768 pixels ou numa de 16 megapixels. O layout não muda de forma quando você troca a resolução. Os detalhes estão na documentação oficial da BFL.

O detalhe que interessa a quem programa: a instrução virou JSON
Aqui está a parte que fez essa novidade sair do mundo do design e entrar no mundo dos agentes de IA. O layout não é enviado como texto solto — é uma tabela de elementos em JSON. Cada linha tem três campos: um id (nome do elemento), um bbox (a caixa) e um desc (a descrição do que fica ali). A frase de cena cita cada elemento pelo seu id, algo como <dome_1>.
A BFL dá um exemplo real de layout para uma cena de festival: o título, a cidade, a cúpula, os banhistas e a multidão — cada um com sua caixa e sua descrição. O modelo recebe isso e monta a imagem respeitando a posição de cada peça.
E se você não quiser desenhar nada? A resposta oficial é direta: "dê ao agente uma linha e uma proporção de tela, e um modelo de linguagem planeja o layout para você" — escrevendo a legenda e a tabela de elementos sozinho. Traduzindo: a API foi desenhada para ser operada por outro modelo de IA, não só por uma pessoa com mouse. É por isso que a cobertura especializada classificou o lançamento como uma API de geração de imagem desenhada explicitamente para orquestração por LLM e pipelines agênticos.
Textos: cada linha ganha a sua própria caixa
Para quem sofre com IA escrevendo texto errado dentro de imagem, esse é o recurso mais promissor. A recomendação da BFL é literal: coloque cada linha de texto na sua própria linha da tabela e coloque as palavras exatas entre aspas na descrição — algo como texto escrito "Sauna". Assim o modelo não precisa "adivinhar" onde a frase termina e onde começa o resto da arte.

Editar sem estragar o resto — e o asterisco honesto
A segunda metade da proposta é a edição. Em vez de "refaça a imagem inteira com essa mudança", você edita caixa por caixa. A tabela de edição tem quatro tipos de linha: Keep (o elemento fica exatamente onde está), Move (ganha uma caixa nova), New (algo entra na cena) e Remove (a caixa de destino vira nula e o elemento desaparece). Dá para fazer várias edições na mesma chamada — trocar três objetos de uma vez, por exemplo.


Agora o asterisco, que a própria BFL faz questão de escrever na documentação: "os pixels fora das caixas editadas normalmente permanecem idênticos" — mas "sombras, reflexos ou iluminação por perto ainda podem mudar". Ou seja, a garantia é de composição, não de bit a bit. Em uma cena com luz dramática, uma caixa nova pode derramar um pouco de claridade sobre o vizinho. A BFL publica inclusive um recurso de mapa de pixels alterados, que mostra em branco o que mudou e em preto o que ficou igual — e é justamente ali, na fronteira das caixas, que mora a dúvida que só produção real responde.
Os limites (e eles existem)
- Caixa pequena demais falha. Nos testes da BFL, um elemento novo numa caixa de cerca de 40 × 25 pixels muitas vezes não aparecia. A orientação é dar espaço ao que é novo.
- "4K" aqui não é o 4K do vídeo. O topo da linha entrega 5.456 × 3.072 pixels — cerca de 16,8 megapixels, o dobro em área de um quadro UHD comum (8,3 MP). São dois usos diferentes da palavra "4K".
- O preço sobe muito rápido no fim. Por imagem: cerca de US$ 0,041 no formato 768×768, US$ 0,048 em 1K, US$ 0,100 em 2K e US$ 0,607 em 4K. O salto do 2K para o 4K é de mais de 6 vezes — e o 4K custa mais de 12 vezes uma imagem 1K. A conta sugere a estratégia óbvia: rascunhar e testar edições em 1K e só renderizar o final em 4K. A BFL está com 50% de desconto na API até 8 de outubro, o que ajuda a testar agora.
- Ainda não é aberto. Pesos comerciais já podem ser licenciados por empresas, mas a versão de pesos abertos só foi prometida "nas próximas semanas", sem data.
Por que isso interessa diretamente a um pipeline como o nosso
Vale a transparência: na CheriffAI, o processo atual para fazer capas e carrosséis é uma gambiarra que funciona — o modelo de imagem gera um fundo sem texto nenhum, e o texto entra depois por cima, via HTML e CSS, renderizado no navegador. Isso garante acentuação perfeita em português e controle total de tipografia, mas exige duas etapas e bastante CSS para acertar o lugar de cada coisa.
O FLUX 3 Image propõe juntar as duas etapas: caixa para cada elemento, texto incluído, tudo numa passada só. Se a promessa se sustentar em produção, é o tipo de mudança que reduz uma classe inteira de retrabalho — porque o problema do "elemento fora de lugar" deixa de ser conserto e passa a ser entrada. E como a versão aberta vem aí, existe um caminho realista de rodar isso localmente, sem mandar arte de cliente para fora.
Mas não vamos vender o que ainda não foi testado. Nós ainda não rodamos esse teste A/B na nossa própria infraestrutura, e é exatamente isso que precisa acontecer antes de trocar o pipeline: colocar a mesma capa nas duas rotas e comparar controle, acentuação e custo. Até lá, a expectativa honesta é: promissor, bem documentado e com a verificação pendente.
O que isso muda para quem não é designer
O ponto que importa para o Brasil é mais simples do que parece. Hoje, quem tem uma loja pequena e tenta fazer arte com IA gasta tempo em tentativa e erro — e às vezes dinheiro pagando gerações que vão para o lixo. Quando a instrução vira coordenada, a conversa muda de "descreva e reze" para "monte e ajuste". Isso é menos mágica e mais ferramenta. Ferramenta é o que permite orçamento, contrato e prazo.
É também o sinal de uma mudança maior: em 2026, a corrida da geração de imagem saiu do "quem faz a foto mais bonita" e entrou na pergunta "quem consegue colocar cada peça exatamente onde o cliente pediu". Para um negócio, a segunda pergunta vale bem mais do que a primeira.
Fontes
- Black Forest Labs — FLUX 3 Image: Maximum control over every pixel (01/10/2026)
- BFL Docs — Bounding boxes com FLUX 3 Image: grid 0–1000, tabela de elementos e tipos de edição
- BFL Docs — FLUX 3 Image Editing: referências múltiplas, edição por instrução e mapa de pixels alterados
- Black Forest Labs — FLUX 3: Multimodal Video, Image & Audio (anúncio da família, jul/2026)
- Black Forest Labs — Pricing (preços por resolução e desconto de lançamento até 08/10)
- The Decoder — Black Forest Labs launches Flux 3 Image with multi-step editing (01/10/2026)

