Na quarta-feira (30/09), o Google apresentou o Gemini 4 Argon. É o modelo mais forte que a empresa já construiu — e você, muito provavelmente, não vai poder usar. Não nesta semana, e talvez não neste ano.

O Argon não teve lançamento de produto. Ele foi entregue a um grupo fechado de "defensores cibernéticos" dentro do Fairwind Program, o programa de segurança do Google, e a empresa se recusa a dizer quando o resto do mundo terá acesso. A única coisa parecida com uma data é uma frase vaga: a liberação para desenvolvedores, empresas e consumidores vem "assim que possível", começando por clientes pagos da API e assinantes do plano Ultra.

Há também um preço, o que confirma que a ideia é vender: 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de saída, com 95% de desconto para contexto já lido do cache.

A história desse lançamento diz menos sobre o modelo e mais sobre uma mudança na forma como a fronteira da inteligência artificial chega até nós. E essa mudança tem consequência direta para quem mora no Brasil.

Um tubo de descarga com argônio: o gás nobre brilha em violeta quando recebe energia. O nome do novo modelo do Google vem daí — e o comportamento, por enquanto, combina com a fama do gás: não reage com quase nada.

O que o Argon é capaz de fazer

O Google chama o Argon de modelo de "primeira linha" (frontier) e diz que ele foi treinado para sustentar raciocínio longo em tarefas que exigem muitos passos. Traduzindo: não é um modelo para responder perguntas soltas, é um modelo para tocar um trabalho inteiro sozinho.

Os números apresentados pela própria empresa:

  • CWE-bench v1 (consertar falhas de segurança): 68% — empate em primeiro lugar, dando sequência ao desempenho do 3.8 Flash Cyber, lançado em setembro;
  • DeepSWE v1.1: 77,9% — recorde em um teste de engenharia de software do mundo real, com tarefas de horizonte longo;
  • Vals Index: primeiro lugar — índice que mede trabalho economicamente relevante em finanças, direito, programação e impostos;
  • AutomationBench (Zapier): 51,3% — primeiro lugar em fluxos de trabalho de negócio de ponta a ponta;
  • LVBench: 91,7% — estado da arte em entender vídeos longos.

E um detalhe técnico que muda o tipo de tarefa possível: o Argon pode gerar até 1 milhão de tokens de saída, contra 64 mil do modelo anterior. Na prática, ele não escreve um trecho de código — escreve um projeto inteiro numa tacada só, sem perder o fio da meada no meio do caminho.

A empresa também afirma que o Argon lidera o teste de resistência a prompt injection indireto (quando alguém esconde uma instrução maliciosa dentro de uma página ou documento que a IA lê). É um ponto honesto: quanto mais autonomia o modelo tem, mais perigoso fica o texto que ele lê sem desconfiar.

Ele encontra, confirma e conserta a falha — sozinho

A parte mais impressionante — e a mais delicada — é a promessa central: o Argon consegue, sem gente no meio, procurar vulnerabilidades, validar que elas são reais e escrever a correção.

Para os parceiros de cibersegurança considerados confiáveis, o Google tomou uma decisão que merece atenção: liberar o Argon sem as travas usuais de segurança cibernética. Essas travas são os filtros que, em modelos comuns, bloqueiam pedidos para escrever código de ataque. Elas existem para reduzir risco, mas também limitam quem trabalha na defesa, porque defender exige entender o ataque por dentro.

O raciocínio do Google é direto: "é um modelo deste calibre, com este nível de desempenho, que é de fato importante para os defensores", disse Tulsee Doshi, responsável de produto dos modelos Gemini, à CNBC.

Só que a frase vale nos dois sentidos. A mesma capacidade que encontra uma brecha e escreve o remendo é a capacidade que encontra uma brecha e escreve a exploração. Não existe um botão que separe as duas coisas dentro do modelo — a separação existe nas políticas de quem recebe o acesso. É exatamente por isso que o lançamento é restrito. E é exatamente por isso que a pergunta "quem é um defensor confiável?" passa a importar mais do que o benchmark.

O primeiro exemplo público é concreto. A Wiz, empresa de segurança na nuvem, usou o Argon no programa Scan for Good — uma iniciativa que faz varreduras gratuitas em infraestrutura pública crítica — e encontrou uma falha até então desconhecida em um software hospitalar que expunha dados pessoais sensíveis de pacientes. Segundo o Google, modelos de fronteira anteriores não tinham achado essa falha.

As travas de cibersegurança dos modelos existem para impedir pedidos de código malicioso. Para os defensores do Fairwind Program, o Google abriu a porta: liberou o Argon sem essas travas.

O Google já está usando — dentro de casa

Talvez a parte mais curiosa do anúncio sejam os usos internos, porque eles mostram o que acontece quando ninguém precisa negociar orçamento nem esperar fila de acesso.

Times do Google usaram grupos de agentes Argon para analisar a telemetria dos data centers e achar otimizações de memória. O resultado: mais de 300 tebibytes de memória liberados depois do deploy, com estimativa de chegar a algo entre 500 TiB e 1 PiB.

Outros times usaram o modelo para migrar bases de código gigantes de C e C++ para Rust — um trabalho reconhecidamente chato, caro e cheio de armadilhas, que costuma consumir anos de equipe.

E os pesquisadores de computação quântica usaram o Argon para otimizar o consumo de qubits e portas lógicas de sub-rotinas que travavam aplicações importantes. Em um dos casos, o modelo bateu a linha de base publicada em 40%, em questão de minutos.

Ou seja: o modelo mais forte do Google está sendo usado, em primeiro lugar, para resolver os problemas do próprio Google. Isso não é uma crítica — é a informação mais útil do anúncio. Mostra o tamanho do ganho de produtividade que a empresa está capturando antes de qualquer cliente ver a cor do modelo.

Grupos de agentes Argon analisaram a telemetria dos data centers do Google e liberaram mais de 300 tebibytes de memória. A IA otimizando a infraestrutura que treina a própria IA.

O que o Google não contou

Nem tudo são flores, e a parte boa deste blog é que a gente lê a letra miúda junto com o comunicado.

Primeiro: nos próprios documentos citados no lançamento, o Argon ficou atrás dos concorrentes em dois dos quatro benchmarks de programação. Ou seja, não é um passeio — é liderança em alguns terrenos e derrota em outros. A Reuters destacou exatamente isso.

Segundo: todos os números são auto-reportados. CWE-bench, DeepSWE, Vals, AutomationBench — quem publica os resultados é o Google. Avaliação independente, com o modelo na mão de terceiros, ainda não existe. Histórico recente ensina a desconfiar: em setembro, a xAI apresentou um modelo como "o mais custo-eficiente da fronteira" e o avaliador independente o colocou abaixo da linha de eficiência dos concorrentes.

Terceiro: não há data pública. A liberação é "em fases", e a empresa também entrou no processo voluntário de revisão pré-lançamento do governo dos Estados Unidos. Antes disso, atrasos: o lançamento vem depois de meses de demora na linha de modelos de fronteira do Google, com candidatos ao Gemini 3.5 Pro descartados no caminho.

Quarto: o preço é "introdutório". Palavra do próprio Google. Preço introdutório é aquele que sobe depois que a concorrência enfraquece.

Agora existem três formas de lançar uma IA

Esse é o ponto que faz o Argon valer um post. Até pouco tempo, lançar um modelo de fronteira tinha um roteiro único: anuncia, abre a lista de espera, solta para todo mundo, deixa o mercado testar.

Hoje existem três caminhos — e eles convivem na mesma semana:

  1. Lançamento aberto ao público — o modelo entra no chat, na API, nos planos e vira produto.
  2. Engavetar por segurança — em 28/09, a OpenAI confirmou que abandonou o lançamento do GPT-6.1 Astra, que estava previsto para outubro, depois que testes internos mostraram que ele não atingia os padrões de segurança e alinhamento da empresa. Um modelo construído e não entregue.
  3. Liberação vigiada — o caso do Argon: o modelo existe, funciona, é usado, mas o acesso é racionado por convite e por uma avaliação prévia do governo.

Nenhum desses caminhos é bom ou ruim por si. Mas os três juntos contam uma história clara: o modelo de fronteira deixou de ser um produto e virou uma liberação controlada. Quem chega antes não é mais quem paga mais rápido — é quem está na lista certa. E a lista é feita por um laboratório privado em conjunto com um governo estrangeiro.

Com 1 milhão de tokens de saída, o Argon não escreve um trecho de código: escreve um projeto inteiro numa única trajetória. É a diferença entre um assistente e um time.

E o Brasil nessa história?

O Brasil não aparece no Fairwind Program. Não há parceiro brasileiro anunciado, não há prazo para o Argon chegar aqui e não há nenhum sinal de que a varredura gratuita de infraestrutura pública vá incluir sistemas brasileiros.

Repare no exemplo que o próprio Google escolheu para mostrar o modelo funcionando: uma falha desconhecida em software hospitalar que expunha dados de pacientes. Falha que passou batido por todos os modelos de fronteira anteriores. Isso não é um caso de laboratório — é a descrição de uma boa parte da infraestrutura pública do mundo, inclusive a nossa. Sistemas de saúde, de arrecadação, de previdência e de controle. Muito código legado, muita coisa escrita em C e C++, muita integração antiga, e dados pessoais sensíveis circulando por dentro.

Se a ferramenta mais capaz de encontrar esse tipo de falha é liberada primeiro para um grupo fechado, escolhido por um laboratório dos Estados Unidos junto com o governo americano, então a ordem de prioridade da defesa cibernética brasileira passa a ser escrita por alguém que não tem motivo nenhum para nos colocar no topo da lista. Ninguém vai varrer o sistema de um hospital público brasileiro de graça. Não porque exista má intenção, mas porque ninguém foi convidado a fazer isso.

Isso tem um lado desconfortável e um lado prático. O desconfortável é de soberania: depender do calendário de liberação de um modelo estrangeiro para proteger infraestrutura crítica é aceitar que a nossa defesa tem prazo de terceiro. O lado prático é que o método já está na mesa e não depende do Argon — agentes de IA lendo código legado, procurando falhas, validando e escrevendo correção já é algo que times brasileiros podem fazer hoje, com modelos abertos e orçamento modesto. Foi mais ou menos isso que a Wiz fez, só que com o modelo mais caro do mundo disponível.

Existe também o caminho regulatório, e aqui a discussão é nossa. A LGPD já obriga quem trata dados pessoais a protegê-los. O que falta é transformar essa obrigação em rotina técnica: varredura contínua de código legado, correção antes do vazamento, e não depois da manchete. O Argon é uma ferramenta excelente para essa rotina. Ele não é a rotina.

O que fica

O Gemini 4 Argon é um daqueles lançamentos em que o modelo importa menos que a forma. Ele é forte — provavelmente o mais forte que o Google já colocou no ar — mas o que ele inaugura é a era da IA de fronteira com porteiro. Você não compra o melhor modelo. Você é selecionado para ele, e a seleção passa por um critério que não é técnica nem preço: é confiança.

Para o Brasil, isso é um lembrete incômodo e útil. Enquanto a fronteira se organiza em listas de convidados, a defesa que realmente protege os dados de um brasileiro não vai vir de fora — ela vai vir de alguém aqui dentro, com ferramentas abertas na mão, olhando para o código que todo mundo esqueceu. A pergunta que sobra é bem simples: quem está fazendo isso pelos nossos sistemas, agora?