A imagem oficial do Google parece ter saído do novo filme do "Quarteto Fantástico", mas nada disso: ela marca o retorno a uma disputa que a empresa parecia ter abandonado.
Durante meses, a companhia ficou um pouco à deriva na corrida pelos modelos de fronteira, mas, com o Gemini 4 Argon, tudo indica — pelo menos segundo os benchmarks — que o Google se posiciona como uma das três empresas com os modelos mais potentes do mundo. E o problema é justamente esse: os benchmarks.
O Google está de volta ao jogo
O Gemini 4 Argon chega com resultados em benchmarks que o colocam ao lado da OpenAI e da Anthropic na disputa pelos modelos de fronteira mais potentes do mundo.
A Artificial Analysis lhe atribui 53 pontos em seu Intelligence Index — a mesma pontuação do GPT-6 Astra —, mas, segundo testes internos do Google, o Gemini 4 é uma potência que supera o Opus 5.5 e o Fable 5.1 em diversos testes. Será que ele é realmente tão bom quanto o Google afirma?
Os testes internos parecem deixar claro que o Gemini 4 Argon é, atualmente, o melhor modelo do mundo. Não temos certeza de que seja.
Não podemos afirmar se é o melhor
Embora os dados, tanto do Google quanto da Artificial Analysis, ofereçam muitas pistas sobre o desempenho fantástico do Gemini 4 Argon, o problema é que o modelo ainda não foi lançado em larga escala. Inicialmente, ele estará disponível para um grupo restrito de "testadores de confiança" e especialistas em cibersegurança por meio do programa Fairwind.
O modelo também está sendo analisado pelo governo dos EUA — uma prática que vem se tornando comum para evitar bloqueios governamentais.
Alguns funcionários o testaram, e a situação fica mais complexa
A Bloomberg conversou com colaboradores, e é aí que a capacidade do modelo começa a parecer um pouco mais incerta. Eles afirmam que, embora o Argon realmente obtenha pontuações fantásticas nos testes, ele não apresenta o mesmo desempenho refinado ao realizar certas tarefas de programação.
O Google nega isso, e Sundar Pichai garante que suas equipes o utilizam extensivamente e estão obtendo bons resultados. Parece haver uma divisão interna quanto à capacidade prática do modelo, e é impossível saber como ele se comporta para cada pessoa até que possamos testá-lo.
O Google volta à disputa, mas ainda está um pouco atrás dos modelos da Claude, que continuam à frente segundo a Artificial Analysis.
Um benchmark é apenas isso: um benchmark
Testes voltados para programação ou automação tentam simular casos reais, mas ainda precisam ser tarefas delimitadas, verificáveis e com condições reproduzíveis. Como todos sabemos, o nosso dia a dia é bem menos "limpo", e quem utiliza IA pode lidar com repositórios enormes, dependências ou documentação imperfeita.
Mesmo que um modelo tenha um desempenho excelente nos testes, ele pode não ser tão bom quanto parecia na experiência real do usuário. Tudo depende do caso de uso e, claro, da opinião do próprio usuário. O que é bom para alguns pode não ser tão bom para outros.
Menos alucinações, mas...
A Artificial Analysis indica que a taxa de alucinações do Gemini 4 Argon é de 15% no teste AA-Omniscience, enquanto o GPT-6 Astra alucina 50% — uma diferença enorme. O fato é que o Astra consegue maior precisão neste teste. O que acontece aqui é que o Gemini 4 não alucina tanto porque é capaz de dizer "não sei" em vez de inventar uma resposta. É uma forma sensata de agir, mas também demonstra que esse índice de "15%" precisa de contexto.
O Google também quer competir por preço
Inicialmente, o Gemini 4 terá um preço promocional de 2/10 dólares por milhão de tokens de entrada/saída — algo importante, especialmente agora que o uso desses modelos em tarefas de agentes por longos períodos pode sair muito caro.
Segundo a Artificial Intelligence, com esse custo reduzido, o Gemini 4 consegue um custo por tarefa 40% inferior ao do GPT-6 Astra. Mas, claro, isso não durará para sempre; o Google dobrará os preços posteriormente para 4/20 dólares, um custo mais difícil de absorver em usos intensivos. Esperamos que uma possível variante "Flash" alivie essa questão.
Ver 0 Comentários