Até agora, usar IA para programar funcionava mais ou menos assim: você escolhe um modelo e ele faz tudo sozinho. O HydraFusion, novo projeto do GitHub para o Copilot, muda essa lógica. Em vez de apostar num único cérebro, ele monta uma equipe com modelos de empresas diferentes e decide, pedido a pedido, quem faz o quê.
É isso que o GitHub chama de orquestração multimodelo. Pense num maestro: ele não toca todos os instrumentos, mas sabe quando chamar o violino e quando deixar o piano quieto. Para quem usa, essa complexidade fica escondida. Você seleciona o HydraFusion como qualquer outro modelo e ele cuida do resto.
Como funciona: três jeitos de resolver
No modo Single, um único modelo resolve a tarefa direto. É o caminho mais rápido, usado quando o problema não pede reforço.
No modo Cascade (cascata), um modelo mais barato faz o primeiro rascunho. Um filtro de qualidade avalia o resultado: se passou, fica; se não passou, o trabalho sobe para um modelo mais forte. É como um estagiário que resolve o que consegue e só leva ao chefe o que realmente precisa. O modelo caro só entra quando faz diferença.
No modo Critique (crítica), um modelo escreve a solução e outro, de uma família de IA diferente, revisa. Esse crítico só pode ler, sem mexer no código. O autor recebe os comentários e corrige uma vez. É a lógica da segunda opinião: quem revisa não carrega os mesmos vícios de quem escreveu.
Por trás disso, o GitHub diz seguir algumas regras: contabilizar o custo de cada etapa, impor limite de tempo e cancelamento a todas elas, isolar a revisão e não aplicar nenhuma mudança no código se o processo falhar no meio. Antes de rodar, o sistema também confere se os modelos escolhidos estão disponíveis.
O resultado, com asterisco
O HydraFusion foi comparado ao Claude Opus 5 em três testes de programação. No TerminalBench 2.1, acertou 4,9 pontos percentuais a mais com custo estimado 67% menor. Nos outros dois, ficou praticamente empatado: 1,5 ponto abaixo no DeepSWE, gastando 36% menos, e 0,1 ponto abaixo no CheckpointBench, teste criado pelo próprio GitHub, com custo 65% menor.
Os números impressionam, mas pedem cautela. São avaliações offline, feitas pela própria empresa e não por terceiros, e mostram a melhor configuração ajustada. O custo é estimado, com premissas de preço do GitHub. E o recurso está em research preview, ou seja, é experimental: o GitHub avisa que modelos, comportamento e até o nome podem mudar. Por enquanto, ele está disponível no Copilot CLI, a versão de linha de comando, para todos os planos, ativando o modo experimental. A cobrança segue o consumo de cada modelo usado.
Por que importa
A corrida da IA vinha sendo contada como uma disputa por quem tem o modelo mais poderoso. O HydraFusion aponta outro caminho: combinar modelos baratos e fortes, com revisão cruzada, pode entregar resultado parecido gastando bem menos. Para empresas que pagam por cada tarefa executada pela IA, essa conta pesa, e muito.
O HydraFusion ainda é um experimento, validado apenas pelos números do próprio GitHub. Mas a aposta é clara: o próximo salto da IA para programação pode não vir de um modelo maior, e sim de saber qual modelo chamar, quando chamar e quem vai conferir o trabalho. Se os resultados se confirmarem fora do laboratório, trocar o "modelo mais caro" por uma equipe bem coordenada tende a virar o padrão.
Ver 0 Comentários