Tendências do dia

HydraFusion: GitHub põe modelos de IA para trabalhar em equipe no Copilot e chega ao nível do Opus 5 gastando menos

A cada tarefa, o recurso experimental decide se basta um modelo, se vale escalar para um mais caro ou se chama um revisor de outra família de IA. Nos testes internos do GitHub, o custo estimado caiu até 67%.

GitHub
Sem comentários Facebook Twitter Flipboard E-mail
vinicius-braga

Vinicius Braga

Publisher
vinicius-braga

Vinicius Braga

Publisher

Vinicius Braga trabalha há mais de 20 anos com conteúdo digital. Sempre foi um entusiasta da tecnologia e sempre acreditou que inovação não é só sobre máquinas ou códigos, mas sobre pessoas. No Xataka Brasil, usa suas experiências com mídia digital, dados e inteligência artificial para aproximar o público das grandes transformações do mundo tech e mostrar como o futuro já está acontecendo e pode ser acessado por todos.

45 publicaciones de Vinicius Braga

Até agora, usar IA para programar funcionava mais ou menos assim: você escolhe um modelo e ele faz tudo sozinho. O HydraFusion, novo projeto do GitHub para o Copilot, muda essa lógica. Em vez de apostar num único cérebro, ele monta uma equipe com modelos de empresas diferentes e decide, pedido a pedido, quem faz o quê.

É isso que o GitHub chama de orquestração multimodelo. Pense num maestro: ele não toca todos os instrumentos, mas sabe quando chamar o violino e quando deixar o piano quieto. Para quem usa, essa complexidade fica escondida. Você seleciona o HydraFusion como qualquer outro modelo e ele cuida do resto.

Como funciona: três jeitos de resolver

No modo Single, um único modelo resolve a tarefa direto. É o caminho mais rápido, usado quando o problema não pede reforço.

No modo Cascade (cascata), um modelo mais barato faz o primeiro rascunho. Um filtro de qualidade avalia o resultado: se passou, fica; se não passou, o trabalho sobe para um modelo mais forte. É como um estagiário que resolve o que consegue e só leva ao chefe o que realmente precisa. O modelo caro só entra quando faz diferença.

No modo Critique (crítica), um modelo escreve a solução e outro, de uma família de IA diferente, revisa. Esse crítico só pode ler, sem mexer no código. O autor recebe os comentários e corrige uma vez. É a lógica da segunda opinião: quem revisa não carrega os mesmos vícios de quem escreveu.

Por trás disso, o GitHub diz seguir algumas regras: contabilizar o custo de cada etapa, impor limite de tempo e cancelamento a todas elas, isolar a revisão e não aplicar nenhuma mudança no código se o processo falhar no meio. Antes de rodar, o sistema também confere se os modelos escolhidos estão disponíveis.

O resultado, com asterisco

O HydraFusion foi comparado ao Claude Opus 5 em três testes de programação. No TerminalBench 2.1, acertou 4,9 pontos percentuais a mais com custo estimado 67% menor. Nos outros dois, ficou praticamente empatado: 1,5 ponto abaixo no DeepSWE, gastando 36% menos, e 0,1 ponto abaixo no CheckpointBench, teste criado pelo próprio GitHub, com custo 65% menor.

GitHub

Os números impressionam, mas pedem cautela. São avaliações offline, feitas pela própria empresa e não por terceiros, e mostram a melhor configuração ajustada. O custo é estimado, com premissas de preço do GitHub. E o recurso está em research preview, ou seja, é experimental: o GitHub avisa que modelos, comportamento e até o nome podem mudar. Por enquanto, ele está disponível no Copilot CLI, a versão de linha de comando, para todos os planos, ativando o modo experimental. A cobrança segue o consumo de cada modelo usado.

Por que importa

A corrida da IA vinha sendo contada como uma disputa por quem tem o modelo mais poderoso. O HydraFusion aponta outro caminho: combinar modelos baratos e fortes, com revisão cruzada, pode entregar resultado parecido gastando bem menos. Para empresas que pagam por cada tarefa executada pela IA, essa conta pesa, e muito.

O HydraFusion ainda é um experimento, validado apenas pelos números do próprio GitHub. Mas a aposta é clara: o próximo salto da IA para programação pode não vir de um modelo maior, e sim de saber qual modelo chamar, quando chamar e quem vai conferir o trabalho. Se os resultados se confirmarem fora do laboratório, trocar o "modelo mais caro" por uma equipe bem coordenada tende a virar o padrão.

Inicio