A compressão de modelos de IA ganhou uma técnica nova que coloca a física teórica a serviço da economia computacional. Pesquisadores da Multiverse Computing publicaram em 21 de setembro de 2026 um método que reformula a podagem de redes neurais como um problema de otimização de Ising, o mesmo framework matemático usado para estudar ímãs e vidros de spin em física da matéria condensada. O resultado: é possível remover 40 dos 80 blocos do Llama-3.3-70B e chegar a 77 pontos no MMLU, enquanto os métodos anteriores ficam na faixa dos 50 pontos com a mesma taxa de remoção.
Como funciona a podagem por otimização de Ising
A compressão de modelos de IA tradicional avalia cada bloco de forma independente, como se cada parte do modelo não interagisse com as demais. O método da Multiverse Computing captura as interações entre blocos por uma expansão de Taylor de segunda ordem, calculando uma matriz Hessiana cujos elementos fora da diagonal representam o acoplamento entre pares de blocos.
Isso mapeia o problema inteiro a um vidro de spin de Ising. Os estados de baixa energia do sistema de spins correspondem a configurações de blocos removidos que mantêm o desempenho do modelo. A exploração acontece sem retreinar o modelo do zero, usando apenas um conjunto pequeno de dados de calibração para calcular a Hessiana, tornando viável avaliar bilhões de configurações candidatas em tempo razoável.
O método foi testado também no Qwen3-14B: remover 12 dos 40 blocos entregou cerca de 10 pontos a mais no MMLU do que as técnicas concorrentes. Funciona em arquiteturas heterogêneas como o NVIDIA-Nemotron, que mistura camadas Mamba2, atenção convencional e mistura de especialistas (MoE) no mesmo modelo. Um dado curioso: os pesquisadores descobriram que estados excitados do sistema de Ising às vezes superam o estado fundamental após o retreinamento.
Por que isso importa para o seu negócio
A compressão de modelos de IA impacta diretamente o custo de inferência. Um modelo com metade dos blocos processa cada requisição em menos tempo e consome menos memória de GPU, o que se traduz em fatura menor de cloud e em latência mais baixa para o usuário final.
Para empresas que avaliam o custo de hospedar modelos abertos, um Llama-3.3-70B cortado ao meio mantém desempenho competitivo: 77 pontos no MMLU frente a 50 dos métodos anteriores. Estudos recentes também mostraram que técnicas de processamento de dados em LLMs podem reduzir o desempenho; conhecer os limites de cada abordagem é o que permite escolher bem.
Isso não é solução de prateleira ainda: o método foi publicado como pesquisa e requer implementação técnica. A tendência é clara, porém: ferramentas de compressão de modelos de IA estão ficando precisas o suficiente para que médias empresas consigam rodar modelos de grande porte sem o custo de infraestrutura dos gigantes.
O código e o artigo completo estão disponíveis no HuggingFace da Multiverse Computing.
Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.
Fontes:





