Mais GPUs, mais servidores e data centers cada vez maiores. Essa foi uma das fórmulas que impulsionaram a recente explosão da inteligência artificial. Mas existe um problema difícil de ignorar: toda essa infraestrutura precisa ser comprada, refrigerada e alimentada com enormes quantidades de eletricidade. Com a IA entrando em cada vez mais empresas e produtos, uma nova corrida está ganhando importância — não para aumentar o número de cálculos, mas para descobrir quais deles podem simplesmente desaparecer.
Fazer praticamente a mesma coisa usando menos máquina virou um objetivo estratégico
Segundo uma pesquisa global da McKinsey publicada em 2026, 89% das organizações consultadas já utilizavam inteligência artificial regularmente em pelo menos uma função.
Mas aproximadamente uma em cada cinco também afirmava limitar sua utilização devido aos custos operacionais, incluindo aqueles relacionados ao processamento de tokens.
Isso devolveu protagonismo a uma velha obsessão da computação: fazer o software utilizar os recursos disponíveis da maneira mais eficiente possível.
Uma possibilidade está na precisão numérica.
Modelos não precisam necessariamente realizar todas as operações utilizando números representados com a máxima precisão disponível. Formatos como FP16, BF16 e FP8 podem reduzir memória, movimentação de dados e capacidade computacional necessária em comparação com representações mais precisas.
O segredo é escolher onde essa redução pode acontecer sem comprometer significativamente o resultado.
E existem outras ferramentas.
É possível reutilizar modelos previamente treinados, eliminar parâmetros pouco importantes, transformar modelos grandes em versões menores por meio de destilação ou aplicar quantização para diminuir memória e custo computacional.
Outra estratégia vai ainda mais longe: não ativar toda a rede neural para resolver cada tarefa.
É justamente essa a lógica das arquiteturas conhecidas como Mixture of Experts (MoE).
Em vez de fazer o modelo inteiro trabalhar para processar cada token, diferentes regiões atuam como “especialistas”, e apenas uma parte delas é selecionada conforme a necessidade.

Continua após a publicidade
O DeepSeek mostrou por que deixar partes do modelo paradas pode ser uma vantagem
O DeepSeek-V3 é um dos exemplos mais conhecidos dessa estratégia.
Embora tenha 671 bilhões de parâmetros, aproximadamente 37 bilhões são ativados para processar cada token.
Em termos simplificados, possuir um modelo gigantesco não significa obrigatoriamente utilizar todos os seus componentes o tempo inteiro.
A empresa também informou que o treinamento final exigiu cerca de 2,788 milhões de horas de GPU Nvidia H800. Sua arquitetura combina MoE com outras técnicas de eficiência, incluindo treinamento de baixa precisão em FP8.
Estudos posteriores sobre sua infraestrutura destacaram justamente a importância do codesign entre hardware e software: em vez de tratar chips e algoritmos como problemas separados, ambos podem ser projetados para aproveitar melhor um ao outro.
Isso não transforma MoE em uma solução mágica.
Distribuir o trabalho entre especialistas cria seus próprios desafios, incluindo comunicação entre componentes, movimentação de dados, uso de memória e equilíbrio de carga. Pesquisadores continuam procurando maneiras de reduzir até mesmo quantos especialistas precisam ser acionados durante a inferência.
O incentivo econômico, porém, é simples.
Cada operação evitada representa menos tempo de GPU. Menos tempo de GPU significa menos energia e, potencialmente, menor custo para processar milhões ou bilhões de tokens.
E isso está se tornando particularmente importante porque o problema energético cresce junto com a IA.
Modelos mais eficientes não significam necessariamente data centers consumindo menos
A Agência Internacional de Energia estimou que os data centers consumiram aproximadamente 415 TWh de eletricidade em 2024, cerca de 1,5% da demanda mundial.
Para 2030, seu cenário central projeta algo próximo de 945 TWh, praticamente o dobro em poucos anos.
Existe ainda uma aparente contradição.
Tornar a IA mais eficiente reduz o custo de cada operação, mas também pode incentivar sua utilização em muito mais lugares. Chatbots, programação, buscas, geração de imagens e vídeos e agentes capazes de executar longas sequências de tarefas ampliam rapidamente a quantidade total de processamento.
Um modelo pode, portanto, consumir muito menos para realizar determinada tarefa enquanto a indústria como um todo continua demandando cada vez mais eletricidade.
É por isso que a busca pelo chamado “algoritmo verde” também é uma corrida econômica.
Durante anos, a competição da inteligência artificial esteve concentrada em quem conseguiria construir modelos maiores e oferecer mais poder computacional.
A próxima vantagem pode surgir da pergunta oposta: quanto desse enorme modelo realmente precisa trabalhar cada vez que alguém envia um comando?
Se a resposta for “muito menos do que hoje”, o próximo grande salto da IA talvez não seja adicionar mais chips — mas aprender a deixar uma parte deles sem nada para fazer.
Veja todas notícias sobre Tecnologia
Publicidade



