Pular para o conteúdo

Como reduzir o custo de IA

Sete medidas para pagar menos pela mesma tarefa, com o tamanho da economia de cada uma e uma calculadora para testar.

Resposta direta

Troque o modelo nas tarefas simples, guarde em cache o que se repete e processe em lote o que pode esperar. Em um atendimento de 200 conversas por dia, trocar o GPT-6.1 Sol pelo GPT-6 Luna baixa a conta de R$ 657,88 para R$ 32,89 por mês.

Teste as medidas no seu atendimento

Conversas de 6 trocas, com instruções de 600 palavras.

PTAX de venda de 02/10/2026, do Banco Central. Troque pela cotação do seu cartão.

Com as medidas marcadas, a conta do mês cai para

R$ 18,88

Antes: R$ 657,88. Economia de R$ 639,00 por mês (97%).

Ver a conta passo a passo
  1. Hoje: 6.000 conversas no GPT-6.1 Sol = R$ 657,88
  2. Troca de modelo: a mesma conversa no GPT-6 Luna
  3. Cache: 67% da leitura são as instruções repetidas, cobradas a US$ 0,01 por milhão em vez de US$ 0,10
  4. Tamanho das respostas mantido
  5. Sem lote (atendimento ao vivo não pode esperar)
  6. Resultado: US$ 3,49 × R$ 5,2238 × 1,035 (IOF) = R$ 18,88

Fonte: OpenAI, tabela de preços da API · lido em . Dólar: PTAX de venda do Banco Central de 02/10/2026. IOF: Decreto nº 12.499/2025 (art. 15-B, VII, do Decreto nº 6.306/2007), em vigor desde 11/06/2025.

O cálculo do cache não inclui a taxa de gravação cobrada na primeira vez que o trecho é guardado (25% a mais na Anthropic, para 5 minutos).

Quais medidas reduzem a conta de IA?

Da que mais pesa para a que menos pesa, em um uso típico de atendimento.

MedidaEconomiaQuando usar
1. Modelo mais barato nas tarefas simplesAté 95% (GPT-6.1 Sol para GPT-6 Luna)Perguntas repetidas, triagem, classificação.
2. Cache das instruções repetidasA parte repetida da leitura paga de 5% a 10% do preçoSempre que o mesmo texto abre todos os pedidos.
3. Processamento em lote50% em leitura e escritaResumos, relatórios e tudo o que pode esperar até 24 horas.
4. Respostas mais curtasProporcional ao corte na parte mais cara (a escrita)Atendimento: peça respostas de até três frases.
5. Instruções enxutasCada palavra a menos é paga a menos em toda respostaRevise o texto de instruções e corte o que o modelo não usa.
6. Conversas mais curtasA leitura cresce a cada troca, porque o histórico volta juntoEncerre o assunto e comece uma conversa nova.
7. Só o trecho necessário do documentoProporcional ao que deixa de ser enviadoEnvie a cláusula, não o contrato inteiro.

Fonte: OpenAI, tabela de preços da API; Anthropic, preços da API do Claude; Google, preços da API Gemini (atualizada em 01/10/2026) · lido em

Trocar de modelo vale a pena?

É a medida de maior efeito, e a mais ignorada. A diferença entre o modelo econômico e o principal da mesma empresa chega a 20 vezes: o GPT-6 Luna custa US$ 0,10 e US$ 0,50 por milhão de tokens; o GPT-6.1 Sol, US$ 2 e US$ 10. Muita gente usa o modelo caro para tudo por hábito.

O caminho seguro: separe 30 perguntas reais dos seus clientes, rode nos dois modelos e compare as respostas. Se o barato acerta, fique nele e deixe o caro só para o que ele errou. Veja os preços lado a lado na calculadora de custo de IA.

Como funcionam o cache e o lote?

Cache é pagar barato para reler o que já foi lido. Em um atendente, as instruções da empresa abrem todos os pedidos. Guardadas em cache, elas passam a custar uma fração na leitura: 10% do preço na maioria dos modelos da Anthropic (5% no Opus 5.5), e de 5% a 10% nos modelos da OpenAI desta página. Na Anthropic, gravar o trecho custa 25% a mais na primeira vez, e o cache vale por 5 minutos, renovados a cada uso.

Lote é trocar pressa por desconto. OpenAI, Anthropic e Google cobram a metade quando você envia os pedidos de uma vez e aceita a resposta em até 24 horas. Não serve para quem está esperando no WhatsApp; serve para os 50 contratos do mês. E as duas medidas se somam.

Antes de tudo, entenda de onde vem o gasto: em o que é token está a diferença entre o que a IA lê e o que ela escreve.

Exemplo resolvido

Atendimento de 200 conversas por dia, 6 trocas cada
São 6.000 conversas no mês. Em cada uma, 4.800 dos 7.140 tokens lidos são as instruções relidas seis vezes: é nesse trecho que o cache atua.
Hoje, no GPT-6.1 Sol
R$ 657,88
Só com cache das instruções, no mesmo modelo
R$ 362,03
Trocando para o GPT-6 Luna
R$ 32,89
GPT-6 Luna com cache das instruções
R$ 18,88
Economia por mês
R$ 639,00 (97%)

Perguntas frequentes

Como reduzir o custo de IA?

As três medidas de maior efeito são: usar um modelo mais barato nas tarefas simples, guardar em cache a parte do pedido que se repete e processar em lote o que pode esperar, com 50% de desconto.

O que é cache de prompt?

É guardar no provedor o trecho que se repete em todo pedido, como as instruções do atendente. Na leitura seguinte, esse trecho custa uma fração do preço: 10% na maioria dos modelos da Anthropic e de 5% a 10% nos da OpenAI citados aqui.

O que é processamento em lote?

É enviar muitos pedidos de uma vez e receber as respostas em até 24 horas. OpenAI, Anthropic e Google dão 50% de desconto nesse modo. Serve para resumir documentos e classificar textos, não para atendimento ao vivo.

Modelo mais barato responde pior?

Em tarefas simples e repetidas, a diferença costuma ser pequena. Teste com casos reais do seu negócio antes de decidir, e reserve o modelo caro para o que exige raciocínio.

Respostas mais curtas economizam quanto?

A escrita custa 5 vezes mais que a leitura na maioria dos modelos, então pedir respostas objetivas reduz a parte mais cara da conta na mesma proporção do corte.