Calculadora de custos
de LLM API
Cole um prompt de exemplo ou escreva as contagens de tokens, defina o seu volume e veja quanto custa um mês em Claude, GPT, Gemini, Llama e DeepSeek; lado a lado, com cada preço editável.
Quanto custará um mês de chamadas?
Estimativa de tokens = caracteres / 4. Os tokenizadores reais variam conforme o modelo e o idioma, normalmente 10-15%; bom para orçamentar, não para faturas.
| Modelo | Entrada $/1M | Saída $/1M | Custo / mês | Comparar | Se multiplicar x10 |
|---|
Quando a sua IA constrói um site, a Yetty coloca-o no ar e mantém-se ligada por MCP; a sua IA continua a editar, publicar e ler leads.
Como funciona mesmo
a faturação de LLM
Dois contadores, não um
A entrada e a saída são faturadas em separado, e a saída costuma custar cerca de 5 vezes mais por token. Um modelo falador num plano barato pode faturar mais do que um modelo conciso num plano caro.
Você reenvia o chat inteiro
A API não tem estado: cada turno reenvia o histórico completo como entrada. Uma conversa de 20 turnos paga o turno 1 vinte vezes; por isso os chats longos ficam caros depressa.
O cache é a grande alavanca
Um prefixo de prompt estável (prompt de sistema, documentos, ferramentas) pode ser posto em cache; então os fornecedores faturam a entrada em cache com forte desconto, muitas vezes cerca de 90%. Ative-o acima para ver o efeito.
O tamanho do modelo é um intervalo de x25
Entre um modelo pequeno e um de topo a mesma chamada pode variar 25 vezes no preço. Encaminhe as chamadas simples (classificar, extrair, reformatar) para o pequeno e reserve o de topo para o trabalho difícil.
Tokens não são palavras
O inglês tem em média cerca de 4 caracteres por token, mas código, JSON e idiomas não latinos tokenizam mais pesado. O mesmo prompt "curto" em hebraico ou japonês pode custar bastante mais.
O sucesso é o perigo
Os custos escalam de forma linear com o uso; a coluna x10 acima é o cenário "a nossa funcionalidade descolou". Orçamente para isso antes do lançamento, não no email da fatura depois.
As pessoas também perguntam
Quanto custa a Claude API por milhão de tokens?
Em meados de 2026 as tarifas de referência são cerca de 5$ por milhão de tokens de entrada e 25$ por milhão de tokens de saída no Claude Opus, 3$/15$ no Claude Sonnet e 1$/5$ no Claude Haiku. Os fornecedores mudam preços e lançam promoções com frequência, e é exatamente por isso que cada célula de preço nesta calculadora é editável; trate os valores padrão como ponto de partida e cole os números atuais da página de preços do seu fornecedor.
Como estimo quantos tokens tem o meu texto?
Uma regra rápida para o inglês é um token por cada 4 caracteres, ou cerca de 750 palavras por cada 1,000 tokens. Os tokenizadores reais variam conforme o modelo e o idioma; código, escritas não latinas e formatação incomum podem mexer na contagem em 10-15% ou mais, por isso use a estimativa para orçamentar e o contador de tokens do fornecedor quando precisar de uma fatura exata.
Como reduzo os meus custos de LLM API?
As três alavancas que mais importam: use um modelo menor para chamadas simples (classificar e extrair raramente precisam de um modelo de topo), faça cache do prefixo de prompt que se repete (os fornecedores descontam muito a entrada em cache, muitas vezes cerca de 90%) e corte o que envia; prompts de sistema mais curtos e histórico resumido reduzem a fatura de entrada em cada pedido. As Batch APIs costumam acrescentar mais ~50% de desconto para trabalhos que podem esperar.