| Item | Como é cobrado | Preço público |
| Telegram | Uso do bot | Gratuito |
| Classificação (intenção + nível) | gpt-5.4-nano, por token | $0,20/milhão tokens entrada · $1,25/milhão saída |
| Transcrição de áudio | gpt-4o-mini-transcribe, por minuto | ~$0,003/minuto |
| Servidor (VPS) | Mensal, fixo | R$ 52,99/mês (Hostinger, plano KVM 1, contratação mês a mês) |
R$ 0,06
por atendimento — simulação de 1.000 atendimentos/mês
Simulação: 1.000 atendimentos/mês, com 4 mensagens de texto em média cada e 20% incluindo 1 áudio de ~15s. A classificação de intenção e nível de letramento roda uma única vez por atendimento — na primeira mensagem, não a cada mensagem trocada — o que dá cerca de 2.140 tokens de IA por atendimento, medidos direto dos prompts do sistema. Isso soma US$ 0,611 (≈ R$ 3,14) em IA por mês para os 1.000 atendimentos. O servidor (R$ 52,99/mês ÷ R$ 5,14 = US$ 10,31) somado à IA dá US$ 10,92/mês — R$ 56,13/mês — R$ 0,06 por atendimento (câmbio R$ 5,14, 21/08/2026).
Estes valores são uma estimativa baseada nos preços públicos da OpenAI e no tamanho real dos prompts do sistema — não representam uma fatura paga. O protótipo foi desenvolvido usando créditos de teste da conta da equipe, não uma assinatura de produção.
A arquitetura usa o menor modelo da geração atual (gpt-5.4-nano) nas duas classificações que abrem cada atendimento, reservando modelos maiores apenas se o projeto crescer para tarefas que exigirem mais raciocínio — reduzindo o custo por atendimento sem abrir mão da precisão.
A simulação acima usa o preço cheio, sem descontos. Na prática, o custo tende a ser ainda menor: como os prompts de sistema de intencao.py e classificador.py são fixos e reaproveitados em toda chamada, eles são elegíveis ao desconto de cache de prompt da OpenAI — até 90% mais barato na parte repetida.
Em escala muito maior que a testada aqui, existe outro caminho: hospedar um modelo de código aberto (como Llama ou Mistral) no próprio servidor, trocando custo por token por custo fixo de infraestrutura. Não foi o caminho escolhido para este protótipo — que prioriza simplicidade e rapidez de desenvolvimento —, mas é uma opção real se o volume de atendimentos crescer o suficiente para justificar o investimento.