Arquitetura

Como a Iara funciona

Duas camadas de IA analisam cada mensagem em paralelo. Uma terceira entra só quando a conversa foge do roteiro. E um painel mostra tudo acontecendo, em tempo real.

O caminho de uma mensagem

Da mensagem à resposta

Cada mensagem que chega passa por este fluxo — em segundos.

Mensagem chega texto ou áudio, pelo Telegram
Se for áudio: gpt-4o-mini-transcribe transcreve antes de qualquer análise — o sistema nunca processa áudio bruto
intencao.py descobre o que a pessoa quer
classificador.py decide como a pessoa fala
As duas análises rodam em paralelo, sobre a mesma mensagem.
Resposta no caminho certo Guiado · Intermediário · Direto
As camadas

Quatro peças, cada uma com um só trabalho

Camada 1 · Intenção

intencao.py gpt-5.4-nano

Descobre o que a pessoa quer, entre 4 tarefas: trocar de plano, consultar fatura, reclamar de sinal ou cancelar linha.

Lê a mensagem inteira — não depende de onde o pedido aparece na frase. "Oi, tudo bem? Então, é que minha conta veio estranha" é entendido do mesmo jeito que "consultar fatura".

Camada 2 · Letramento

classificador.py gpt-5.4-nano

Decide como a pessoa fala, com base nos 5 níveis oficiais do Inaf. É essa leitura que escolhe o caminho da conversa — Guiado, Intermediário ou Direto.

Camada 3 · Reserva

interprete.py

Entra só quando a resposta foge do esperado. Se a pessoa responde uma pergunta — "qual o mais barato?" — no meio de uma confirmação, o interprete entende o desvio em vez de deixar a conversa travar.

Porta de entrada · Áudio

gpt-4o-mini-transcribe

Transcreve mensagens de áudio antes de qualquer análise. Quem prefere falar a escrever — e muita gente prefere — usa a Iara do mesmo jeito.

O fluxo, visualmente

O caminho de uma mensagem, camada por camada

Diagrama do fluxo técnico da Iara Mensagem do usuário segue para intencao.py e classificador.py em paralelo, que convergem na definição do caminho da conversa. O interprete.py entra apenas quando a resposta é ambígua, antes da resposta final adaptada ao nível de letramento. Mensagem do usuário em paralelo, sobre a mesma mensagem intencao.py O QUE a pessoa quer classificador.py COMO a pessoa fala Define o caminho Guiado · Intermediário · Direto Resposta adaptada ao nível de letramento interprete.py só se a resposta for ambígua Diagrama do fluxo técnico da Iara Mensagem do usuário segue para intencao.py e classificador.py em paralelo, que convergem na definição do caminho da conversa. O interprete.py entra apenas quando a resposta é ambígua, antes da resposta final adaptada ao nível de letramento. Mensagem do usuário as duas análises rodam em paralelo intencao.py O QUE a pessoa quer classificador.py COMO a pessoa fala Define o caminho Guiado · Intermediário · Direto interprete.py só se a resposta for ambígua Resposta adaptada ao nível de letramento
A régua

Os 5 níveis oficiais do Inaf

O Indicador de Alfabetismo Funcional (Inaf) é a referência nacional para medir alfabetismo. O classificador.py usa esses mesmos 5 níveis para ler cada mensagem.

Analfabeto
Rudimentar
Elementar
Intermediário
Proficiente
O painel

Tudo visível, em tempo real

Um painel em FastAPI + SQLite em modo WAL acompanha cada atendimento no momento em que acontece: nível Inaf, caminho, tarefa, taxa de resolução sem atendente humano e tempo médio por nível.

Print do painel da Iara mostrando os atendimentos em tempo real

Até a densidade dos cards conta a história

Os próprios cards do painel têm densidade visual diferente por caminho — o Guiado é mais espaçoso, o Direto mais compacto. É um lembrete permanente para quem opera o sistema: "mais devagar" é mais cuidado, não pior atendimento.

Cards Guiado e Intermediário lado a lado no painel da Iara

Os cards Guiado e Intermediário lado a lado no painel — a diferença de densidade visual entre os caminhos é intencional.

Validação

Números de validação

10+

suítes automatizadas de teste

6

casos-âncora da escala do Inaf

19

variações de confirmação testadas

7

personas cobrindo os 5 níveis oficiais

Não é um instrumento de diagnóstico clínico — é um protótipo validado com rigor pro que ele se propõe a fazer. A Iara não aplica o teste oficial do Inaf, que é presencial e cronometrado: o que ela faz é uma aproximação, baseada nos descritores de cada nível, pensada pra funcionar dentro de uma conversa real.

Transparência

Quanto custa a Iara?

ItemComo é cobradoPreço público
TelegramUso do botGratuito
Classificação (intenção + nível)gpt-5.4-nano, por token$0,20/milhão tokens entrada · $1,25/milhão saída
Transcrição de áudiogpt-4o-mini-transcribe, por minuto~$0,003/minuto
Servidor (VPS)Mensal, fixoR$ 52,99/mês (Hostinger, plano KVM 1, contratação mês a mês)
R$ 0,06

por atendimento — simulação de 1.000 atendimentos/mês

Simulação: 1.000 atendimentos/mês, com 4 mensagens de texto em média cada e 20% incluindo 1 áudio de ~15s. A classificação de intenção e nível de letramento roda uma única vez por atendimento — na primeira mensagem, não a cada mensagem trocada — o que dá cerca de 2.140 tokens de IA por atendimento, medidos direto dos prompts do sistema. Isso soma US$ 0,611 (≈ R$ 3,14) em IA por mês para os 1.000 atendimentos. O servidor (R$ 52,99/mês ÷ R$ 5,14 = US$ 10,31) somado à IA dá US$ 10,92/mês — R$ 56,13/mês — R$ 0,06 por atendimento (câmbio R$ 5,14, 21/08/2026).

Estes valores são uma estimativa baseada nos preços públicos da OpenAI e no tamanho real dos prompts do sistema — não representam uma fatura paga. O protótipo foi desenvolvido usando créditos de teste da conta da equipe, não uma assinatura de produção.

A arquitetura usa o menor modelo da geração atual (gpt-5.4-nano) nas duas classificações que abrem cada atendimento, reservando modelos maiores apenas se o projeto crescer para tarefas que exigirem mais raciocínio — reduzindo o custo por atendimento sem abrir mão da precisão.

A simulação acima usa o preço cheio, sem descontos. Na prática, o custo tende a ser ainda menor: como os prompts de sistema de intencao.py e classificador.py são fixos e reaproveitados em toda chamada, eles são elegíveis ao desconto de cache de prompt da OpenAI — até 90% mais barato na parte repetida.

Em escala muito maior que a testada aqui, existe outro caminho: hospedar um modelo de código aberto (como Llama ou Mistral) no próprio servidor, trocando custo por token por custo fixo de infraestrutura. Não foi o caminho escolhido para este protótipo — que prioriza simplicidade e rapidez de desenvolvimento —, mas é uma opção real se o volume de atendimentos crescer o suficiente para justificar o investimento.

A melhor explicação é uma conversa

A Iara é uma inteligência artificial e, como qualquer outra IA, pode cometer erros.