Pixios Pixios
01 / 11
Análise · Custo de tokens da Fábrica

Os repositórios economizam token. O dinheiro da Fábrica está em outro lugar.

Você trouxe quatro ferramentas que cortam leitura desnecessária, a família Ralph que trabalha horas sem perguntar e a sua técnica de criar as peças uma vez e só importar. Conferi cada repositório no GitHub e abri o banco do build da Peixaria para ver onde os tokens realmente foram. A conclusão muda a ordem do que vale testar.

US$ 109custo de tabela do build da Peixaria
55%desse valor em tentativas repetidas
98,7%do volume de tokens é contexto relido
80%do gasto em integração e correção
Role, use as setas do teclado ou os botões no topo
Dados reais · build da Peixaria (06 e 07/10)

Metade do gasto foi trabalho repetido, não trabalho novo

Somei as 245 execuções de agente do build, por tipo de tarefa. Os valores são o preço de tabela da API (na assinatura você paga zero, mas gasta cota na mesma proporção).

Correções40 tarefas, 147 execuções
US$ 48,6
Integração5 tarefas, 62 execuções (12 por tarefa)
US$ 38,2
Páginas13 tarefas, 13 execuções
US$ 9,3
API5 tarefas, 13 execuções
US$ 8,9
Seed + schema10 tarefas, 10 execuções
US$ 4,2

Primeira tentativa × repetição

104 execuções de primeira vez custaram US$ 49,4. As 141 repetições custaram US$ 59,8 (55%).

O que foi rejeitado depois

As 89 execuções que falharam nos portões somam US$ 54,8 (50%). As 62 que bateram no limite da assinatura custaram quase nada (US$ 0,15).

Cada execução relê muito

Mediana de 300 mil tokens de contexto por execução, 90% abaixo de 952 mil e máximo de 1,9 milhão. Só 1,2 milhão foram escritos pelo agente, contra 93,5 milhões de contexto.

Leitura: a página, que é o que a IA mais "escreve", custou só 8,5% do total. O dinheiro está no vai-e-volta de integrar, testar, falhar e corrigir. O campo de contexto do banco soma cache lido e cache criado, então não separo os dois; a Onda 0 passa a gravá-los separados.

O que isso muda

Custo = quantas voltas × quanto contexto cada volta relê

A maioria das ferramentas que você achou ataca um terço dessa conta. Vale saber qual terço antes de instalar qualquer coisa.

O que as ferramentas atacam

saída do Bash
  • Cortam o texto que grep, find, git, npm e logs devolvem ao agente.
  • Funciona muito bem para quem usa o Claude Code solto, com Bash livre, instalando e rodando de tudo.
  • O próprio RTK avisa que o corte dilui: saída do Bash é só uma parte da entrada, e a entrada é só parte da conta.

Onde a Fábrica gasta

voltas e retentativas
  • O agente da Fábrica já roda com arquivos permitidos fechados e Bash restrito a uma lista curta. Há pouco "grep gigante" para cortar.
  • 141 de 245 execuções foram repetição; 12 execuções por tarefa de integração.
  • 73% dos 30 achados registrados vieram do back-end (SQL, 409/404, N+1, memória); 23% de telas.
Consequência: o maior ganho de token da Fábrica é fazer o agente acertar de primeira e escrever menos código novo. É exatamente a sua técnica de criar as peças uma vez e importar. Os repositórios entram como complemento, em segundo plano.
Verificação no GitHub · 07/10/2026

Os repositórios existem, mas nem tudo que o chat afirmou se confirmou

ProjetoEstrelas · atualização · licençaO que fazO que consegui confirmar
RTK (rtk-ai/rtk)82,6 mil · 07/10 · Apache-2.0Proxy em Rust que enxuga a saída de 100+ comandos"Até 90% da saída do Bash"; o README diz que isso não é 90% da conta
usagetrim43 · 07/10 · MITDobra saída verbosa e recupera o original por referênciaBenchmarks próprios: docker 99,4%, pytest 93,2%, em fixtures
ASK Token Optimizer28 · 05/07 · binário fechado2 hooks que filtram a saída do shell87,7% na sessão, mas 56,2% sem 1 grep atípico (número do próprio autor)
token-saver (ppgranger)153 · 19/09 · Apache-2.0Plugin com 32 processadores (git, docker, npm, terraform)Existe; o exemplo de 176 mil para 5 mil caracteres não localizei
Claude Token Saver16 · 30/09 · MITBusca a função e entrega só o trechoMediana de 50 a 96% de economia, mas média até −28% em buscas por descrição
GrepAI1,9 mil · 21/09 · MITBusca semântica local e grafo de chamadas (Go)Promete redução drástica de entrada; os 97% citados no chat não achei no README. Precisa de embeddings (Ollama)
Ralph (snarktank)21,9 mil · 02/02 · MITLaço que repete até o PRD acabar, contexto limpo a cada voltaÉ o original popular. Também: frankbria 9,7 mil, mikeyobrien 3,2 mil
Ralph (chrismdp)34 · 10/05 · MITLaço mínimo com tickets em markdownConfirmado
Ralph (Sean-Shmulevich)1 · 10/03 · MITVersão em Rust com PRD e watchdogExiste, mas com 1 estrela: não é referência
Ralph Loop (flight505)não encontrado-O endereço devolve 404; o resumo do chat pode ter se confundido

As estrelas e datas vêm da API do GitHub. Os percentuais de economia são sempre dos próprios autores, em condições deles; não rodei nenhum deles na Fábrica. O "optimize" (que audita skills não usadas) não consegui localizar.

Família 1 · filtrar o que as ferramentas devolvem

RTK, usagetrim, ASK e token-saver: bom para você, pouco para a Fábrica

Onde ajudam de verdade

No seu uso pessoal do Claude Code, com Bash livre: npm install, docker build, git log e testes verbosos entram inteiros no contexto. Ali a economia é real e imediata, e o RTK é a opção mais madura (82 mil estrelas, Apache-2.0).

Por que pesam pouco na Fábrica

O agente roda em dontAsk, sem npm, sem docker, sem curl. Só node, ./verificar, ls, cat, grep e git status/diff. A leitura de arquivos vai pela ferramenta Read, que filtros de Bash em geral não interceptam.

O risco que não vale correr

Um filtro que "resume" o resultado de um teste pode esconder o erro que o agente precisa ler. Na Fábrica o agente consertar errado custa uma volta inteira de portões. E o ASK é binário fechado: grátis só abaixo de CAD 100 mil de faturamento.

Melhor que instalar filtro: os comandos ./verificar e ./reproduzir são nossos. Dá para fazê-los devolver só falha, caminho e linha, sem ruído, e deixar o resto num arquivo que o agente abre se quiser. Mesmo efeito, sem terceiro no meio e sem risco de esconder erro.

Não recomendo

ASK
  • Binário fechado, licença comercial acima de CAD 100 mil.
  • O Pixios é produto comercial; a licença entra em conflito.

Pode entrar como piloto

RTK
  • Só na fase de correção, 3 execuções com e 3 sem, comparando tokens e resultado.
  • Também no seu Claude Code pessoal, hoje.
Família 2 · ler só o trecho

Claude Token Saver e GrepAI: úteis depois do lançamento, não na construção

O que o benchmark mostra

No Claude Token Saver o trecho certo vem em primeiro em 20 a 85% das buscas (depende de acertar o nome) e a economia média chega a ficar negativa quando a busca é por descrição. Não é "82% sempre".

Na construção já temos algo melhor

Cada tarefa tem lista fechada de arquivos permitidos, e o pixios.manifesto.json descreve rotas, tabelas e fluxos. O agente não precisa descobrir onde as coisas estão; o mapa já vem no prompt.

Onde brilham: alterações leves

O plano pago dá até 10 alterações por mês em apps do cliente. Ali o agente entra num projeto grande sem mapa de tarefa. Busca por trecho e por significado corta a leitura de arquivos inteiros.

Fase do produtoFerramenta que cabeObservação
Construção (fase 4)Manifesto + arquivos permitidos (já existe)Nada a instalar
Alterações leves do clienteGrepAI (Go, MIT) usando o Ollama que já roda no cérebroIndexar por projeto; medir antes de adotar
Seu Claude Code pessoalClaude Token Saver ou GrepAITeste de 1 dia num projeto grande seu

A ideia de um "Context Optimizer" que pergunta "preciso ler isso?" antes de chamar o modelo é boa para as alterações leves: primeiro o manifesto, depois o trecho, só então o arquivo inteiro. Dá para construir sobre o que já existe, sem depender de terceiros.

Família 3 · Ralph, o laço que não para

A Fábrica já é um Ralph, com mais proteção

Ralph é, em essência, um while que chama o Claude, uma tarefa por vez, com contexto limpo, até a lista acabar. Comparei com o orquestrador do Pixios.

Ideia do RalphNa Fábrica hoje
Uma tarefa por sessão, contexto novoSim: cada execução usa --no-session-persistence
Lista de tarefas (PRD, tickets)Sim: o planejador gera as tarefas no banco, com dependências
Testar antes de marcar como feitaSim, e mais: 9 portões depois de cada tarefa
Commit a cada tarefaSim (campo commit na tarefa)
Disjuntor e limite de tentativasSim: limite de rodadas, pausa por limite do motor e retomada
Permissão total (--dangerously-skip-permissions)Não, e é melhor assim: modo dontAsk com lista de permissões e escrita só nos arquivos da tarefa
Notas de aprendizado entre sessões (progress.txt)Não tem. O agente que corrige não sabe o que o anterior tentou, além do feedback do portão

Ralph não economiza token

Ele economiza a sua atenção. Cada volta com contexto limpo relê o projeto de novo, então pode até gastar mais. A economia vem de acertar em menos voltas.

Vale emprestar 1 ideia

Um arquivo de aprendizados por build (o que falhou, por que, o que não repetir), lido pelo agente de correção. Evita refazer a mesma tentativa, que é onde estão as 141 repetições.

Cuidado com os relatos

"Projeto de US$ 50 mil por US$ 300" vem de blogs promocionais, sem auditoria. Os próprios autores recomendam rodar em contêiner. Não troque a Fábrica por um Ralph externo.

Sua técnica · peças prontas e importadas

Escrever uma vez, certificar e importar é o maior corte

Quando o botão, o dropdown, o alerta, a tabela e o formulário já existem e já passaram nos testes, o agente deixa de inventá-los. Cada peça pronta economiza token de três jeitos.

Menos código escrito

Importar Tabela, Formulario ou Modal são duas linhas, em vez de 150. A saída do agente cai e o arquivo fica pequeno.

Menos contexto relido

O agente lê a assinatura da peça, não o código dela. O GUIA.md descreve as peças em uma tabela curta, e esse trecho fixo fica no cache de prompt.

Menos retentativas

Estado vazio, número cortado, formulário que recusa dado válido: a peça já nasce resolvida. Aqui está a parcela de 55% do custo.

Ajuste importante pelos dados: só 23% dos achados são de tela. 73% são de back-end: SQL montado por interpolação, 409/404 no caminho feliz, N+1, lista sem paginação, memória. A mesma técnica precisa valer para o servidor: um módulo base certificado de CRUD (consulta parametrizada, paginação, erros mapeados, validação) que a IA só configura.
TruqueO que cortaEsforço
Biblioteca de UI certificada (botão, select, alerta, tabela, modal, formulário), com tema claro e escuroCódigo de tela e falhas do G2, G3 e G6Médio, uma vez
Módulo base de CRUD no back-endFalhas do G1, G7 e G8 e quase todo o trabalho de integraçãoMédio, uma vez
Gerador de schema, seed e rotas a partir do manifesto, sem IATarefas inteiras viram scriptMédio
Chaves i18n nos 3 idiomas geradas por script a partir de uma tabelaTexto repetitivo e inconsistênciaBaixo
GUIA.md curto e estável (cache de prompt) e prompt de sistema sem mudar entre tarefasLeitura inicial de cada execuçãoBaixo
Feedback do portão só com o delta do erro, e arquivo de aprendizadosRepetição da mesma tentativaBaixo
Haiku nas tarefas padrão (schema, seed, i18n, triagem)Preço por token nas tarefas simplesBaixo
Estimativa · hipóteses a validar

De US$ 109 para algo perto de US$ 38 a 60 por build

As faixas abaixo são minhas, a partir dos dados do build da Peixaria. Elas não somam, porque várias atacam o mesmo gasto de retentativa. Só valem depois de medir em 3 builds.

AlavancaEfeito no custoBase do cálculoRisco
Peças certificadas (UI + CRUD de back-end)−25% a −40%Correção e integração são US$ 87 dos US$ 109; origem dos achados medidaMédio: depende de cobrir os casos
Triagem de falso alarme + arquivo de aprendizados−10% a −20%409/404 e "SQL interpolado" repetem; 141 repetiçõesBaixo
Haiku nas tarefas padrão−5% a −10%Schema, seed e API somam US$ 13 (12%); Haiku 4.5 custa US$ 1/US$ 5 por milhão de tokens, bem abaixo do SonnetBaixo, medir qualidade
Saída enxuta de ./verificar e ./reproduzir + GUIA.md curto−3% a −8%Sem medição por ferramenta aindaBaixo
RTK ou usagetrim no agente0 a −5%Bash do agente já é restritoMédio: pode esconder erro
GrepAI / Claude Token Saver~0 na construçãoArquivos já vêm fechados na tarefaBaixo
Ralph externo0A Fábrica já faz o que ele fazAlto: trocaria proteção por permissão total
HojePeixaria, preço de tabela
US$ 109
Faixa conservadora−45%
~US$ 60
Faixa otimista−65%
~US$ 38

Por que isso importa para o negócio: a assinatura mensal é US$ 99 (R$ 249). Um build de US$ 109 em preço de tabela passa do valor da primeira mensalidade. Enquanto o motor for a assinatura, o limite é cota; quando virar API, isso vira margem. O alvo de US$ 38 a 60 só vale depois de confirmado na Onda 0.

Plano · em ordem de ganho por esforço

Medir primeiro, depois as peças, por último as ferramentas

  1. Medir por execução (1 dia): gravar número de voltas, cache lido e criado separados, bytes devolvidos por ferramenta e quais arquivos foram lidos. Sem isso, as faixas da página anterior são palpite.
  2. Módulo base de CRUD no back-end e biblioteca de UI certificada: a maior alavanca. Começa pela Peixaria: as 5 integrações e as 40 correções mostram quais peças faltaram.
  3. Triagem de falso alarme e arquivo de aprendizados por build: o agente de correção lê o que já foi tentado. Ataca direto as 141 repetições.
  4. Haiku por tipo de tarefa: uma tarefa de schema, seed, i18n e triagem com Haiku, comparando qualidade e cota na assinatura.
  5. Saída enxuta de ./verificar e ./reproduzir, e GUIA.md curto: mexe só em ferramenta nossa; mede o ganho antes e depois.
  6. Pilotos opcionais: RTK só na fase de correção (3 com, 3 sem) e GrepAI nas alterações leves do cliente. Só entram se a medição mostrar ganho sem esconder erro.
O que eu não faria

Instalar o ASK

Binário fechado e licença comercial acima de CAD 100 mil. Conflita com o Pixios como produto.

Trocar a Fábrica por um Ralph

Perderia portões, escopo fechado e a lista de permissões, sem reduzir token.

Permissão total no cérebro

O --dangerously-skip-permissions não entra na VPS de produção. Se um dia usar, só em contêiner descartável.

O que preciso de você

Onde está sua biblioteca

Em qual projeto seu estão os botões, dropdowns, alertas e tabelas que você reaproveita? Me diga o nome e eu leio e transformo em peça certificada do Pixios.

Aval para os itens 1 a 3

Medir, criar o módulo base e a triagem. Nenhum remove portão.

Teste do RTK no seu uso

Posso instalar no Claude Code do cérebro como piloto de 1 dia. Reversível.