Os repositórios economizam token. O dinheiro da Fábrica está em outro lugar.
Você trouxe quatro ferramentas que cortam leitura desnecessária, a família Ralph que trabalha horas sem perguntar e a sua técnica de criar as peças uma vez e só importar. Conferi cada repositório no GitHub e abri o banco do build da Peixaria para ver onde os tokens realmente foram. A conclusão muda a ordem do que vale testar.
Metade do gasto foi trabalho repetido, não trabalho novo
Somei as 245 execuções de agente do build, por tipo de tarefa. Os valores são o preço de tabela da API (na assinatura você paga zero, mas gasta cota na mesma proporção).
Primeira tentativa × repetição
104 execuções de primeira vez custaram US$ 49,4. As 141 repetições custaram US$ 59,8 (55%).
O que foi rejeitado depois
As 89 execuções que falharam nos portões somam US$ 54,8 (50%). As 62 que bateram no limite da assinatura custaram quase nada (US$ 0,15).
Cada execução relê muito
Mediana de 300 mil tokens de contexto por execução, 90% abaixo de 952 mil e máximo de 1,9 milhão. Só 1,2 milhão foram escritos pelo agente, contra 93,5 milhões de contexto.
Leitura: a página, que é o que a IA mais "escreve", custou só 8,5% do total. O dinheiro está no vai-e-volta de integrar, testar, falhar e corrigir. O campo de contexto do banco soma cache lido e cache criado, então não separo os dois; a Onda 0 passa a gravá-los separados.
Custo = quantas voltas × quanto contexto cada volta relê
A maioria das ferramentas que você achou ataca um terço dessa conta. Vale saber qual terço antes de instalar qualquer coisa.
O que as ferramentas atacam
- Cortam o texto que grep, find, git, npm e logs devolvem ao agente.
- Funciona muito bem para quem usa o Claude Code solto, com Bash livre, instalando e rodando de tudo.
- O próprio RTK avisa que o corte dilui: saída do Bash é só uma parte da entrada, e a entrada é só parte da conta.
Onde a Fábrica gasta
- O agente da Fábrica já roda com arquivos permitidos fechados e Bash restrito a uma lista curta. Há pouco "grep gigante" para cortar.
- 141 de 245 execuções foram repetição; 12 execuções por tarefa de integração.
- 73% dos 30 achados registrados vieram do back-end (SQL, 409/404, N+1, memória); 23% de telas.
Os repositórios existem, mas nem tudo que o chat afirmou se confirmou
| Projeto | Estrelas · atualização · licença | O que faz | O que consegui confirmar |
|---|---|---|---|
| RTK (rtk-ai/rtk) | 82,6 mil · 07/10 · Apache-2.0 | Proxy em Rust que enxuga a saída de 100+ comandos | "Até 90% da saída do Bash"; o README diz que isso não é 90% da conta |
| usagetrim | 43 · 07/10 · MIT | Dobra saída verbosa e recupera o original por referência | Benchmarks próprios: docker 99,4%, pytest 93,2%, em fixtures |
| ASK Token Optimizer | 28 · 05/07 · binário fechado | 2 hooks que filtram a saída do shell | 87,7% na sessão, mas 56,2% sem 1 grep atípico (número do próprio autor) |
| token-saver (ppgranger) | 153 · 19/09 · Apache-2.0 | Plugin com 32 processadores (git, docker, npm, terraform) | Existe; o exemplo de 176 mil para 5 mil caracteres não localizei |
| Claude Token Saver | 16 · 30/09 · MIT | Busca a função e entrega só o trecho | Mediana de 50 a 96% de economia, mas média até −28% em buscas por descrição |
| GrepAI | 1,9 mil · 21/09 · MIT | Busca semântica local e grafo de chamadas (Go) | Promete redução drástica de entrada; os 97% citados no chat não achei no README. Precisa de embeddings (Ollama) |
| Ralph (snarktank) | 21,9 mil · 02/02 · MIT | Laço que repete até o PRD acabar, contexto limpo a cada volta | É o original popular. Também: frankbria 9,7 mil, mikeyobrien 3,2 mil |
| Ralph (chrismdp) | 34 · 10/05 · MIT | Laço mínimo com tickets em markdown | Confirmado |
| Ralph (Sean-Shmulevich) | 1 · 10/03 · MIT | Versão em Rust com PRD e watchdog | Existe, mas com 1 estrela: não é referência |
| Ralph Loop (flight505) | não encontrado | - | O endereço devolve 404; o resumo do chat pode ter se confundido |
As estrelas e datas vêm da API do GitHub. Os percentuais de economia são sempre dos próprios autores, em condições deles; não rodei nenhum deles na Fábrica. O "optimize" (que audita skills não usadas) não consegui localizar.
RTK, usagetrim, ASK e token-saver: bom para você, pouco para a Fábrica
Onde ajudam de verdade
No seu uso pessoal do Claude Code, com Bash livre: npm install, docker build, git log e testes verbosos entram inteiros no contexto. Ali a economia é real e imediata, e o RTK é a opção mais madura (82 mil estrelas, Apache-2.0).
Por que pesam pouco na Fábrica
O agente roda em dontAsk, sem npm, sem docker, sem curl. Só node, ./verificar, ls, cat, grep e git status/diff. A leitura de arquivos vai pela ferramenta Read, que filtros de Bash em geral não interceptam.
O risco que não vale correr
Um filtro que "resume" o resultado de um teste pode esconder o erro que o agente precisa ler. Na Fábrica o agente consertar errado custa uma volta inteira de portões. E o ASK é binário fechado: grátis só abaixo de CAD 100 mil de faturamento.
./verificar e ./reproduzir são nossos. Dá para fazê-los devolver só falha, caminho e linha, sem ruído, e deixar o resto num arquivo que o agente abre se quiser. Mesmo efeito, sem terceiro no meio e sem risco de esconder erro.Não recomendo
- Binário fechado, licença comercial acima de CAD 100 mil.
- O Pixios é produto comercial; a licença entra em conflito.
Pode entrar como piloto
- Só na fase de correção, 3 execuções com e 3 sem, comparando tokens e resultado.
- Também no seu Claude Code pessoal, hoje.
Claude Token Saver e GrepAI: úteis depois do lançamento, não na construção
O que o benchmark mostra
No Claude Token Saver o trecho certo vem em primeiro em 20 a 85% das buscas (depende de acertar o nome) e a economia média chega a ficar negativa quando a busca é por descrição. Não é "82% sempre".
Na construção já temos algo melhor
Cada tarefa tem lista fechada de arquivos permitidos, e o pixios.manifesto.json descreve rotas, tabelas e fluxos. O agente não precisa descobrir onde as coisas estão; o mapa já vem no prompt.
Onde brilham: alterações leves
O plano pago dá até 10 alterações por mês em apps do cliente. Ali o agente entra num projeto grande sem mapa de tarefa. Busca por trecho e por significado corta a leitura de arquivos inteiros.
| Fase do produto | Ferramenta que cabe | Observação |
|---|---|---|
| Construção (fase 4) | Manifesto + arquivos permitidos (já existe) | Nada a instalar |
| Alterações leves do cliente | GrepAI (Go, MIT) usando o Ollama que já roda no cérebro | Indexar por projeto; medir antes de adotar |
| Seu Claude Code pessoal | Claude Token Saver ou GrepAI | Teste de 1 dia num projeto grande seu |
A ideia de um "Context Optimizer" que pergunta "preciso ler isso?" antes de chamar o modelo é boa para as alterações leves: primeiro o manifesto, depois o trecho, só então o arquivo inteiro. Dá para construir sobre o que já existe, sem depender de terceiros.
A Fábrica já é um Ralph, com mais proteção
Ralph é, em essência, um while que chama o Claude, uma tarefa por vez, com contexto limpo, até a lista acabar. Comparei com o orquestrador do Pixios.
| Ideia do Ralph | Na Fábrica hoje |
|---|---|
| Uma tarefa por sessão, contexto novo | Sim: cada execução usa --no-session-persistence |
| Lista de tarefas (PRD, tickets) | Sim: o planejador gera as tarefas no banco, com dependências |
| Testar antes de marcar como feita | Sim, e mais: 9 portões depois de cada tarefa |
| Commit a cada tarefa | Sim (campo commit na tarefa) |
| Disjuntor e limite de tentativas | Sim: limite de rodadas, pausa por limite do motor e retomada |
Permissão total (--dangerously-skip-permissions) | Não, e é melhor assim: modo dontAsk com lista de permissões e escrita só nos arquivos da tarefa |
Notas de aprendizado entre sessões (progress.txt) | Não tem. O agente que corrige não sabe o que o anterior tentou, além do feedback do portão |
Ralph não economiza token
Ele economiza a sua atenção. Cada volta com contexto limpo relê o projeto de novo, então pode até gastar mais. A economia vem de acertar em menos voltas.
Vale emprestar 1 ideia
Um arquivo de aprendizados por build (o que falhou, por que, o que não repetir), lido pelo agente de correção. Evita refazer a mesma tentativa, que é onde estão as 141 repetições.
Cuidado com os relatos
"Projeto de US$ 50 mil por US$ 300" vem de blogs promocionais, sem auditoria. Os próprios autores recomendam rodar em contêiner. Não troque a Fábrica por um Ralph externo.
Escrever uma vez, certificar e importar é o maior corte
Quando o botão, o dropdown, o alerta, a tabela e o formulário já existem e já passaram nos testes, o agente deixa de inventá-los. Cada peça pronta economiza token de três jeitos.
Menos código escrito
Importar Tabela, Formulario ou Modal são duas linhas, em vez de 150. A saída do agente cai e o arquivo fica pequeno.
Menos contexto relido
O agente lê a assinatura da peça, não o código dela. O GUIA.md descreve as peças em uma tabela curta, e esse trecho fixo fica no cache de prompt.
Menos retentativas
Estado vazio, número cortado, formulário que recusa dado válido: a peça já nasce resolvida. Aqui está a parcela de 55% do custo.
| Truque | O que corta | Esforço |
|---|---|---|
| Biblioteca de UI certificada (botão, select, alerta, tabela, modal, formulário), com tema claro e escuro | Código de tela e falhas do G2, G3 e G6 | Médio, uma vez |
| Módulo base de CRUD no back-end | Falhas do G1, G7 e G8 e quase todo o trabalho de integração | Médio, uma vez |
| Gerador de schema, seed e rotas a partir do manifesto, sem IA | Tarefas inteiras viram script | Médio |
| Chaves i18n nos 3 idiomas geradas por script a partir de uma tabela | Texto repetitivo e inconsistência | Baixo |
GUIA.md curto e estável (cache de prompt) e prompt de sistema sem mudar entre tarefas | Leitura inicial de cada execução | Baixo |
| Feedback do portão só com o delta do erro, e arquivo de aprendizados | Repetição da mesma tentativa | Baixo |
| Haiku nas tarefas padrão (schema, seed, i18n, triagem) | Preço por token nas tarefas simples | Baixo |
De US$ 109 para algo perto de US$ 38 a 60 por build
As faixas abaixo são minhas, a partir dos dados do build da Peixaria. Elas não somam, porque várias atacam o mesmo gasto de retentativa. Só valem depois de medir em 3 builds.
| Alavanca | Efeito no custo | Base do cálculo | Risco |
|---|---|---|---|
| Peças certificadas (UI + CRUD de back-end) | −25% a −40% | Correção e integração são US$ 87 dos US$ 109; origem dos achados medida | Médio: depende de cobrir os casos |
| Triagem de falso alarme + arquivo de aprendizados | −10% a −20% | 409/404 e "SQL interpolado" repetem; 141 repetições | Baixo |
| Haiku nas tarefas padrão | −5% a −10% | Schema, seed e API somam US$ 13 (12%); Haiku 4.5 custa US$ 1/US$ 5 por milhão de tokens, bem abaixo do Sonnet | Baixo, medir qualidade |
Saída enxuta de ./verificar e ./reproduzir + GUIA.md curto | −3% a −8% | Sem medição por ferramenta ainda | Baixo |
| RTK ou usagetrim no agente | 0 a −5% | Bash do agente já é restrito | Médio: pode esconder erro |
| GrepAI / Claude Token Saver | ~0 na construção | Arquivos já vêm fechados na tarefa | Baixo |
| Ralph externo | 0 | A Fábrica já faz o que ele faz | Alto: trocaria proteção por permissão total |
Por que isso importa para o negócio: a assinatura mensal é US$ 99 (R$ 249). Um build de US$ 109 em preço de tabela passa do valor da primeira mensalidade. Enquanto o motor for a assinatura, o limite é cota; quando virar API, isso vira margem. O alvo de US$ 38 a 60 só vale depois de confirmado na Onda 0.
Medir primeiro, depois as peças, por último as ferramentas
- Medir por execução (1 dia): gravar número de voltas, cache lido e criado separados, bytes devolvidos por ferramenta e quais arquivos foram lidos. Sem isso, as faixas da página anterior são palpite.
- Módulo base de CRUD no back-end e biblioteca de UI certificada: a maior alavanca. Começa pela Peixaria: as 5 integrações e as 40 correções mostram quais peças faltaram.
- Triagem de falso alarme e arquivo de aprendizados por build: o agente de correção lê o que já foi tentado. Ataca direto as 141 repetições.
- Haiku por tipo de tarefa: uma tarefa de schema, seed, i18n e triagem com Haiku, comparando qualidade e cota na assinatura.
- Saída enxuta de
./verificare./reproduzir, eGUIA.mdcurto: mexe só em ferramenta nossa; mede o ganho antes e depois. - Pilotos opcionais: RTK só na fase de correção (3 com, 3 sem) e GrepAI nas alterações leves do cliente. Só entram se a medição mostrar ganho sem esconder erro.
Instalar o ASK
Binário fechado e licença comercial acima de CAD 100 mil. Conflita com o Pixios como produto.
Trocar a Fábrica por um Ralph
Perderia portões, escopo fechado e a lista de permissões, sem reduzir token.
Permissão total no cérebro
O --dangerously-skip-permissions não entra na VPS de produção. Se um dia usar, só em contêiner descartável.
Onde está sua biblioteca
Em qual projeto seu estão os botões, dropdowns, alertas e tabelas que você reaproveita? Me diga o nome e eu leio e transformo em peça certificada do Pixios.
Aval para os itens 1 a 3
Medir, criar o módulo base e a triagem. Nenhum remove portão.
Teste do RTK no seu uso
Posso instalar no Claude Code do cérebro como piloto de 1 dia. Reversível.
De onde vêm os números
Dados internos: banco do Pixios (tabelas execucoes, tarefas e achados) do build da Peixaria, em 07/10/2026, com o custo de tabela calculado pelo próprio Claude Code. Estrelas, datas e licenças: API pública do GitHub no mesmo dia. Percentuais de economia: dos autores de cada projeto.