Pular para o conteúdo principal

godmod3: Interface Multi-Modelo

Lucas Mendonça
Lucas MendonçaDev Full-Stack & Freelancer
Compartilhar

godmod3: Interface Multi-Modelo

51 modelos rodando em paralelo e, no fim, um "composite score".

Eu ia passar batido. Achei que era mais uma tabela de ranking.

Aí li a seção de calibração do PAPER.md. Está escrito lá: o comprimento da resposta responde por 46,7% da faixa efetiva de pontuação. Ou seja, resposta longa pontua alto independentemente de estar certa.

Isso não invalida a ferramenta. Mas muda completamente como você deve ler o resultado dela.

O godmod3 (estilizado G0DM0D3) não é alternativa ao ChatGPT. É uma ferramenta de avaliação multi-modelo e red-teaming que roda no browser, não guarda nada em servidor de ninguém, e custa o que você gastar em chamadas de API.

Informações verificadas no repositório oficial em agosto de 2026*. O projeto evolui rápido — confira o *repo pro estado atual.

O que é e por que devs estão olhando

O que é e por que devs estão olhando

A proposta é simples: um arquivo HTML, muitos modelos, zero instalação.

O projeto é mantido pelo elder-plinius sob licença AGPL-3.0, está no GitHub e é hospedado oficialmente em godmod3.ai — não é mirror, é a hospedagem oficial.

No acesso a modelos existem agora três caminhos: 60 modelos listados via OpenRouter, até 44 modelos via Venice, ou modelos locais no seu próprio hardware. Esse último entrou depois de abril e muda o cálculo de custo — volto nisso.

O apelo pra dev é específico: você ganha um jeito estruturado de comparar saídas de modelos lado a lado, rodar experimentos de perturbação de input e avaliar comportamento de segurança entre providers — sem montar infraestrutura.

Resumindo: ferramenta de pesquisa que por acaso roda numa aba do browser.

Instalação e primeira execução

Instalação e primeira execução

Versão hospedada: você cola sua chave da OpenRouter nas configurações, escolhe um tema e está rodando. Uns 90 segundos. Sem conta, sem e-mail, sem cadastro.

Versão local: clona o repo, roda python3 -m http.server 8000, abre localhost:8000. É isso — a aplicação inteira é o index.html. Sem npm, sem build, sem dependência pra gerenciar.

Modelos locais: em Settings → API Keys → Local Models você informa um endereço como http://localhost:11434/v1 e usa "Test & Discover Models". Ollama, LM Studio, llama.cpp e vLLM são suportados. Ativando o modo Local-only, as chamadas pra OpenRouter e Venice ficam completamente desligadas e a telemetria é desativada automaticamente.

A chave da API fica no localStorage. O README oficial diz: "No cookies, no PII. API key stays in your browser."

A afirmação se sustenta. Não tem armazenamento no servidor, e a telemetria padrão é leve e desativável.

Mas atenção: localStorage não é banco de dados. Se você limpar os dados do browser ou trocar de navegador, seu histórico foi embora.

Lucas: Zero cadastro é ótimo até você lembrar que "zero cadastro" também significa "zero backup". Se o histórico importa pro seu trabalho, exporta antes de fechar a aba.

GODMODE CLASSIC

É o ponto de entrada da maioria. Roda cinco combinações pré-configuradas de modelo + system prompt em paralelo e devolve o resultado com maior pontuação.

Onde é genuinamente útil: testar uma pergunta técnica em Claude, GPT-5, Grok e mais dois modelos ao mesmo tempo leva uns 8–12 segundos e custa o equivalente a cinco consultas individuais. Quando você não sabe qual família de modelo lida melhor com o domínio — pesquisa de segurança, raciocínio matemático, debug em linguagem pouco comum — isso economiza tempo de verdade. Você tem sinal sobre a variância entre modelos sem ficar trocando na mão.

Onde não vale: em pergunta direta, onde qualquer modelo competente dá a mesma resposta, o CLASSIC só adiciona latência e custo. Cinco modelos numa consulta que o Claude resolveria sozinho em dois segundos é desperdício de crédito.

A questão da pontuação: o godmod3 não usa um modelo juiz externo pra ranquear. A pontuação é heurística baseada em regras, rodando local. Os pesos listados no site oficial: Qualidade 50% + "Filteredness" 30% + Velocidade 20%.

"Filteredness" é o peso relevante aqui: ele premia respostas diretas e penaliza rodeios, preâmbulos e recusas. Isso é intencional pro caso de uso de red-teaming, mas precisa ficar claro: uma resposta errada e confiante pode pontuar mais que uma resposta certa e cautelosa. A ferramenta otimiza pra franqueza, não pra precisão.

Lucas: Traduzindo pro dia a dia: se você usar esse score pra escolher modelo em projeto de cliente, vai acabar escolhendo o modelo mais convicto, não o mais correto. São coisas diferentes.

ULTRAPLINIAN

Aqui fica interessante e caro. Ele manda seu prompt pra vários modelos em paralelo, em cinco camadas — que vão de 12 até 60 modelos.

O custo se divide em dois cenários

Rodando via OpenRouter: a camada mais alta dispara dezenas de chamadas simultâneas por consulta. Numa consulta de 500 tokens de entrada e 300 de saída, assumindo média de ~US$3 por milhão de tokens na mistura de modelos, uma rodada completa custa aproximadamente US$0,10–0,20. Uma sessão de pesquisa com cinquenta consultas fica em US$5–10.

São estimativas. Pro número real, olhe o painel da OpenRouter, não a interface do godmod3 — a ferramenta não tem indicador de gasto.

Rodando com modelos locais: não tem custo por chamada. No lugar dele entra o limite de hardware — quantos modelos você consegue rodar simultaneamente e em que velocidade. O problema de custo vira problema de capacidade.

São restrições diferentes. Escolha a camada sabendo em qual delas você está.

O composite score é confiável?

Essa é a pergunta central pra quem usa o ULTRAPLINIAN pra escolher o "melhor" modelo.

A resposta: é um proxy útil, não verdade absoluta.

A fórmula é Qualidade (50%) + Filteredness (30%) + Velocidade (20%). Mas o PAPER.md diz na seção de calibração que o comprimento responde por 46,7% da faixa efetiva de pontuação. Ou seja, uma resposta mais longa e detalhada pontua bem mais alto, independentemente da precisão real.

Se você está avaliando modelos numa tarefa onde concisão é virtude, essa tabela te engana.

Pra que ela serve, então: identificar quando um modelo recusa e quando aceita, medir variância de franqueza entre providers, e sinalizar respostas que se desviam muito da mediana. São sinais legítimos de pesquisa em segurança. Não substituem avaliação específica do seu domínio.

"Liquid Response": enquanto o ULTRAPLINIAN roda, ele já vai mostrando o melhor resultado atual e atualizando conforme respostas com pontuação maior chegam. Na prática você vê um resultado quase imediato (do modelo pequeno mais rápido) e assiste ele ser substituído conforme os modelos maiores respondem. Boa decisão de UX — faz o ULTRAPLINIAN parecer mais rápido do que é.

Parseltongue e AutoTune

O Parseltongue é o motor de perturbação de input: 33 técnicas de transformação em três níveis de intensidade, agrupadas em seis famílias (substituição leet, confundíveis Unicode, inserção de caracteres de largura zero, variantes de reversão e outras). O uso declarado é testar se os classificadores de segurança do lado da entrada resistem a perturbação em nível de caractere.

O PAPER.md documenta 100% de detecção em 54 casos-teste padrão — ou seja, o Parseltongue reconhece e transforma de forma confiável as palavras-gatilho conhecidas. O que isso significa contra o sistema de segurança de um modelo específico em produção não é garantido.

Se você faz pesquisa de segurança sobre robustez de classificador, o Parseltongue é um jeito estruturado de gerar um conjunto de teste sistemático. Se você quer uma ferramenta de chat de uso geral, ele só adiciona complexidade.

O AutoTune classifica seu prompt por contexto e aplica parâmetros de amostragem adequados — o README atual fala em 20 contextos de consulta. Temperatura baixa e amostragem estreita pra código, temperatura alta e amostragem diversa pra escrita criativa, valores equilibrados pra análise.

Um loop de feedback ajusta esses presets com base em joinha/deslike usando Média Móvel Exponencial (α=0,3). Segundo o PAPER.md, o loop converge pra uma melhora de 29–62% na distância de parâmetros em até 19 avaliações.

O próprio PAPER.md declara o limite: a abordagem EMA é deliberadamente simples, "adaptação leve" — não é otimização bayesiana nem contextual bandit. Funciona pra convergir em preferências estáveis, mas não lida bem com troca rápida de contexto. Se você usar godmod3 pra gerar código e escrever texto criativo na mesma sessão, os parâmetros aprendidos vão se misturar em vez de ficar específicos por contexto.

Limitações honestas

Limitações honestas

localStorage significa nenhuma memória persistente. Todo o histórico, configurações e contexto de conversa vive no localStorage de um browser. Limpou os cookies, perdeu tudo. A exportação e importação funcionam, mas é processo manual que você precisa lembrar de fazer. Pra fluxos de pesquisa que se estendem por dias ou semanas, isso é um custo operacional real.

O custo se acumula invisível. A ferramenta não tem painel de gastos. Na camada mais alta são dezenas de chamadas por consulta. Uma sessão de cinquenta consultas vira milhares de chamadas. Os custos são reais — mas aparecem na sua fatura da OpenRouter, não na interface. Pra planejar orçamento você precisa sair da ferramenta.

Rodando com modelos locais esse ponto muda: não tem fatura, mas tem hardware e tempo.

O composite score tem viés de comprimento. Já escrevi acima: 46,7% da faixa efetiva. Respostas longas pontuam mais, o que inclina o ULTRAPLINIAN em direção a modelos verbosos.

Queda de conexão significa resultado parcial. Dezenas de chamadas simultâneas pressupõem dezenas de conexões estáveis. Rede instável gera timeout. O ULTRAPLINIAN lida bem com resultados parciais (pontua o que voltou), mas uma rodada com conexão ruim pode produzir uma tabela justamente sem os modelos que importavam.

Sem voz, sem upload de arquivo via API no modo MCP. Só texto, apesar da interface responsiva.

O recurso de publicação de dataset exige entendimento. Rodando o servidor de API completo por conta própria (não no godmod3.ai), existe um recurso opt-in que publica suas consultas e as saídas dos modelos num dataset público no HuggingFace. Vem desativado e exige consentimento explícito com aviso. A limpeza automática de PII roda, mas não há garantia de que seja completa. Esse recurso não existe na versão hospedada. Se você avalia o godmod3 pra pesquisa, saiba em qual modo de instalação está.

Lucas: Esse último ponto merece atenção se você trabalha com código de cliente. "Opt-in" e "desativado por padrão" só protegem quem leu. Antes de rodar o servidor completo, confira em que modo você está.

Pra quem serve e pra quem não

Pra quem serve e pra quem não

Use se:

  • Você faz pesquisa de red-team: testar comportamento de segurança entre providers, avaliar robustez de classificador, comparar padrões de recusa- Você está avaliando qual família de modelo lida melhor com um tipo de consulta antes de se comprometer com uma integração- Você quer comparação multi-modelo sem levantar infraestrutura- Privacidade importa: você precisa saber que seus dados não estão sendo logados em algum lugar — a arquitetura baseada em localStorage e o código auditável AGPL-3.0 dão isso

Não use se:

  • Você precisa de memória persistente entre sessões — o godmod3 não tem- Você faz trabalho de produção que exige contexto de codebase — não tem acesso a sistema de arquivos, não entende repositório, não faz mudanças coordenadas. Ferramentas feitas pra esse problema (Claude Code, ou Cursor pra integração com IDE) operam em outra camada: entendem a arquitetura do projeto, mantêm contexto entre sessões e produzem diffs mergeáveis em vez de respostas avaliadas- Você quer um substituto simples do ChatGPT — a sobrecarga de ULTRAPLINIAN, Parseltongue e AutoTune é desperdício em consulta conversacional- Seu time precisa de histórico compartilhado, trilha de auditoria ou gestão centralizada de chaves — nada disso existe aqui

A fronteira é clara: o godmod3 responde "qual modelo dá a melhor resposta pra essa pergunta agora". Coding agents respondem "como eu levo essa mudança de codebase até o merge". Não são soluções concorrentes, são camadas diferentes.

FAQ

P: godmod3.ai é a versão hospedada oficial?

Sim. É a versão oficial mantida pelo elder-plinius, com a mesma base de código do repositório. A única diferença relevante é que o recurso de geração de dataset (publicação opt-in no HuggingFace) não existe no site hospedado — ele só aparece quando você roda o servidor de API completo por conta própria.

P: Ele guarda minhas conversas em algum lugar?

Não tem armazenamento no servidor. Sua chave de API, histórico de chat e configurações ficam no localStorage do browser. Segundo o README oficial: "No cookies, no PII. API key stays in your browser." A telemetria leve (metadados operacionais, não conteúdo de conversa) é desativável em Settings → Privacy, e no modo Local-only ela desliga sozinha.

P: Quanto custa rodar o ULTRAPLINIAN na escala máxima?

Depende dos modelos chamados e do tamanho do prompt. Via OpenRouter, na camada mais alta, conte dezenas de chamadas por consulta. Pra uma consulta de 500 tokens de entrada e 300 de saída, com média de ~US$3 por milhão de tokens, uma rodada fica em torno de US$0,10–0,20; uma sessão de cinquenta consultas, US$5–10. São estimativas — olhe o painel da OpenRouter pros valores reais e use camadas menores se custo for preocupação. Com modelos locais não há custo por chamada, apenas limite de hardware.

P: Como funciona o composite score?

A fórmula é Qualidade (50%) + Filteredness (30%) + Velocidade (20%). Qualidade cobre relevância, completude, coerência e precisão. Filteredness premia respostas diretas, sem rodeio e sem recusa. Velocidade considera tempo de resposta e eficiência de token. Segundo o PAPER.md, o comprimento responde por 46,7% da faixa efetiva de pontuação — respostas longas se destacam independentemente da qualidade real. Use o score como sinal de franqueza e recusa, não como ranking absoluto de qualidade.

P: godmod3 ou OpenWebUI?

Ferramentas diferentes pra trabalhos diferentes. O OpenWebUI é uma interface polida e self-hosted, otimizada pra conversa multi-modelo, memória persistente e uso em time. O godmod3 é ferramenta de pesquisa otimizada pra avaliação paralela, red-teaming e análise de segurança. Se você quer uma experiência tipo ChatGPT com seus modelos e seu histórico, OpenWebUI. Se quer rodar um experimento sistemático em dezenas de modelos e analisar a variância, godmod3.

Conclusão

O godmod3 é uma boa ferramenta se você souber o que ela mede. Pra ver diferença de comportamento entre modelos, comparar padrões de recusa e testar robustez de classificador, ele entrega isso sem exigir infraestrutura.

Só não leia a tabela como ranking de qualidade. Sem saber do viés de comprimento, você vai confundir o modelo mais detalhado com o melhor modelo.

Se for testar, comece pela camada menor e deixe o painel da OpenRouter aberto.

Lucas: Meu uso realista disso não é escolher modelo — é ter argumento. Quando o cliente pergunta "por que esse modelo e não aquele", uma comparação lado a lado vale mais que opinião.
Lucas Mendonça
Escrito porLucas MendonçaDev Full-Stack & Freelancer

Oi, aqui é o Lucas! Sou dev full-stack freelancer com experiência em construir MVPs e ferramentas internas pra startups. Comecei a escrever quando três clientes me fizeram a mesma pergunta no mesmo mês: "qual ferramenta de IA vale a pena?" — resolvi testar em projetos reais e documentar o que aprendi. Escrevo sobre o que funciona de verdade quando o deadline está chegando.

Guias Relacionados