
51 model, paralel çalışıyor, sonunda bir "composite score" veriyor.
İlk gördüğümde geçtim. Bir başka sıralama tablosu sandım.
Sonra PAPER.md'deki kalibrasyon bölümünü okudum. Orada şu yazıyordu: uzunluk, etkin skor aralığının %46,7'sini oluşturuyor. Yani uzun cevap, doğru cevaptan bağımsız olarak yüksek puan alıyor.
İşte asıl mesele bu. Araç kötü değil — ama neyi ölçtüğünü bilmeden kullanırsan, yanlış şeyi ölçtüğünü fark etmezsin.
godmod3 (yazılışıyla G0DM0D3) bir ChatGPT alternatifi değil. Tarayıcıda çalışan, kimsenin sunucusunda hiçbir şey saklamayan, maliyeti sadece yaptığın API çağrıları kadar olan bir çok-model değerlendirme ve red-team aracı.
Bu yazıdaki bilgiler projenin resmî reposu üzerinden Ağustos 2026 itibarıyla kontrol edildi. Proje hızlı gelişiyor — güncel durumu repodan doğrula.
godmod3 ne ve geliştiriciler neden bakıyor

Vaat basit: tek bir HTML dosyası, çok sayıda model, kurulum yok.
Proje elder-plinius tarafından AGPL-3.0 altında geliştiriliyor. GitHub'da bulunuyor ve godmod3.ai adresinde resmî olarak barındırılıyor — bu bir mirror değil, resmî kurulum.
Model erişimi tarafında artık üç yol var: OpenRouter üzerinden listelenen 60 model, Venice üzerinden 44'e kadar model, ya da kendi donanımındaki yerel modeller. Son madde Nisan'dan sonra eklendi ve maliyet hesabını doğrudan değiştiriyor — buna aşağıda döneceğim.
Geliştirici için cazip yan net: model çıktılarını yan yana karşılaştırmanın, girdi perturbasyon deneyleri çalıştırmanın ve sağlayıcılar arası güvenlik davranışını değerlendirmenin yapılandırılmış bir yolu. Altyapı kurmadan.
Kısacası: tarayıcı sekmesinde çalışan bir araştırma aracı.
Kurulum ve ilk çalıştırma

Barındırılan sürüm: Ayarlara OpenRouter API anahtarını yapıştırıyorsun, bir tema seçiyorsun, çalışıyor. Yaklaşık 90 saniye. Hesap yok, e-posta yok, kayıt yok.
Yerel sürüm: Repoyu klonluyorsun, python3 -m http.server 8000 çalıştırıyorsun, localhost:8000'i açıyorsun. Hepsi bu — uygulamanın tamamı index.html. npm yok, build adımı yok, yönetilecek bağımlılık yok.
Yerel modeller: Settings → API Keys → Local Models bölümüne http://localhost:11434/v1 gibi bir adres giriyorsun ve "Test & Discover Models" ile modelleri buluyorsun. Ollama, LM Studio, llama.cpp ve vLLM destekleniyor. Local-only modunu açarsan OpenRouter ve Venice çağrıları tamamen devre dışı kalıyor, telemetri de otomatik kapanıyor.
API anahtarı localStorage içinde duruyor. Resmî README şöyle diyor: "No cookies, no PII. API key stays in your browser."
İddia tutuyor. Sunucu tarafında depolama yok, varsayılan telemetri hafif ve ayarlardan kapatılabiliyor.
Burada duralım. localStorage bir veritabanı değil. Tarayıcı verilerini temizlersen ya da başka bir tarayıcıya geçersen geçmişin gider. Bu, aşağıdaki sınırlar bölümünde daha ayrıntılı.
GODMODE CLASSIC
Çoğu kullanıcı için giriş noktası burası. Beş önceden yapılandırılmış model + sistem promptu kombinasyonunu paralel çalıştırıyor ve en yüksek puanlı sonucu döndürüyor.
Gerçekten işe yaradığı yer: Teknik bir soruyu Claude, GPT-5, Grok ve iki model daha üzerinde aynı anda test etmek yaklaşık 8–12 saniye sürüyor ve beş tekil sorgu kadar maliyet çıkarıyor. Hangi model ailesinin o alanda daha iyi olduğundan emin değilsen — güvenlik araştırması, matematiksel akıl yürütme, az bilinen bir dilde debug — bu gerçekten zaman kazandırıyor. Model varyansı hakkında elle geçiş yapmadan sinyal alıyorsun.
Gereksiz olduğu yer: Herhangi bir yetkin modelin aynı cevabı verdiği düz sorularda CLASSIC sadece gecikme ve maliyet ekliyor. Claude'un tek başına iki saniyede halledeceği bir sorgu için beş model çalıştırmak, OpenRouter bütçenin israfı.
Puanlama meselesi: godmod3 sıralama için harici bir yargıç model kullanmıyor. Puanlama yerelde çalışan kural tabanlı bir sezgisel. Resmî sitede listelenen ağırlıklar: Kalite %50 + Filtresizlik %30 + Hız %20.
"Filtresizlik" burada kritik olan. Kaçamak cevapları, uzun girişleri ve reddetmeleri cezalandırıyor. Red-team kullanımı için tasarım gereği böyle, ama anlaşılması gereken şu: kendinden emin yanlış bir cevap, temkinli doğru bir cevabı geçebilir. Araç doğruluğu değil, doğrudanlığı optimize ediyor.
ULTRAPLINIAN
İşin ilginçleştiği ve pahalılaştığı yer. Promptunu beş kademe üzerinden çok sayıda modele paralel gönderiyor. Kademeler 12 modelden 60 modele kadar çıkıyor — en alt kademe hızlı ve ucuz, en üst kademe alandaki her şeyi kapsıyor.
Maliyet hesabı iki senaryoya ayrılıyor
OpenRouter üzerinden çalıştırıyorsan: en üst kademe tek sorguda onlarca eşzamanlı API çağrısı ateşliyor. 500 girdi / 300 çıktı token'lık bir sorguda, model karışımı üzerinden ortalama ~3 $/M token varsayarsan, tek bir tam tur kabaca 0,10–0,20 dolar. Elli sorguluk bir araştırma oturumu 5–10 dolar.
Bunlar tahmin. Gerçek rakam için godmod3 arayüzüne değil, OpenRouter panosuna bak — araçta harcama göstergesi yok.
Yerel modellerle çalıştırıyorsan: çağrı başına ücret yok. Bunun yerine donanım sınırın var — kaç modeli aynı anda çalıştırabildiğin ve ne hızda. Maliyet sorunu, kapasite sorununa dönüşüyor.
Bu ikisi farklı kısıtlar. Hangisinde olduğunu bilerek kademe seç.
Composite score güvenilir mi?
"En iyi" modeli seçmek için ULTRAPLINIAN'a güvenen herkes için asıl soru bu.
Cevap: kullanışlı bir vekil, mutlak gerçek değil.
Formül Kalite (%50) + Filtresizlik (%30) + Hız (%20). Ama PAPER.md kalibrasyon bölümünde açıkça yazıyor: uzunluk, etkin skor aralığının %46,7'sini oluşturuyor. Yani daha uzun ve detaylı bir cevap, gerçek doğruluktan bağımsız olarak belirgin şekilde daha yüksek puan alıyor.
Kısalığın erdem olduğu bir görevde model değerlendiriyorsan, bu tablo seni yanıltır.
Peki ne için iyi? Bir modelin ne zaman reddedip ne zaman uyduğunu tespit etmek, sağlayıcılar arası doğrudanlık varyansını ölçmek, medyandan güçlü şekilde sapan cevapları işaretlemek. Bunlar meşru güvenlik araştırması sinyalleri. Alana özgü değerlendirmenin yerini tutmaz.
"Liquid Response": ULTRAPLINIAN çalışırken mevcut en iyi sonucu akıtıyor ve daha yüksek puanlı cevaplar geldikçe güncelliyor. Pratikte neredeyse anında bir sonuç görüyorsun (en hızlı küçük modelden) ve büyük modeller yanıtladıkça onun daha iyileriyle değiştiğini izliyorsun. İyi bir UX kararı — ULTRAPLINIAN'ı olduğundan hızlı hissettiriyor.
Parseltongue ve AutoTune
Parseltongue, godmod3'ün girdi perturbasyon motoru: üç yoğunluk kademesinde 33 dönüştürme tekniği, altı aileye gruplanmış (leet ikamesi, Unicode benzerleri, sıfır genişlikli karakter ekleme, ters çevirme varyantları ve diğerleri). Belirtilen kullanım amacı, modellerin girdi tarafındaki güvenlik sınıflandırıcılarının karakter düzeyi perturbasyona ne kadar dayanıklı olduğunu test etmek.
PAPER.md, 54 varsayılan tetikleyici test vakasında %100 tespit oranı belgeliyor — yani Parseltongue bilinen tetikleyici kelimeleri güvenilir şekilde tanıyıp dönüştürüyor. Bunun belirli bir modelin dağıtılmış güvenlik sistemi karşısında ne anlama geldiği garanti değil.
Sınıflandırıcı dayanıklılığı üzerine güvenlik araştırması yapıyorsan, Parseltongue sistematik bir test seti üretmenin yapılandırılmış yolu. Genel amaçlı bir sohbet aracı arıyorsan, çoğu sorgu için sadece karmaşıklık ekliyor.
AutoTune, promptunu bağlam türlerine göre sınıflandırıp o bağlama uygun örnekleme parametrelerini uyguluyor — README güncel olarak 20 sorgu bağlamından söz ediyor. Kod için düşük sıcaklık ve dar örnekleme, yaratıcı yazım için yüksek sıcaklık ve çeşitli örnekleme, analitik için dengeli değerler.
Bir geri bildirim döngüsü, beğen/beğenme oylarına göre bu ön ayarları Üstel Hareketli Ortalama (α=0,3) ile güncelliyor. PAPER.md'ye göre döngü 19 oylama içinde %29–62 parametre mesafesi iyileşmesine yakınsıyor.
PAPER.md'nin kendisi sınırı da yazıyor: EMA yaklaşımı kasıtlı olarak basit, "hafif adaptasyon" — Bayesçi optimizasyon ya da contextual bandit değil. Kararlı tercihlere doğru yakınsamada işe yarıyor, ama hızlı bağlam değişimini iyi kaldıramıyor. Aynı oturumda hem kod üretimi hem yaratıcı yazım yaparsan, öğrenilen parametreler bağlama özgü kalmak yerine harmanlanıyor.
Dürüst sınırlar

localStorage, kalıcı hafıza yok demek. Bütün geçmişin, ayarların ve konuşma bağlamın tek bir tarayıcının localStorage'ında. Çerezleri temizlersen her şeyi kaybedersin. Dışa/içe aktarma çalışıyor ama manuel bir süreç ve hatırlaman gerekiyor. Günlere ya da haftalara yayılan araştırma akışları için bu gerçek bir operasyonel yük.
Maliyet görünmeden birikiyor. Araçta harcama panosu yok. En üst kademede sorgu başına onlarca API çağrısı yapıyorsun. Elli sorguluk bir oturum binlerce çağrı demek. Maliyetler gerçek — ama OpenRouter faturanda görünüyor, arayüzde değil. Bütçe planlaması için arayüzden tamamen çıkman gerekiyor.
Yerel modellerle çalışırsan bu madde değişiyor: fatura yok, ama donanım ve süre var.
Composite score'da uzunluk yanlılığı var. Yukarıda yazdım: uzunluk etkin skor aralığının %46,7'si. Uzun cevaplar daha yüksek puan alıyor, bu da ULTRAPLINIAN'ı ayrıntılı modellere doğru eğiyor.
Bağlantı kopması kısmi sonuç demek. Onlarca eşzamanlı API çağrısı, onlarca kararlı bağlantı varsayıyor. Dengesiz ağlar timeout üretiyor. ULTRAPLINIAN kısmi sonuçları düzgün yönetiyor (dönen ne varsa üzerinden puanlıyor), ama kötü bağlantılı bir tur, tam da önemsediğin modellerin eksik olduğu bir tablo üretebiliyor.
Ses yok, MCP modunda API üzerinden dosya yükleme yok. Arayüz duyarlı tasarlanmış olsa da sadece metin.
Veri seti yayınlama özelliğini anlaman gerekiyor. Kendi sunucunda tam API sunucusunu çalıştırıyorsan (godmod3.ai'de değil), sorgularını ve model çıktılarını herkese açık bir HuggingFace veri setine yayınlayan bir opt-in özellik var. Varsayılan olarak kapalı ve uyarı penceresiyle açık onay istiyor. Otomatik PII temizleme çalışıyor ama eksiksiz olduğu garanti değil. Bu özellik barındırılan sürümde yok — sadece kendi kurduğun API sunucusu için geçerli. Araştırma amaçlı değerlendiriyorsan, hangi dağıtım modunda olduğunu bil.
Kimin için, kimin için değil

Kullan, eğer:
- Red-team araştırması yapıyorsan: sağlayıcılar arası güvenlik davranışını test etmek, sınıflandırıcı dayanıklılığını değerlendirmek, reddetme örüntülerini karşılaştırmak
- Bir API entegrasyonuna bağlanmadan önce hangi model ailesinin belirli bir sorgu tipini daha iyi karşıladığını değerlendiriyorsan
- Altyapı kurmadan çok modelli karşılaştırma istiyorsan
- Gizlilik önemliyse: verinin bir yerde loglanmadığını bilmen gerekiyorsa — localStorage tabanlı mimari ve denetlenebilir AGPL-3.0 kodu bunu veriyor
Kullanma, eğer:
- Oturumlar arası kalıcı hafızaya ihtiyacın varsa — godmod3'te yok
- Codebase bağlamı gerektiren üretim kodu yazıyorsan — dosya sistemi erişimi yok, repo anlayışı yok, koordineli değişiklik yapma yeteneği yok. Bu problem için yapılmış araçlar (Claude Code, IDE entegrasyonu için Cursor) stack'in başka bir katmanında çalışıyor: projenin mimarisini anlıyorlar, oturumlar arası bağlamı koruyorlar ve değerlendirilmiş metin yerine merge edilebilir diff üretiyorlar
- Basit bir ChatGPT ikamesi arıyorsan — ULTRAPLINIAN, Parseltongue ve AutoTune'un yükü sohbet sorguları için israf
- Ekibin paylaşılan geçmiş, denetim izi ya da merkezi anahtar yönetimi istiyorsa — burada hiçbiri yok
Sınır net: godmod3 "bu soruya şu an hangi model en iyi cevabı veriyor" sorusuna cevap veriyor. Coding agent'lar ise "bu codebase değişikliğini nasıl merge ederim" sorusuna. Bunlar rakip çözümler değil, farklı katmanlar.
SSS
godmod3.ai resmî barındırılan sürüm mü?
Evet. elder-plinius tarafından işletilen resmî sürüm ve GitHub reposuyla aynı kod tabanı. Tek anlamlı fark, veri seti üretme özelliğinin (opt-in HuggingFace yayınlama) barındırılan sitede bulunmaması — o sadece tam API sunucusunu kendin kurduğunda mevcut.
Konuşmalarımı bir yerde saklıyor mu?
Sunucu tarafında depolama yok. API anahtarın, sohbet geçmişin ve ayarların tarayıcının localStorage'ında. Resmî README'ye göre: "No cookies, no PII. API key stays in your browser." Hafif telemetri (sohbet içeriği değil, operasyonel meta veri) Settings → Privacy altından kapatılabiliyor. Local-only modunda ise otomatik kapanıyor.
ULTRAPLINIAN'ı tam kapasite çalıştırmak gerçekte ne tutuyor?
Çağrılan modellere ve prompt uzunluğuna bağlı. OpenRouter üzerinden en üst kademede sorgu başına onlarca çağrı düşün. 500 girdi / 300 çıktı token'lık bir sorgu için karışık modellerde ortalama ~3 $/M token varsayarsan, tek tur kabaca 0,10–0,20 dolar; elli sorguluk bir oturum 5–10 dolar. Bunlar tahmin — gerçek rakamlar için OpenRouter panosuna bak ve maliyet endişen varsa alt kademeleri kullan. Yerel modellerde ise çağrı ücreti yok, donanım sınırı var.
Composite score nasıl çalışıyor?
Formül: Kalite (%50) + Filtresizlik (%30) + Hız (%20). Kalite; alaka, bütünlük, tutarlılık ve doğruluğu kapsıyor. Filtresizlik doğrudan, kaçamak yapmayan, reddetmeyen cevapları ödüllendiriyor. Hız, yanıt süresi ve token verimliliğini hesaba katıyor. PAPER.md'ye göre uzunluk etkin skor aralığının %46,7'sini oluşturuyor — yani uzun cevaplar gerçek kaliteden bağımsız olarak öne çıkıyor. Skorları mutlak bir kalite sıralaması değil, doğrudanlık ve reddetme sinyali olarak kullan.
godmod3 mü, OpenWebUI mu?
Farklı işler için farklı araçlar. OpenWebUI; çok modelli sohbet, kalıcı hafıza ve ekip kullanımı için optimize edilmiş, cilalı, kendi sunucunda çalışan bir arayüz. godmod3; paralel değerlendirme, red-teaming ve güvenlik analizi için optimize edilmiş bir araştırma aracı. Kendi modellerinle ChatGPT benzeri bir deneyim ve kendi geçmişini istiyorsan OpenWebUI. Onlarca model üzerinde sistematik bir deney çalıştırıp varyansı analiz etmek istiyorsan godmod3.
Sonuç
Bu kadarını söyleyeyim şimdilik: godmod3, ne olduğunu bilerek kullanırsan iyi bir araç. Model davranışındaki farkı görmek, reddetme örüntülerini karşılaştırmak ve sınıflandırıcı dayanıklılığını test etmek için altyapı kurmadan çalışan bir düzenek.
Ama tabloyu bir kalite sıralaması sanma. Uzunluk yanlılığını bilmeden bakarsan, en ayrıntılı modeli en iyi model sanırsın.
Parseltongue ve yerel model tarafını ayrıca yazmak istiyorum — orası daha ilginç. Şimdilik: alt kademeyle başla, OpenRouter panosunu açık tut.
İyi kodlamalar.
