İçeriğe geç

Reasoning ayarı low mu high mı? Kodlama ajanı için görev bazlı seçim

Low, medium, high, xhigh ve max aynı iş için açılmamalı. Kodlama görevini riskine, belirsizliğine ve doğrulama maliyetine göre doğru reasoning seviyesine yönlendiren pratik rehber.

Kaynakdoğrulandı
  1. [01]OpenAI API — Reasoning models2026-08-18
  2. [02]Claude Platform — Effort2026-08-18
  3. [03]Google AI for Developers — Gemini thinking2026-08-18

Kodlama ajanında reasoning ayarını sürekli high ya da max kullanmak güvenli bir varsayılan değil. Küçük ve kolay doğrulanan bir değişiklikte yalnızca süreyi ve token tüketimini artırabilir. Belirsiz bir üretim hatasında low kullanmak ise ajanın daha ilk planda yanlış yola sapmasına yol açabilir. Bu yazı bir benchmark değil; OpenAI, Anthropic ve Google’ın güncel dokümantasyonundaki ayarları gerçek görev türlerine çeviren bir seçim rehberi.

Kısa cevap: tek dosyalı ve geri alınabilir işler için low; birkaç dosyaya yayılan, plan isteyen günlük geliştirme için medium; kök nedeni belirsiz hata, mimari karar veya riskli migration için high kullan. xhigh ya da max seviyesini ancak iş uzun sürüyorsa, hata pahalıysa ve önceki seviye yetersiz kaldıysa aç. Model adı ve arayüz değişse de başlangıç noktası görev riski olmalı.

Önce aynı kelimelerin aynı ayar olmadığını kabul et

OpenAI’nin dokümantasyonuna göre reasoning.effort değerleri modele bağlı olarak none, minimal, low, medium, high, xhigh ve max seçeneklerinden bir bölümünü destekleyebiliyor. Şirket, düşük eforu hız ve daha az token; yüksek eforu daha kapsamlı düşünme ve daha yüksek yanıt kalitesiyle ilişkilendiriyor. GPT-5.6 standart ve pro modlarında ayar verilmezse medium kullanıyor. Bunlar OpenAI’nin ürün tanımlarıdır; her depoda aynı kalite farkını garanti etmez. [1]

Anthropic’in effort ayarı yalnız iç düşünmeyi değil, metin yanıtını ve araç çağrılarını da etkiliyor. Dokümana göre Claude varsayılan olarak high kullanıyor; low daha az araç çağrısı yapabilir, medium hız-maliyet-performans dengesi için, xhigh ise uzun ajan ve kodlama işleri için konumlanıyor. Anthropic de effort değerinin katı bir token bütçesi değil, davranış sinyali olduğunu söylüyor. [2]

Google tarafında thinking_level seçenekleri modele göre değişiyor. Örneğin bazı Gemini modelleri minimal, low, medium ve high düzeylerini birlikte desteklerken bazıları daha dar bir liste sunuyor; varsayılan seviye de modelden modele değişiyor. Google basit görevlerde minimal/low, karşılaştırma gibi orta görevlerde varsayılan seviye, ileri kodlama ve çok adımlı planlamada yüksek düşünme öneriyor. Bu da sağlayıcılar arasında yalnız etiket adına bakarak bire bir eşleme yapılamayacağını gösteriyor. [3]

Low: sonuç ucuz doğrulanabiliyorsa

Low ayarı, görevin sınırı ve kabul kriteri belliyse iyi bir başlangıç. Buradaki amaç “önemsiz iş” seçmek değil; yanlış sonucu test, lint veya kısa bir diff incelemesiyle hemen yakalayabilmek.

  • Tek dosyada isim düzeltme, küçük metin ya da yapılandırma değişikliği.
  • Mevcut deseni takip eden birim testi ekleme.
  • Belirli bir sembolün nerede kullanıldığını bulma ve kısa kod açıklaması.
  • Linter’ın işaret ettiği açık bir hatayı düzeltme.

Low kullandığında görevi dar tut: “şu dosyada şu testi ekle, yalnız ilgili kodu değiştir, sonra bu komutu çalıştır” gibi. Ajan kapsamı kendi kendine genişletmeye başlıyorsa reasoning seviyesini yükseltmeden önce görevi yeniden sınırla.

Medium: günlük ajan işi için varsayılan

Medium, bir solo geliştiricinin çoğu üretim işi için daha mantıklı başlangıç. OpenAI medium seviyesini planlama, karmaşık muhakeme ve yargı isteyen işlerde dengeli nokta olarak tanımlıyor; GPT-5.6’nın varsayılanı da bu. Bu yine bir vendor iddiası, fakat görev yönlendirmesi için işe yarayan bir başlangıç çerçevesi. [1]

  • Bir özelliği mevcut mimari ve test desenine uydurma.
  • Birkaç dosyaya yayılan fakat geri alınabilir refactor.
  • API değişikliğiyle birlikte tipleri, testleri ve dokümantasyonu güncelleme.
  • Log ve hata mesajlarından iki ya da üç olası kök nedeni karşılaştırma.

Medium görevde ajandan önce plan, sonra küçük bir değişiklik kümesi, en son test iste. Tek seferde büyük diff almak yerine her kontrol noktasında kapsamı yeniden teyit etmek, reasoning seviyesini yükseltmekten daha fazla fayda sağlayabilir.

High: belirsizlik veya hata maliyeti yükseldiğinde

High, daha uzun yanıt istediğin için değil, karar ağacı genişlediği için açılmalı. OpenAI bu düzeyi zor muhakeme, karmaşık hata ayıklama ve derin planlama için; Anthropic ise kalite hızdan daha önemli olduğunda karmaşık kodlama ve ajan işleri için konumluyor. Bunlar sağlayıcıların kendi kullanım önerileridir. [1][2]

  • Kök nedeni bilinmeyen, birden fazla servisi etkileyen üretim hatası.
  • Veri kaybı riski taşıyan şema veya depolama migration planı.
  • Yetkilendirme, ödeme ya da güvenlik sınırını değiştiren kod incelemesi.
  • Birden fazla uygulanabilir mimari arasında geri dönüş maliyeti yüksek seçim.

High ayarı otomatik onay anlamına gelmez. Ajanın varsayımlarını, değiştireceği dosyaları ve doğrulama planını uygulamadan önce yazmasını iste. Üretime yazma, veri silme ve erişim değiştirme adımlarında insan onayı ayrı kalmalı.

xhigh ve max: alışkanlık değil, yükseltme basamağı

OpenAI xhigh seviyesini uzun çalışan ajan görevleri, güvenlik/kod incelemesi ve zorlu kodlama akışları için öneriyor; ek gecikme ve maliyetin ancak kendi değerlendirmelerin açık yarar gösteriyorsa haklı olduğunu belirtiyor. Anthropic xhigh seviyesini 30 dakikayı aşan ve milyonlarca token bütçesine ulaşabilen uzun ajan/kodlama işleriyle ilişkilendiriyor. max ise iki sağlayıcıda da en ağır görevler için en yüksek yetenek sınırı olarak sunuluyor. [1][2]

Pratik kuralım şu: medium veya high ile alınan ilk plan neden yetersiz kaldı sorusunu cevaplamadan xhigh/max açma. Daha fazla düşünme, eksik gereksinimi düzeltmez. Yanlış repo, belirsiz kabul kriteri ya da çalışmayan test ortamı varsa pahalı ayar aynı sorunu daha uzun biçimde üretebilir.

Dört adımlı seçim reçetesi

  • Görevi sınıflandır: geri alınabilir mi, kaç dosya/sistem etkileniyor, yanlış kararın maliyeti ne?
  • En düşük makul seviyeden başla: küçük ve net iş low, günlük çok adımlı iş medium, belirsiz ve riskli iş high.
  • Yükseltme sinyali ara: plan önemli bir bağımlılığı kaçırdı mı, araç çağrıları erken mi durdu, iki deneme aynı yerde mi başarısız oldu?
  • Sonucu reasoning seviyesinden bağımsız doğrula: diff, test, lint, build ve gerekiyorsa güvenlik/üretim kontrolü.

Model katmanını ayrıca seçmen gerekiyorsa GPT-5.6 Sol–Terra–Luna ana rehberi görev derinliği, hız ve maliyet ayrımını anlatıyor.

Terminal yüzeyi ve izin modeli için Codex CLI–Claude Code–Gemini CLI görev rehberine geç. Reasoning ayarı güçlü olsa da yanlış izin sınırını telafi etmez.

Ajan işi bitirdiğinde yedi adımlı çıktı doğrulama kontrol listesini uygula.

Singrey notu

Benim varsayılan reçetem gösterişli değil: low ile küçük işi hızlıca dene, medium ile günlük geliştirmeyi taşı, high seviyesini belirsizlik ve risk için sakla. xhigh/max ise ancak ölçülebilir bir darboğazı çözüyorlarsa değerli. En pahalı reasoning ayarı güven değildir; güven, çıktıyı bağımsız biçimde kontrol edebildiğin yerde başlar.