Çözümler

Kaynaklar

Şirket

Demo Al

Ara

Turkish

Claude Sonnet 4.5: Otonom Kodlamada Yeni Bir Eşik

Anthropic’in Claude Sonnet 4.5 modeli, 30 saatten fazla otonom kodlama sunuyor, SWE-bench Verified (%77,2) ve OSWorld (%61,4) liderliğini üstleniyor ve izinler, kontrol noktaları ile çoklu eyleyici orkestrasyonu için bir Agent SDK'sı ekliyor

Anthropic’in Claude Sonnet 4.5 modeli, 30 saatten fazla otonom kodlama sunuyor, SWE-bench Verified (%77,2) ve OSWorld (%61,4) liderliğini üstleniyor ve izinler, kontrol noktaları ile çoklu eyleyici orkestrasyonu için bir Agent SDK'sı ekliyor

Anthropic, Claude Sonnet 4.5 ile "otonom kodlama" vizyonunu gerçeğe dönüştürüyor. Şirkete göre, model tek bir çalıştırmada odak kaybetmeden 30+ saat boyunca görevde kalabiliyor. Bu süre zarfında sadece kod yazmakla kalmıyor; veritabanını hazırlıyor, yapılandırmaları tamamlıyor ve bir uygulamayı uçtan uca hayata geçiriyor. İlk kurumsal pilot çalışmalar, önceki nesle kıyasla belirgin bir ilerleme olduğunu gösteriyor.


Performans: SWE-bench ve OSWorld'de birincilik iddiası

Gerçek dünya karşılaştırma testlerindeki tablo da aynı derecede net. Sonnet 4.5, gerçek depolara ve sorunlara karşı hata gidermeyi ölçen SWE-bench Verified görevinde %77,2 ile lider konumda. Modelin bilgisayar kullanım yeteneklerini değerlendiren OSWorld'de ise Sonnet 4.5, %61,4'e ulaşıyor. Sonnet 4'ün sadece dört ay önce aynı OSWorld testini %42 civarında tamamladığı düşünüldüğünde, bu sıçrama sadece yapay kazanımlara değil, gerçek bir bilgisayarda daha güvenilir çok adımlı yürütmeye işaret ediyor.


Geliştiriciler için: Agent SDK ve Claude Code güncellemeleri

Geliştiricilere yönelik iki önemli unsur öne çıkıyor. Birincisi, Claude Agent SDK. Anthropic, Sonnet 4.5'in arkasındaki otonom altyapıyı açarak ekiplere uzun süreli görev bellek yönetimi, yetkilendirme ve otonomi kontrolü ile çoklu ajan koordinasyonu için bir çerçeve sunuyor. İkincisi, şablon kodlar (boilerplate) olmadan gerçek zamanlı yazılım oluşturmayı sergilemek üzere tasarlanmış, zaman sınırlı bir araştırma önizlemesi olan Imagine with Claude. Bunlar birlikte, otonom senaryoları "demo ürünü" olmanın ötesine taşıyarak üretime daha da yakınlaştırıyor.

Fiyatlandırmada sürpriz yok: Sonnet 4.5, Sonnet 4 ile aynı fiyatlardan sunuluyor; 1 milyon girdi token'ı için 3 ABD Doları ve 1 milyon çıktı token'ı için 15 ABD Doları. Bu durum, maliyet öngörülerini altüst etmeden daha güçlü yetenekler arayan ekipler için büyük önem taşıyor. Model bugün itibarıyla Claude API ve sohbet arayüzü üzerinden erişilebilir durumda.


Güvenlik ve Uyum: ASL-3 korumaları ve enjeksiyon savunmaları

Güvenlik ve uyum, lansmanın merkezinde yer alıyor. Anthropic, Sonnet 4.5'i bugüne kadarki en uyumlu öncü modeli olarak konumlandırıyor. Şirket; yaltaklanma (sycophancy), aldatıcı davranışlar ve güç arayışı eğilimlerinde azalmaların yapıldığını, ayrıca komut enjeksiyonu (prompt-injection) savunmalarında ve ASL-3 korumalarında ilerlemeler kaydedildiğini bildiriyor. Uyum, denetim ve güvenlik paydaşları için bu geliştirmeler, otonom iş akışlarının benimsenmesindeki engelleri azaltabilir.


Kurumlar için pratik faydalar

Bu durum pratikte nasıl görünüyor? Eski hizmetleri modernize eden orta ölçekli bir ekip için Sonnet 4.5; depo tarama ve bağımlılık temizliğinden, testleri başarıyla geçirmeye ve CI (Sürekli Entegrasyon) güncellemeye kadar tek bir uzun işlemde ilerleyebilir. Bir analist senaryosunda ise model; tarayıcıda dosya indirebilir, elektronik tabloları dönüştürebilir ve aynı oturumda kısa ve öz bir özet rapor oluşturabilir. Kısacası, bu sadece metin üretimiyle ilgili değil, etkili bilgisayar kullanımıyla ilgilidir.

Anthropic’in Agent SDK'sı, üretim aşamasındaki yönetim ve işletilebilirlik açıklarını kapatıyor: kontrol noktası/geri alma (checkpoint/rollback), yetki politikaları ve çoklu ajan koordinasyonu, mühendislik liderlerine kavram kanıtından (PoC) yayına kadar uygulanabilir bir yol sunuyor.

  • Kod modernizasyonu: Çok adımlı yeniden yapılandırmalar (örneğin yekpare bir yapıyı parçalama) uçtan uca çalıştırılabilir. Kontrol noktaları ve yetkiler, kontrol mekanizmalarını ve güvenli geri almaları sistemleştirir.

  • Veriden rapora döngüleri: Finans/operasyon için tarayıcı tabanlı "indir-temizle-raporla" döngüleri tek bir kesintisiz oturumda yürütülebilir.

  • Ajan portföyü: Alt ajanlarla (örneğin, ön uç iskeleti ile paralel olarak arka uç API kurulumu), SDK kurumsal yetkilendirme şemaları altında eşzamanlı akışlar sağlar.


Sonuç

Claude Sonnet 4.5, "otonom kodlama" vaadini somut örneklerle destekleyen ilk modellerden biridir. 30+ saatlik kesintisiz çalışmalar, OSWorld'de %61,4 başarı ve gerçek depo bağlamlarındaki güçlü performans, işi bitirmek için gerçekten bilgisayar kullanabilen bir sisteme işaret ediyor. Aynı zamanda, yetkiler, kontrol noktaları ve çoklu ajan koordinasyonuna sahip Agent SDK, işletmelerin PoC'den üretime geçmek için ihtiyaç duyduğu yönetim katmanını sunuyor.

Model dünyasının hızla geliştiği bu dönemde Anthropic'in yaklaşımı olan aynı fiyata daha fazla güç ve daha sıkı güvenlik, rekabeti canlı tutuyor. Mühendislik liderleri için yapılması gereken net: dar kapsamlı, uçtan uca bir pilot çalışma ile başlayın, ajanın görevi gerçekten tamamlayıp tamamlamadığını ölçün ve ardından daha büyük kod tabanlarında yetkiler, geri alma ve denetlenebilirlik ile ölçeklendirin.