Çözümler

Kaynaklar

Şirket

Demo Al

Ara

Turkish

Claude Opus 5: Aynı Fiyat, Bir Kuşak Sıçrama

Anthropic, modeli yarı maliyetine Fable 5'in öncü zekasına yaklaşan bir model olarak konumlandırıyor. Yine de yayınlanan rakamlar Opus 5'in yaklaşmaktan çok daha fazlasını yaptığını gösteriyor: Çoğu kodlama ve bilgi işi değerlendirmesinde kendisinden iki kat daha pahalı olan Fable 5'i geride bırakıyor.

Anthropic, modeli yarı maliyetine Fable 5'in öncü zekasına yaklaşan bir model olarak konumlandırıyor. Yine de yayınlanan rakamlar Opus 5'in yaklaşmaktan çok daha fazlasını yaptığını gösteriyor: Çoğu kodlama ve bilgi işi değerlendirmesinde kendisinden iki kat daha pahalı olan Fable 5'i geride bırakıyor.

Claude Opus 5 İnceleme Blogu Kapak Sayfası

Anthropic iki aydan kısa sürede dört model çıkardı. Sıranın sonuncusu 24 Temmuz Cuma günü geldi: Claude Opus 5.

Bu kez sürpriz fiyatta değil. Opus 5, bir önceki model Opus 4.8 ile birebir aynı fiyata geliyor: milyon token başına giriş 5, çıkış 25 dolar. Sürpriz, aynı fiyata gelen sıçramanın büyüklüğünde.

Anthropic modeli “Fable 5’in sınır zekâsına yarı fiyatına yaklaşan model” diye konumlandırıyor. Ancak yayımlanan tabloya bakıldığında Opus 5, iki katı pahalı olan Fable 5’i kodlama ve bilgi işi değerlendirmelerinin çoğunda yaklaşmakla kalmayıp geçiyor.

Özet: 30 saniyede Claude Opus 5

•          Çıkış tarihi: 24 Temmuz 2026

•          Fiyat: 5 $ giriş / 25 $ çıkış (milyon token) — Opus 4.8 ile aynı

•          Bağlam penceresi: 1 milyon token

•          Bilgi kesim tarihi: Mayıs 2026 — güncel Claude modelleri arasında en yenisi

•          Öne çıktığı testler: Frontier-Bench, OSWorld 2.0, GDPval-AA v2, ARC-AGI 3, AutomationBench

•          Geride kaldığı yerler: SWE-bench Pro’da 0,8 puan; siber sömürüde Mythos 5

Son iki ayda ne oldu?

Opus 5’in nereye oturduğunu görmek için kısa bir geriye bakış gerekiyor. Model tablosu Haziran başından bu yana neredeyse tamamen değişti.

•          28 Mayıs — Opus 4.8. Bir süre “sınırın en üstü” konumunu korudu.

•          9 Haziran — Mythos kademesi. Anthropic, Opus’un üzerine yeni bir kademe açtı. İlk iki model Claude Mythos 5 ve Claude Fable 5 aynı gün yayınlandı. İkisi aynı temel modeli paylaşıyor; Fable 5, biyoloji, siber güvenlik ve LLM Ar-Ge alanlarında ek güvenlik önlemleriyle geliyor.

•          12 Haziran — erişim askıya alındı. Anthropic, ABD Ticaret Bakanlığı’nın ihracat kontrollerine uyum gerekçesiyle her iki modelin erişimini durdurdu. Yaklaşık üç hafta boyunca üst kademe fiilen kullanılamadı.

•          30 Haziran — kontroller kalktı. Anthropic erişimi 1 Temmuz’da yeniden açtı. Aynı gün Sonnet 5 çıktı: orta kademeyi Opus bandına taşıyan, 31 Ağustos’a kadar 2/10 dolarlık tanıtım fiyatıyla sunulan bir model.

•          24 Temmuz — Opus 5. Tabloyu bir kez daha karıştırdı, çünkü bu kez sıçrama fiyata değil yalnızca performansa yansıdı.

Bu tempo pratik bir sorun yaratıyor: iki ay önce yapılmış bir model seçimi bugün büyük ihtimalle güncelliğini yitirmiş durumda. Kurulu akışlarda hâlâ Opus 4.8 ya da daha eski bir model sabitlenmiş olabilir. Opus 5’in getirdiği fark, bu tercihleri gözden geçirmeyi hak edecek büyüklükte.

Claude Opus 5 özellikleri ve fiyatı

Özellik

Değer

Bağlam penceresi

1 milyon token (hem varsayılan hem maksimum)

Maksimum çıkış

128.000 token

Düşünme (thinking)

Varsayılan olarak açık

Bilgi kesim tarihi

Mayıs 2026 (güncel Claude modelleri arasında en yenisi)

Fiyat

Giriş 5 $ / Çıkış 25 $ (milyon token) — Opus 4.8 ile aynı

Veri saklama

Genel erişimde veri saklama zorunluluğu yok

Claude Max planında varsayılan model oldu; Claude Pro’da erişilebilen en güçlü model.

Modelin bir de effort kademesi var: low, medium, high (varsayılan), xhigh ve max. Aşağıdaki skorların bir kısmı bu kademeye göre değiştiği için, benchmark rakamlarını okurken bunu akılda tutmak gerekiyor.

Opus katmanı neden bu kez farklı?

Model kademelerinde alışılmış anlatı, alt kademenin üst kademeye yaklaşması yönündedir. Opus 5’te olan bunun tersi: Opus katmanı, üzerindeki Fable katmanına yetişmekle kalmıyor, birkaç yerde onu geçiyor — üstelik yarı fiyata.

Anthropic’in kendi vurgusu da tek bir benchmark’ta değil, eğrinin şeklinde. Yayımlanan grafiklerin neredeyse tamamı skoru harcanan dolara karşı çiziyor ve Opus 5’in eğrisi Fable 5’inkinin üstünde ve solunda duruyor. Yani “daha çok ödersen daha iyi” değil, “daha aza daha iyi”.

Claude Opus 5 benchmark sonuçları

Aşağıdaki rakamlar Anthropic’in lansman notlarından ve sistem kartından geliyor; bir kısmı bu materyalleri okuyan bağımsız derlemeler üzerinden doğrulandı.

İki uyarıyı baştan koymakta fayda var:

1.         Skorların önemli bir bölümü effort ayarına göre belirgin şekilde değişiyor.

2.         Frontier-Bench koşusunda güvenlik sınıflandırıcısı tarafından reddedilen çağrılar Opus 4.8’e düşürülmüş. Yani o sonuç saf model ölçümü değil, sistem ölçümü.

Kodlama benchmark’ları

Anthropic’in yeni ajan tabanlı kodlama testi Frontier-Bench v0.1’de Opus 5 yüzde 43,3 alıyor. Opus 4.8 yüzde 18,7’de kalmıştı; Fable 5 yüzde 33,7, GPT-5.6 Sol yüzde 34,4. Yani bir önceki modelin iki katından fazlası, üstelik görev başına daha düşük maliyetle.

SWE-bench Pro’da tablo daha sıkışık: Opus 5 yüzde 79,2 alıyor; Fable 5 yüzde 80,0 ve Mythos 5 yüzde 80,3 ile hâlâ ince farkla önde. Ama karşılaştırma noktası Opus 4.8’in yüzde 69,2’si olduğunda, tek kuşakta kapanan mesafe görünüyor. Kalan 0,8 puan için iki kat fiyat ödemek çoğu ekip için anlamlı bir denklem değil.

SWE-bench Verified’da ise yüzde 96,0 skoru, bu testin pratikte doyuma ulaştığını gösteriyor.

CursorBench 3.2’de Opus 5, Fable 5’in zirve skoruna yüzde 0,5’ten daha yakın; görev başına maliyet ise yarısı.

Bilgisayar kullanımı ve otomasyon

OSWorld 2.0’da Opus 5 yüzde 70,6 alıyor; Fable 5 yüzde 66,1, Opus 4.8 ise yüzde 55,7’de kalmıştı. Anthropic’in ifadesiyle Opus 5, Fable 5’in en iyi sonucunu maliyetin yaklaşık üçte biriyle geçiyor.

Zapier AutomationBench — iş görevlerinin baştan sona tamamlanıp tamamlanmadığını ölçen test — Opus 5’e yüzde 26,0 veriyor; Opus 4.8 yüzde 17,0, Fable 5 yüzde 17,4. En düşük effort ayarında bile diğer modellerden daha fazla görev geçiyor.

Zapier CEO’su Wade Foster, ham bir hesap sağlığı tablosundan başlayıp riskli hesapları işaretleyen, doğru sahibini uyaran ve özet çıkaran uçtan uca akışı önceki modellerin geçemediğini, Opus 5’in yüzde 100 tamamladığını aktarıyor.

Bilgi işi ve akıl yürütme

GDPval-AA v2’de Opus 5, 1.861 Elo ile liderliği alıyor; Fable 5 1.747, GPT-5.6 Sol 1.736 puanda. Burada bir not gerekiyor: Elo tabloları zaman içinde yeniden temellendiriliyor, dolayısıyla farklı tarihlerde yayımlanmış puanları yan yana koymak yanıltıcı olur. Anlamlı olan, aynı çekilişteki sıralama.

ARC-AGI 3’te — modelin daha önce görmediği türden problemleri çözmesini ölçen test — Opus 5 yüzde 30,2 alıyor; en yakın rakip yüzde 8 civarında kalıyor. Yaklaşık dört kat fark. Bu büyüklükte bir açık nadirdir ve bir miktar sağlıklı şüpheyi hak eder; tek bir koşuya güvenmeden kendi iş yükünüzle doğrulamakta fayda var.

Bilim ve görsel çıktı

Opus 5, Anthropic’in yaşam bilimleri değerlendirmelerinin tamamında Opus 4.8’in üstünde. En belirgin iyileşme organik kimyada:

•          Spektroskopi verisinden moleküler yapı çıkarımında 10,2 puan fark

•          Bir proteinin dizi varyasyonlarının işlevi nasıl etkilediğini tahmin etmede 7,7 puan fark

Görsel çıktı tarafında da belirgin bir sıçrama var; Anthropic lansmanda modelin ürettiği etkileşimli simülasyonları örnek gösteriyor.

Pratikte ne fark ediyor?

Anthropic’in anlatısı tek bir davranışta toplanıyor: model kendi işini doğruluyor ve başarana kadar yineliyor.

Lansmanda verilen örnekler bu yönde. Bir Frontier-Bench görevinde modelden bir makine parçasının teknik çizimini 3B FreeCAD modeline dönüştürmesi isteniyor, ama çizimi doğrudan görmesinin yolu bilerek kapatılıyor. Opus 5 kendi bilgisayarlı görü hattını yazıp geometriyi ham piksellerden çıkarıyor ve parçayı yeniden kuruyor. Aynı kurulumda başka hiçbir model beş denemede çözemiyor.

Popüler bir paket yöneticisindeki gerçek bir hatada ise topluluğun yamasının atladığı uç durumu bulup kök nedeni düzeltiyor. Rakip bir model yalnızca yüzeydeki belirtiyi düzeltip hatayı çözülmüş ilan ediyor.

Erken erişim geri bildirimleri

Ortak payda dikkat çekici biçimde verimlilik:

•          Harvey: Opus 4.8’in maksimum akıl yürütme moduna benzer performansı, ortalama yüzde 26 daha az token üreterek elde ettiğini söylüyor.

•          Fundamental Research Lab: Zor finansal modelleme görevlerinde ortalama 9 puan daha yüksek doğruluğa, üçte bir daha az tur ve araç çağrısıyla, yüzde 60 daha az sürede ulaştığını aktarıyor.

•          Box: Opus 4.8’e göre genel yüzde 8, veri analizinde yüzde 11, durum tespiti akışlarında yüzde 17 iyileşme bildiriyor.

Bu rakamların hepsinin verim rakamı olması önemli. “Daha akıllı” değil, “aynı işi daha az token ve daha az turla” anlamına geliyorlar — faturaya doğrudan yansıyan taraf da burası.

İstem yazarken değişen bir şey var mı?

Eski modellerde eklemeye alıştığınız “işini kontrol et, sonra tekrar gözden geçir” tarzı talimatlar, Opus 5’te zaten yapılan bir şeyi tekrar tetikleyerek gereksiz token yakabiliyor.

Mevcut istemlerinizi Opus 5’e taşırken bu tür kendi kendini denetleme talimatlarını gözden geçirmekte fayda var. Model bu davranışı zaten varsayılan olarak sergiliyor.

Güvenlik ve hizalanma

Anthropic’in otomatik davranış denetiminde Opus 5, bugüne kadarki en hizalı modelleri olarak öne çıkıyor. Genel yanlış hizalanma skoru 2,3 ile son modeller arasında en düşüğü.

Claude’un anayasasına Opus 4.8, Sonnet 5 ve Fable 5’ten daha iyi uyuyor; aldatıcı davranış oranı en düşük seviyede ve kötüye kullanıma kandırılmaya en dirençli model. Geri döndürülmesi zor yan etkileri olabilecek pervasız eylemlerden kaçınma konusunda da en güvenli sonucu veriyor.

Yani Opus 5’te yetenek ve güvenlik aynı yönde hareket etmiş. Kademeler arasında sık görülen “daha yetenekli ama daha riskli” dengesi burada geçerli değil.

Siber tarafta çizilen sınır

Opus 5 siber görevler üzerinde bilerek eğitilmedi. Buna rağmen genel yeteneğin artmasıyla açık bulma konusunda Mythos 5’e yaklaştı. Ancak açığı fiili bir tehdide çevirme, yani sömürü tarafında belirgin şekilde geride.

Sınıflandırıcılar kaynak kodda açık bulmaya izin veriyor; ikili dosya tabanlı tarama, sızma testi ve exploit üretimini engelliyor. Fable 5’e kıyasla yaklaşık yüzde 85 daha az müdahale bekleniyor.

Biyoloji tarafındaysa Opus 5 artık genel erişime açık en yetenekli bilimsel araştırma modeli konumunda.

Opus 5 vs Fable 5 vs Sonnet 5 vs GPT-5.6 Sol

Opus 5’i tek başına değil, aynı anda masada olan diğer seçeneklerle birlikte okumak gerekiyor:

Model

Fiyat (giriş / çıkış, milyon token)

Opus 5 karşısındaki konumu

Opus 5

5 $ / 25 $

Referans nokta. Frontier-Bench, OSWorld 2.0, GDPval-AA v2, ARC-AGI 3 ve AutomationBench’te önde. Veri saklama zorunluluğu yok.

Fable 5

10 $ / 50 $

Paylaşılan testlerin çoğunda geride, üstelik iki katı fiyatta. Elinde kalan: SWE-bench Pro’da 0,8 puan ve CursorBench’te birkaç ondalık. Ayrıca veri saklama gereksinimi var.

Mythos 5

Genel erişimde değil

Siber sömürü ve otonom biyoloji araştırmasında hâlâ önde. Project Glasswing kapsamında sınırlı sayıda kuruluşla kullanılıyor.

Sonnet 5

2 $ / 10 $ (31 Ağustos’a kadar), sonrasında 3 $ / 15 $

Fark artık zekâda değil birim maliyette. Yüksek hacimli ve tekrar eden işlerde hâlâ ezici avantaj.

GPT-5.6 Sol

Girişte Opus 5 ile aynı, çıkışta yaklaşık %17 daha pahalı

Frontier-Bench, ARC-AGI 3, GDPval-AA v2, OSWorld 2.0, CursorBench ve AutomationBench’te Opus 5 önde. DeepSWE’de Sol önde; kodlama ajanı endeksinde tablo beraberliğe yakın.

Tablonun özeti şu: Fable 5 artık varsayılan üst basamak olmaktan çıkıyor, Sonnet 5 ise alt tarafta yerini koruyor. Opus 5, ikisinin arasındaki bandı belirgin şekilde genişletmiş durumda.

Claude Opus 5 kimin işine yarar?

•          Uzun soluklu, gözetimsiz otomasyon kuranlar: Kendi işini doğrulama ve başarana kadar yineleme davranışı, günlük operasyon otomasyonunda en doğrudan karşılığını burada buluyor.

•          Bilgisayar kullanımı ve arayüz otomasyonu: OSWorld 2.0’daki hem daha yüksek hem daha ucuz sonuç, tercihi tartışmaya kapatıyor.

•          Bilgi işi ağırlıklı ekipler: Rapor, analiz, tablo ve sunum üretiminde GDPval-AA v2 liderliği en çok gerçek işe karşılık gelen ölçüt.

•          Halihazırda Fable 5 kullananlar: İş yüklerinin çoğunda Opus 5’e geçmek hem daha ucuz hem çoğu testte daha iyi. Fable 5’i, ölçtüğünüz bir görevde gerçekten fark yarattığını doğruladığınız yerlerde tutmak daha makul.

•          Yüksek hacimli ve basit işler: Opus 5 doğru araç değil. Sonnet 5 hâlâ birim maliyette kazanıyor.

Sonuç

Opus 5, bir kuşak atlamanın fiyat etiketine yansımadan da olabileceğini gösteren bir sürüm. Aynı 5/25 dolara; Frontier-Bench’te Opus 4.8’in iki katından fazla, bilgisayar kullanımında ve bilgi işinde iki kat pahalı Fable 5’in üstünde bir model geliyor.

Geride kaldığı yerler ise dar ve iyi tanımlı: SWE-bench Pro’da bir puanın altında bir fark ve siber sömürü tarafında Mythos 5’e karşı bilinçli bir mesafe.

Opus 5’ten sonra model seçimi aslında biraz daha basitleşti: hacim ve maliyetin belirleyici olduğu işler için Sonnet 5, geri kalan hemen her şey için Opus 5. Fable 5 artık varsayılan değil, doğrulanmış bir ihtiyaç halinde başvurulan üst basamak.