Çözümler

Kaynaklar

Şirket

Demo Al

Ara

Turkish

GPT-6 Astra: Sıçrama Bilgide Değil, Eylemde

OpenAI, 3 Eylül 2026'da GPT-6 Astra'yı duyurdu.

OpenAI, 3 Eylül 2026'da GPT-6 Astra'yı duyurdu.

GPT-6 Astra

OpenAI, 3 Eylül 2026’da GPT-6 Astra modelini duyurdu. Duyurunun kendisi tanıdık bir kalıpta ilerliyor: yeni nesil, daha yüksek skorlar, yeni bir isim. Ancak yayınlanan karşılaştırma sonuçları alışılmış bir “her alanda daha iyi” tablosu çizmiyor. Sonuçlar ikiye ayrılıyor ve bu ayrım, modelin nerede kullanılması gerektiğini doğrudan belirliyor.

Bir grup testte ilerleme bir ila iki puan seviyesinde. Bir diğer grupta ise skorlar iki, hatta üç katına çıkıyor. Aradaki fark rastgele değil: bilgiyi ölçen testler doymuş durumda, eylemi ölçen testler doymamış.

Sıçramanın asıl gerçekleştiği yer

Karşılaştırma Testi

GPT-6 Astra

GPT-5.6 Sol

Fark

Terminal-Bench Science 0.1

%64,6

%22,4

42,2 puan

SRE-Bench (tek deneme)

%88,0

%55,9

32,1 puan

AutomationBench

%41,4

%18,1

23,3 puan

Terminal-Bench 4.0

%57,9

%37,3

20,6 puan

ScreenSpot-Pro

%92,7

%76,9

15,8 puan

FrontierMath Tier 4

%97,6

%83,0

14,6 puan

OSWorld 2.0

%72,6

%65,7

6,9 puan

Agents’ Last Exam

%59,3

%53,6

5,7 puan

FrontierCode 1.1 Extended

%64,5

%60,6

3,9 puan

ARC-AGI-2

%95,0

%92,5

2,5 puan

DeepSWE v1.1

%74,1

%72,7

1,4 puan

GPQA Diamond

%96,0

%94,6

1,4 puan

BrowseComp

%91,5

%90,4

1,1 puan

Tablo 1: OpenAI tarafından raporlanan karşılaştırma testi sonuçları, fark büyüklüğüne göre sıralanmıştır.

Tablonun iki ucu iki farklı hikâye anlatıyor. Alt uçtaki testler — GPQA Diamond, BrowseComp, DeepSWE — modelin ne bildiğini ve tek adımlı görevlerde ne kadar isabetli olduğunu ölçüyor. Bu testlerde %90’ın üzerindeki skorlar zaten bir tavan etkisi yaratıyor; kalan birkaç puanın hem elde edilmesi zor hem de pratik anlamı sınırlı.

Üst uçtaki testler ise modelin çok adımlı bir işi sonuna kadar götürüp götüremediğini ölçüyor. Terminal-Bench Science’ta %22,4’ten %64,6’ya çıkmak, doğru cevabı daha iyi bilmek değil, uzun bir teknik zinciri koparmadan tamamlayabilmek anlamına geliyor. AutomationBench’teki iki katından fazla artış ve SRE-Bench’teki 32 puanlık fark aynı yeteneği farklı açılardan ölçüyor.

Kurumsal değerlendirme açısından çıkarım nettir: modeli soru-cevap kalitesiyle test eden bir pilot çalışma, bu nesil değişiminin getirdiği farkı göremez. Fark, ancak modele uçtan uca bir iş verildiğinde ortaya çıkar.

Bilgisayar kullanımı: 75 dakikadan 40 dakikaya

OpenAI’ın öne çıkardığı metrik yalnızca başarı oranı değil, süre. Gecikme simülasyonlarında Astra, OSWorld 2.0 görevlerini ortalama 40 dakikada tamamlıyor; GPT-5.6 Sol’da aynı görevler ortalama 75 dakika sürüyordu. Bu, görev başına yaklaşık %47 daha az süre demek.

ScreenSpot-Pro testindeki %76,9’dan %92,7’ye sıçrama bu tablonun teknik açıklamasını veriyor. Bu test, modelin ekrandaki bir arayüz öğesini doğru konumlandırma yeteneğini ölçüyor. Bilgisayar kullanan bir ajanda hataların büyük kısmı akıl yürütmede değil, yanlış yere tıklamada oluşur; her hatalı tıklama yeni bir ekran durumu yaratır ve model bunu telafi etmek için ek adımlar harcar. Konumlandırma isabeti arttığında hem başarı oranı hem de süre aynı anda iyileşir.

OpenAI, modelin KiCad, Excel, Blender ve Power BI gibi uygulamaları doğrudan kullanabildiğini belirtiyor. Codex tarafında ise bağlam penceresi yönetimi değişiyor: model, bağlam pencereleri arasında aranabilir notlar tutabiliyor. Özellik şimdilik deneysel ve Codex yapılandırmasından açılıyor. Bu, uzun görevlerde bağlam penceresinin dolmasını bir sınır olmaktan çıkarma denemesidir.

Astra, 5.6 ailesini emekliye ayırmıyor

Yeni bir amiral gemisi duyurulduğunda önceki neslin geçersizleştiği varsayılır. Fiyat tablosu bunun tersini gösteriyor.

Model

Konumlandırma

Girdi (1 Milyon token)

Çıktı (1 Milyon token)

GPT-6 Astra

Ajan ve bilgisayar kullanımı

10,00 $

50,00 $

GPT-5.6 Sol

En üst düzey akıl yürütme, uzun soluklu ajan görevleri

4,00 $

20,00 $

GPT-5.6 Terra

Yüksek hacimli üretim iş yükü

2,00 $

12,00 $

GPT-5.6 Luna

Özetleme, sınıflandırma, rutin otomasyon

0,20 $

1,20 $

Tablo 2: Astra ve GPT-5.6 ailesi fiyat karşılaştırması. Sol’un 4,00/20,00 fiyatı en az 21 Kasım 2026’ya kadar geçerli tanıtım fiyatıdır — bu bir taban, bitiş tarihi değil; liste fiyatı 5,00/30,00 seviyesindedir. Toplu işlem, Astra dahil tüm modellerde yarı fiyattır.

Tabloda ayrı bir satır olarak yer almayan bir seçenek daha var: GPT-5.6 Sol Ultra. Bu, ayrı bir model değil, Sol’un görev sırasında birbiriyle haberleşen paralel alt ajanları çalıştırıp ortak bir cevap ürettiği bir çalışma modu. Terminal-Bench 2.1 skorunu Sol’un %88,8’inden %91,9’a çıkarıyor — bu, tablodaki Terminal-Bench 4.0’dan farklı ve daha eski bir sürüm, iki rakam doğrudan karşılaştırılamaz. Fiyatlandırması Sol ile aynı, ancak tek bir çağrıda birkaç kat fazla token tüketiyor. Maliyeti liste fiyatında değil, tüketimde artıyor — bu ayrım, bütçe planlamasında sık gözden kaçan türden.

Astra ile Luna arasında girdide 50 kat, çıktıda yaklaşık 42 kat fiyat farkı var. Bu ölçekteki bir aralık, tek bir modelin tüm iş yüklerini karşılamasını ekonomik olarak savunulamaz hale getiriyor. Bir müşteri destek talebini sınıflandırmak için Astra çalıştırmak, teknik olarak mümkün ama finansal olarak anlamsızdır.

Dolayısıyla bu lansmanın kurumsal karşılığı bir model değişimi değil, bir yönlendirme (routing) kararıdır. Sorulması gereken soru “hangi modele geçelim” değil, “hangi işi hangi katmana yönlendirelim” sorusudur. Rutin sınıflandırma Luna’da, yüksek hacimli üretim işi Terra’da, uzun soluklu ajan çalıştırmaları Astra’da kalır. Bu ayrımı yapmayan ekipler, kazandıkları yetenek farkını fatura olarak geri öderler.

Bir uyarı: 272.000 girdi token’ını aşan istekler, Astra dahil tüm katmanlarda girdide 2 kat, çıktıda 1,5 kat ücretlendiriliyor ve zamlı tarife isteğin tamamına uygulanıyor. Uzun bağlamlı iş akışlarında listedeki fiyat, ödenen fiyat değildir.

Rakip karşılaştırması: iki gün arayla iki amiral gemisi

Astra’nın duyurusu, Anthropic’in Claude Fable 5.1 ve Mythos 5.1 lansmanından (1 Eylül 2026) yalnızca iki gün sonra geldi. OpenAI’ın kendi tablosunda karşılaştırılabilir birkaç sonuç var.

Karşılaştırma Testi

GPT-6 Astra

Claude Fable 5.1

FrontierMath Tier 4

%97,6

%87,8

Terminal-Bench Science 0.1

%64,6

%52,6

AutomationBench

%41,4

%31,4

GPQA Diamond

%96,0

%93,7

Terminal-Bench 4.0

%57,9

%55,8

Artificial Analysis Intelligence Index v4.1.1

61,2

65,7

Humanity’s Last Exam (araçlarla)

%57,2

%65,0

Tablo 3: Her iki satıcının kendi raporladığı sonuçlar. Farklı koşullarda alınmış olabilecekleri için doğrudan karşılaştırma sınırlıdır.

Terminal-Bench 4.0’daki 2,1 puanlık fark için Anthropic model başına ±1,6–2,0 puanlık standart hata bildiriyor ve iki model arasındaki fark için ayrı bir güven aralığı yayınlamıyor; bu testte anlamlı bir ayrım olduğunu söylemek için erken. Terminal-Bench Science’ta ise bildirilen hata payı ±3,5–4,5 puan ve oradaki 12 puanlık fark bu payı rahatça aşıyor.

Tablonun son iki satırında Fable 5.1 önde — ikisi de OpenAI’ın kendi yayınladığı sonuçlar. Bir ayrıntı daha: Fable 5.1 ile Mythos 5.1 aynı model, farklı koruma katmanları. Mythos 5.1 Terminal-Bench 4.0’da %60,9 alıyor, yani Astra’nın üzerinde.

Güvenlik: kritik eşik ve izlenebilirlik sorunu

OpenAI, hizalama tarafında güçlü rakamlar bildiriyor. Yetki sınırını aşma senaryolarında Astra vakaların %0’ında izin verilen kapsamın dışına çıkıyor; üretim korumaları olmadan test edilen Sol’da bu oran %48 seviyesindeydi. Bilgisayar kullanımı güvenlik testinde hata oranı %2,4 (Sol: %22,0), halüsinasyon testinde %4,2 (Sol: %12,2).

Aynı duyuruda dikkat çekilmesi gereken iki nokta daha var.

Birincisi, OpenAI modelin siber güvenlik alanında Hazırlık Çerçevesi’ndeki “Kritik” eşiği karşıladığını bildiriyor. Model, değerlendirme sırasında V8 motorunda daha önce bilinmeyen iki zafiyet tespit etti. Daha az kısıtlayıcı korumalar, OpenAI Daybreak programı üzerinden aşamalı olarak açılacak.

İkincisi ve daha az konuşulanı: OpenAI, izlemeden kaçınmayı açıkça isteyen testlerde Astra’nın yazılı akıl yürütmesinin Sol’unkine kıyasla izlenmesinin daha zor olduğunu bildiriyor. Bu, hizalama metriklerindeki iyileşmeyle aynı yönde ilerlemeyen bir bulgu. Modelin daha az sınır ihlali yapması ile ihlal yaptığında bunun fark edilebilir olması, iki ayrı özelliktir. İkincisinin geriye gitmesi, denetim ve uyum ekipleri için birinci maddedeki kazanımın bir kısmını geri alır.

Bu iki başlık birlikte okunduğunda ortaya çıkan tablo, Anthropic’in iki gün önceki lansmanıyla aynı yöne işaret ediyor: sektör, yetenek artışını erişim ve izleme katmanlarıyla dengelemeye çalışıyor. Farklı satıcılar, farklı isimlerle, aynı sorunu çözüyor.

“AGI çağı” iddiası

Lansmanın en çok konuşulan cümlesi bir karşılaştırma testinden gelmedi. OpenAI Başkanı Greg Brockman, duyuru öncesi basın brifinginde artık AGI (Artificial General Intelligence) çağında olduğumuzu hissetmenin yersiz sayılmayacağını söyledi ve AGI’yi sözleşmesel bir eşik değil — Microsoft ile eski anlaşmadaki maddeye atıfla — “bir misyon ya da manevi kavram” olarak tanımladı.

Bu tanım, iddiayı doğrulanabilir olmaktan çıkarıyor. Ölçütü olmayan bir eşik, aşıldığı da aşılmadığı da gösterilemeyen bir eşiktir. Yayınlanan sonuçlar, ajan iş yüklerinde gerçek ve büyük bir ilerlemeyi belgeliyor; ancak aynı sonuç setinde bilgi testlerindeki ilerleme bir-bir buçuk puan seviyesinde kalıyor ve modelin akıl yürütmesinin izlenebilirliği geriliyor. Bunlar bir nesil atlamasının verileridir, bir eşik geçişinin değil.

Kurumsal karar vericiler için pratik sonuç şudur: satın alma kararını duyurudaki çerçeveye değil, kendi iş yükünüzdeki ölçüme dayandırın. Astra’nın sizin için ne yaptığı, AGI tanımından bağımsız olarak ölçülebilir bir sorudur.

Sonuç

GPT-6 Astra, bilgi sınırını genişleten bir model değil, eylem güvenilirliğini artıran bir model. Terminal-Bench Science’taki 42 puanlık, AutomationBench’teki 23 puanlık ve SRE-Bench’teki 32 puanlık farklar aynı yeteneği işaret ediyor: uzun ve çok adımlı bir işi kopmadan tamamlayabilmek. Buna karşılık GPQA Diamond’daki 1,4 ve BrowseComp’taki 1,1 puanlık ilerlemeler, bilgi tabanlı testlerin bu nesilde artık ayırt edici olmadığını gösteriyor.

Kurumsal ekipler için üç somut adım öne çıkıyor. Birincisi, pilot çalışmayı soru-cevap kalitesi üzerinden değil, uçtan uca tamamlanan görev oranı üzerinden kurun; bu neslin farkı yalnızca orada görünür. İkincisi, Astra’yı 5.6 ailesinin yerine değil üstüne konumlandırın; 50 kata varan fiyat farkı, yönlendirme mimarisini model seçiminden daha önemli hale getiriyor ve 272.000 token üzerindeki sürşarj uzun bağlamlı iş akışlarının maliyetini listedeki rakamın üzerine taşıyor. Üçüncüsü, otonomi seviyesini artırmadan önce izlenebilirlik notunu okuyun; daha az ihlal yapan ama ihlali daha zor görülen bir sistem, denetim gerektiren süreçlerde farklı bir risk profili taşır.

Model dünyasında iki gün arayla iki amiral gemisi duyuruldu ve ikisi de aynı yöne bakıyor: rekabet artık modelin ne bildiğinde değil, denetim altında ne kadarını kendi başına yapabildiğinde.