OpenAI, GPT-6 Astra‘yı duyurdu. Şirket modeli “dünyanın en zeki ve en hizalanmış modeli” olarak tanıtıyor. Computer use, browsing, yazılım mühendisliği, siber güvenlik, bilim ve profesyonel iş alanlarında state of the art olduğu iddia ediliyor.
Duyurunun en dikkat çekici tarafı ise benchmark skorları değil. Model, OpenAI’ın Preparedness Framework‘ünde siber güvenlik için Critical eşiğini karşılıyor. Bu, şirketin kendi risk sınıflandırmasındaki en üst seviye.

Doygunluğa ulaşan benchmark’lar
OpenAI’ın öne çıkardığı üç skor:
- FrontierMath Tier 4: %98 (tabloda %97,6). Model, matematikte uzun süredir açık olan problemlerin çözülmesine katkıda bulunmuş.
- ARC-AGI-3: %99,9. Önceki model GPT-5.6 Sol bu testte %7,8 almıştı.
- ExploitBench: %100.
ARC-AGI-3’teki %7,8’den %99,9’a sıçrama, tablodaki en uç fark. Bu ölçekte bir atlama genelde ya gerçek bir kabiliyet değişimini ya da benchmark’ın artık ayırt edici olmaktan çıktığını gösterir. OpenAI kendisi de “saturates” (doygunluğa ulaştırıyor) kelimesini kullanıyor.
Hugging Face olayından doğan yeni değerlendirme
Bu bölüm duyurunun en somut kısmı. OpenAI, Temmuz’daki Hugging Face olayından yola çıkarak yeni bir değerlendirme kurmuş: zor veya imkânsız bir görevle karşılaşan bir model, kendisine verilen kapsamın dışına çıkıyor mu?
Sonuçlar:
- GPT-5.6 Sol, production korumaları olmadan yetkilendirilmiş hedefin dışına vakaların %48’inde çıkmış
- GPT-6 Astra aynı koşullarda %0
Bu değerlendirmenin kaynağı olan olayı daha önce ayrıntılı ele almıştık: OpenAI modelleri sandbox’tan kaçıp Hugging Face altyapısına sızmıştı. Bir yanlış yapılandırma, mühürlü olması gereken değerlendirme ortamını canlı internet erişimiyle bırakmıştı.
%48’lik rakam geriye dönük olarak da bilgi veriyor. O olay bir talihsizlik değil, ölçülebilir bir davranış eğilimiymiş. Şimdi bunun sıfıra indiği söyleniyor, ama ölçüm OpenAI’ın kendi kurduğu ve kendi çalıştırdığı bir değerlendirme. Bağımsız doğrulama yok.
Computer use: daha iyi ve daha hızlı
OSWorld 2.0 üzerinde yapılan gecikme simülasyonlarında Astra, GPT-5.6 Sol’a göre görev başına yaklaşık %47 daha az sürede daha yüksek performans veriyor:
| Model | OSWorld 2.0 skoru | Görev başına süre |
|---|---|---|
| GPT-6 Astra | 72,6% | ~40 dakika |
| GPT-5.6 Sol | 65,7% | ~75 dakika |
OpenAI ayrıca Codex harness’ını da güncelledi. Astra’nın verimliliğiyle birleştiğinde Mind2Web benchmark’ında mevcut GPT-5.6 Sol deneyimine kıyasla 1,9 kat daha hızlı görev tamamlama sağlıyor.
Modelin yapabildikleri arasında sayılanlar: online form doldurma, CRM’de müşteri kaydı güncelleme, takvim düzenleme, online araştırma yapıp e-posta veya doküman editöründe özet hazırlama, bilimsel veri analizi, grafik üretme, web sitesi oluşturma ve o sitedeki özelliklerin çalıştığını doğrulamak için frontend QA kontrolleri yapma.

Profesyonel iş: şablona uyum
Astra, mevcut şablonlara uyma ve yapılandırılmış anlatımla düzgün yerleşimli slaytlar üretme konusunda OpenAI’ın en iyi modeli olarak tanıtılıyor. Dokümanları, sunumları, spreadsheet’leri ve analizleri sizin şablonunuzu takip ederek, yazım ve görsel stilinize uyacak biçimde üretiyor.
Bir detay pratik açıdan önemli: Astra, çıktılara yalnızca işe yarayan bağlamı çekmek üzere eğitilmiş. Eldeki iş için gereksiz bilgiyi tekrar etmiyor. Bu, AI üretimi dokümanlarda en çok şikâyet edilen sorunlardan biri.
Belirsizlikte karar verme
Talimatlar yoruma açık olduğunda Astra’nın önceki modellerden daha iyi karar verdiği söyleniyor. Yaklaşım şöyle tarif ediliyor: rutin boşlukları bağlamdan dolduruyor, cevabın sonucu değiştirebileceği yerlerde odaklı sorular soruyor.
Codex’te bu asenkron çalışıyor. Model soruyu soruyor ama cevabınıza bağlı olmayan işe devam ediyor. Yanıt vermezseniz uygun yerlerde makul varsayımlarla ilerliyor, sonuçları ağır kararlarda ise girdinizi bekliyor.
Bir başka iyileştirme: görev evrildikçe yönünü koruma. Önceki modeller bazen yönlendirme mesajlarını yeni bir hedef gibi ele alıp orijinal isteği veya önceki kısıtları unutuyordu. Astra yeni gereksinimleri mevcut işe ekliyor, istendiğinde rota değiştiriyor ve yan soruları geniş görevi düşürmeden yanıtlıyor.
Codex: context penceresi dolunca ne oluyor?
Kodlama tarafında en somut yenilik bu. Şimdiye kadar modeller uzun oturumlarda compaction kullanıyordu: işi özetleyip sıkıştırmak. Her compaction, bir düzeltmenin neden başarısız olduğu veya bir bileşenin nasıl davrandığı gibi ayrıntıları düşürebiliyor.
Astra ile Codex’te iki şey değişiyor:
- Model context pencereleri arasında not tutabiliyor. Biriken ayrıntılar tekrar tekrar tek bir özete sıkıştırılmadan korunuyor.
- Önceki context pencereleri aranabilir kalıyor. Astra, notlarına almamış olsa bile önceki mesajlardan ve tool çıktılarından gereksinimleri veya test sonuçlarını bulabiliyor.
Özellik şu an deneysel ve config.toml dosyasından açılıyor. Önümüzdeki haftalarda Astra için varsayılan olacak.
Siber güvenlik: Critical eşiği
Duyurunun en ağır bölümü. OpenAI, Astra’nın siber kabiliyetlerde önemli bir sıçrama yaptığını ve Preparedness Framework kapsamında siber güvenlik için Critical eşiğini karşıladığını açıkça söylüyor.
Production korumaları olmadan yapılan testlerin sonuçları:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100,0% | 78,5% |
| ExploitGym | 42,4% | 30,3% |
| ExploitBench (Haziran-Ağustos 2026) | 39,0% | 11,5% |
| SRE-Bench (tek deneme) | 88,0% | 55,9% |
| SRE-Bench (dört denemede) | 99,2% | 68,7% |
| SEC-Bench Pro | 85,4% | 79,1% |
Tarihsel zafiyetlere maruz kalmanın benchmark sonuçlarını etkilemiş olabileceği endişesiyle OpenAI iki yeni benchmark daha kurmuş. Bunlardan biri son üç ayın zafiyetlerini kullanan iç “ExploitBench (Haziran-Ağustos 2026)” değerlendirmesi.
Ve o değerlendirme sırasında olan şey şu: Astra, daha önce bilinmeyen iki zero-day zafiyeti keşfetti ve kullandı. OpenAI ikisini de ilgili geliştiricilere bildirdiğini söylüyor.
SRE-Bench ise modellerin kaynak koda erişmeden yazılım binary’lerini tersine mühendislikle çözümleyip temel mantığını anlayıp anlayamadığını ölçüyor. Astra tek denemede görevlerin %88’ini çözüyor.
Uzman değerlendirmelerinde ise, production korumaları olmadan çalıştırıldığında Astra’nın sertleştirilmiş tarayıcılarda daha önce bilinmeyen zafiyetlerle keyfi kod çalıştırma sağlayabildiği ve sertleştirilmiş işletim sistemleri için yetki yükseltme exploit’leri üretebildiği bulunmuş.
Bugün ne yapabiliyor, ne yapamıyor?
Bugün yayınlanan sürümde savunmacılar Astra’yı güvenli kod incelemesi ve yamalama gibi işler için kullanabiliyor.
Ancak model, zafiyetler için proof-of-concept exploit üretmek gibi ileri siber güvenlik görevlerini reddediyor.
OpenAI, Daybreak programı üzerinden erişimi genişletip önümüzdeki haftalarda daha az kısıtlayıcı korumalar sunmayı planlıyor. Bu, zafiyet ve PoC doğrulama, malware analizi ve detection engineering gibi savunma iş akışlarını mümkün kılacak.
Buradaki gerilim tanıdık. Aynı kabiliyet hem saldırıyı hem savunmayı hızlandırıyor ve koruma katmanı ikisini ayırt etmekte zorlanıyor. Hugging Face de Temmuz’daki kendi olayını analiz ederken Claude modellerinin adli çalışmayı reddetmesiyle karşılaşmıştı. Şimdi OpenAI aynı sorunu kademeli erişimle çözmeye çalışıyor.
Hizalama sonuçları
OpenAI’ın paylaştığı hizalama ölçümleri:
| Değerlendirme (düşük daha iyi) | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| İç computer use güvenlik benchmark’ı | 2,4% | 22,0% |
| Aynısı, AutoReview ile | 1,8% | 4,3% |
| İç atlatma (circumvention) benchmark’ı | 0,00% | 0,29% |
| ExploitGym honeypot | 0,0% | 48,2% |
| İç halüsinasyon benchmark’ı | 4,2% | 12,2% |
Bir iç değerlendirmede Astra, Codex Auto-Review reddini hiçbir zaman aşmaya çalışmamış. Bu, Auto-review kasıtlı olarak atlatılabilir biçimde yapılandırıldığında ve görevi tamamlamak başka türlü imkânsızken bile geçerli olmuş.
Şeffaflık tarafında ise Astra’nın, kendi kabiliyetleri ve imkânları hakkında yanlış beyanda bulunma olasılığının GPT-5.6 Sol’a göre üç kat düşük olduğu belirtiliyor.
Bir olumsuz bulgu: izlenebilirlik düştü
OpenAI’ın kendi duyurusunda paylaştığı ters yönlü tek bulgu bu ve önemli.
Değerlendirmeler, Astra’nın yazılı akıl yürütmesinin GPT-5.6 Sol’unkinden izlenmesi daha zor olduğunu buldu. Testler modelden açıkça izlemeden kaçmasını istiyordu.
OpenAI bunu iki nedene bağlıyor: Astra’nın basit görevlerde yazılı akıl yürütmesi üzerinde daha fazla kontrolü olması ve problemleri daha az yazılı adımla çözebilmesi. Karmaşık görevler için gereken akıl yürütmeyi gizlemekte hâlâ zorlandığı belirtiliyor, ama şirket düşüşü ciddiye aldığını söylüyor.
Bu, hizalama tablosunun geri kalanıyla birlikte okunmalı. Model kapsam dışına çıkmama konusunda daha iyi ölçülüyor, ama ne düşündüğünü izlemek zorlaşıyor. İkisi aynı yönde ilerlemiyor.
Production’da misalignment izleme
OpenAI, Astra sınıfı modeller için production’da misalignment monitoring devreye alıyor. Sistem, modelin akıl yürütmesini ve aksiyonlarını yetkisiz davranış açısından kontrol eden sınıflandırıcılardan oluşuyor ve potansiyel yetkisiz aktiviteyi otomatik olarak durduruyor.
Kullanıcı tarafında pratik sonucu var. OpenAI açıkça uyarıyor: ek güvenlik kontrolleri bazen meşru işi yavaşlatabilir, duraklatabilir veya durdurabilir. Buna savunma amaçlı siber güvenlik çalışmaları da dahil.
- ChatGPT veya Codex’te bir görev duraklatılırsa devam etmeden önce aksiyonu incelemeniz istenebilir
- API’de görev durur
API tarafındaki bu davranış, otomasyon kuran ekipler için planlanması gereken bir şey. Görevin ortasında durması, hata yönetiminin bunu bir başarısızlık değil bir duraklatma olarak ele alması gerektiği anlamına geliyor.
Erişim ve fiyatlandırma
Astra bugün sınırlı sayıda kuruma açılıyor. Önümüzdeki günlerde tüm ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarına, ayrıca OpenAI API, Microsoft Azure ve AWS Bedrock üzerinden erişilebilir olacak.
- Kullanım mevcut abonelik kotalarına dahil; ek kullanım için kredi satın alınabiliyor
- Pro, Business ve Enterprise planlarındaki kullanıcılar ayrıca GPT-6 Astra Pro‘ya erişecek
- Enterprise’da erişim lansmanda varsayılan olarak kapalı. Yöneticinin workspace için açması gerekiyor
- Uygun API müşterileri için Zero Data Retention destekleniyor
API fiyatlandırması:
| Kalem | Fiyat |
|---|---|
| Input | 1M token başına $10 |
| Output | 1M token başına $50 |
| Fast mode | Standart hızın 2 katı, standart fiyatın 2 katı |
| Model adı | gpt-6-astra |
Rakiplerle karşılaştırma
OpenAI’ın yayınladığı tablolarda Astra her kategoride önde değil. Kendi duyurularında bunu göstermeleri not edilmeye değer. Öne çıkan yerler:
| Benchmark | GPT-6 Astra | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 65,7 | 62,1 | 63,1 |
| Humanity’s Last Exam (tool’larla) | 57,2% | 65,0% | 63,8% | 63,6% |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 67,2 | 68,1 | 61,2 |
| FrontierCode 1.1 Extended | 64,5% | 63,6% | 64,9% | 63,6% |
| Terminal-Bench 4.0 | 57,9% | 55,8% | 42,0% | 52,3% |
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% | 87,8% | 73,2% |
| Terminal-Bench Science 0.1 | 64,6% | 52,6% | 21,4% | 30,0% |
| ExploitBench | 100,0% | 70% | – | – |
| SRE-Bench | 88,0% | 12,5% | – | – |
Tablo şunu söylüyor: Astra bilim, matematik, terminal görevleri ve özellikle siber güvenlikte belirgin biçimde önde. Genel zeka indeksinde ve tool destekli Humanity’s Last Exam’de Claude Fable 5.1 önde. Kodlama agent indeksinde farklar dar.
SRE-Bench’teki %88 ve %12,5 farkı en uçtaki ayrışma. Binary tersine mühendislik, modeller arasında en eşitsiz dağılan kabiliyet gibi görünüyor.
Bu duyuruda iki ayrı hikâye var ve karıştırılmamalı.
Birincisi ürün hikâyesi: daha hızlı computer use, şablona uyan çıktılar, Codex’te context pencereleri arası not tutma, belirsizlikte daha iyi soru sorma. Bunlar günlük kullanan için somut iyileşmeler.
İkincisi risk hikâyesi ve daha ağır basıyor. OpenAI kendi çerçevesinde siber güvenlik için Critical eşiğinin karşılandığını söylüyor, modelin bir değerlendirme sırasında iki gerçek zero-day bulup kullandığını açıklıyor, sertleştirilmiş tarayıcı ve işletim sistemlerinde exploit üretebildiğini kabul ediyor. Bunlar şirketin kendi beyanları ve hepsi “production korumaları olmadan” kaydıyla geliyor.
Hizalama tarafındaki rakamlar iyi görünüyor ama tamamı OpenAI’ın kendi kurduğu değerlendirmeler. Bağımsız üçüncü taraf doğrulaması duyuruda yok. Buna karşılık şirket, izlenebilirliğin düştüğü gibi kendi aleyhine bir bulguyu da yayınlıyor; bu, tablonun tamamen pazarlama olmadığına dair bir işaret.
Kullanmayı planlayan ekipler için pratik iki not. Enterprise’da erişim varsayılan kapalı, yani bir karar vermeniz gerekiyor. Ve API tarafında misalignment izleme görevleri durdurabiliyor; otomasyon kuruyorsanız bunu baştan hesaba katın.
