3. Party Haberler

GPT-6 Sol ve GPT-6 Luna duyuruldu: API fiyatları yarıya indi

GPT-6 Sol ve Luna API fiyat karşılaştırması

OpenAI, GPT-6 ailesini Sol ve Luna ile genişletti. İki modelin API fiyatı GPT-5.6 promosyon fiyatlarına göre yarıya indi. AutomationBench, FrontierCode, DeepSWE ve OSWorld’de skor-maliyet karşılaştırmaları, caching iyileştirmeleri ve erişim ayrıntıları.

OpenAI, bu ay başında duyurduğu GPT-6 Astra‘nın ardından aileyi iki modelle genişletti: GPT-6 Sol ve GPT-6 Luna. Şirketin çerçevesi şu: en zorlu ve önemli projeler hâlâ Astra’nın tam derinliğini gerektiriyor, ama iş farklı ölçeklerde, ritimlerde ve bütçelerde yapılıyor.

İki model de Astra ile benzer yöntemlerle eğitilmiş. Duyurunun ana iddiası zeka sıçraması değil, maliyet verimliliğinde sınırı ileri taşımak. Astra’yı daha önce ayrıntılı ele almıştık: GPT-6 Astra duyuruldu.

GPT-6 Sol ve Luna API fiyat karşılaştırması

Fiyatlar yarıya indi

OpenAI, caching ve çıkarım tarafındaki iyileştirmelerin modelleri daha ucuza sunmayı mümkün kıldığını ve bu tasarrufu doğrudan kullanıcılara yansıttığını söylüyor. Sol ve Luna için API fiyatları, GPT-5.6 promosyon fiyatlarına göre yüzde 50 düşürüldü.

ModelGirdiÇıktıDeğişim
GPT-5.6 Sol → GPT-6 Sol$4 → $2$20 → $10yüzde 50 ucuz
GPT-5.6 Luna → GPT-6 Luna$0,20 → $0,10$1,20 → $0,50yüzde 50 ucuz
1 milyon token başına fiyatlar

GPT-6 Astra ise her alanda şirketin en iyi modeli olmaya devam ediyor. OpenAI, en iyi sonucu ve ödün vermeyen bir deneyimi istediğinizde onu seçmenizi öneriyor.

Grafik notu: Aşağıdaki karşılaştırma grafikleri, OpenAI’in duyurusunda yayınlanan etkileşimli grafiklerdeki veri noktalarından üretilmiştir. Değerler grafikten okunduğu için yaklaşıktır; kesin rakamlar için kaynak duyuruya bakın.

Profesyonel iş: AutomationBench

Uygulamalar arası iş akışlarını test eden AutomationBench‘te OpenAI’in öne çıkardığı sonuç şu: GPT-6 Sol, xhigh efor ayarında, maksimum efordaki Claude Opus 5’i görev başına maliyetin sadece yüzde 9’uyla geçiyor. GPT-6 Luna ise high eforda selefini 5,4 puan geçerken görev başına maliyeti yüzde 58 daha düşük.

AutomationBench skor ve maliyet karşılaştırması
AutomationBench: skor ve görev başına maliyet. Her seri farklı efor seviyelerini gösteriyor
Model (efor)SkorGörev başına maliyet
GPT-6 Sol (xhigh)33,2$0,27
GPT-6 Astra (low)30,3GPT-6 Sol’un 3,9 katı
Claude Opus 5 (max)26,9GPT-6 Sol’un 11,1 katı
Claude Fable 5.1 + Opus 5 fallback (max)31,4GPT-6 Sol’un 8,9 katından fazla
Skorlar yüzde. Fable 5.1 satırındaki maliyet, görevlerin yaklaşık yüzde 40’ında devreye giren Opus 5 fallback maliyetini içermiyor

Son satırdaki dipnot önemli ve OpenAI bunu kendisi belirtiyor: Claude Fable 5.1’in maliyet verisi, görevlerin yaklaşık yüzde 40’ında devreye giren Opus 5 fallback’lerinin maliyetini içermediği için gerçek maliyeti olduğundan düşük gösteriyor. Yani o karşılaştırmadaki fark pratikte daha da büyük, ama ne kadar olduğu raporlanmamış.

Agents’ Last Exam‘de ise GPT-6 Sol maksimum eforda 56,4 puan alıyor; Claude Opus 5’in aynı değerlendirmedeki en yüksek skorunun üzerinde ve görev başına maliyeti yüzde 60 daha düşük.

Olgusal doğruluk

OpenAI’in iç olgusal doğruluk değerlendirmesi, kullanıcıların önceki modellerde hata bildirdiği, kimliksizleştirilmiş gerçek konuşmalara dayanıyor. Sonuç: GPT-6 Sol, selefinin yaklaşık yarısı kadar hata yapıyor ve çok daha düşük maliyetle Astra seviyesindeki güvenilirliğe yaklaşıyor. Luna da belirgin şekilde iyileşiyor; yüksek efor seviyelerinde GPT-5.6 Sol ile eşleşiyor, maliyeti ise onun yaklaşık yüzde biri.

Olgusal hata oranı karşılaştırması
Zor sorularda olgusal hata oranı. Düşük olan daha iyi

OpenAI’in bu değerlendirme için koyduğu şerh de önemli: bu hata üreten konuşmalar tipik kullanımı temsil etmiyor, gerçek kullanımda olgusal hatalar daha nadir.

Kodlama

Duyuruda kodlama bölümü, maliyetin neden bu kadar öne çıktığını açıklayan bir veriyle başlıyor. OpenAI’in kendi iç kullanımı üssel olarak büyümüş: API fiyatlarıyla değerlendirildiğinde günlük token kullanımı medyan araştırmacı için 600 doları, 90. yüzdelikteki araştırmacılar için 7.000 doları aşmış.

Kodlama agent’ları daha uzun ve zorlu görevleri üstlendikçe sürekli kullanımın maliyeti daha çok önem kazanıyor. OpenAI’in argümanı bu: daha düşük fiyat, geliştiricilere yineleme için daha fazla alan veriyor.

FrontierCode skor ve maliyet karşılaştırması
FrontierCode: kod üretiminde skor ve maliyet

FrontierCode, bir kodlama agent’ının ürettiği değişikliklerin gerçek kod tabanlarına merge edilmeye hazır olup olmadığını değerlendiriyor. GPT-6 Sol burada GPT-5.6 Sol’un belirgin şekilde üzerine çıkıyor ve Claude Fable 5.1’in xhigh skoruna çok daha düşük maliyetle ulaşabiliyor.

DeepSWE skor ve maliyet karşılaştırması
DeepSWE: yazılım mühendisliği görevlerinde skor ve maliyet

DeepSWE v1.1‘de GPT-6 Sol maksimum eforda 68,8 puan alıyor. Bu, Claude Fable 5’in aynı değerlendirmedeki en yüksek skorunun (xhigh eforda 69,9) 1,1 puan altında, ama görev başına maliyeti yaklaşık yüzde 80 daha düşük.

GPT-6 Luna ise maksimum eforda 66,6 puan alıyor; bu, orta efordaki Claude Opus 5 ve Fable 5 ile karşılaştırılabilir bir sonuç. Bu karşılaştırmalarda Luna’nın görev başına maliyeti Opus 5’ten yüzde 93, Fable 5’ten yüzde 96 daha düşük.

Anthropic’in aynı dönemde yaptığı maliyet vurgusuyla karşılaştırmak için: Claude Opus 5.5 duyurusu. İki şirket de bu turda zekâdan çok maliyeti konuşuyor.

Computer use

GPT-6 Astra computer use’da dünyanın en iyi modeli olmaya devam ediyor, ama Sol ve Luna seleflerine göre daha maliyet verimli. OSWorld 2.0 offline setinde GPT-6 Sol xhigh eforda 60,5 puan alıyor; orta efordaki Claude Opus 5’in 60,3 puanına benzer bir sonuç, görev başına maliyeti ise yaklaşık yüzde 80 daha düşük. GPT-6 Luna (max) ise GPT-5.6 Sol’un (medium) skorunu onun onda biri maliyetle geçebiliyor.

İletişim tarzı

Astra’nın geliştirilmiş iletişim tarzı Sol ve Luna’ya da taşınmış. OpenAI’e göre bu özellikle teknik ve kodlama konuşmalarında fark edilecek:

  • Daha fazla netlik
  • Daha az jargon
  • Daha az tuhaf ifade
  • Daha az değersiz ayrıntı
  • Genel olarak biraz daha kısa cevaplar, öz kaybedilmeden

Duyuruda bir örnek karşılaştırma da var. OpenAI kendi tercihini açıklarken gerekçelerini sıralıyor: yeni model sonuca daha hızlı atlamıyor, soranın zaten bildiği ayrıntıları tekrar etmiyor, muğlak ifadelerden kaçınıyor, neyi kontrol edip neyi etmediğini daha açık söylüyor.

Caching iyileştirmeleri

Token fiyatlarının yanında, uygulamaların tekrar kullandığı bağlam için de tasarruf var. GPT-6’da prompt caching varsayılan olarak daha yüksek cache isabet oranı verecek şekilde iyileştirilmiş; cache’ten okunan girdi token’larında yüzde 90 indirim geçerli.

Geliştiriciler için üç yeni imkân sayılıyor:

  • İzleme ve teşhis: Prompt Caching Dashboard girdinin ne kadarının cache’lendiğini ve bunun zaman içinde nasıl değiştiğini gösteriyor. Teşhis aracı kaçırılan caching fırsatlarını ve nedenini açıklıyor.
  • Cache bozmadan ayar değiştirme: Zor görevler için reasoning effort’u artırmak veya basit takip soruları için düşürmek, ayrıca tool’ları açıp kapatmak artık önceki bağlamın cache’te kalmasını bozmuyor.
  • Hangi ön eklerin cache’leneceğini seçme: Açık breakpoint’ler, cache’lenen prompt ön eklerinin nerede biteceğini belirlemeye izin veriyor.

GitHub’ın bildirdiğine göre bu iyileştirmeler son birkaç ayda, OpenAI modellerine yapılan milyarlarca istek genelinde yeniden işlenmesi gereken prompt token’larının payını yüzde 50’den fazla azaltmış ve Copilot’un daha hızlı yanıt vermesine yardımcı olmuş.

Hizalama

Sol ve Luna, Astra ile tanıtılan hizalama çalışmasının üzerine kuruluyor. OpenAI’in hizalama değerlendirmelerinde her iki model de GPT-5.6 muadillerine göre iyileşme gösteriyor; bunlara kodlama işleri hakkında yanıltıcı iddialarda bulunma oranının düşmesi de dahil.

Şirketin kendi koyduğu şerh burada da var: bu değerlendirmeler bilinçli olarak zorlu durumları test ediyor ve tipik kullanımdaki başarısızlık oranlarını ölçmüyor.

Erişim

GPT-6 Sol ve GPT-6 Luna, bugünden itibaren ChatGPT Work ve Codex‘te tüm Plus, Pro, Business, Enterprise ve Edu kullanıcıları için kullanılabilir. Free ve Go kullanıcıları masaüstü uygulamasından GPT-6 Luna’ya erişebiliyor. Modeller henüz Chat’te yok.

API tarafında model adları:

gpt-6-sol
gpt-6-luna

OpenAI, servisi herkes için stabil tutmak adına ChatGPT’de dağıtımı gün boyunca kademeli yapacağını belirtiyor. Copilot tarafındaki model eklemelerini de takip ediyoruz: GPT-6 Astra GitHub Copilot’ta.


Bu duyuru, geçen haftaki Claude Opus 5.5 duyurusuyla aynı hikâyeyi anlatıyor: rekabet artık en yüksek skorda değil, aynı skoru kaç dolara verdiğinizde. Grafiklerin hepsinin skor-maliyet ekseninde çizilmiş olması bunun en açık göstergesi.

Karşılaştırma verilerini okurken iki şeyi akılda tutmak gerekiyor. Birincisi, rakip model skorları kamuya açık raporlardan alınmış ve Fable 5.1 verisi bulunamadığında Fable 5 skorları kullanılmış. İkincisi, OpenAI’in kendi dipnotu: Fable 5.1’in maliyeti, görevlerin yüzde 40’ında devreye giren fallback maliyeti dahil edilmediği için eksik gösteriliyor. Bu tür dipnotlar genelde başlıklara yansımıyor.

Pratik çıkarım, kendi iş yükünüzü ölçmekten geçiyor. Sol ve Luna’nın vaadi daha iyi cevap değil, aynı cevabın daha ucuza alınması. Bunu test etmenin yolu benchmark tablosu okumak değil, mevcut agent iş akışınızı iki modelde çalıştırıp harcanan token ve tamamlanan görev sayısını karşılaştırmak. Caching iyileştirmeleri de faturayı doğrudan etkilediği için, ölçümü cache isabet oranınızla birlikte yapmakta fayda var.

Kaynak: https://openai.com/index/introducing-gpt-6-sol-and-luna/

Yazar Hakkında

Kerem Şuğle

Solution Architect, VMware vExpert ve Microsoft sertifikalı altyapı uzmanı. VMware vSphere/vSAN/VCF, Azure, AWS, Google Cloud, enterprise sanallaştırma ve yapay zeka konularında 15+ yıl deneyim. AI/cloud dönüşümü, sovereign cloud, enterprise güvenlik ve modern altyapı mimarisi alanlarında yazıyor.

Leave a Comment