Azure • Haberler • Microsoft

Microsoft-Decision-1: hızlı karar veren AI modeli

d1-cover

Microsoft, routing, sınıflandırma ve agent kontrolü için geliştirdiği Microsoft-Decision-1 modelini duyurdu: 85 ms gecikme, GPT-6 Sol’den 35 kat hızlı, 200 kat ucuz.

Microsoft, hızlı karar puanlama (decision scoring) için geliştirdiği yeni modeli Microsoft-Decision-1’i duyurdu. Model Microsoft Foundry’de ve OpenRouter üzerinden kullanılabiliyor. Hedefi metin üretmek değil; routing, sınıflandırma, önceliklendirme, doğrulama ve iş akışı kontrolü gibi işlerde yazılımın doğrudan kullanabileceği yapılandırılmış kararlar vermek.

Microsoft’un iddiası net: Decision-1, eğitimde kullanılmayan yaklaşık 150 bin soruyu kapsayan 36 benchmark’lık karşılaştırmada en yüksek doğruluğu aldı ve ölçülen en hızlı model oldu. İkinci sıradaki H2O-Lightning-4B v1.1’den 2,5 kat, GPT-6 Sol’den 35 kat daha hızlı.

Decision model nedir?

Decision model’ler AI’da hızla öne çıkan yeni bir kategori. LLM’ler metin üretmek ya da karmaşık problemler üzerinde akıl yürütmek için tasarlanıyor. Decision model’ler ise tek bir iş için var: sabit bir seçenek kümesi içinden karar vermek ve bunu yazılımın hemen işleyebileceği yapılandırılmış bir çıktı olarak döndürmek. Çok düşük maliyetle ve yüksek performansla karar verip sınıflandırma yapabilen bir model olduğunda, bir LLM’e sormanın pahalı ya da yavaş kaldığı pek çok iş mümkün hale geliyor.

Doğruluk, gecikme ve kalibrasyon yan yana: Microsoft-Decision-1 doğrulukta birinci ve ölçülen en hızlı model, kalibrasyonda üçüncü. Kaynak: Microsoft
Doğruluk, gecikme ve kalibrasyon yan yana: Microsoft-Decision-1 doğrulukta birinci ve ölçülen en hızlı model, kalibrasyonda üçüncü. Kaynak: Microsoft

Microsoft-Decision-1 nasıl çalışıyor

Microsoft, modeli Qwen3.5-9B üzerinde hızlı ve tek geçişli (single-pass) karar puanlama için ek eğitimden geçirerek oluşturdu. Şirket yakında modeli Microsoft AI (MAI) ve OpenAI modelleri dahil başka temel modeller üzerine de taşıyacağını söylüyor.

Modele sabit bir cevap seçenekleri kümesi verildiğinde, her seçenek için kalibre edilmiş bir olasılık skoru döndürüyor. Evet/hayır, çoktan seçmeli ve derecelendirme seçeneklerini destekliyor; ayrıca AI yanıtlarının ve agent aksiyonlarının rubric’e göre notlanmasını da yapabiliyor. Hepsi basit, yapılandırılmış tek bir API çağrısıyla.

Microsoft, güvenilir bir decision model kurmak için beş sorunu çözmek zorunda kaldığını anlatıyor.

1. Hız

Her karar gecikme ekliyor, özellikle adımlar birbirine bağlıysa. Art arda gelen 20 kararın her birine sadece 100 milisaniye eklemek, toplam iş akışını iki saniye uzatıyor. Agent’ların her adımda bir şeye karar verdiği sistemlerde bu fark hızla büyüyor.

Decision-1’in medyan (p50) gecikmesi 85 ms, p95 gecikmesi 125 ms. Aynı ölçümde GPT-6 Sol 3,01 saniyede kalıyor; yani Decision-1 yaklaşık 35 kat hızlı. Diğer decision model’ler 210 ile 400 ms arasında.

İstek başına medyan gecikme: Microsoft-Decision-1 85 ms, GPT-6 Sol 3,01 saniye. Kaynak: Microsoft
İstek başına medyan gecikme: Microsoft-Decision-1 85 ms, GPT-6 Sol 3,01 saniye. Kaynak: Microsoft
ModelMedyan gecikme
Microsoft-Decision-185 ms (p95: 125 ms)
H2O-Lightning-4B v1.1210 ms
Jev 1.13.0240 ms
GPT-6 Luna Decisions300 ms
Quyet-1.0-Large380 ms
Surogate Rune 26B-A4B380 ms
deck-31B400 ms
GPT-6 Sol3,01 s

2. Genellenebilen kalite

Bir modeli tek bir benchmark’a ya da tek tip karar görevine göre overfit etmek kolay. Asıl soru, kalitenin modelin eğitilmediği görevlere taşınıp taşınmadığı. Microsoft bu yüzden Decision-1’i eğitimden gizli tutulan onlarca benchmark’ta değerlendirdi: routing, ranking, uzun bağlam, çok dilli ve dağılım dışı (out-of-distribution) görevler, reasoning ve güvenlik.

Ayrıca popüler açık leaderboard JevBench’teki en iyi public modellerden birkaçını alıp 36 ek public ve private benchmark’ta test etti. Toplam 147.137 soruluk bu sette Decision-1 yüzde 83,5 ortalama doğrulukla birinci oldu. İlginç bir detay: JevBench’te 1. sırada olan Quyet-1.0-Large bu geniş sette üçüncülüğe, 3. sıradaki deck-31B ise altıncılığa düşüyor.

36 benchmark ve 147.137 soru üzerinde ortalama doğruluk. Kaynak: Microsoft
36 benchmark ve 147.137 soru üzerinde ortalama doğruluk. Kaynak: Microsoft
ModelOrtalama doğrulukJevBench sırası
Microsoft-Decision-1%83,5–
Jev 1.13.0%82,3–
Quyet-1.0-Large%81,91
Surogate Rune 26B-A4B%79,78
GPT-6 Luna Decisions%79,47
deck-31B%77,83
H2O-Lightning-4B%77,25
Strands-Decider 2B (AWS)%54,8 (36 benchmark’ın 23’ü)–

3. Dayanıklılık

Eşdeğer girdiler eşdeğer kararlar üretmeli. Production’da durumlar ve talimatlar farklı kelimelerle ifade ediliyor, seçenek açıklamaları değişiyor, seçeneklerin sırası karışıyor, key’ler değişiyor ve zararsız format gürültüsü ortaya çıkıyor. Bunların hiçbiri kararı anlamlı şekilde değiştirmemeli.

Microsoft aynı isteği sekiz farklı şekilde bozup kararın ne sıklıkla değiştiğini ölçtü. Decision-1 ortalamada bu bozulmaların yüzde 1,3’ünde karar değiştiriyor. Seçenek açıklamaları başka kelimelerle yazıldığında ya da seçenekler ters çevrildiğinde veya karıştırıldığında ise hiç karar değiştirmiyor.

4. Olasılık ve güven kalibrasyonu

Olasılık değeri sadece bir sıralama skoru değil, API’nin bir parçası. Uygulamalar ne zaman harekete geçeceklerine, ne zaman erteleyeceklerine ya da insan incelemesi isteyeceklerine bu güven değerine bakarak karar veriyor. Dolayısıyla yüzde 90’lık bir tahmin, temsili vakalarda on seferin yaklaşık dokuzunda doğru çıkmalı.

Kalibrasyon, Decision-1’in birinci olmadığı tek başlık. 100’ün mükemmel olduğu ölçekte 92,2 ile üçüncü sırada; Jev 1.13.0’ın (93,7) 1,5 puan, Quyet-1.0-Large’ın (93,1) 0,9 puan gerisinde. Microsoft yazıyı sonradan güncelleyip Jev sonuçlarını eklemiş ve bu tabloyu açıkça gösteriyor.

36 benchmark üzerinde kalibrasyon skoru: Microsoft-Decision-1 92,2 ile üçüncü. Kaynak: Microsoft
36 benchmark üzerinde kalibrasyon skoru: Microsoft-Decision-1 92,2 ile üçüncü. Kaynak: Microsoft

5. Güvenlik

Bir decision model zararlı istekleri tanımalı ama zararsız olanları gereksiz yere engellememeli. Microsoft, Decision-1’i zararlı içerik, jailbreak denemeleri ve prompt injection’ı kapsayan 11 benchmark’ta 5.250 istekle test etti. Şirkete göre model zararlı davranışı reddederken yüksek ölçüde kullanışlı kalmayı başardı. Bu bölümde yazı ayrıntılı rakam vermiyor.

Demo: sınıflandırma

Sınıflandırma, decision model’lerin temel kullanım alanı. Aşağıdaki demoda Decision-1’in farklı sorguları GPT-6 Sol’e kıyasla ne kadar hızlı ve doğru kategorize ettiği görülüyor.

Microsoft-Decision-1 ile GPT-6 Sol’ün sınıflandırma karşılaştırması. Kaynak: Microsoft

Demo: computer use

Decision model’ler computer use senaryolarında da verimli olabiliyor: her adımda ekrandaki seçenekler arasından bir sonraki aksiyonu seçmek tam olarak bir karar problemi. Bu demo, bir sırt çantası satın alma görevinde Decision-1’in GPT-6 Sol’e göre ne kadar hızlı ilerlediğini gösteriyor.

Computer use demosu: sırt çantası satın alma görevinde Microsoft-Decision-1 ve GPT-6 Sol. Kaynak: Microsoft

Microsoft içeride nasıl test ediyor

Microsoft, modeli kendi ekiplerinde dört farklı alanda denemiş.

Veri etiketleme. Xbox Research; anketlerden, Steam’den ve Twitter/X’ten gelen 10 binden fazla açık uçlu geri bildirimi ve yorumu, araştırmacıların belirlediği sabit bir tema kümesine ayırmak için Decision-1’i kullandı. Amaç insanların farklı oyunlar, lansmanlar ve yayınlar hakkında ne söylediğini anlamak. Ekip, modelin kalitede GPT-6 Sol ile rekabet edebildiğini, ama 14 kattan fazla hızlı ve 200 kat ucuz çalıştığını gördü.

Sınıflandırma başına süre: Microsoft-Decision-1 her veri setinde 200 ms'nin altında, GPT-6 Sol 2,6 ile 2,8 saniye arasında. Kaynak: Microsoft
Sınıflandırma başına süre: Microsoft-Decision-1 her veri setinde 200 ms’nin altında, GPT-6 Sol 2,6 ile 2,8 saniye arasında. Kaynak: Microsoft

Üç veri setinde metin başına ortalama süre Decision-1 için 143 ile 188 ms arasında, GPT-6 Sol için 2,6 ile 2,8 saniye arasında. Maliyet farkı daha da büyük: aynı veri setini bir kez sınıflandırmak GPT-6 Sol ile 1 ila 3 dolar tutarken Decision-1 ile yaklaşık bir sent. Microsoft’un tahminine göre bir milyon metne ölçeklendiğinde GPT-6 Sol yaklaşık 2.434 dolar, Decision-1 ise yaklaşık 11 dolar tutuyor.

Veri setini bir kez sınıflandırmanın maliyeti: Microsoft-Decision-1, GPT-6 Sol'den 212 ile 223 kat ucuz. Kaynak: Microsoft
Veri setini bir kez sınıflandırmanın maliyeti: Microsoft-Decision-1, GPT-6 Sol’den 212 ile 223 kat ucuz. Kaynak: Microsoft
Veri setiGPT-6 SolMicrosoft-Decision-1Fark
Racing Title (753 yorum)2,8 s / 1,83 $159 ms / 0,9 sent~18 kat hızlı, ~213 kat ucuz
First-Person Shooter (341 yorum)2,6 s / 1,03 $188 ms / 0,5 sent~14 kat hızlı, ~212 kat ucuz
Studio Livestream (1.030 gönderi)2,6 s / 2,92 $143 ms / 1,3 sent~18 kat hızlı, ~223 kat ucuz

Kalite kontrol. Copilot ekibi sohbet ve agentic yanıtların kalitesini ölçüyor. Testlerinde Decision-1’i GPT-5.6 Luna ile rekabet edebilir ve 100 kat daha hızlı buldular.

Olay müdahalesi. Microsoft’un nöbetçi mühendisleri canlı olaylara müdahale ederken log’lar, ticket sistemleri, görüşmeler, mesajlar ve diğer veri kaynaklarından ilgili bilgiyi AI ile çekiyor. Decision-1, bilgi getirme işinde bir LLM’den hem daha iyi hem daha hızlı sonuç verdi.

Bilimsel keşif. Microsoft Discovery’de bir agent önceki deneyi değerlendiriyor, rubric notlarına göre yaklaşımını gözden geçiriyor ve hedeflerine ulaşana kadar tekrarlıyor (adaptive replanning). Decision-1, LLM tabanlı puanlamaya göre 46 kat daha tutarlı ve üç kat hızlı çıktı; adaptive replanning’de de yaklaşık dört kat hız sağladı. Uzun süren bilimsel deneylerde daha hızlı ve güvenilir planlama, sonuçları ciddi şekilde etkileyebilir.

Microsoft Discovery’de adaptive replanning. Kaynak: Microsoft

Nerelerde kullanılabilir

Microsoft, modelin potansiyel kullanım alanlarını uzun bir liste halinde veriyor:

  • Agent kontrolleri: Agent’ın önerdiği bir sonraki adımı değerlendirip devam etmeye, durmaya, yeniden denemeye ya da bir modele, araca veya insana devretmeye karar vermek.
  • Model routing: Gelen isteği değerlendirip kalite, maliyet ve gecikme gereksinimlerine göre en uygun modeli seçmek.
  • Skill tabanlı kararlar: Uzun bir talimat listesini her seferinde yeniden işlemeden, bir agent skill’inin kurallarını uygulayıp uygun aksiyonu seçmek.
  • Veri etiketleme: Sosyal medya gönderilerine, müşteri geri bildirimlerine ve diğer verilere analiz ya da eğitim için tutarlı etiketler atamak.
  • AI judging: AI’ın ürettiği bir yanıtı tanımlı kalite kriterlerine göre değerlendirip kabul, revize ya da ret kararı vermek.
  • Intent analizi: Kullanıcının ne yapmaya çalıştığını belirleyip desteklenen bir intent ile eşleştirmek.
  • Olay yönlendirme: Bir olayı türüne ve aciliyetine göre sınıflandırıp doğru ekibe ya da iş akışına yönlendirmek.
  • Veri doğrulama: Bir girdinin tanımlı gereksinimleri karşılayıp karşılamadığını kontrol edip kabul, ret ya da inceleme kararı vermek.
  • Öneriler: Aday kümesinden en ilgili ürünü, teklifi ya da sonraki aksiyonu seçmek.
  • Arama alaka düzeyi: Bir arama sonucunun sorguyla ne kadar eşleştiğini değerlendirip alaka etiketi ya da öncelik atamak.
  • İçerik sınıflandırma ve filtreleme: İçeriği konuya ya da policy’ye göre kategorize edip göstermeye, filtrelemeye ya da incelemeye göndermeye karar vermek.
  • Kod tarama: Kodu tanımlı kriterlere göre değerlendirip olası hataları ya da policy ihlallerini işaretlemek.
  • Güvenlik taraması: İstekleri, çıktıları ya da önerilen aksiyonları riske göre sınıflandırıp izin vermek, engellemek ya da üst seviyeye taşımak.
  • Computer ve UI kullanımı: Mevcut ekrana ve göreve göre bir seçenek kümesinden sonraki arayüz aksiyonunu seçmek.
  • Robotik: Gözlemlere, görev hedeflerine ve çalışma kısıtlarına göre önceden tanımlı robot aksiyonları arasından seçim yapmak.
  • Bilimsel keşif: Aday hipotezleri, bileşikleri ya da deneyleri tanımlı kriterlere göre eleyip önceliklendirmek.

Fiyat ve erişim

Fiyatlandırma modelin en dikkat çekici yanlarından biri: input token’lar milyon token başına 0,042 dolar, output token’lar ücretsiz. Model çıktı olarak uzun metin değil olasılık skorları döndürdüğü için maliyetin neredeyse tamamı girdiden geliyor.

Karşılaştırılan modeller

Microsoft’un benchmark’larda kullandığı diğer modeller: Quyet-1.0-Large, Surogate Rune 26B-A4B, GPT-6 Luna Decisions, deck-31B, H2O-Lightning-4B ve Strands-Decider 2B. Sonradan eklenen Jev 1.13.0 ise doğrulukta ikinci, kalibrasyonda birinci sırada.

Bundan sonrası

Microsoft’a göre agentic AI gerçek olduğundan beri maliyet, insanların AI’ı nasıl kullanacağına karar vermesinde büyük rol oynuyor ve doğru iş için doğru modeli seçmek giderek önem kazanıyor. Agent’lar gerçek dünyada aksiyon alırken decision model’ler, onları karmaşık ortamlarda yönlendirmek ve kontrol etmek için kullanılabilir. Şirket, kaliteyi, güveni ve maliyeti iyileştirmek için modeli güncellemeye devam edeceğini söylüyor.


Decision-1’in önemi tek bir benchmark birinciliğinden çok, işaret ettiği mimari değişiklikte. Agent sistemlerinde çağrıların büyük kısmı aslında metin üretimi değil, “devam mı, dur mu”, “hangi model”, “hangi araç” gibi küçük kararlar. Bunları 85 ms’de ve milyon token başına 4 sente veren bir model, her adımda büyük bir LLM çağırmanın maliyetini ve gecikmesini ciddi şekilde düşürebilir. Bazı noktaları da akılda tutmak gerek: benchmark’ları Microsoft kendisi koşturmuş ve bir kısmı private; doğruluk farkı ikinci sıradaki Jev’e göre sadece 1,2 puan; kalibrasyonda model üçüncü; güvenlik bölümünde ise somut rakam yok. Qwen3.5-9B tabanlı olması da açık modellerin bu kategoride ne kadar rekabetçi olduğunu gösteriyor. Kendi sınıflandırma ya da routing iş yükünüz varsa, fiyat bu kadar düşükken kendi verinizle denemek en sağlıklı karşılaştırma olur.

Kaynak: https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

Yazar Hakkında

Kerem Şuğle

Solution Architect, VMware vExpert ve Microsoft sertifikalı altyapı uzmanı. VMware vSphere/vSAN/VCF, Azure, AWS, Google Cloud, enterprise sanallaştırma ve yapay zeka konularında 15+ yıl deneyim. AI/cloud dönüşümü, sovereign cloud, enterprise güvenlik ve modern altyapı mimarisi alanlarında yazıyor.

Leave a Comment