Microsoft, Foundry’deki Anthropic model portföyünü Claude Fable 5.1 ve Claude Mythos 5.1 ile genişletti. Duyuru 1 Eylül 2026’da Microsoft Foundry Blog’da yayınlandı.
Öne çıkan iddia, geleneksel akıl yürütme benchmark’larındaki iyileşmeler değil. Microsoft’un vurguladığı şey modelin daha uzun ve karmaşık iş akışlarında performansını sürdürebilmesi: çok adımlı görevleri planlamak, tool kullanmak, koşullar değiştikçe uyum sağlamak ve işi sonuna kadar taşımak.

Fable 5.1 ve Mythos 5.1 aynı model
Duyurunun en net teknik bilgisi bu ve genelde gözden kaçıyor. İki model aynı temel modelin iki farklı sunumu:
- Claude Fable 5.1 — public preview sürümü. Siber güvenlik ve biyoloji kabiliyeti gerektiren sorgularda korumalar devreye girip fallback yapıyor.
- Claude Mythos 5.1 — Anthropic’in siber güvenlik ve biyoloji araştırması için en yetenekli modeli. Claude Mythos 5’te olduğu gibi tam siber ve biyo kabiliyetlerini koruyor, erişimi sınırlı.
Yani ikisi arasındaki fark yetenek değil, hangi soruların yanıtlanacağı. Aynı ağırlıklar, farklı koruma yapılandırması ve farklı erişim politikası. Güvenlik araştırması yapan bir ekip Fable 5.1’de duvara toslarsa, bunun sebebi modelin bilmemesi değil, o sürümün cevaplamamayı seçmesi.
Tek prompt’un ötesindeki işler için
Microsoft’un çerçevesi şu: kurumsal iş yüklerinin çoğu tek bir etkileşimde tamamlanamıyor.
- Bir yazılım mühendisliği görevi onlarca uygulamaya yayılabilir
- Bir performans incelemesi birden fazla analiz ve test turu gerektirebilir
- Bir agent uygulamalar arasında gezinmek, bir backlog’u işlemek, tool’ları koordine etmek, yeni bilgiye tepki vermek ve uzun süre çalışmaya devam etmek zorunda kalabilir
Bu senaryolar için tek bir andaki güçlü akıl yürütme yetmiyor. Bağlamı koruyabilen, birden fazla adım boyunca karar verebilen, bir yaklaşım başarısız olduğunda toparlanabilen ve hedefe doğru ilerlemeyi sürdüren bir model gerekiyor.
Geliştiriciler açısından bu, AI’a devredilebilecek mühendislik görevlerinin genişlemesi demek: kod üretimi ve debug’ın ötesinde daha büyük özellikler, kod tabanı seviyesinde değişiklikler, code review ve performans optimizasyonu.
Agentic uygulamalar açısından ise tarayıcı, tool, kurumsal sistem ve uzun süre çalışan managed agent içeren iş akışlarında daha yüksek güvenilirlik.
Asıl önemli kısım: tıkandığında ne yapıyor?
Duyurunun en somut ve en değerli bölümü burası. Benchmark skorları bir modelin production’a hazır olup olmadığını tek başına belirlemiyor. Aynı derecede önemli olan, iş planlandığı gibi gitmediğinde modelin nasıl davrandığı.
Microsoft’a göre Fable 5.1 şunlarda daha iyi:
- Tıkandığını fark etmek
- Tamamlanmamış işi bildirmek
- Problemi gerçekten çözmeden başarı görüntüsü yaratan kestirmelerden kaçınmak
Verilen iki örnek fazlasıyla tanıdık:
- Yazılım mühendisliğinde bir model, başarısız olan bir testi testi devre dışı bırakarak çözmemeli
- Analitik bir iş akışında verideki boşlukları desteklenmeyen varsayımlarla doldurup sonucu tamamlanmış gibi sunmamalı
Bu davranışlar, agent kullanan herkesin en az bir kez yaşadığı türden. Microsoft’un ifadesiyle Fable 5.1, belirsiz görevlerde daha iyi muhakeme ve daha az kendinden emin yanlış cevap gösteriyor. Tıkanırsa başarı raporlamak yerine söylüyor.
Bu iddiaların duyuruda sayısal karşılığı verilmiyor. Ne kadar daha az kestirme, hangi değerlendirmede ölçüldü, önceki sürümle farkı ne kadar; hiçbiri yok. Kendi iş yükünüzde ölçmeden bunu bir garanti olarak almayın.
Bilgi işinde analizden çıktıya
Fable 5.1’in hedefi yazılım geliştirmenin ötesine geçiyor. Kurumsal bilgi işi nadiren tek soru ve tek cevaptan ibaret. Tipik bir iş akışı şöyle ilerliyor: bir konuyu araştırmak, bilgiyi analiz etmek, hesaplama yapmak, bir çıktı üretmek, sonucu gözden geçirmek ve belirli bir kitleye göre rafine etmek.
Microsoft’un verdiği örnek: model bir iş problemini araştırabilir, destekleyici bilgiyi analiz edebilir, spreadsheet’lerle çalışabilir, bir öneri geliştirebilir ve sonuçları bir memo veya sunuma dönüştürebilir; bu arada kendi işini kontrol ederek.
Bunun özellikle anlamlı olduğu alanlar: finans, muhasebe, sağlık ve profesyonel hizmetler. Buralarda AI’ın değeri giderek içerik üretmekten değil iş akışını tamamlamaktan geliyor.
Araştırma kurumları için de literatür taraması, hipotez üretimi, deney tasarımı, sonuç yorumlama ve formal verification araçları kullanan uzun soluklu teorik çalışmalar sayılıyor.
Microsoft’un çerçeve önerisi net: “AI bu iş akışının neresinde yardımcı olabilir” sorusundan, “hangi iş akışlarını baştan sona daha eksiksiz yürütebilir” sorusuna geçmek.
Foundry tarafı
Yetenekli bir modele erişim, production AI sistemi kurmanın yalnızca bir parçası. Kurumların ayrıca şunlara ihtiyacı var: modelleri kendi verileri ve iş yükleriyle değerlendirmek, tool’lara ve kurumsal bilgiye bağlamak, agent kurup orkestre etmek, sistemin production’da nasıl davrandığını gözlemlemek ve işin gerektirdiği güvenlik ile governance kontrollerini uygulamak.
Microsoft’un argümanı, Foundry’nin bunları tek platformda toplaması. Geliştiriciler Fable 5.1’i diğer modellerle yan yana değerlendirebiliyor, her iş yükü için doğru modeli seçebiliyor ve bu sistemleri gereksinimler değiştikçe işletebiliyor.
Vurgulanan hedef “her senaryo için tek model seçmek” değil, tutarlı operasyonel kontrolleri korurken her iş yüküne doğru zekayı uygulayabilen uyarlanabilir bir sistem kurmak. Foundry’deki Claude yeteneklerini daha önce ele almıştık: Tek çağrıdan ajanlara: Claude için Foundry’de beş yeni yetenek ve Claude Foundry’de generally available.
Fable 5’ten geçiş: prompt’larınızı sadeleştirin
Bu bölüm, mevcut kullanıcılar için duyurunun en pratik kısmı. Claude Fable 5 kullanan ekipler için mevcut prompt’lar genelde olduğu gibi taşınabiliyor. Ancak Microsoft, geçişi eski model davranışını telafi etmek için yazılmış prompt’ları gözden geçirme fırsatı olarak görüyor.
Artık gerekmeyebilecek şeyler:
- Tahmin yürütmemesi için tekrarlanan uyarılar
- Birden fazla katmanlı kendi kendini doğrulama talimatları
- Aşırı kuralcı tamamlanma kriterleri
Microsoft’un uyarısı doğrudan: aşırı scaffolding, daha yetenekli bir modelin etkinliğini sınırlayabilir.
Bu, prompt biriktiren ekipler için önemli bir nokta. Zamanla eklenen her “sakın uydurma”, “önce doğrula”, “şu formatta bitir” talimatı, o günkü modelin bir zaafına verilmiş cevaptı. Model değişince bu talimatlar faydalı olmaktan çıkıp kısıtlayıcı hale gelebiliyor. Ama kimse geri dönüp silmiyor.
Önerilen yaklaşım: her talimatı olduğu gibi taşımak yerine Fable 5.1’i temsili production iş yüklerinizle değerlendirin. Kalite, güvenilirlik, gecikme ve mevcut doğrulama mekanizmalarınızın etkinliğini karşılaştırın, kanıt destekliyorsa sadeleştirin.
Enterprise Frontier Safeguards
Anthropic ayrıca Enterprise Frontier Safeguards‘ı duyurdu. Bu çözüm, müşterilere en yetenekli Anthropic modellerini güvenli biçimde deploy ederken verilerini kendi kontrol ettikleri bulut altyapısında saklama seçeneği veriyor.

Duyuruda bundan fazla ayrıntı yok. Hangi modelleri kapsadığı, hangi bulut yapılandırmalarının desteklendiği ve nasıl fiyatlandırıldığı belirtilmemiş. Veri ikametgahı kısıtı olan kurumlar için ilgi çekici bir başlık, ama şu an sadece bir başlık.
Nasıl başlanır?
Claude Fable 5.1 bugün itibarıyla Microsoft Foundry model kataloğunda. Microsoft’un değerlendirme önerisi basit prompt karşılaştırmasının ötesine geçmek yönünde. Test edilmesi önerilen işler, tam da sürdürülebilir akıl yürütme gerektirdiği için zor olanlar:
- Tüm kod tabanına yayılan bir özellik
- Tool’lar ve sistemler arasında çalışması gereken bir agent
- Tamamlanması birden fazla adım süren bir analiz
- Modelin yaklaşımını sürekli değerlendirip rafine etmesini gerektiren bir araştırma iş akışı
Bu duyuruda tek bir benchmark sayısı yok. Bir model duyurusu için sıra dışı bir tercih ve iki yönden okunabilir. İyimser okuma: Microsoft, skorların production davranışını öngörmediğini kabul edip doğru soruya odaklanıyor. Temkinli okuma: doğrulanabilir hiçbir iddia ortaya konmamış, geriye kendi ölçümünüzü yapmak kalıyor.
Her iki durumda da pratik sonuç aynı. Fable 5.1’in vaadi tek atışlık kalitede değil, uzun soluklu görevlerde tıkanmayı itiraf etme ve kestirmeye sapmama davranışında. Bunu ölçmenin yolu da benchmark değil, kendi başarısız senaryolarınızı tekrar çalıştırmak: daha önce agent’ınızın testi devre dışı bırakarak “çözdüğü” veya eksik veriyle tamamlanmış rapor ürettiği vakalar.
Geçiş yapacak ekipler için ikinci bir iş var: prompt’lardaki eski savunma katmanlarını temizlemek. Bu genelde ertelenen bir bakım işi, ama Microsoft’un kendi uyarısına göre onları taşımak yeni modelin işine yaramıyor, aksine sınırlıyor.
