Haberler • Security

Gemini 4 Argon: Google’ın yeni frontier modeli

g4-cover

Google, 1 milyon token output limiti olan Gemini 4 Argon’u duyurdu. Model önce siber savunma ekiplerine açılıyor; kodlama ve kurumsal işlerde iddialı.

Google, yeni frontier modeli Gemini 4 Argon’u duyurdu. Model ilk aşamada yalnızca Fairwind Program kapsamındaki güvenilir siber savunma ekiplerine açılıyor. Google’ın hedefi uzun soluklu, çok adımlı iş akışlarında derin reasoning’i sürdürebilen bir model; öne çıkardığı alanlar da gerçek dünya yazılım mühendisliği, hukuk ve finans gibi kurumsal bilgi işleri ve siber savunma.

Google bu kez kademeli bir dağıtım yapıyor. Şirket, ABD hükümetinin gönüllü pre-release model erişim sürecine katıldığını ve erken test kullanıcılarından gelen geri bildirimlerle guardrail’leri geliştirdikten sonra modeli geliştiricilere, kurumlara ve son kullanıcılara açacağını söylüyor.

Argon’un tanıtım fiyatı milyon input token başına 2 dolar, milyon output token başına 10 dolar. Cache’lenmiş input token’larda yüzde 95 indirim var. Tanıtım dönemi bittiğinde fiyat milyon input token için 4 dolar, output için 20 dolar olacak.

Gemini 4 Argon benchmark tablosu. Kaynak: Google
Gemini 4 Argon benchmark tablosu. Kaynak: Google

Google içinde zaten kullanılıyor

Argon, Google’ın kendi iş akışlarında binlerce çalışan tarafından kullanılıyor. Şirketin paylaştığı örnekler oldukça somut:

  • Quantum algoritma optimizasyonu: Kuantum araştırmacıları, kritik uygulamalarda darboğaz yaratan alt rutinlerin spacetime kaynaklarını (qubit × gate) Argon ile optimize ediyor. Bir örnekte model, yayımlanmış baseline’ı dakikalar içinde yüzde 40 geride bıraktı.
  • Bellek verimliliği: Bir grup Argon agent’ı, tüm filodaki profiling telemetrisini analiz edip Google veri merkezlerinde bellek optimizasyonlarını kendi başına buldu ve uyguladı. Dağıtım tamamlandığında 300 TiB’tan fazla bellek boşa çıktı; toplam tasarrufun 500 TiB ile 1 PiB arasında olması bekleniyor.
  • Büyük ölçekli kod taşıma: Argon agent’ları Google genelinde C/C++ kod tabanlarını Rust’a taşıyor. İş, re2 ve libgav1 gibi on binlerce satırlık kütüphanelerden 800 bin satırı aşan Fuchsia Zircon kernel’ine kadar uzanıyor. Bu sistemlerin kritikliği nedeniyle yeniden yazımlar production’a çıkmadan önce otomatik ve manuel denetimden, emülasyon testlerinden geçiyor.

libgav1 örneği özellikle dikkat çekici. Google’ın açık kaynak video decoder’ı için Argon agent’ları mevcut bir Rust port’unu alıp 32 bin satırlık SIMD kodunu kaldırdı. Profile-guided deneyler yapıp derleyici çıktısını inceleyerek, derleyicinin kendiliğinden vektörize edebileceği güvenli Rust kodu yazdılar. Sonuç, Rust port’undan 2,7 kat hızlı çalışan, aynı video çıktısını veren ve optimize C++ sürümüne yaklaşan memory-safe bir decoder.

1 milyon token output limiti

Google, daha uzun ve karmaşık kullanım senaryoları için Argon’un output token limitini 64 binden 1 milyon token’a çıkardı. Model tek bir trajectory içinde yüz binlerce token üretebildiğinde, zor problemleri tek seferde çözmek için çok daha derin düşünebiliyor.

Kodlama ve kurumsal iş akışları

Google mühendisleri Argon’u gündelik debugging’den büyük kod tabanı taşımalarına ve algoritma tasarımına kadar her işte kullanıyor. Model, gerçek dünyadaki uzun soluklu yazılım mühendisliği görevlerini ölçen DeepSWE v1.1’de yüzde 77,9 ile yeni bir state of the art skoru elde etti.

DeepSWE v1.1 sonuçları. Kaynak: Google
DeepSWE v1.1 sonuçları. Kaynak: Google

Kodlamanın ötesinde Argon, Vals Index’te de ilk sırada. Bu endeks finans, kodlama, hukuk ve vergi işlerindeki ekonomik etkiyi ölçüyor ve her sektörü ABD GSYİH’sine katkısına göre ağırlıklandırıyor.

Vals Index sonuçları. Kaynak: Google
Vals Index sonuçları. Kaynak: Google

Alana özel testlerde de tablo benzer. Argon, çok adımlı finansal araştırmayı ölçen Vals Finance Agent v2’de ve hukuki araştırma ile metin hazırlamayı ölçen Harvey’s Legal Agent Benchmark’ta önde.

Vals Finance Agent v2 sonuçları. Kaynak: Google
Vals Finance Agent v2 sonuçları. Kaynak: Google
Harvey's Legal Agent Benchmark sonuçları. Kaynak: Google
Harvey’s Legal Agent Benchmark sonuçları. Kaynak: Google

Zapier’in temel iş fonksiyonlarında uçtan uca yürütmeyi ölçen AutomationBench’inde de Argon yüzde 51,3 ile birinci.

AutomationBench sonuçları. Kaynak: Google
AutomationBench sonuçları. Kaynak: Google

Görsel anlama gerektiren bilgi işlerinde de model güçlü. Profesyonel grafik analizi yapabiliyor, uzun videolardaki detayları yakalayabiliyor ve bir dizi dokümana dayanarak aksiyon alabiliyor. Uzun video anlamayı ölçen LVBench’te yüzde 91,7 ile state of the art skoruna sahip.

Siber savunmada öne çıkıyor

Google, Argon’u siber savunmada yüksek kapasiteli olacak şekilde eğittiğini söylüyor. Model kritik yazılım açıklarını kendi başına bulabiliyor, doğrulayabiliyor ve yamalayabiliyor. Güvenilir savunma ekipleri ve Google’ın kendi iç ekipleri için Argon, siber guardrail’ler olmadan sunulacak. Böylece bu ekipler modelin siber savunma kabiliyetlerinin tamamını kullanabilecek.

Wiz, Argon’u kritik kamu altyapısını ücretsiz korumayı amaçlayan Scan for Good girişiminde kullanmaya başladı. İlk denemelerde model, dünya genelinde hastanelerin kullandığı bir sağlık yazılımında hassas kişisel verileri açığa çıkaran kritik bir zafiyet buldu. Önceki frontier modeller bu riski kaçırmıştı.

Güvenlik açıklarını düzeltme becerisini ölçen CWE-bench v1’de Argon, yüzde 68 ile birinciliği paylaşıyor. Bu sonuç, 3.8 Flash Cyber’ın CWE-bench v0’daki performansının üzerine kuruluyor.

CWE-bench v1 sonuçları. Kaynak: Google
CWE-bench v1 sonuçları. Kaynak: Google

Zafiyet keşfinde de 3.8 Flash Cyber’a göre ciddi bir sıçrama var. Google’ın iç zafiyet benchmark’ında Argon, 20 programlama dilini kapsayan karmaşık kod tabanlarında geniş bir yelpazede açık buldu. Kaynak kodu olmadan canlı web sistemlerini analiz etme becerisini ölçen Wiz’in iç black-box penetrasyon testi benchmark’ında da saldırı yüzeyini keşfetme, zafiyet tespit etme ve bunları doğrulayan proof-of-concept üretme konusunda 3.8 Flash Cyber’ı geride bıraktı.

Zafiyet keşfi sonuçları. Kaynak: Google
Zafiyet keşfi sonuçları. Kaynak: Google

Geniş kullanıma açılmadan önce güvenlik önlemleri

Google, Argon’u herkese açmadan önce dört alanda önlemleri güçlendirdiğini söylüyor.

İlki kötüye kullanıma karşı savunma. Model, Frontier Safety Framework doğrultusunda siber saldırılara ya da kimyasal, biyolojik, radyolojik ve nükleer (CBRN) saldırılara yönelik zararlı istekleri reddedecek, ama meşru dual-use bilimsel araştırmaya engel olmayacak şekilde tasarlandı. Google ayrıca kötüye kullanımı yakalamak için modelin iç aktivasyonlarını izleyen tekniklerini geliştirdi. Bu önlemler iç ve dış red team’ler tarafından manuel ve otomatik saldırılarla test edildi.

İkincisi prompt injection’a karşı dayanıklılık. Google, Argon’un dolaylı prompt injection saldırılarına karşı şimdiye kadarki en dirençli modeli olduğunu söylüyor. Otomatik red teaming ve adversarial training sayesinde model, Gray Swan’ın Indirect Prompt Injection (IPI) benchmark’ında önde.

Gray Swan Indirect Prompt Injection benchmark sonuçları. Kaynak: Google
Gray Swan Indirect Prompt Injection benchmark sonuçları. Kaynak: Google

Üçüncüsü misalignment izleme. Argon’un bir görevi kullanıcının niyetinin ötesine geçecek şekilde tamamlamaya çalışmasını önlemek için Google, modelin chain-of-thought’unu ve aksiyonlarını izleyen, gerektiğinde çalışmayı durduran önlemler devreye alıyor. Benzer bir sistem eğitim sürecinde de kullanılmış ve bulgular bir incident response ekibine iletilmiş. Google, bu bulguları eğitime geri beslememeye özellikle dikkat ettiğini söylüyor; aksi hâlde model, izlemeden kaçacak şekilde düşünmeyi öğrenebilirdi. Şirket sektörün geri kalanını da reasoning şeffaflığını korumaya çağırıyor.

Dördüncüsü sistemlerin sıkılaştırılması. Google, agent control yol haritası doğrultusunda yüksek riskli eğitim ya da değerlendirme başlamadan önce sandbox ortamlarını izole edip mühürlüyor ve bu agent güvenliği pratiklerini partnerleriyle paylaşacağını belirtiyor.

Ne zaman erişilebilir olacak

Argon şu an siber savunma ekiplerinden ve güvenilir test kullanıcılarından oluşan ilk grupta. Google, bu gruptan gelen geri bildirimlerle sistemi güçlendirdikten sonra modeli önce ücretli API müşterilerine ve Google AI Ultra abonelerine, ardından daha geniş kitleye açacak.


Argon’un en ilginç yanı benchmark’lardan çok dağıtım şekli. Google ilk kez bir frontier modeli siber savunma ekiplerine guardrail’siz verip genel kullanıcıyı sonraya bırakıyor. 1 milyon token’lık output limiti de uzun agent görevleri için gerçek bir fark yaratabilir, ama o boyutta bir çıktının 10 dolarlık output fiyatıyla faturaya nasıl yansıyacağını hesaba katmak gerekiyor. Libgav1 ve bellek optimizasyonu gibi iç örnekler etkileyici; bunların dış müşterilerde ne kadar tekrarlanabildiğini erişim genişlediğinde göreceğiz.

Kaynak: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

Yazar Hakkında

Kerem Şuğle

Solution Architect, VMware vExpert ve Microsoft sertifikalı altyapı uzmanı. VMware vSphere/vSAN/VCF, Azure, AWS, Google Cloud, enterprise sanallaştırma ve yapay zeka konularında 15+ yıl deneyim. AI/cloud dönüşümü, sovereign cloud, enterprise güvenlik ve modern altyapı mimarisi alanlarında yazıyor.

Leave a Comment