DeepSeek V4.1-Flash: 552 milyar parametre, 1M bağlam

DeepSeek, 552B MoE’li V4.1-Flash’ı duyurdu: 1 milyon token bağlam, asimetrik mimari ve dörtte bir KV önbellek.

DeepSeek V4.1-Flash: 552 milyar parametre, 1M bağlam

Çin merkezli yapay zekâ şirketi DeepSeek, 10 Eylül 2026’da DeepSeek-V4.1-Flash modelini duyurdu. Yeni sürüm, 552 milyar parametreli bir Mixture-of-Experts (MoE) mimarisi, yerli çoklu modal görsel anlama ve bir milyon tokena uzanan bağlam penceresiyle öne çıkıyor. Şirket, modeli özellikle daha hızlı çıkarım, daha yüksek verim ve ajan tipi uzun görevler için konumlandırıyor.

Neden önemli?

Uzun bağlamlı modellerde asıl maliyet çoğu zaman ham parametre sayısından değil, konuşma boyunca tutulan KV önbelleğinden geliyor. DeepSeek, V4.1-Flash’ta bu önbelleğin HBM ihtiyacını önceki nesle göre dörtte bire, SSD tarafındaki kalıcı depolama ihtiyacını ise sekizde bire indirdiğini söylüyor. Önbellek isabet ücretlerinin ajan maliyetlerinde büyük pay tuttuğunu belirten şirket, sıkıştırmanın özellikle uzun oturumlu iş yüklerinde faturaları düşürebileceğini vurguluyor.

Asimetrik mimari: az aktif parametre, geniş bağlam

Resmî duyuruya göre V4.1-Flash, Causal Encoder–Decoder adı verilen asimetrik bir yapı kullanıyor. Giriş tarafında yaklaşık 8 milyar, çıkış tarafında yaklaşık 16 milyar aktif parametre çalışıyor. Toplam omurga 552 milyar parametre olsa da her token için tüm model ateşlenmiyor; bu da aynı donanımda daha yüksek eşzamanlılık vaat ediyor.

ShiftDelete’in aktardığı teknik özetlerde Compressed Sparse Attention 2, FP4 formatı ve SWA Bounded Replay gibi bellek odaklı yaklaşımlar da geçiyor. Bu yöntemler, tüm ara durumları sürekli bellekte tutmak yerine gerektiğinde küçük parçaları yeniden hesaplayarak yükü azaltmayı hedefliyor. Aynı kaynak, 4 bin tokenden 1 milyon tokene çıkıldığında işlem gücü ihtiyacının yalnızca yüzde 25 civarı arttığını belirtiyor.

  • 552 milyar parametreli MoE omurga
  • Girişte ~8B, çıkışta ~16B aktif parametre
  • 1 milyon token bağlam penceresi
  • KV önbellekte önceki nesle göre 1/4 HBM ve 1/8 SSD ihtiyacı
  • Yerli çoklu modal (metin + görüntü) destek

Performans iddiası ve ürün hattı değişikliği

DeepSeek, yeni ön eğitim yöntemleri ve daha geniş ölçekli pekiştirmeli öğrenme sonrası eğitimin ardından V4.1-Flash’ın kendi amiral gemisi DeepSeek-V4-Pro’yu da geride bırakan ölçümler ürettiğini açıklıyor. Şirket, birden fazla tarafın yaptığı testlerde performans, maliyet, hız ve toplam çalışma süresi açısından V4.1-Flash’ın V4-Pro’nun önüne geçtiğini öne sürüyor.

API tarafında model adı olarak deepseek-flash kullanılıyor. Eski V4-Flash ve V4-Flash-Vision-Exp emekliye ayrıldı; uyumluluk için deepseek-v4-flash ve deepseek-v4-flash-vision-exp isimleri geçici olarak V4.1-Flash’a yönlendiriliyor. 14 Eylül 2026 saat 04:00 UTC’den itibaren deepseek-v4-pro istekleri de V4.1-Flash fiyatıyla yeni modele yönlenecek; bu durum gelecekteki V4.1-Pro çıkışına kadar sürecek.

Fiyatlandırma ve ortaklar

Şirket, daha verimli mimari sayesinde API fiyatlarını düşürdüğünü ve yeni fiyatlandırmanın 10 Eylül 2026 04:00 UTC’de yürürlüğe girdiğini duyurdu. Yoğun / yoğun olmayan saat ayrımı devam ediyor; yoğun olmayan tarifeler, yoğun saatlerin yüzde 50’si düzeyinde. WorkBuddy (CodeBuddy dahil) ve OpenCode gibi resmi ortakların V4.1-Flash’ı tam desteklediği belirtiliyor.

ShiftDelete haberinde modelin yaklaşık 45 trilyon tokenlık bir veri kümesiyle eğitildiği ve akıl yürütme, yazılım geliştirme ile ajan görevlerinde önceki Pro sürümleriyle rekabet edebildiği aktarılıyor. Bazı test senaryolarında rakiplere göre yüzde 5–10 daha iyi sonuçlar bildirildiği de aynı kaynakta yer alıyor; bağımsız doğrulama için resmi ölçüm tabloları ve üçüncü taraf benchmark’ları izlenmeli.

Kullanıcılar ve sektör için anlamı

V4.1-Flash, “daha büyük model = her zaman daha pahalı çıkarım” denklemine karşı asimetrik aktivasyon ve önbellek sıkıştırmasıyla cevap veriyor. Özellikle uzun belge özetleme, kod tabanı gezme, çok adımlı ajan işleri ve görsel + metin birleşik görevlerde maliyet/performans dengesi arayan ekipler için yeni bir seçenek ortaya çıkıyor.

Öte yandan, V4-Pro’nun yönlendirilmesi geliştiricilerin model isimlerini ve fiyat varsayımlarını güncellemesini gerektiriyor. Yoğun saat tarifeleri hâlâ geçerli olduğu için üretim iş yüklerinde zamanlama ve önbellek isabet oranı izlenmeye devam etmeli. DeepSeek ayrıca açık kaynak topluluğuyla çıkarım desteğini genişleteceğini ve büyük ölçekli dağıtımlar için ek seçenekler üzerinde çalıştığını söylüyor.

Kısaca: V4.1-Flash, DeepSeek’in yeni mimari ailesinin en küçük üyesi olarak hem API’de hem de bellek ekonomisinde agresif bir adım. 1 milyon token bağlamı daha ucuza taşıma iddiası tutulursa, ajan tabanlı ürünlerin günlük maliyeti belirgin şekilde değişebilir.

Yazar

Burak

SanalData teknoloji haberleri yazarı.

Yorum yaz