Sekiz büyük dil modelini, yirmi kategoriye dağılmış 600 gerçekçi SIEM alarm senaryosunda yarıştırdık. Her model her senaryoya bir karar verdi; kararları insan tarafından etiketlenmiş ground truth ile karşılaştırdık. Doğruluk, gecikme ve maliyet birlikte ölçüldü — çünkü üçü ayrı ayrı yanıltıcı.
Katı puanlama tam eşleşme arar: TP=TP, FP=FP, CCN=CCN. Esnek puanlamada TP ve CCN birleştirilir — operasyonel olarak ikisi de “kapatma, aksiyon al” yönündedir ve bazı analist iş akışlarında ayrım önemsizdir. İki puan arasındaki fark, modelin TP/CCN ayrımındaki tereddüdünü ölçer.
| # | Model | Sağlayıcı | Katı | Esnek | D / K / Y | Gecikme | Toplam $ | $ / doğru |
|---|
Yavaş düşünmek ödül vermiyor. Ölçümün en net bulgusu bu: en uzun süre “düşünen” iki yapılandırma (Claude Opus 4.7 thinking·max ve Kimi K2.6, 104 saniye ortalama) sıralamanın alt yarısında. En hızlı model Grok 4.3 aynı zamanda ikinci en doğrusu. Bu görevde ek muhakeme süresi doğruluğa dönüşmüyor.
Sol üst köşe ucuz ve doğru demek — aradığın yer orası. Sağ alt pahalı ve zayıf. Yatay eksen logaritmik, çünkü maliyetler 32 kat aralığa yayılıyor.
Bir SOC kuyruğunda alarm başına 100 saniye, gerçek zamanlı triyajı imkânsız kılar. Bu grafik hız ile doğruluk arasında bir takas olup olmadığını sorar — cevap hayır.
Senaryolar gerçek SOC kuyruklarının bileşimini yansıtacak şekilde dağıtıldı: çoğunluğu gerçek tehdit, önemli bir kısmı müşteri teyidi gerektiren belirsiz durumlar, azınlığı temiz yanlış alarm. Kolay bir dağılım değil — bir modelin her şeye “kötü niyetli” diyerek yüksek puan alması mümkün değil.
| Karar | Anlamı | Adet | Pay |
|---|---|---|---|
| TP | True Positive — gerçek kötü niyetli aktivite; kritik olanlar otomatik L2 eskalasyonu tetikler | 383 | 63,8% |
| CCN | Customer Confirmation — yetki veya kapsam teyidi gerekiyor | 122 | 20,3% |
| FP | False Positive — yanlış alarm, kapat | 68 | 11,3% |
| ID | Insufficient Data — karar için yeterli bilgi yok | 27 | 4,5% |
Her senaryo, bir SOC analistinin ekranında göreceğine yakın bir zarf olarak hazırlandı: ham log alanları, varlık bağlamı ve tetikleyen kural başlığı. Modele serbest metin değil, dört seçenekten birini seçmesi istendi — TP, FP, CCN, ID. Ground truth etiketleri insan analistler tarafından verildi ve modellere hiçbir aşamada gösterilmedi.
Her senaryo yaklaşık 30 varyantla çalıştırıldı; raporlanan skorlar bu koşumların birleşimidir. Tek bir koşum kanıt sayılmaz — modeller arası farkın gürültüden ayrılabilmesi için tekrar şart.
Maliyet rakamları sağlayıcıların ölçüm tarihindeki liste fiyatlarından hesaplandı. Qwen 3.6 kendi donanımımızda çalıştırıldı; onun için gösterilen tutar eşdeğer API fiyatlandırmasıdır, gerçek elektrik maliyeti değil.