Claude 5.5 model ailesinin ilk üyesi olan Claude Opus 5.5 tanıtıldı. Yapılan duyuruya göre yeni model, çoğu görevde Claude Fable 5.1 seviyesinde performans gösterirken, Opus 5 modeline kıyasla çalıştırma maliyetini yüzde 40 oranında düşürüyor.
Model yayımlanmadan önce Frontier Tasarım ve METR gibi dış değerlendiriciler tarafından test edildi. Şirketin binlerce simüle senaryoyu içeren otomatik davranış denetimi hizalama paketinde Opus 5.5, şimdiye kadar test edilen modeller arasında en yüksek performansı elde etti. Testler daha uzun görevleri, imkansız görevleri ve gerçek senaryoları kapsayacak şekilde genişletilirken modelin prompt enjeksiyonuna karşı Opus 5'e göre daha dirençli olduğu ve belirlenen sınırların dışına çıkma ihtimalinin azaldığı aktarıldı. Modelin detaylı değerlendirme verileri Opus 5.5 Sistem Kartı kapsamında paylaşıldı.
Performans tarafında yapılan ilk testlerde bir test uzmanı, bir mühendislik ekibinin haftalar sürecek 680.000 satırlık kod geçişini bir günden kısa sürede tamamladı. Web uygulaması yükleme sürelerini optimize etme görevinde Opus 5.5, 40 denemenin 39'unda başarılı olurken; tek bir komuttan oyun geliştirme testinde de grafik ve cila yönünden diğer modellerden daha yüksek puan aldı.
Biyoloji ve siber güvenlik alanındaki riskler bakımından Claude Mythos 5.1 ile karşılaştırılabilir bulunan model, Claude Fable 5.1 ile benzer güvenlik önlemleri altında sunuluyor. Biyoloji araştırmaları için Yaşam Bilimleri Doğrulama Programı başvuruları açılırken, Siber Doğrulama Programı erişiminin önümüzdeki haftalarda doğrulanmış uzmanlara genişletileceği belirtildi.