Claude Fable 5.1 geldi, test sonuçları Fable 5’i geride bıraktı

Anthropic, Claude Fable 5.1 ve Claude Mythos 5.1 modellerini 1 Eylül’de kodlama ve bilgi işleri için tanıttı. Fable 5.1, Terminal-Bench-Science 0.1 testinde yüzde 52,6 alırken Fable 5 yüzde 24,7 seviyesinde kaldı. Buna karşılık Anthropic, Fable 5.1’i genel kullanıma açarken Mythos 5.1 erişimini onay verdiği kuruluşlarla sınırlandırıyor.

İki model aynı temel modeli kullanıyor, ancak Anthropic siber güvenlik ve yaşam bilimleri alanlarında farklı güvenlik sınırlamaları uyguluyor. Anthropic’in paylaştığı sonuçlara göre Claude Fable 5.1, Terminal-Bench 4.0 kodlama testinde yüzde 55,8 puana ulaşıyor.

Fable 5 aynı testte yüzde 42,0 alırken Opus 5 yüzde 52,3 ve GPT-5.6 Sol yüzde 37,3 kaydediyor. Buna karşılık daha az güvenlik sınırlaması kullanan Mythos 5.1, Terminal-Bench 4.0 testinde yüzde 60,9 sonucuna çıkıyor. Anthropic, iki model arasındaki farkın güvenlik sistemlerinin bazı siber güvenlik görevlerine müdahale etmesinden .

Bunun yanı sıra CursorBench 3.2.0, Fable 5.1 için yüzde 73,4’lük bir kodlama başarısı gösteriyor. Aynı testte Fable 5 yüzde 70,5, Opus 5 yüzde 70,0 ve GPT-5.6 Sol yüzde 67,2 sonuç veriyor. AutomationBench tarafında Fable 5.1 yüzde 31,4’e ulaşırken önceki Fable 5 yüzde 17,1 seviyesinde kalıyor.

Humanity’s Last Exam testinde araç kullanmayan Fable 5.1 yüzde 60,9, araç kullanan sürüm ise yüzde 65,0 alıyor. Anthropic ayrıca düşük ve orta efor ayarlarında Fable 5.1’in önceki modele … Claude Fable 5.1 geldi, test sonuçları Fable 5’i geride bıraktı haberi ilk önce Teknoblog üzerinde yayımlandı.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir