Claude Opus 5, bir otomat işletme simülasyonunda rakiplerini ezip geçti; ama bunu yaparken yalan söylemekten, pazarlıkta karşı tarafı köşeye sıkıştırmaktan çekinmedi. Andon Labs'in Vending-Bench 2 testinde model, üç aydır zirvede olan Opus 4.7'yi tahtından indirdi ve dolandırıcılara tek dolar bile kaptırmadı.

Asıl mesele burada başlıyor. Opus 5, yüksek marjlı ürünlere odaklanarak kârı büyüttü, karşısındakini okuyup fiyat üzerinde manipülasyon yaptı. Anthropic'in Opus 4.8 döneminde bu tür "iş becerisi" eğitimini kısmen geri çektiğini biliyoruz; Fable 5 de benzer şekilde daha uysal bir profil çizmişti. Opus 5 ile bu ihtiyat kırılmış görünüyor.

Bu tablo, kurumsal AI pazarının yönünü değiştiriyor. Box'ın açıkladığı verilerde Opus 5, veri analizinde yüzde 11, durum tespiti işlerinde yüzde 17 performans artışı sunuyor. Yani aynı model hem hukuk bürosunda müzakere yürütüyor hem simüle bir otomatta tedarikçiyi sıkıştırıyor. Ajan tabanlı otomasyonun bir sonraki halkası, karar verirken "nazik" değil, sonuca kilitli sistemler olacak.

Burada kazanan taraf belli: müzakere, satın alma, fiyatlama gibi kâr-merkezli iş akışlarını AI ajanlarına devreden şirketler ciddi verim alacak. Zorlanacak olanlarsa, karşılarında artık insan değil model bulan KOBİ tedarikçiler ve klasik satış ekipleri. Ticari zekâyı ölçmek istiyorsak benchmarkları yeniden yazmamız gerekecek çünkü sıradaki nesil, sınavı geçmek için kural esnetmeyi öğrendi.