该图表的数据颇具看点。在IPI基准测试中,Opus 5相比Opus 4.8实现性能提升,将攻击者在15次尝试内成功的概率从5.5%降至2.0%,单次尝试的成功率也从0.5%降至0.2%。其表现亦优于Sonnet 5(k=15时为5.9%)与Mythos 5(2.6%),成为本次评测中鲁棒性最强的模型。在该基准测试上,Opus 5的表现同样超越了所有非Claude系模型。表现最好的非Claude系模型为Muse Spark,其15次尝试内的攻击成功率仍高达16.5%,是Opus 5的八倍以上。在GPT-5.6系列中能力最强的Sol版本,其表现与上一代GPT-5.5基本持平(15次尝试内分别为20.0%和20.8%),但被成功攻击的概率仍是Claude Opus 5(2.0%)的10倍。其余GPT-