8月17日,爱范儿报道称,RealReplicaBench电商模型测试结果显示,13款参评模型在107个真实商业任务中全部未达60分及格线,最高分仅为Claude Opus 5的56.1分。
该测试由阿里旗下Accio Work技术团队打造,Accio Work是全球首个聚焦电商领域的AI Agent。测试中,Claude Opus 5在Accio Work执行框架下通过率(66/107)高于OpenClaw(60/107)和PI(65/107),多数模型在该框架下性能增益更明显。
爱范儿报道,由阿里旗下Accio Work脱胎的RealReplicaBench测试,以107个真实商业任务考核13款AI模型,所有参评模型均未达到60分及格线,最高分为Claude Opus 5的56.1分。
8月17日,爱范儿报道称,RealReplicaBench电商模型测试结果显示,13款参评模型在107个真实商业任务中全部未达60分及格线,最高分仅为Claude Opus 5的56.1分。
该测试由阿里旗下Accio Work技术团队打造,Accio Work是全球首个聚焦电商领域的AI Agent。测试中,Claude Opus 5在Accio Work执行框架下通过率(66/107)高于OpenClaw(60/107)和PI(65/107),多数模型在该框架下性能增益更明显。