收录解读
EnterpriseClawBench是首个从真实企业工作会话中构建的智能体基准,包含852个可复现任务,每个任务配有恢复的工作环境夹具、重写提示、角色类别、技能子类、强制规则和语义评分标准,覆盖文件处理、工具调用和业务工件交付等真实企业场景。
在人工审核的120任务精简子集上,32种harness-模型组合中最佳配置(Codex+GPT-5.5)得分仅0.663,显示当前顶级系统在真实企业环境中仍有巨大差距,且单一综合分数无法全面反映企业级需求。
研究指出企业级评估必须分维度报告:工件交付质量、视觉呈现效果、单次调用成本(CNY计)、平均任务运行时间以及技能迁移能力,为产业界制定了更现实的多维评估框架。
数据集因含内部企业内容不予公开,仅发布构建和评估协议,限制了社区复现;基准覆盖的企业场景类型有限,泛化范围待扩展。
原始摘要
EnterpriseClawBench constructs 852 reproducible enterprise agent tasks from real workplace sessions, paired with fixtures, rewritten prompts, role classes, skill subclasses, hard rules, and semantic rubrics. On a 120-task Lite subset, the best configuration (Codex with GPT-5.5) reaches only 0.663. Results show enterprise agent evaluation must measure artifact delivery, visual quality, cost, runtime, and skill-transfer, not just a single score.