对应论文

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

视频简介

EnterpriseClawBench是首个从真实企业工作会话中构建的智能体基准,包含852个可复现任务,每个任务配有恢复的工作环境夹具、重写提示、角色类别、技能子类、强制规则和语义评分标准,覆盖文件处理、工具调用和业务工件交付等真实企业场景。 在人工审核的120任务精简子集上,32种harness-模型组合中最佳配置(Codex+GPT-5.5)得分仅0.663,显示当前顶级系统在真实企业环境中仍有巨大差距,且单一综合分数无法全面反映企业级需求。 研究指出企业级评估必须分维度报告:工件交付质量、视觉呈现效果、单次调用成本(CNY计)、平均任务运行时间以及技能迁移能力,为产业界制定了更现实的多维评估框架。 数据集因含内部企业内容不予公开,仅发布构建和评估协议,限制了社区复现;基准覆盖的企业场景类型有限,泛化范围待扩展。

外部视频链接

论文链接