目录

从企业数据库世界,到任务合成、真实 Agent 评测、失败分析和工具图检索。

项目背景:为什么要做 EntBench-Agent

企业 Agent 评测最麻烦的地方在于:任务要像真的,数据要对得上,工具链还要跑得通。

企业数据库世界:先造一个能跑业务的公司

企业任务能否真实,第一步看数据库世界是否站得住。

工具库设计:107 个企业工具怎么和数据库对齐

工具库的价值在于,它让数据库世界真的能被 Agent 操作。

Motif 与 Seed:从企业关系图里抽任务骨架

任务生成之前,先从企业关系图里抽出一个可靠的骨架。

任务草稿生成与编译:让 LLM 写任务,让规则落地

LLM 负责把任务写自然,compiler 负责把任务变成能跑的 benchmark 文件。

门控系统:规则检查与可解性验证

任务生成出来之后,还要过几道关。看起来合理的任务,实际跑起来可能直接失败。

真实 Agent 评测:ProgressiveDailyAgent 与轨迹采集

benchmark 的价值最终要落到真实 Agent 执行上。任务生成得再好,也要看 Agent 跑出来什么轨迹。

失败分析闭环:从错误标签到训练样本

Agent 失败之后,最有价值的是知道它错在工具、参数、事实、写状态还是回答。

工具图检索:从成功路径到 PPR 扩散

企业工具调用更像一条条历史工作流路径。

工程总结:EntBench-Agent 给我的几个经验

做企业 Agent benchmark,难点在于让任务、数据、工具、评测和日志形成闭环。