目录
从企业数据库世界,到任务合成、真实 Agent 评测、失败分析和工具图检索。
项目背景:为什么要做 EntBench-Agent
企业 Agent 评测最麻烦的地方在于:任务要像真的,数据要对得上,工具链还要跑得通。
企业数据库世界:先造一个能跑业务的公司
企业任务能否真实,第一步看数据库世界是否站得住。
工具库设计:107 个企业工具怎么和数据库对齐
工具库的价值在于,它让数据库世界真的能被 Agent 操作。
Motif 与 Seed:从企业关系图里抽任务骨架
任务生成之前,先从企业关系图里抽出一个可靠的骨架。
任务草稿生成与编译:让 LLM 写任务,让规则落地
LLM 负责把任务写自然,compiler 负责把任务变成能跑的 benchmark 文件。
门控系统:规则检查与可解性验证
任务生成出来之后,还要过几道关。看起来合理的任务,实际跑起来可能直接失败。
真实 Agent 评测:ProgressiveDailyAgent 与轨迹采集
benchmark 的价值最终要落到真实 Agent 执行上。任务生成得再好,也要看 Agent 跑出来什么轨迹。
失败分析闭环:从错误标签到训练样本
Agent 失败之后,最有价值的是知道它错在工具、参数、事实、写状态还是回答。
工具图检索:从成功路径到 PPR 扩散
企业工具调用更像一条条历史工作流路径。
工程总结:EntBench-Agent 给我的几个经验
做企业 Agent benchmark,难点在于让任务、数据、工具、评测和日志形成闭环。