从企业数据库世界,到任务合成、真实 Agent 评测、失败分析和工具图检索。
文章列表
- 01-项目背景:为什么要做 EntBench-Agent
- 02-企业数据库世界:先造一个能跑业务的公司
- 03-工具库设计:107 个企业工具怎么和数据库对齐
- 04-Motif 与 Seed:从企业关系图里抽任务骨架
- 05-任务草稿生成与编译:让 LLM 写任务,让规则落地
- 06-门控系统:规则检查与可解性验证
- 07-真实 Agent 评测:ProgressiveDailyAgent 与轨迹采集
- 08-失败分析闭环:从错误标签到训练样本
- 09-工具图检索:从成功路径到 PPR 扩散
- 10-工程总结:EntBench-Agent 给我的几个经验
模块覆盖
| 模块 | 文章位置 |
|---|---|
| 企业数据库世界 | 第 02 篇 |
| 107 个企业工具 | 第 03 篇 |
| 业务 motif | 第 04 篇 |
| seed 子图采样 | 第 04 篇 |
| task_draft.json | 第 05 篇 |
| compiler | 第 05 篇 |
| 规则门控 | 第 06 篇 |
| 可解性门控 | 第 06 篇 |
| RealBenchmark | 第 07 篇 |
| ProgressiveDailyAgent | 第 07 篇 |
| 工具链轨迹 | 第 07 篇 |
| 失败标签体系 | 第 08 篇 |
| 训练数据反馈 | 第 08 篇 |
| Path Mining | 第 09 篇 |
| 工具历史图 | 第 09 篇 |
| 语义 seed + PPR | 第 09 篇 |