先固定“怎样才算更好”
问题很具体:在保留场景查询与引用检查的前提下,一份候选方案能否让 AI 工作流更快?在比较前,同时保留性能门槛和场景检查;不能只挑改善的样本。
本次使用 3 类合成场景、2 个引擎、2 个版本,每种组合重复 3 次,共 36 次。基线与候选各 18 次,场景与重复次数相同。
局部变快,检查通过数却下降
| 版本 | 通过 | 未通过 | 总计 |
|---|---|---|---|
| 基线 | 17 | 1 | 18 |
| 候选 | 14 | 4 | 18 |
部分场景耗时改善,但候选没有同时通过性能与场景检查。这里没有把未通过的结果排除,也没有把局部提速概括成整体成功。
决定:保留原方案
先定位未通过的组合,再决定是否调整候选。要比较的应当是从任务开始到结果可验收的完整过程;如果快出来的时间又花在纠错上,收益就需要重新计算。
这份记录能说明什么
上述通过数是预设查询 / 引用检查的结果,不是完整答案质量或生产成功率。36 次合成样本不能外推生产性能,也不足以代表全部任务。
这是独立的工作流对照,不是对“Agent 与界面如何分工”的直接验证。两条路径共享验证方法,结论仍各自保留边界。