先固定“怎样才算更好”

问题很具体:在保留场景查询与引用检查的前提下,一份候选方案能否让 AI 工作流更快?在比较前,同时保留性能门槛和场景检查;不能只挑改善的样本。

本次使用 3 类合成场景、2 个引擎、2 个版本,每种组合重复 3 次,共 36 次。基线与候选各 18 次,场景与重复次数相同。

样本是合成输入,公开记录仅保留汇总;不包含私人数据或内部系统入口。

局部变快,检查通过数却下降

预设场景的查询 / 引用检查
版本 通过 未通过 总计
基线 17 1 18
候选 14 4 18

部分场景耗时改善,但候选没有同时通过性能与场景检查。这里没有把未通过的结果排除,也没有把局部提速概括成整体成功。

决定:保留原方案

先定位未通过的组合,再决定是否调整候选。要比较的应当是从任务开始到结果可验收的完整过程;如果快出来的时间又花在纠错上,收益就需要重新计算。

这份记录能说明什么

上述通过数是预设查询 / 引用检查的结果,不是完整答案质量或生产成功率。36 次合成样本不能外推生产性能,也不足以代表全部任务。

这是独立的工作流对照,不是对“Agent 与界面如何分工”的直接验证。两条路径共享验证方法,结论仍各自保留边界。

公开版说明:历史记录的匿名汇总,原始输入与完整运行证据未在本站开放,因此这不是可独立复现的公开基准。

看看另一条判断准备怎样验证 →← 回到变化全图