更新一下这个项目。
上次发这个 Playground 时,我主要还在研究 Jev 的 Choice / Noul / Score 到底怎么用。后来我真的把 Jev 接进了一个 AI 日程助手,并针对上面提到的“8:00 到单位 ≠ 8:00 开会”这类问题做了 3 组对照。
结果挺出乎我预期:
现有流程:42/48
只改善 LLM context:46/48
改善 context + Jev:38/48
也就是说,这轮实验里 加 Jev 反而比不加差。在 holdout 中 Jev 也没有修正原方案的错误,反而引入了新的 mismatch 。 粘贴的 Markdown (1)
复盘后我现在觉得,比“再加一个模型”更重要的是先把 context/evidence flow 做对。如果继续测 Jev ,我会把它负责的 decision 缩得非常窄,而不是让它再判断整个 Agent 的行为。
完整实验记录放这里了:
https://tryjevai.com/blog/jev-ai-agent-scheduling-test算是给上次这个帖子的一个后续,也把负结果一起记录下来。
新帖里也开了一贴讨论具体实验结果,就不在这里重复贴完整数据了。
https://www.v2ex.com/t/1247068