Taylor77's recent timeline updates
Taylor77

Taylor77

V2EX member #671519, joined on 2024-01-14 15:27:51 +08:00
Today's activity rank 25434
Taylor77's recent replies
在哪里申请退款啊,我看订单里没有退款选择
补一个更清楚的结果摘要,主帖里的实验数据排版挤在一起了:
48 个 case:
A |现有流程:42/48
B |改善 LLM Context:46/48
C | Better Context + Jev:38/48
24 个 holdout case:
B:23/24
B + Jev:17/24
这轮实验最值得记录的结果是:
改善原 LLM 的 context ,比增加 Jev decision layer 效果更好。
如果继续测试 Jev ,我会把它负责的 decision 缩到一个非常具体的问题,而不是让它重新判断整个 Agent 应该做什么。
更新一下这个项目。
上次发这个 Playground 时,我主要还在研究 Jev 的 Choice / Noul / Score 到底怎么用。后来我真的把 Jev 接进了一个 AI 日程助手,并针对上面提到的“8:00 到单位 ≠ 8:00 开会”这类问题做了 3 组对照。
结果挺出乎我预期:
现有流程:42/48
只改善 LLM context:46/48
改善 context + Jev:38/48
也就是说,这轮实验里 加 Jev 反而比不加差。在 holdout 中 Jev 也没有修正原方案的错误,反而引入了新的 mismatch 。 粘贴的 Markdown (1)
复盘后我现在觉得,比“再加一个模型”更重要的是先把 context/evidence flow 做对。如果继续测 Jev ,我会把它负责的 decision 缩得非常窄,而不是让它再判断整个 Agent 的行为。
完整实验记录放这里了:
https://tryjevai.com/blog/jev-ai-agent-scheduling-test
算是给上次这个帖子的一个后续,也把负结果一起记录下来。

新帖里也开了一贴讨论具体实验结果,就不在这里重复贴完整数据了。https://www.v2ex.com/t/1247068
抱歉,刚发现发帖时把域名写错了 😂
正确地址是: https://tryjevai.com/
感谢提醒!
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   952 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 22:26 · PVG 06:26 · LAX 15:26 · JFK 18:26
♥ Do have faith in what you're doing.