V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  wdhwg001  ›  全部回复第 1 页 / 共 65 页
回复总数  1295
1  2  3  4  5  6  7  8  9  10 ... 65  
甚至 Claude 也没问题,你为了 5hr 额度来回切账号都没问题,只要你每次都是手动切的,自动切可能有风险。
@sampeng 不是特化训练,是泛化不够。它的训练语料大量来自于 Claude Code ,以至于你让它背诵一些已经不存在的 Schema ,它如数家珍。很可能是 RLHF 在 Claude Code 里训练任务完成所需的 Token 总数,然后训成了特化,因为 Claude Code 会还原 cwd 。

任何第三方 Harness 都要尽可能地去还原原生行为,包括名字、schema 、各种提醒,否则数不尽的坑在面前。
难道要趁此机会欣赏自己的鸡巴吗?
@BestEicky 这是原本的内置功能被全局禁用,灰度恢复。
@KJH subagents 可以锁到 Opus 的
@guin Opus 3 时代老号就算 IP 全球来回跳,时区在中国,聊天用中文,都没问题。
@BestEicky

8 tasks (3 done, 1 in progress, 4 open)
◼ 当前任务 1
◻ 后续任务 2
◻ 后续任务 3
◻ 后续任务 4
◻ 后续任务 5
… +3 completed

这个东西。
12 天前
回复了 zeni18 创建的主题 问与答 一直不理解 skills, 这不就是提示词吗?
@windliang 其实当时明眼人都知道偷了 Cursor Rules 里的可选规则,但是 Cursor 没想着拿它造生态。
12 天前
回复了 bxxwcl 创建的主题 程序员 我是不是太学生思维了
@chenyongchanggg 板着脸认真说事情的时候可能会有点过拟合吧…就隐约带一点 AI 味道,但是是真人没毛病嗯
8 月 31 日
回复了 bxxwcl 创建的主题 程序员 我是不是太学生思维了
@Jinmu24 没啥求教的,我觉得也不需要上一个 ADR ,在该 Reflection 的点提醒,然后 Reflection 结果持久化,去调优 Reflection 就行了,没啥必要去翻倍 usage 审查,事实上 LLM 对于自己犯的错误非常敏感,这是 RLHF 的核心部分。

狠狠摔一跤就是指,你要让它去犯错和挣扎,而不是要让它去预先怀疑。因为怀疑是普适性的,它会怀疑每一件事,导致任务完成时间拉长,而如果让它对着怀疑去 reflection ,它不会有把 finding 记录下来的东西,你给它套上一个 sidecar LLM 也没用,如果不踩坑,两者大概率都不响,因为 base model bias 摆在那里,两个模型之间会倾向于认同彼此,你要让它响才行。

提高怀疑本身也是很难建立平衡和 metrics 的,而 Reflection 思路则容易很多,很多时候开发任务是需要人来做这个 reasoning 的,任务完成时间是刚需,而提高怀疑的代价清晰,收益不确切,预测收益困难,策略只能是全用上,就像越来越依赖 xhigh 一样。
8 月 30 日
回复了 bxxwcl 创建的主题 程序员 我是不是太学生思维了
@Jinmu24 我的评价:

它的驱动力不成立,或者说我的看法相反:我觉得 LLM 应该狠狠摔一跤或者在 HITL 里站直了挨骂,然后它学会的东西会被积累以降低后续的任务完成时间。你的驱动力是抬高怀疑,这增加的额外消耗是普遍的,而错误本身不是。
https://www.v2ex.com/t/1235190

没时间搓 codex 版,但是如果你的 harness 是 Claude Code ,我搓的这东西有时候能救命。
@liupeiqiang 不是这个意思,是说这是经典的 AI 味道,浓到让人觉得会有点“最不绕弯子的太稳了”。
8 月 30 日
回复了 milkleeeeee 创建的主题 Claude Claude Max 20x 的周限真的能用满吗
同 Opus 5 主力,Fable 只在编排层,不总是 xhigh 拉满。

目前用量是超过两个 20x 订阅,不总是能超第三个订阅,要看实际工作量。

到了这个用量之后,实际上切号就真的是个麻烦事了,瓶颈在 5h ,切号又不能全自动化,否则会被 A\抓现行。现在是主动把 5h 周期钉住,这样稍微好处理一点。
虽然说我觉得 AI 做前端无可厚非,但是看到“The honest take”的时候还是会皱眉。

ZDR 我目前先不奢望了,只是希望内容真的不要被拿去当作语料,那个卖数据得免费用量的东西别开。

另外,实际上我有一个侧面:我会用会议笔记去长期挂着耳机,开在手机上,然后想到什么就说出来,让会议笔记帮我收想法,但是这拖着一个会议当然是很麻烦。只是这个实现起来也费劲,VAD 和 EOT 都要有了,否则分分钟跑炸用量。

此外,如果你是 Soniox ,其实那个 STT 对于自纠正的认同度很高,它本质上是一个 LLM 。另外如果你实时把 transcript 吐出来的话,人类就会看到这个乱糟糟的文本里面拼错的部分然后尝试纠正,这种纠正可以在 LLM 完成整理之后去跑另一个流程,识别并且去提升正确率。Typeless 选择隐藏这个乱糟糟的东西,制造了魔法效果,但也留下了黑盒,抹掉了自纠正空间,这个留给你取舍吧。
一句话介绍:

我每周烧掉起码两个,差不多三个 Max 20x 订阅。

https://github.com/wdhwg001/csift 是我给 Claude Code 的 session 层打的补丁。https://www.v2ex.com/t/1235190 是在 V2EX 上的宣传,因为这么重的用户才能挖到的东西确实是受众很窄,所以只作为重度 AI 使用者之间递名片用。

有自己的编排层,懒得开源,市面上躺着的 superpowers 的 yet another 茫茫多。

有点子。

不在找 CTO ,但欢迎 networking ,有意的话回复,我不主动加过去打扰,因为毕竟同样都是技术人,相轻也是常态,没有点 ego 就不是 cofounder 了。
1  2  3  4  5  6  7  8  9  10 ... 65  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2651 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 30ms · UTC 11:30 · PVG 19:30 · LAX 04:30 · JFK 07:30
♥ Do have faith in what you're doing.