coefu

coefu

V2EX member #616381, joined on 2023-02-28 17:15:35 +08:00
Today's activity rank 2733
Per coefu's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
coefu's recent replies
我觉得 dsh 整挺好。

web ui 好在,不用装在自己的主力机上面,直接装在强大的开发机上,主力机 通过 web ui 来工作。
https://book.douban.com/subject/1003479/
https://book.douban.com/subject/36526876/

推荐你几本书,一大一小而已,大小本质上来说没什么区别。你看懂了大的,小的自然就懂了。
1 ,从 Google 出去的时候开始的。

2 ,太阳底下没有新鲜事,参照 80 ~ 90 年代国企。

3 ,如果深度读过中国历史,就知道原因,从 2 里面衍生出来的。微缩版本的周期律。
22h 16m ago
Replied to a topic by runner2011 职场话题 想跨行做 AI 开发
现在这个竞争激烈程度,哪里还有给你转行试错的机会?科班出身的硕博一大把 都在排队呢。

没在这个领域搞个七八年,连门槛都达不到。
不用请什么定制搞 agent 的人,只是你们用的基础模型不够强。这本来就是一个离散发散的场景,不是连续可收敛的场景。如果一年花个几十万,请个人就能搞定这个看起来是个例,实际上是个通用大问题的话,那么整个 sre 领域后面就没有存在的价值,以及没有工作继续做了。

和 10 年前,那些痴心妄想一个系统搞定 sre 的土老帽没什么区别。
搞机器学习的和你们只会搞 web 体系的,不是一路人好吗。
2 days ago
Replied to a topic by ashong 程序员 编程效果对比 本地 Qwen3.8-27B vs Deepseek
鹈鹕很 Q 。
2 days ago
Replied to a topic by sNullp 分享发现 网络大神搞出来的 queqiao
@shunia 他搞 agent 才是跨度。本身就是做 infra 的。
2 days ago
Replied to a topic by coefu Local LLM mac ultra deepseek harness & qwen3.8-27B 几点经验
最新进展:

因为 qwen3.8 27B 是一个非常典型的 Hybrid / Gated DeltaNet + Attention 模型.

整个 kvcache 包含了 Attention KV Cache+Recurrent State ,llama.cpp 的 context-shift 只能搞经典 attention ,没办法搞 recurrent state ,用不了 context shift 。通过缩小整个 context ,让 tg 一直保持一个比较高的状态,这条路走不通。

很烦,😡
当前模型的攻击能力已经远超人类的防护能力了。你只能找一个每个周期都能保证最先进的模型,做防守。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1259 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 23:52 · PVG 07:52 · LAX 16:52 · JFK 19:52
♥ Do have faith in what you're doing.