coefu
ONLINE

coefu

V2EX member #616381, joined on 2023-02-28 17:15:35 +08:00
Today's activity rank 7807
Per coefu's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
coefu's recent replies
你给的插件足够多,就能做成 Javis 。
1h 56m ago
Replied to a topic by 1258 程序员 qwen3.8 27B 被低估了
@1258 推理端,其实还有更省电的。

最屌的是 ,近存计算,在 ssd 上面焊接一个 FPGA ,把算子烧进 FPGA ,直接绕过内存墙。不过这个得看 FPGA 的算力进展了。或许也要单独供电,但是肯定也比整机功耗低。

现在瑞芯微 RK182X 系列 就是在 m.2 上面搞得 堆叠 RAM ,有 1TB 的带宽,直接悍在 FPGA 周边的。不过容量被瓶颈在 5G B ,搞不上去了。还得是看 存储厂商。
4h 18m ago
Replied to a topic by 1258 程序员 qwen3.8 27B 被低估了
它的对手是 早它几天开源的 Muse-Glimmer-30B ,glimmer 确实也很 ok ,但是 Hidden dimension 6656 ,Layers 52 ,比 27B 少了 12 层深度,虽然宽了点,表达更丰富。但是,在特定的领域里,比如 coding / math ,逻辑缜密性 比 表达能力更重要。这在具体任务上,通常就是 看起来在思考,但是最深层次的矛盾,总是擦肩而过,力有不逮的感觉。

glimmer 适合写小说,写剧本,一定深度的任务。

qwen3.8 是 coding 领域真正的生产力工具。
4h 29m ago
Replied to a topic by 1258 程序员 qwen3.8 27B 被低估了
1 ,deepseek harness + qwen3.8 27B ,自己修复自己 bug ,自己给自己写插件。

2 ,联网,记忆,都让它自己写的插件。一个联网的小 case ,都还有很多搞不定。指点一条路,searxng 。记忆参考 benchmark: https://agentmemories.ai/home

3 ,Hidden Dimension: 5120 ,Number of Layers: 64 ,dense 黄金比例下,参数有限,只能靠反复推理榨出更多智力,过度推理是代价,但是本地部署,无非多几度电罢了,终归能把任务完成。从 Hidden Dimension: 8192
,Number of Layers: 92 的 2.4T 里 蒸馏出来的 逻辑能力。就这么点参数,逻辑能力占多了,通用知识当然就少了。
@oldlamp 我虽然言语狂了点,但是态度是建立在每天都在学习提升的基础上;沉浸在整个机器学习领域的第八个年头了,从统计机器学习,到深度学习,强化学习,每个领域都摸了一个遍。基础数学公式的推导,以及前沿工程领域论文,都过了一遍的。

起码从自我反思的角度来说,学而不思则罔,思而不学则怠 的境界,虽然也陷入过,但是能自我清醒意识到并脱离。

这哥们儿自己基础薄弱,上来想当然就算了,态度还这么阴阳,我没理由惯着他。

老哥谬赞了,黄石公我肯定没那么高境界。同龄人里这个领域来说,我服 陈天奇,王树森,李沐 他们,但是这个论坛里没有能让我服的人。我也在做事,只是还没有出成果罢了。但是我做的,必然不是当前这些水准的事情。
@EliteOtaku 跳梁小丑,能回复你一句,算给你长脸了。
LLM 参数的量,最根本的矛盾在于 信息论里对于信息的压缩。

LLM 模型本身 静态参数架构的量 对于要体现的 智能 ,关系其实不大,与之影响最大的是 context kv cache 。为什么:
1 ,LLM 本身静态参数其实只需要存储 最精炼的逻辑能力即可,世界客观知识 完全可以压缩到 context kv cache ,只要 context kv cache 无限长度能够存在,就能压缩一切,那么整个模型的初始化参数量就是 O(n),常数级别。

2 ,以目前的硬件能力,context kv cache 显然做不到 无限长度,那么压缩 context kv cache 的算法就是关键,所以,你会看到 一皮条 这部分的工程创新和优化。

3 ,但是信息论里就决定了,有限的结构无法无损压缩还原无限的信息。只要压缩了,必定就有损失。信息熵增地不可逆决定的。
LLM 和人脑之间的进化差距,如同马车之于未来的宇宙飞船。


马车在工程结构上迭代 N 版,不从底层结构上搞出范式创新,依然只是 高级的马车。
@EliteOtaku 那么现在的 MOE 架构是什么呢?

思而不学则怠。
要做孩子的朋友成为自己人,而不是家长成为对立面。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3471 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 11:07 · PVG 19:07 · LAX 04:07 · JFK 07:07
♥ Do have faith in what you're doing.