• 请不要在回答技术问题时复制粘贴 AI 生成的内容
1258
V2EX  ›  程序员

qwen3.8 27B 被低估了

  •  
  •   1258 · 7h 23m ago · 3057 views
    qwen3.8 27B 完全被低估了,讨论度不高。
    如果有人在年初跟我讲,可以用两张 3090 本地部署一个超越当时最强的 opus4.5 几代的模型,我会觉得是痴人说梦。
    感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧
    21 replies    2026-08-17 20:47:00 +08:00
    yiranw09
        1
    yiranw09  
       7h 13m ago
    你指 runinfra 免费的 qwen3.8 27B ?很奇怪的是我始终无法把他接入 hermes ,一直报错 Context length exceeded (16 tokens). Cannot compress further.
    sentinelK
        2
    sentinelK  
       7h 13m ago   ❤️ 2
    没有网络检索能力的小模型就是渣。

    小模型意味着信息量储备少,没有非常深厚的常识基础,或者说常识的抽象程度很高。
    如果没有外部信息做支撑,很容易产生很多没有细节的“正确的废话”。

    最简单的办法,你用 llama.cpp 的默认 web 应用调用一下试试看,直接就变成弱智。

    能力强的小模型很像中年老板。能量大,但其实不太关注信息量和细节。他的能力都来自于和外界的串联。你把他手机收了直接降级成中年油腻老头。

    相反,老版本的大模型像是老教授,不太会玩手机,所以显得很笨,很脱离现实。
    1258
        3
    1258  
    OP
       7h 7m ago
    @sentinelK 好比喻,也可以比喻成能力很强的年轻程序员,没有 github 或者网络检索很难凭经验解决 bug ,只能力大砖飞
    1258
        4
    1258  
    OP
       7h 5m ago
    @yiranw09 runinfra 的 3.8 居然免费了吗?这个模型部署成本确实很低
    levn
        5
    levn  
       7h 2m ago
    都吹成本地的 opus4.6 了,还叫低估吗
    1258
        6
    1258  
    OP
       6h 54m ago
    @levn 是本地百无禁忌的 opus4.6 ,这很夸张了,你甚至可以要求他做坏事,或者在灰色地带赚钱,只需要付出电费。
    nguoidiqua
        7
    nguoidiqua  
       6h 49m ago
    其实 R 站讨论热度很高的,国内玩自己部署的还是相对较少。

    单看编程方面的跑分,略超 Opus 4.6 、MiniMax M3 、Gemini 3.5 ,略低于 Hy3 、Kimi K2.6 ,稍弱于 V4 Flash 0731 、Spark 1.1 、Gemini 3.7 、GLM-5.2 、Qwen3.7 Max 。(当然跑分这个东西仅供参考,各家跑分的排名都是出入较大的)

    不过目前反馈有:一、过度推理,xHigh 下面推理消耗的时间和 TOKEN 比 Medium 多几倍。二、偏科严重,相比 Qwen3.6 27B ,某些方面提升很大,某些方面反而倒退了。
    coefu
        8
    coefu  
       6h 27m ago
    1 ,deepseek harness + qwen3.8 27B ,自己修复自己 bug ,自己给自己写插件。

    2 ,联网,记忆,都让它自己写的插件。一个联网的小 case ,都还有很多搞不定。指点一条路,searxng 。记忆参考 benchmark: https://agentmemories.ai/home

    3 ,Hidden Dimension: 5120 ,Number of Layers: 64 ,dense 黄金比例下,参数有限,只能靠反复推理榨出更多智力,过度推理是代价,但是本地部署,无非多几度电罢了,终归能把任务完成。从 Hidden Dimension: 8192
    ,Number of Layers: 92 的 2.4T 里 蒸馏出来的 逻辑能力。就这么点参数,逻辑能力占多了,通用知识当然就少了。
    coefu
        9
    coefu  
       6h 16m ago
    它的对手是 早它几天开源的 Muse-Glimmer-30B ,glimmer 确实也很 ok ,但是 Hidden dimension 6656 ,Layers 52 ,比 27B 少了 12 层深度,虽然宽了点,表达更丰富。但是,在特定的领域里,比如 coding / math ,逻辑缜密性 比 表达能力更重要。这在具体任务上,通常就是 看起来在思考,但是最深层次的矛盾,总是擦肩而过,力有不逮的感觉。

    glimmer 适合写小说,写剧本,一定深度的任务。

    qwen3.8 是 coding 领域真正的生产力工具。
    necZhang711
        10
    necZhang711  
       4h 42m ago
    @nguoidiqua 求问,r 站是啥子
    zhuantouer
        11
    zhuantouer  
       4h 25m ago
    x 上讨论挺多的,看老外的评价口碑还可以

    m4 pro 试了下,10t/s 左右,的确思考过度,蹲一下他们的 moe a3b 的模型
    1258
        12
    1258  
    OP
       4h 10m ago
    @coefu 666 大佬好专业的回答,自托管生产力我觉得是里程碑,毕竟电费直接转生产力了,而且可预见的是这一脚油门下去后面还会出现更猛的
    1258
        13
    1258  
    OP
       4h 10m ago
    @necZhang711 reddit 呀
    coefu
        14
    coefu  
       3h 54m ago
    @1258 推理端,其实还有更省电的。

    最屌的是 ,近存计算,在 ssd 上面焊接一个 FPGA ,把算子烧进 FPGA ,直接绕过内存墙。不过这个得看 FPGA 的算力进展了。或许也要单独供电,但是肯定也比整机功耗低。

    现在瑞芯微 RK182X 系列 就是在 m.2 上面搞得 堆叠 RAM ,有 1TB 的带宽,直接悍在 FPGA 周边的。不过容量被瓶颈在 5G B ,搞不上去了。还得是看 存储厂商。
    realJamespond
        15
    realJamespond  
       3h 12m ago
    opencode 批量重构调用子 agent 没有 3.6 好用,想半天,3.6 上来就直接干活,都是 unsloth ud q6
    tt83
        16
    tt83  
       3h 7m ago
    阿里云为啥自己不部署这个模型,3.8 Max 还是太贵
    acerphoenix
        17
    acerphoenix  
       1h 22m ago
    @sentinelK 大模型只要不部署在私网不能联网,都可以自己外接 Agent 进行网络检索呀。就是现在单纯的哪个模型也没有网络检索能力呀,都是 Agent 给的。
    jaoyina
        18
    jaoyina  
       1h 19m ago
    27b 的 coding 能力能到啥水平?
    565656
        19
    565656  
       1h 14m ago
    @acerphoenix #17 有没有什么插件给 qwen3.8 联网的
    Nzelites
        20
    Nzelites  
       29 mins ago
    27b 这么强那满血版的 3.8max 应该起飞啊 为什么好像口碑一般
    Gylx
        21
    Gylx  
       18 mins ago
    :)
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3185 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 41ms · UTC 13:05 · PVG 21:05 · LAX 06:05 · JFK 09:05
    ♥ Do have faith in what you're doing.