3090 24GB 的显卡 64GB DDR5 内存
目前调研能部署的有 Qwen3-Coder-30B-A3B ( Q4_K_M / AWQ )、DeepSeek-R1-Distill-Qwen-32B ( AWQ / INT4 )、DeepSeek-Coder-V2-Lite ( Q4_K_M / Q5_K_M )、DeepSeek-Coder-33B ( Q4_K_M )
有同志真自己部署了吗,哪一个的效果相对好一点呢?
3090 24GB 的显卡 64GB DDR5 内存
目前调研能部署的有 Qwen3-Coder-30B-A3B ( Q4_K_M / AWQ )、DeepSeek-R1-Distill-Qwen-32B ( AWQ / INT4 )、DeepSeek-Coder-V2-Lite ( Q4_K_M / Q5_K_M )、DeepSeek-Coder-33B ( Q4_K_M )
有同志真自己部署了吗,哪一个的效果相对好一点呢?
1
misdake 16h 34m ago
没那么关注,不过前些天我装了个 Strata ( https://github.com/Niko1221/Strata ),也许可以试试。
|
2
misdake 16h 33m ago
24GB 显存可以搞高精度一点的模型还有长上下文了。
|
3
codehz 13h 18m ago via Android
这种去年的模型有啥好折腾的,工具调用根本不稳定,不如用🤗上的新模型量化版
|
4
kennylam777 13h 3m ago
舊模型不值得折騰+1
DS R1 Distill 還是 Qwen2.5, 而 Qwen3 也不算太好, 這些東西 Tool use 正確輸出 xml 也極不穩定而且無法自行修正, 到了 Qwen 3.5 就好很多 有 64GB RAM 直接上 Strata 試試吧, Qwen 3.8 Flash Next 125B A10B 的 Tool uses 很穩, 3090 應該在 Prefill 及 generation 的速度也十分好用 |
5
xixi1412 11h 56m ago
年度最佳本地小模型:
低内存:qwen3.8 27B. 高内存:qwen3.8 flash next ( Strata ). 27b 在执行层面上,只要把任务和验收标准写好,质量不比 gpt6 sol 差。找个大一点的付费模型当领导,27b 当力工。 |
6
wwhc 11h 32m ago 建议 llama.cpp 上 Qwen3.8 27B Q4 。建议暂时不要尝试 Strata ,这个东西似乎买了推广,作为一个开源推理系统,推广力度如此之大,原因不明,等情况明朗后再尝试,上 Qwen3.8 flash next 用 llama.cpp 也没有问题
|
7
passive 9h 14m ago via Android
strata 真香。ddr5 内存再大一点会更香。
|
8
ezioswj 4h 30m ago via Android
qwen3.6 35ba3b apex mtp 版本,效率和质量好得多
qwen3.8 27b 也可以,但是说实话我体感一般。 另外你跑的那些都是过时了吧,删了认准最新版吧 |
9
kenvix 7 mins ago
1 个 3090 就 Qwen3.8 27B 。有 4 个 3090 就 qwen3.8 flash next
|