BingoXuan

BingoXuan

V2EX member #170096, joined on 2016-04-22 13:23:09 +08:00
Today's activity rank 9926
Per BingoXuan's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
BingoXuan's recent replies
@lgc931018
我有观察 usage 的,看起来并没有 reset 。刚刚开了 sol high+luna max 的子 agent 讨论了大规模重构方案,我驳回了 2 次才消费了 6%。我的场景是本地长期 2 个处理 repo ,偶尔有 1-2 个 repo 偶尔需要修改,每个 repo 不超过 3 个 thread ,网页版隔离上下文讨论其他方案。我不确定其他不使用 sub2api 同样遇到额度快速消耗的场景是怎么样。btw ,我的账号都是走一个固定 ip 的,虽然是机房 ip ,但是纯净度还 ok 。
我昨天没有收到重置,今天用 luna max 跑了好几个任务,额度还是卡在 72%
@sentinelK
sglang 推荐 nvfp4 量化是 RadixArk/Qwen3.8-27B-NVFP4 版本。unsloth 家的 nvfp4 量化可能还不如自家的 gguf 。NVIDIA 的 3.6 27B 的 nvfp4 量化明显比 unsloth 好得多。qwen3.8 的 kv cache 量化最多只能去到 fp8 ,到目前 nvfp4 的 kv cache 量化各家支持还是半残废。Blackwell 的硬件潜力还没有完全挖掘出来。
等 Qwen3.8 35BA3B 吧。3.8 27B 最大问题不是权重。而是 kv cache 。q8 量化跑满 262k 上下文要 8-9G 显存。开 turbo quant 有损失。即使是 Blackwell 显卡,vllm 和 sglang 都还没支持完整的 nvfp4 kv cache 支持
13 days ago
Replied to a topic by OBJECTION 健身 中登有多少在健身的...
一三五去游半个小时
17 days ago
Replied to a topic by netox 分享发现 在线体验 16K token/s 的新大模型部署架构
@cowcomic
deepseek 激活也是 13B 。这时候就是 xilinx 出马了,通过 pcie 重新烧录权重数据。那样 n 张互联就能跑 deepseek v4 flash 0731 了。主要问题是如何把权重数据变成可烧录。
@Hyschtaxjh
六面骰子一样不够随机。参考 cloudflare 办公室的随机数采样
我昨天一天就消耗了 65%了。现在 review 也是用自己部署的 27B 在干。感觉就是逼着人升级 Pro (因为不禁用,我有这个升级想法)
Jul 25
Replied to a topic by rpish 问与答 技术已死?
以前的技术是不同个体探索得到的知识和经验,现在探索都靠 AI 了,经验都被模型厂吸收了转换到模型中。所以技术更多是,和 AI 协作过程中,个体未知知识是否被消化。
Jul 21
Replied to a topic by Leon6868 程序员 多端 GUI 真的没有银弹吗
@Leon6868
skill+多模态+playwright 能加速回环。小模型可以用来验证流程和细节提供相关信息,大模型负责实现。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1199 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 17:45 · PVG 01:45 · LAX 10:45 · JFK 13:45
♥ Do have faith in what you're doing.