最新版加速 越狱版模型 MINIMAX H3 性能超seedance2.0 ?本地部署8G显存可运行 开源无审查 质量超高
答案不看模型名字,只看三个数:参数量、量化精度、上下文长度。
权重占多少
参数量乘以每个参数的字节数。FP16 是 2 字节,Q8 是 1 字节,Q4 是 0.5 字节。
所以一个 7B 模型用 Q4 跑,权重大概 3.5 GB。
算出来的只是权重。上下文缓存和推理中间结果还要额外占,实际比算出来的多 15% 到 30%,留够余量。
卡在边缘时先砍上下文
同样的显存预算,一个大模型配短上下文,效果通常好过一个小模型配长上下文。