@cainiao3hao 在 Strata的量化测试 中发帖
哦我的老天爷,宣传说32g内存+12g显存的电脑上就能跑tmd qwen3.8-flash-next,这strata简直像魔法一样,我真想用我的靴子狠狠地踢只肯给那么点显存的老黄的屁股,哦我一定会的
但总归有些担心,这玩意儿会不会损失太多,还不如直接llama.cpp跑qwen3.8-27B啥的,所以假期最后一天,挂着做了一些测试
▶
测试环境
测试基线
llama.cpp qwen3.8-flash-next bf16 cpu计算版
值得注意的是,基线仅仅只是更改cpu计算跟gpu计算,都会产生挺大的差别,互相的KLD尽管只有0.0126,PPL 1.0001,但top-1一致率却只有95.4%
▶
opus对此的解释
这也解释了为什么unsloth其他模型能接近99%的q8,在qwen3.8-flash却只有94.122%的原因,毕竟同模型换成gpu计算都能差这么多
根据硬件编解...