废品 (@feipinxiang) 在 24g显存下本地qwen3.8 27b真的能用来干活了? 中发帖
纯讨论一下,显卡4090 24g,可以用20g左右(要留点显存其他软件用)。
模型用的unsloth的Qwen3.8-27B-UD-Q4_K_M.gguf。
主要想拿来辅助简单的编程agent,真的可以拿来干活了么? 至少要支持一个96k上下文的会话吧。
还有各种量化版本,各位佬推荐什么方案啊?
GSQ-RCOIQ3_S
UD-Q4_K_M
Swift 1.5
SwiftxGSQ-RCO
Flash-Next GGUF
Bonsai2-27B
QUASAR-QATNVFP4
Uncensored去审查版
llama-server.exe ^
-m "Qwen3.8-27B-UD-Q4_K_M.gguf" ^
--host 127.0.0.1 ^
--port 8033 ^
-ngl 999 ^
-c 131072 ^
--flash-attn on ^
--cach...