废品 (@feipinxiang) 在 24g显存下本地qwen3.8 27b真的能用来干活了? 中发帖

纯讨论一下,显卡4090 24g,可以用20g左右(要留点显存其他软件用)。 
模型用的unsloth的Qwen3.8-27B-UD-Q4_K_M.gguf。 
主要想拿来辅助简单的编程agent,真的可以拿来干活了么? 至少要支持一个96k上下文的会话吧。 
还有各种量化版本,各位佬推荐什么方案啊? 
GSQ-RCOIQ3_S 
UD-Q4_K_M 
Swift 1.5 
SwiftxGSQ-RCO 
Flash-Next GGUF 
Bonsai2-27B 
QUASAR-QATNVFP4 
Uncensored去审查版 
llama-server.exe ^
-m "Qwen3.8-27B-UD-Q4_K_M.gguf" ^
--host 127.0.0.1 ^
--port 8033 ^
-ngl 999 ^
-c 131072 ^
--flash-attn on ^
--cach...
 
 
Back to Top