jeffccie花巨资测试:Qwen3.8-27B_RTX3090_Ollama_上下文对比 中发帖

[image] 
Qwen3.8-27B 在 RTX 3090 24G 上的上下文对比实测

基于 Ollama 0.32.15 DEBUG 日志 + 此前 32K 基准测试数据 
数据源:ollama64k.log / ollama128.log(本次 log)+ 原 Qwen3.8-27B_RTX3090_Ollama_上下文性能对比报告.md 32K 章节 
测试时间:2026-08-22 


TL;DR




档位
结论




32K
100% GPU、Prefill ~1200 tok/s、Decode 30-42 tok/s。性能最好,但 Coding Agent 容易撑爆。


64K
100% GPU、Prefill ~1100 tok/s、Decode ~37 tok/s。真正的甜点档。


128K
触发 12 层 CPU Offload,Decode 掉到 2...
 
 
Back to Top