宙方 (@ZeusFunk)🔥爽了】GPT6-Astra把我本地部署的GLM5.3Flash速度提高了50%! 中发帖

前几天刚买了两台 DGXSpark 
 [81e14ac541f13e1696e46f18a7864fa9] 
然后部署GLM5.3Flash,目前社区里面 效果最好、速度最快(相对)的方案是 
Mia-lab的 
MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks: GLM-5.3 Flash EXL3 for 2x DGX Sparks 
但是它prose decode只有27tps左右 结构化代码会提高 在真实harness上下文中实际速度甚至只有24-30波动,还是偏慢了。 
然后让Astra直接帮我定制化内核,在不损失精度的情况下优化解码速度, 

/goal 进一步优化Decode速度,从推理引擎、spark专属内核、GLM5.3flash特性、双机数据交换等方面入手,善用GitHub、huggingface、context7等互联网手段,专为...
 
 
Back to Top