凌凡 (@lingfan) 在 有没有佬懂模型部署的 中发帖
像本地部署一些满血的开源模型,想要预估一下成本,比如部署GLM-5.3-Flash,原生 FP8,需要最低及以上需要哪些nvidia A/N系列的卡能部署,这些卡各需要多少张,8/32/64并发的情况下各能产生多少token/s