darkstarrd 在 Ninfer和Strata 这两个真的是让老硬件起飞了 3090+64g 本地120bmoe模型1M上下文 中发帖
Strata之前用了一阵子Ninfer,速度快最爽的是可以高并发,也就算了,毕竟也就是27B dense
Strata一出来各种离谱的结果,8g+32gram的笔记本都能跑120b的moe模型了
稍微好点的老爷机本地开1M上下文,另一个号称自己优化后4090上跑到220tps的
这个框架还欠缺的就是并发能力和视频推理能力了,这两个还是得用Ninfer
[image]
[116d3760087d1815d7e8adf833c144be]
这么搞下去,硬件还有可能降价吗