Felix (@FelixZhu) 在 CloudFlare提出了一种让k3自部署又快又省还小的方案 中发帖
原文地址:
这篇文章的主要方法就几步
首先,记录KV Coche的算法精度砍半,也就是从BF16砍到FP8,前者每个字2字节而后者只有1字节,单张显卡记录的上下文直接涨了一半,并且根据测试,在多项标准考试上几乎无区别,差距在1分以内。除此之外,他们还将ai处理信息的能力分布,在理解用户说的内容的时候依旧使用高精度的BF16,而到开始回复了就使用FP8,省空间。
其次,他们将大模型的大小直接从FP8压缩到了INT4,前者是8位整数后者是4位整数,以GLM5.2为例,体积从705G降低到421G,小了40%。与第一步一样,在处理信息的时候保持高精度计算,采用FP8,而在回答的时候使用INT4。差距依旧控制在0.8分之内。
文中其实还提到了如何在使用量极大的情况下,确保各个人的对话不会乱窜的解决方法,但是和自部署自用无关