surf (@zhangshiwu)发现自己对1M上下文的需求并不高 中发帖

[image] 
之前在论坛看过一张图,好像是说模型上下文越多,模型会变得越傻,200k处于刚好的状态. 
同时,我也发现上下文越长,模型首字越慢,反而200k也刚刚好. 
有没有佬友有不同意见和建议的
 
 
Back to Top