爱吃番茄 (@fanjie)发现个问题,长上下文不如短上下文好用 中发帖

1m上下文的模型都有注意力分散,左右脑互博的情况 
这种情况v4flash尤甚 
反而是codex里300k上下的上下文模型注意力是最集中的 
把v4flash限制到250k上下文有效改善了目标飘移的情况
 
 
Back to Top