爱吃番茄 (@fanjie) 在 发现个问题,长上下文不如短上下文好用 中发帖
1m上下文的模型都有注意力分散,左右脑互博的情况
这种情况v4flash尤甚
反而是codex里300k上下的上下文模型注意力是最集中的
把v4flash限制到250k上下文有效改善了目标飘移的情况1m上下文的模型都有注意力分散,左右脑互博的情况
这种情况v4flash尤甚
反而是codex里300k上下的上下文模型注意力是最集中的
把v4flash限制到250k上下文有效改善了目标飘移的情况