Xixuer都觉得我在串路由派,那就不睡了,完整梳理路由 claude 论点 中发帖

1.claude 的分词器和 deepseek v4 不同,如果能找到某个词,在 claude 的数量占比比 deepseek 高,那就能够在 deepseek 还没到 1m 上下文时,claude 先到 1m 上下文,而这超出 1m 上下文的文本,会报错,deepseek 的处理方案是直接降级到自己的模型继续回复。 


2.fable 和 mythos 的最大上下文都是 1m,单次最长输出都是 128k,只要能够让模型在思考的过程中一直保持输出,直到超过128k 这个边界,就会触发截断,而 deepseek v4 两个模型都是384k 
 [image] 
[image] 


3.fable和 mythos 都是自适应思考模型,而 deepseek v4 系列是可以关闭思考的,如果走 v4 的非思考接口,但是模型依旧在思考,依旧能证实 
 [image] 


4.脏 token...
 
 
Back to Top