@scp 在 GLM-5.3 多维能力测评 中发帖
延续上一个话题 L站专属多维 benchmark 征集帖
引流,再多来些佬们投票,不要沉贴啊
基于现有佬投票关心的指标做了一版多维能力图。我个人体验GLM-5.3下来,感觉智能水平还是有的,任务如果描述的很详细清楚的话,一般理解和执行都还不错。但是在需要主动去了解其他信息(非上下文输入)的时候可靠的程度上明显不如 GPT系的模型(有些时候甚至不如5.6 luna )
不知道佬们用 GLM-5.3 的体验怎么样,还有就是对于这个多维测评有什么补充建议没?
[glm-5-3]