csgobad 在 One Shot评测越看越没意义了,而且看的很烦 中发帖
这几天在X一直看到各种拿dsv4f来对比opus5/fable/gpt-5.6-sol这类模型然后一直重复着dsv4f水平还差远什么的,开始觉得很烦躁了
[image]
最主要原因就是这些视觉评测和实际体验差别太大了,我过去一周用opus5都用了快60B token的实际体感就是“过度思考”的模型,我发现这种过度思考模型在这种“一句话评测”里面确实会表现的最“惊艳”因为他总是会帮你完成很多你没要求的细节
但是这种过度思考在真实使用的场景就是每回合思考非常多非常慢,甚至有些简单的东西他都过度思考,常常去多做一些事情,以至于现在用这些模型你还得额外规范他什么东西别碰别做,用起来就是很不爽
gpt-5.6-sol好一些但也是会过度思考,最近用比较少只用了600m
老实说最近用的最爽反而是grok-4.5所以觉得如果dsv4f能有差不多的速度之上再聪明一点那就是很好用的模型了