@SErAphLi根据我骂AI的频次来评测模型的能力 中发帖

最近ds flash很好用,突发奇想让他写一个网页来统计我骂哪个模型最多,什么时候骂,骂了几条。可惜CC 6月份之前的数据没了。不然还可以看看4.5的数据。本意是想看看Fable 5和Opus 5是不是降智了。不过最近Opus 5的token使用效率太低了导致套餐都用完了。 
gpt-5.4-mini是因为codex居然会自动切换sol到5.4 mini,而我的消息转发到TG上看不到TUI上的变化,结果就非常愤怒的骂了一通。5.4 mini可真是又倔又弱智,简直了。 
 [image] 
[image] 
[image] 
4.6的能力真是忽高忽低的。不过也算是用的最久的,有1M上下文还没有安全限制,可以研究注册机之类的。 
4.8是刚开始有幻觉问题,后来发的消息都使用英文,所以弱智程度下降了。
 
 
Back to Top