mi tu 在 怎么从互联网拼出一个模型的真实(可能)能力? 中发帖

最近经常看到各种询问模型哪个好用的帖子,我想大家不会每个模型都用一遍,订阅订错了也很亏钱,所以我来分享一下和我主观感觉接近的榜单和怎么通过云测评来云出一个大概率不会出错的答案,方便各位选型和更好的使用模型。 
(防止查户口叠甲,本人是大部分模型感兴趣都会用用的类型,持有devin gpt claude glm command code google pro订阅,没有订阅的会通过白嫖渠道使用,平时评论推荐主要出于主观感受,以下内容也是纯主观感受,任何问题友好交流指正) 
古德哈特定律:一个指标变成目标时,它就不再是一个好指标。 
指标原本是某个真实目标的代理。一旦它变成考核标准,人们就会直接优化这个代理本身,而不是它背后真正想要的东西。 
所以首先我们排除所有出现在模型发布页的跑分表,除tb4这种新榜测旧模的情况以外 
 [image] 
一切发布前测试的跑分榜单都有刷分风险,况且我想论坛内...
 
 
Back to Top