叅 (@Timmyzzo)简单做了个search能力的小测试题【图一乐】,grok4.5 4.2 gpt 5.6 sol网页版和codex,claude系列测不起 中发帖

grok-4.20-multi-agent-xhigh可用性变低后,grok忘记了搜索和nsfw的老本行了,开始进军code,所以评鉴一下最近一代的search能力
测试结果就不放了太长了,放个prompt吧 
prompt: 
▶ 
prompt
 [image] 
模型A:grok build 原生调用 4.5 high 
模型B:web 5.6 sol 高 
模型C:grok web super 4.5 expert 
模型D:个人grok2api 的  grok-4.20-multi-agent-xhigh 
模型E:站里某大佬的官key:grok-4.20-multi-agent-xhigh 
模型F:codex 5.6 sol xhigh (居然跑了一个多小时。。。) 
模型G:Gemini 3.1pro web 
结论排行(由codex 5.6 xhigh提供): 




排名
...
 
 
Back to Top