c.skeleton (@cskeleton) 在 从评价西餐菜单来看看各家模型的聊天效果 中发帖

测试背景
测试灵感源于看到这份菜单感觉吃不饱,于是问了哈基米,哈基米指出了很多细节,于是我决定多找几个模型对比,竟然差异挺大,也能窥见模型的一些文本和通用能力。 
可以看出来各个模型对于提示词细节的关注,对于问题的理解,回答文本的表述风格和质量,看出来不同模型的差异。 
简要说明

截图是美国驻华大使馆官方公众号发的晚宴菜单,
菜单的最后提到了白宫蜂蜜,所以模型应该可以明确知道这顿饭的可能的目的;
我的提问是一个模糊的,这里的评价并没有明确指出是要评价菜单文案还是菜品搭配。

Prompt

 [image] 
你对图里的菜单作何评价 
所有提示词都是以这张图片+这一句话发送的,测试基本使用了各家手机app,Arena网页,具体在下面详情有写明。 
大家也可以测试下不同的渠道和模型。 

一点有趣的 TL;DR

回复详情
Gemini - Gemini App
▶ 
Gemini 3.8 F...
 
 
Back to Top