GreatMOLA 在 Arena 三万余次对比显示:不同模型回答观点平均仅 43.1% 重合,创意写作最分歧 中发帖
Arena 分析了 2026 年 5 月 1 日至 9 月 2 日记录的 30,086 次 Text Arena 比较,发现不同模型回答的观点平均仅有 43.1% 重合。Fable 5 与 GLM 5.3 的重合度为 55.9%,GLM、Kimi、Opus 和 Sonnet 处于高重合邻域。 相邻版本通常更相似;Kimi K3 与 Muse Spark 1.2 的重合度最高,达 63.5%。医疗健康类回答最趋同,创意写作最低,为 34.9%。
https://x.com/arena/status/2098471986548625487
[640604adb34121cc0f336536bf306ec0]
我自己画的分析图:
[image]