supermadmax 在 模型能力测评:老游戏的 Web 移植 中发帖
[!WARNING] 注意
本评测的任务单一、覆盖范围较为有限,无法全面反映模型性能,请理性看待结果。
评测环境:macOS (Darwin 25.6.0, Apple Silicon)、Emscripten 4.0.10、Google Chrome 150、Node 26 + Playwright
参评模型:GPT-5.6 Luna、Kimi K3、Claude Fable 5、GLM 5.2、DeepSeek V4 Flash (GA)、GPT-5.6 Sol、Gemini 3.6 Flash、Grok 4.5、Qwen 3.8 Max (GA)
本文不含 AI 润色,部分内容由个人转述自 AI 评审意见,请放心食用。
写在前面
最近花时间鼓捣了这么一个评测,主要动机是,有点看腻了各个模型的 one shot 演示,为什么不来点有意思的呢?于是就产生了一个把桌面游...