黄叶点子 (@Ryan1024) 在 Qwen3.8目前只有流口水的水平 中发帖
我做了两个测试,都是实际应用场景。
第一个测试是让它更新Python Workout中的过时的代码,替换为Python 3.12版本的代码,并生成最终的EPUB电子书。过程中反复偷懒、曲解用户需求。导致大量返工,最后消耗了大量token,得出的结果不尽如人意。
第二个测试是我给他一些Python知识点的Anki卡片,让他校对其中有没有知识性错误。这哥们直接生造了一个Python语法,并言之凿凿地说一张正常的卡片有知识性错误。被打脸之后,秒道歉。
我觉得这两个任务难度不高,复杂度稍微有一点。但也不是很高。但是模型最后的表现让我感到非常失望。阿里还是那个阿里。
附图一张
[image]