quafulArtificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其后 中发帖

Artificial Analysis发布医学复杂推理评测MLCR-AA,考察模型对复杂医疗病例报告的分析、推理能力,评分项包括完整性、准确性和简洁性:Medical Long Context Reasoning (MLCR-AA) | Artificial Analysis 
评测结果,从完整性上,Claude Fable 5、Opus 5遥遥领先: 
 [截屏2026-08-24 11.04.16] 
Kimi K3的完整性居然超过了GPT-5.6。 
但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名: 
 [截屏2026-08-24 11.10.45] 
看来医学方面的问题,应该是Claude Fable 5/Opus 5 + GPT-5.6 Sol组合着看
 
 
Back to Top