朝月 (@jiozhaoyue) 在 关于自部署大模型基准测试 中发帖
公司部署了几个社区微调版模型,想要测试下部署的模型的通用能力(大概就是多维度的,每个方面,都测下,然后看哪个模型适合做哪个方面的)
优先纯聊天的测试
github上找了一些开源的benchmark的框架,比如
modelscope/evalscope
open-compass/opencompass
但是对于完整上手写整个测试计划,然后测试,再给出最终报告(附上相关数据),还是有点束手无措
想问问佬友们这个有没有现成的方案(最好是企业级的)或是模型基准测试的相关经验呢?