朝月 (@jiozhaoyue)关于自部署大模型基准测试 中发帖

公司部署了几个社区微调版模型,想要测试下部署的模型的通用能力(大概就是多维度的,每个方面,都测下,然后看哪个模型适合做哪个方面的) 
优先纯聊天的测试 
github上找了一些开源的benchmark的框架,比如 
modelscope/evalscope 
open-compass/opencompass 
但是对于完整上手写整个测试计划,然后测试,再给出最终报告(附上相关数据),还是有点束手无措 
想问问佬友们这个有没有现成的方案(最好是企业级的)或是模型基准测试的相关经验呢?
 
 
Back to Top