2026-04-01
构建更优AI评测基准:评价者数量多少算够?
本研究提出基于"黄金"评分数据的机器学习模型评估框架,优化项目数量与每项评估者数量之间的权衡。研究发现传统的1-5名评估者配置往往不足,需要超过10名评估者才能捕捉人类观点的细微差别。通过模拟器测试发现,合理优化评估者比...
本研究提出基于"黄金"评分数据的机器学习模型评估框架,优化项目数量与每项评估者数量之间的权衡。研究发现传统的1-5名评估者配置往往不足,需要超过10名评估者才能捕捉人类观点的细微差别。通过模拟器测试发现,合理优化评估者比...