1 分•作者: andrelago•大约 2 个月前
通过 Ollama 和类似提供商,使用自定义任务集对本地大型语言模型进行广泛的指标基准测试。您可以使用确定性评估标准或带有自定义指令的大型语言模型裁判。 此功能还支持查询 HuggingFace,以根据您设备的规格比较热门模型,从而了解哪些模型可能值得在您的环境中进行测试。