在 60 多个学术基准(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)上评估大语言模型。用于模型质量基准测试、模型对比、报告学术结果或追踪训练进度。EleutherAI、HuggingFace 和主要研究实验室广泛采用的行业标准。支持……
在 Hermes Agent 中使用
这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。
在 60 多个学术基准(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)上评估大语言模型。用于模型质量基准测试、模型对比、报告学术结果或追踪训练进度。EleutherAI、HuggingFace 和主要研究实验室广泛采用的行业标准。支持……
适合:在 60 多个学术基准(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)上评估大语言模型。用于模型质量基准测试、模型对比、报告学术结果或追踪训练进度。EleutherAI、HuggingFace 和主要研究实验室广泛采用的行业标准。支持……
先确认你的 Agent 支持 Skill,再按原文说明完成安装。
这是 Hermes Agent 的内置 Skill,安装 Hermes Agent 后可按官方 Skill Catalog 调用。
执行安装命令前,请检查仓库来源、依赖、权限和脚本内容,不要把密钥直接写进命令或公开配置。
从公开说明中提炼的能力与适用范围。
在 60 多个学术基准(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)上评估大语言模型。用于模型质量基准测试、模型对比、报告学术结果或追踪训练进度。EleutherAI、HuggingFace 和主要研究实验室广泛采用的行业标准。支持……
这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。
快速判断它是否适合你的任务。
适合已经使用 Hermes Agent,并希望直接调用内置能力的用户。
安装和功能变化以原始资料为准。