使用 TRL 进行 GRPO/RL 微调的专家指导,适用于推理和任务特定模型训练

在 Hermes Agent 中使用

这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。