LLM 对齐的简单偏好优化。DPO 的无参考替代方案,性能更优(AlpacaEval 2.0 上提升 +6.4 分)。无需参考模型,比 DPO 更高效。适用于希望比 DPO/PPO 更简单、更快训练的偏好对齐场景。
在 Hermes Agent 中使用
这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。
LLM 对齐的简单偏好优化。DPO 的无参考替代方案,性能更优(AlpacaEval 2.0 上提升 +6.4 分)。无需参考模型,比 DPO 更高效。适用于希望比 DPO/PPO 更简单、更快训练的偏好对齐场景。
适合:LLM 对齐的简单偏好优化。DPO 的无参考替代方案,性能更优(AlpacaEval 2.0 上提升 +6.4 分)。无需参考模型,比 DPO 更高效。适用于希望比 DPO/PPO 更简单、更快训练的偏好对齐场景。
先确认你的 Agent 支持 Skill,再按原文说明完成安装。
这是 Hermes Agent 的内置 Skill,安装 Hermes Agent 后可按官方 Skill Catalog 调用。
执行安装命令前,请检查仓库来源、依赖、权限和脚本内容,不要把密钥直接写进命令或公开配置。
从公开说明中提炼的能力与适用范围。
LLM 对齐的简单偏好优化。DPO 的无参考替代方案,性能更优(AlpacaEval 2.0 上提升 +6.4 分)。无需参考模型,比 DPO 更高效。适用于希望比 DPO/PPO 更简单、更快训练的偏好对齐场景。
这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。
快速判断它是否适合你的任务。
适合已经使用 Hermes Agent,并希望直接调用内置能力的用户。
安装和功能变化以原始资料为准。