LLM 对齐的简单偏好优化。DPO 的无参考替代方案,性能更优(AlpacaEval 2.0 上提升 +6.4 分)。无需参考模型,比 DPO 更高效。适用于希望比 DPO/PPO 更简单、更快训练的偏好对齐场景。

在 Hermes Agent 中使用

这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。