huggingface-accelerate
最简单的分布式训练 API。仅需 4 行代码即可为任意 PyTorch 脚本添加分布式支持。统一的 DeepSpeed/FSDP/Megatron/DDP API。自动设备分配、混合精度(FP16/BF16/FP8)。交互式配置,单命令启动。HuggingFace 生态系统标准。
汇集公开精选榜单与 Hermes Agent 内置能力。先看用途和适用场景,再复制安装命令或打开原文核对。
12 个结果
最简单的分布式训练 API。仅需 4 行代码即可为任意 PyTorch 脚本添加分布式支持。统一的 DeepSpeed/FSDP/Megatron/DDP API。自动设备分配、混合精度(FP16/BF16/FP8)。交互式配置,单命令启动。HuggingFace 生态系统标准。
使用 Flash Attention 优化 Transformer 注意力机制,实现 2-4 倍加速和 10-20 倍内存减少。适用于训练/运行长序列(>512 tokens)的 Transformer 模型,或遇到注意力机制导致 GPU 内存不足的问题,或需要更快推理速度的场景。支持 PyTorch 原生 SDPA,…
使用 LoRA、QLoRA 和 25+ 方法进行 LLM 的参数高效微调。适用于在 GPU 内存有限的情况下微调大模型(7B-70B),需要训练 <1% 参数且精度损失最小,或进行多适配器服务的场景。HuggingFace 官方库…
高级 PyTorch 框架,包含 Trainer 类、自动分布式训练(DDP/FSDP/DeepSpeed)、回调系统和极少样板代码。代码从笔记本电脑扩展到超级计算机保持一致。适用于希望使用内置最佳实践的干净训练循环。
LLM 对齐的简单偏好优化。DPO 的无参考替代方案,性能更优(AlpacaEval 2.0 上提升 +6.4 分)。无需参考模型,比 DPO 更高效。适用于希望比 DPO/PPO 更简单、更快训练的偏好对齐场景。
提供使用 slime(Megatron+SGLang 框架)进行 LLM 后训练的强化学习指导。适用于训练 GLM 模型、实现自定义数据生成工作流,或需要与 Megatron-LM 紧密集成以实现 RL 扩展的场景。
使用 Axolotl 进行 LLM 微调的专家指导 - YAML 配置、100+ 模型、LoRA/QLoRA、DPO/KTO/ORPO/GRPO、多模态支持
使用 Unsloth 实现快速微调的专家指导 - 训练速度提升 2-5 倍,内存减少 50-80%,支持 LoRA/QLoRA 优化
使用 torchtitan 提供原生 PyTorch 分布式 LLM 预训练,支持 4D 并行(FSDP2、TP、PP、CP)。适用于在 8 到 512+ GPU 上大规模预训练 Llama 3.1、DeepSeek V3 或自定义模型,支持 Float8、torch.compile 和分布式检查点。
使用 TRL 进行强化学习微调 LLM - SFT 用于指令调优,DPO 用于偏好对齐,PPO/GRPO 用于奖励优化,以及奖励模型训练。适用于需要 RLHF、对齐模型偏好或从人类反馈中训练的场景。兼容 HuggingFace Tr…
使用 TRL 进行 GRPO/RL 微调的专家指导,适用于推理和任务特定模型训练
构建、测试和调试 Hermes Agent RL 环境以用于 Atropos 训练。涵盖 HermesAgentBaseEnv 接口、奖励函数、Agent 循环集成、工具评估、wandb 日志记录以及三种 CLI 模式(serve/process/evaluate)。适用于创建、审查或调试 Atropos 训练环境。
条目根据公开目录和原始文档摘要整理,保留来源与原文入口。安装前请查看原文中的依赖、权限和安全说明;热度指标仅用于发现内容,不代表绝对质量。