在 CPU、Apple Silicon 和消费级 GPU 上运行大语言模型推理,无需 NVIDIA 硬件。用于边缘部署、M1/M2/M3 Mac 电脑、AMD/Intel GPU,或当 CUDA 不可用时。支持 GGUF 量化(1.5-8 位),减少内存占用,相比 PyTorch 在 CPU 上提速 4-10 倍。

在 Hermes Agent 中使用

这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。