Agent Skills Directory

695 个 Skill,让 AI 更懂你的工作

汇集公开精选榜单与 Hermes Agent 内置能力。先看用途和适用场景,再复制安装命令或打开原文核对。

Skill
695
分类
60
精选目录
333
Hermes 内置
95
Hermes Agent

MLOps · 推理

8 个结果

MLOps · 推理Hermes Agent

instructor

使用 Pydantic 验证从大语言模型响应中提取结构化数据,自动重试失败的提取,以类型安全方式解析复杂 JSON,并流式传输部分结果——经过实战检验的结构化输出库

适合使用 Pydantic 验证从大语言模型响应中提取结构化数据,自动重试失败的提取,以类型安全方式解析复杂 JSON,并流式传输部分结果——经过实战检验的结构化输出库
Hermes 内置打开详情
MLOps · 推理Hermes Agent

llama-cpp

在 CPU、Apple Silicon 和消费级 GPU 上运行大语言模型推理,无需 NVIDIA 硬件。用于边缘部署、M1/M2/M3 Mac 电脑、AMD/Intel GPU,或当 CUDA 不可用时。支持 GGUF 量化(1.5-8 位),减少内存占用,相比 PyTorch 在 CPU 上提速 4-10 倍。

适合在 CPU、Apple Silicon 和消费级 GPU 上运行大语言模型推理,无需 NVIDIA 硬件。用于边缘部署、M1/M2/M3 Mac 电脑、AMD/Intel GPU,或当 CUDA 不可用时。支持 GGUF 量化(1.5-8 位),减少内存占用,相比 PyTorch 在 CPU 上提速 4-10 倍。
Hermes 内置打开详情
MLOps · 推理Hermes Agent

obliteratus

使用 OBLITERATUS 技术从开源权重大语言模型中移除拒绝行为——基于机制可解释性技术(均值差异、SVD、白化 SVD、LEACE、SAE 分解等)移除防护机制,同时保留推理能力。提供 9 种 CLI 方法,28 个分析模块,116 个模型预设……

适合使用 OBLITERATUS 技术从开源权重大语言模型中移除拒绝行为——基于机制可解释性技术(均值差异、SVD、白化 SVD、LEACE、SAE 分解等)移除防护机制,同时保留推理能力。提供 9 种 CLI 方法,28 个分析模块,116 个模型预设……
Hermes 内置打开详情
MLOps · 推理Hermes Agent

outlines

在生成过程中保证有效的 JSON/XML/代码结构,使用 Pydantic 模型实现类型安全输出,支持本地模型(Transformers、vLLM),并通过 Outlines——dottxt.ai 的结构化生成库最大化推理速度

适合在生成过程中保证有效的 JSON/XML/代码结构,使用 Pydantic 模型实现类型安全输出,支持本地模型(Transformers、vLLM),并通过 Outlines——dottxt.ai 的结构化生成库最大化推理速度
Hermes 内置打开详情
MLOps · 推理Hermes Agent

serving-llms-vllm

使用 vLLM 的 PagedAttention 和连续批处理实现高吞吐量大语言模型服务。用于部署生产级大语言模型 API、优化推理延迟/吞吐量,或在 GPU 内存有限的情况下服务模型。支持 OpenAI 兼容端点、量化(GPTQ/AWQ/FP8)、连续批处理、动态批处理等功能……

适合使用 vLLM 的 PagedAttention 和连续批处理实现高吞吐量大语言模型服务。用于部署生产级大语言模型 API、优化推理延迟/吞吐量,或在 GPU 内存有限的情况下服务模型。支持 OpenAI 兼容端点、量化(GPTQ/AWQ/FP8)、连续批处理、动态批处理等功能……
Hermes 内置打开详情
MLOps · 推理Hermes Agent

tensorrt-llm

使用 NVIDIA TensorRT 优化大语言模型推理,实现最高吞吐量和最低延迟。用于在 NVIDIA GPU(A100/H100)上进行生产部署,当您需要比 PyTorch 快 10-100 倍的推理性能,或需要支持量化(FP8/INT4)、飞行中批处理和多模型并发服务时使用……

适合使用 NVIDIA TensorRT 优化大语言模型推理,实现最高吞吐量和最低延迟。用于在 NVIDIA GPU(A100/H100)上进行生产部署,当您需要比 PyTorch 快 10-100 倍的推理性能,或需要支持量化(FP8/INT4)、飞行中批处理和多模型并发服务时使用……
Hermes 内置打开详情
MLOps · 推理Hermes Agent

gguf-quantization

GGUF 格式和 llama.cpp 量化,用于高效 CPU/GPU 推理。当您需要在消费级硬件、Apple Silicon 上部署模型,或需要 2-8 位灵活量化且无需 GPU 要求时使用。

适合GGUF 格式和 llama.cpp 量化,用于高效 CPU/GPU 推理。当您需要在消费级硬件、Apple Silicon 上部署模型,或需要 2-8 位灵活量化且无需 GPU 要求时使用。
Hermes 内置打开详情
MLOps · 推理Hermes Agent

guidance

使用正则表达式和语法控制大语言模型输出,确保生成有效的 JSON/XML/代码,强制结构化格式,并使用 Guidance 构建多步骤工作流——微软研究院的约束生成框架

适合使用正则表达式和语法控制大语言模型输出,确保生成有效的 JSON/XML/代码,强制结构化格式,并使用 Guidance 构建多步骤工作流——微软研究院的约束生成框架
Hermes 内置打开详情
内容与来源说明

条目根据公开目录和原始文档摘要整理,保留来源与原文入口。安装前请查看原文中的依赖、权限和安全说明;热度指标仅用于发现内容,不代表绝对质量。